{"subject_id":"3a3cc48d0099813c819ec7f4485cda4c","topico":"NLP: tokenização, stemming × lemmatização, BoW, TF-IDF, embeddings","stems":["Acerca do processamento de linguagem natural e dos conceitos de modelos preditivos (supervisionados) e descritivos (não supervisionados), julgue os itens a seguir.","No que se refere à inteligência artificial e aprendizado de máquina, julgue os próximos itens.","Acerca de técnicas de pré-processamento de dados não estruturados, julgue o próximo item.","A respeito de inteligência artificial, julgue os itens seguintes."],"questions":[{"id":"0314a69baad1","number":108,"stem":0,"statement":"Em um pipeline de pré-processamento de linguagem natural aplicado ao domínio jurídico, a tokenização deve, necessariamente, ser precedida pela lematização, uma vez que a lematização opera sobre formas canônicas já segmentadas.","answer":"E","source":{"slug":"TJ_PA_25_SERVIDOR","ano":2025},"explanation":{"verdict_reason":"A ordem é a inversa: a tokenização é a primeira etapa do pipeline, porque é ela que segmenta o texto corrido em unidades, e só então a lematização opera sobre cada token para devolvê-lo à forma canônica. A própria justificativa do item denuncia a inversão ao dizer que a lematização opera sobre formas já segmentadas, pois quem segmenta é a tokenização. O domínio jurídico não altera essa ordem.","distortion_type":"inversao","distorted_span":"a tokenização deve, necessariamente, ser precedida pela lematização","corrected_statement":"Em um pipeline de pré-processamento de linguagem natural aplicado ao domínio jurídico, a lematização deve, necessariamente, ser precedida pela tokenização, uma vez que a lematização opera sobre formas já segmentadas.","concept":"Tokenização precede lematização e stemming","citation":null,"trap_note":"Quando o item afirma uma ordem de etapas, reconstrua o pipeline e pergunte o que cada etapa recebe como entrada. Normalização de forma (lematização, stemming, remoção de palavras vazias) sempre consome tokens, logo sempre vem depois da tokenização."}},{"id":"5142f6c8936a","number":111,"stem":1,"statement":"Stemming é uma técnica que reduz palavras flexionadas ao seu radical, permitindo que as variações de uma palavra sejam tratadas como um mesmo termo, o que melhora o desempenho de modelos de aprendizado de máquina.","answer":"C","source":{"slug":"STJ_24","ano":2024},"explanation":{"verdict_reason":"O stemming corta afixos para reduzir formas flexionadas a um radical comum, de modo que estudar, estudando e estudou passem a contar como um mesmo termo. O efeito é agrupar ocorrências que de outro modo ficariam dispersas em atributos distintos e reduzir a dimensionalidade da representação, e é daí que vem o ganho de desempenho que o item menciona. A afirmação não promete que o radical produzido seja uma palavra válida, então nada nela extrapola.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Stemming agrupa flexões sob um mesmo radical","citation":null,"trap_note":"Stemming e lematização se separam pelo método e pela garantia: o stemming corta por regra e pode devolver um radical que não é palavra; a lematização consulta léxico e classe gramatical e devolve sempre uma forma de dicionário. Item que exija palavra válida do stemming, ou que dispense o léxico da lematização, trocou as duas."}},{"id":"d1c186cda219","number":113,"stem":2,"statement":"A técnica TF-IDF majora a importância de um termo que aparece muitas vezes em um documento e poucas vezes nos outros documentos de um mesmo corpus.","answer":"C","source":{"slug":"TRF6_24","ano":2024},"explanation":{"verdict_reason":"O TF-IDF é o produto de dois fatores que puxam em sentidos opostos: a frequência do termo no documento, que sobe quando o termo se repete ali, e a frequência inversa nos documentos, que sobe quando o termo é raro no corpus. O peso máximo recai, portanto, sobre o termo muito frequente naquele documento e pouco frequente nos demais, que é justamente o termo discriminante descrito no item. O termo comum a todos os documentos é penalizado pelo segundo fator.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"TF-IDF premia o termo frequente no documento e raro no corpus","citation":null,"trap_note":"Guarde a direção de cada metade: TF sobe com a repetição dentro do documento; IDF sobe com a raridade no corpus. O item errado dessa família inverte uma das duas, premiando o termo frequente em todo o corpus ou tratando o IDF como contagem em vez de inverso."}},{"id":"369d6527a49e","number":112,"stem":3,"statement":"Um dos desafios do processamento de linguagem natural (PLN) é a polissemia, ou seja, a característica de palavras e frases poderem ter mais de um significado.","answer":"C","source":{"slug":"SEFAZ_CE_21","ano":2021},"explanation":{"verdict_reason":"Polissemia é a propriedade de uma mesma forma carregar mais de um significado, resolvido apenas pelo contexto: banco, manga, processo. É um desafio central do processamento de linguagem natural porque a representação da palavra precisa variar conforme a frase, e todo método que fixe um único sentido por forma erra de modo sistemático. O item define o fenômeno e o classifica corretamente como desafio da área.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Polissemia: mesma forma, vários significados","citation":null,"trap_note":"A ambiguidade é o desafio recorrente do processamento de linguagem natural e aparece em camadas: léxica (polissemia), sintática (a qual termo o adjunto se liga) e referencial (a quem remete o pronome). O item errado dessa família dá a uma camada a definição de outra."}}]}