{"subject_id":"3a3cc48d00998186b9d3f3b5782bb5f0","topico":"Algoritmos: regressões, árvores, Random Forest × XGBoost, SVM, KNN, K-Means","stems":["CIÊNCIA DE DADOS E BANCO DE DADOS A respeito de aprendizagem de máquina, julgue os itens que se seguem.","A respeito de máquinas de vetores de suporte e de avaliação de modelos de regressão, julgue os próximos itens.","Julgue os itens a seguir, em relação a técnicas de agrupamento, a técnicas de redução de dimensionalidade, e a processamento de linguagem natural.","Julgue os itens que se seguem, relativos a ciência de dados e inteligência artificial (IA).","Em relação ao aprendizado supervisionado, ao algoritmo random forest (floresta aleatória) e a overfitting e underfitting, julgue os seguintes itens.","Em relação a tecnologias de IA e aprendizado de máquina, julgue os itens que se seguem.","Julgue os próximos itens, relativos a aprendizado de máquina e BI (Business Intelligence).","Julgue os itens a seguir, a respeito de gestão de dados e de aprendizado de máquina.","Dois conjuntos de dados (A e B) necessitam ser processados e analisados. O conjunto A contém os dados idade, rendimento mensal e quantidade de filhos de certa população, todos eles numéricos. O objetivo da análise do conjunto A é determinar quem está empregado, por meio de categorização (empregado ou não empregado). O conjunto B contém o texto completo de mensagens de vários emails, sendo todos os dados desse conjunto caracteres. O objetivo da análise do conjunto B é determinar se um email é spam, por meio de categorização (spam ou não spam). Considerando essa situação hipotética, julgue os próximos itens.","No que se refere à inteligência artificial e aprendizado de máquina, julgue os próximos itens.","Julgue os itens seguintes, a respeito de ciência de dados e de modelagem de dados.","Julgue os próximos itens, relativos a aprendizado de máquina.","Julgue o próximo item a respeito dos conceitos de Machine Learning.","A respeito de inteligência artificial, julgue os itens seguintes.","A respeito de mineração de dados, julgue os itens que se seguem.","Julgue os itens subsecutivos, referentes às tecnologias de bancos de dados."],"questions":[{"id":"dfec41a8449a","number":53,"stem":0,"statement":"No agrupamento hierárquico, ao contrário do k-means, não se exige especificação prévia do número de clusters.","answer":"C","source":{"slug":"SUSEP_25","ano":2025},"explanation":{"verdict_reason":"É a diferença prática que separa os dois métodos de agrupamento. No k-means, o k é entrada obrigatória: é preciso dizer quantos grupos se quer antes de rodar o algoritmo, porque são k centroides que serão inicializados. No agrupamento hierárquico não se informa quantidade alguma: o algoritmo produz o dendrograma inteiro, da fusão de dois objetos até o grupo único, e o número de grupos é escolhido depois, cortando o dendrograma na altura desejada.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"k-means exige k previamente; hierárquico, não","citation":null,"trap_note":"Guarde a pergunta que separa os dois: o número de grupos é entrada ou saída? No k-means é entrada; no hierárquico sai do corte do dendrograma. A banca inverte esse par com frequência, afirmando que o hierárquico exige o número prévio ou que o k-means o descobre sozinho."}},{"id":"647d2107f123","number":83,"stem":1,"statement":"SVM (support vector machines) é um classificador não probabilístico que utiliza um hiperplano com margem máxima para separar dados em diferentes categorias, combina modelos lineares com técnicas de aprendizagem baseadas em instâncias e pode executar classificações lineares ou realizar classificações não lineares.","answer":"C","source":{"slug":"MP_CE_25_SERVIDOR","ano":2025},"explanation":{"verdict_reason":"A descrição percorre, sem erro, as quatro propriedades que definem a SVM: ela decide de que lado do hiperplano o objeto cai, sem produzir uma probabilidade de pertinência, o que a torna um classificador não probabilístico; escolhe entre os infinitos hiperplanos separadores aquele de margem máxima; combina um modelo linear com a aprendizagem baseada em instâncias, porque o hiperplano é escrito em função apenas dos vetores de suporte, que são exemplos do próprio conjunto de treinamento; e, com o uso de funções de núcleo, separa também dados que não são linearmente separáveis no espaço original.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"SVM: hiperplano de margem máxima, não probabilístico","citation":null,"trap_note":"Separe quem entrega probabilidade de quem entrega lado: classificadores bayesianos calculam a probabilidade de pertinência a uma classe; a SVM entrega a classe. Item que atribua saída probabilística à SVM, ou saída meramente categórica ao Naive Bayes, inverteu a natureza dos dois."}},{"id":"6c8250578001","number":84,"stem":2,"statement":"Considere que se queira aplicar técnicas de processamento de linguagem natural na frase Paulo nasceu no Ceará, de forma tal que Paulo e Ceará sejam considerados, respectivamente, o nome da pessoa e o nome do local de nascimento dela. Nessa situação, é correto utilizar o NER (named entity recognition), pois, por meio da utilização do algoritmo K-means, os grupos relacionados aos termos que se deseja segmentar — no caso, pessoa e local — podem ser encontrados.","answer":"E","source":{"slug":"MP_CE_25_SERVIDOR","ano":2025},"explanation":{"verdict_reason":"A primeira metade do item está certa: NER é de fato a tarefa que marca Paulo como pessoa e Ceará como local. O que derruba o item é a justificativa introduzida por pois. O K-means é um algoritmo de agrupamento não supervisionado: ele reparte os objetos em k grupos por distância e não sabe nomear os grupos que encontra, de modo que nunca poderia decidir que um deles é pessoa e o outro é local. O reconhecimento de entidades nomeadas se faz por rotulação de sequências com modelos treinados sobre texto anotado, não por clusterização.","distortion_type":"relacao_causal","distorted_span":"pois, por meio da utilização do algoritmo K-means","corrected_statement":"Considere que se queira aplicar técnicas de processamento de linguagem natural na frase Paulo nasceu no Ceará, de forma tal que Paulo e Ceará sejam considerados, respectivamente, o nome da pessoa e o nome do local de nascimento dela. Nessa situação, é correto utilizar o NER (named entity recognition), pois, por meio de modelos supervisionados de rotulação de sequências, os termos que se deseja identificar — no caso, pessoa e local — podem ser encontrados.","concept":"Agrupamento não rotula: K-means não faz NER","citation":null,"trap_note":"Quando o item liga uma tarefa a um algoritmo com pois, porque ou uma vez que, julgue a ligação e não a tarefa. Aqui a conclusão é verdadeira e o mecanismo é falso — basta isso para o item ser errado. E guarde o princípio: algoritmo não supervisionado encontra grupos, nunca os nomeia; qualquer item que faça agrupamento devolver rótulos semânticos está errado."}},{"id":"382907838cd1","number":86,"stem":2,"statement":"Nos algoritmos aglomerativos, ocorre primeiramente a classificação de cada objeto em um grupo e, então, combinam-se os grupos com base em suas proximidades, processo repetido até que exista um cluster, que inclua todos os objetos; já nos algoritmos divisivos, todos os pontos são inicialmente considerados como grupo único, subdividido sucessivamente até que alguma regra de parada seja satisfeita.","answer":"C","source":{"slug":"MP_CE_25_SERVIDOR","ano":2025},"explanation":{"verdict_reason":"As duas metades descrevem corretamente os dois sentidos do agrupamento hierárquico. O aglomerativo é de baixo para cima: parte de cada objeto isolado em seu próprio grupo e vai fundindo os mais próximos até restar um único cluster com tudo dentro. O divisivo é de cima para baixo: parte de um grupo único com todos os pontos e o subdivide sucessivamente até a regra de parada. Nenhuma das duas descrições foi trocada de lugar.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Hierárquico aglomerativo (baixo para cima) × divisivo (cima para baixo)","citation":null,"trap_note":"Aglomerar é juntar, dividir é separar — o próprio nome diz o sentido. Leia sempre o ponto de partida que o item descreve: quem começa com cada objeto em um grupo é o aglomerativo; quem começa com todos os objetos em um grupo só é o divisivo. Essa é a troca mais barata que a banca pode fazer nesse par."}},{"id":"fbb75e0c5f3b","number":109,"stem":3,"statement":"A regressão linear é um modelo preditivo supervisionado que estabelece uma relação entre variáveis independentes e uma variável dependente de natureza contínua.","answer":"C","source":{"slug":"STM_25","ano":2025},"explanation":{"verdict_reason":"Os três atributos conferem. É supervisionado, porque o treinamento usa exemplos com o valor da variável resposta já conhecido; é preditivo, porque o objetivo é estimar esse valor para observações novas; e a variável dependente é contínua, o que é exatamente o que distingue regressão de classificação. A relação estabelecida vai das variáveis independentes para a dependente.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Regressão: supervisionada, preditiva, resposta contínua","citation":null,"trap_note":"A natureza da variável de saída é o eixo mais cobrado deste tópico: saída contínua é regressão, saída categórica é classificação. Antes de discutir qualquer detalhe do algoritmo, leia o que o item diz que o modelo produz."}},{"id":"9e0bd4aad44f","number":27,"stem":4,"statement":"O algoritmo random forest atribui a mesma importância para todas as variáveis ao fazer as predições.","answer":"E","source":{"slug":"ANA_24","ano":2024},"explanation":{"verdict_reason":"É o contrário do que a floresta aleatória faz. As variáveis competem em cada divisão pelo critério de impureza, e só entram na árvore as que separam melhor os dados; como o subconjunto de atributos sorteado muda de nó para nó, cada variável é testada muitas vezes e o ganho que ela produz é diferente do das demais. A floresta não apenas pondera as variáveis de forma desigual como mede essa desigualdade e a devolve: a importância por redução média de impureza e a importância por permutação são saídas padronizadas do método, e estão entre as razões pelas quais ele é usado. Só haveria importância idêntica se todas as variáveis fossem igualmente informativas, o que é caso particular, não regra do algoritmo.","distortion_type":"generalizacao","distorted_span":"a mesma importância para todas as variáveis","corrected_statement":"O algoritmo random forest atribui importâncias diferentes às variáveis ao fazer as predições, e permite medi-las pela redução média de impureza ou por permutação.","concept":"Floresta aleatória mede e diferencia a importância das variáveis","citation":null,"trap_note":"Desconfie de todo item que nivele um mecanismo que existe justamente para discriminar. Achatar em mesma importância, mesmo peso, igualmente prováveis ou tratados da mesma forma é uma forma barata de negar uma função do algoritmo sem parecer que a nega. Aqui a negação é dupla: nega a ponderação desigual e, de quebra, nega a medida de importância que é um dos produtos mais usados da floresta."}},{"id":"0ba32d7139f2","number":58,"stem":5,"statement":"Técnicas de clustering são comuns em sistemas de recomendação para recomendar conteúdos aos usuários de forma individualizada.","answer":"C","source":{"slug":"CNJ_24","ano":2024},"explanation":{"verdict_reason":"É um uso corrente e consolidado. O agrupamento serve ao sistema de recomendação na forma da filtragem colaborativa baseada em vizinhança: usuários com histórico semelhante são reunidos em um mesmo grupo e recomenda-se a um deles o que os demais do grupo consumiram — ou agrupam-se os itens por similaridade de conteúdo. Não há contradição entre o algoritmo ser não supervisionado e o resultado ser individualizado: o grupo é o meio de estimar o gosto de cada usuário.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Agrupamento sustenta recomendação por vizinhança","citation":null,"trap_note":"Não oponha não supervisionado a personalizado. O agrupamento não usa rótulo de classe, mas o grupo a que o usuário pertence é exatamente o que permite prever a preferência dele. Item que negue a aplicação do agrupamento em recomendação, ou que exija rótulos para personalizar, criou uma incompatibilidade que não existe."}},{"id":"fe9b1a2aa818","number":66,"stem":6,"statement":"Random forest é um método de aprendizado de conjunto que combina várias árvores de decisão para formar um modelo mais robusto e preciso. Tal método pode ser usado tanto para resolver problemas de regressão (por exemplo, prever o valor de uma ação) quanto para realizar classificação (por exemplo, compra válida, fraude).","answer":"C","source":{"slug":"EMBRAPA_24","ano":2024},"explanation":{"verdict_reason":"As duas frases descrevem corretamente o método. A floresta aleatória é aprendizado de conjunto: combina várias árvores de decisão treinadas sobre reamostragens dos dados e sobre subconjuntos sorteados de atributos, e decide por voto ou por média, o que dilui o erro de qualquer árvore isolada e entrega um modelo mais estável que uma árvore única. E a árvore, base do conjunto, serve às duas tarefas conforme o que a folha guarda: uma classe, e o conjunto classifica; um valor numérico, e o conjunto faz regressão. Os dois exemplos citados são usos correntes do método.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Floresta aleatória faz classificação e regressão","citation":null,"trap_note":"Enunciado que abre a lista de tarefas com pode ser usado tanto quanto raramente é derrubado neste tópico, porque as famílias principais de fato atravessam mais de uma tarefa: árvore, floresta, boosting, SVM e redes neurais classificam e regridem. A restrição é que erra, não a permissão — compare este item com o que afirma que a SVM realiza apenas tarefas de regressão."}},{"id":"5ed937e43a31","number":66,"stem":7,"statement":"O algoritmo de aprendizagem supervisionada K-means é amplamente utilizado para a classificação de dados rotulados e predição de resultados futuros.","answer":"E","source":{"slug":"EMBRAPA_24","ano":2024},"explanation":{"verdict_reason":"A descrição da tarefa está correta, mas pertence a outro algoritmo. Classificar dados rotulados e prever resultados futuros é trabalho de aprendizado supervisionado, que exige exemplos com a classe já conhecida — é o que fazem o kNN, a árvore de decisão, a regressão logística. O K-means não recebe rótulo nenhum: é agrupamento não supervisionado, reparte os objetos em k grupos pela distância aos centroides e não sabe o que cada grupo significa. O enunciado descreve a família certa e assina o nome do vizinho de letra.","distortion_type":"troca_de_termo","distorted_span":"aprendizagem supervisionada K-means","corrected_statement":"O algoritmo de aprendizagem supervisionada kNN é amplamente utilizado para a classificação de dados rotulados e predição de resultados futuros.","concept":"K-means é agrupamento não supervisionado, não classificador","citation":null,"trap_note":"Leia a saída antes do nome. Se o enunciado diz que o modelo devolve classe a partir de dados rotulados, a família é classificação supervisionada, e qualquer nome de algoritmo de agrupamento assinado ali derruba o item. O par K-means × kNN é o preferido da banca justamente porque a letra k engana: no K-means o k é o número de grupos e não há rótulo; no kNN o k é o número de vizinhos e o rótulo é obrigatório."}},{"id":"8717c7168908","number":67,"stem":6,"statement":"O algoritmo de agrupamento K-means — baseado em centroides, que divide um conjunto de dados em grupos semelhantes com base na distância entre seus centroides — pode ser utilizado para, a partir de uma base de dados de uma rede social, identificar comunidades de usuários com interesses comuns em determinados assuntos.","answer":"C","source":{"slug":"EMBRAPA_24","ano":2024},"explanation":{"verdict_reason":"A definição e a aplicação conferem. O K-means é agrupamento por particionamento baseado em centroides: atribui cada objeto ao centroide mais próximo e recalcula os centroides como a média dos objetos que receberam, até estabilizar, de modo que os grupos resultantes reúnem objetos semelhantes pela medida de distância adotada. Representados os usuários por vetores de interações ou de temas, usuários com interesses próximos caem no mesmo grupo — é agrupamento legítimo, porque quem descobre a partição é o algoritmo e quem interpreta o que cada comunidade tem em comum é o analista, depois.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"K-means agrupa por centroides; a leitura dos grupos é humana","citation":null,"trap_note":"Não confunda descobrir um grupo com nomeá-lo. O agrupamento aplicado a uma tarefa semântica está certo quando o item pede apenas a partição e deixa o significado para o analista, e está errado quando exige que o próprio algoritmo devolva rótulos definidos de antemão — pessoa, local, spam, fraude. Compare este item com o do NER: lá o K-means teria de saber que um grupo é pessoa e o outro é local, e é isso que ele não faz."}},{"id":"b2e5705a0946","number":67,"stem":8,"statement":"O algoritmo Naive Bayes poderia ser utilizado na análise dos dados de A e B.","answer":"C","source":{"slug":"TRT10_24","ano":2024},"explanation":{"verdict_reason":"Os dois objetivos descritos são de categorização binária — empregado ou não empregado em A, spam ou não spam em B — e o Naive Bayes é um classificador, logo serve aos dois. A diferença de natureza dos atributos não o impede: para os atributos numéricos de A usa-se a variante gaussiana, que estima uma densidade por classe, e para o texto de B usa-se a variante multinomial sobre a contagem de termos, que é precisamente o uso clássico do algoritmo em filtragem de spam.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Naive Bayes classifica atributos numéricos e textuais","citation":null,"trap_note":"Em itens que descrevem dois conjuntos e perguntam se um algoritmo serve aos dois, decida primeiro pela tarefa e só depois pelo tipo do dado. Se os dois objetivos são categorização, qualquer classificador de uso geral serve; o tipo do atributo em geral se resolve por variante do mesmo algoritmo ou por pré-processamento, não por troca de método."}},{"id":"3d6437c7ba77","number":68,"stem":7,"statement":"O algoritmo de aprendizagem supervisionada random forest é baseado na criação de múltiplas árvores de decisão; cada árvore é construída a partir de uma amostra aleatória com reposição dos dados de treinamento.","answer":"C","source":{"slug":"EMBRAPA_24","ano":2024},"explanation":{"verdict_reason":"As três afirmações conferem. A floresta aleatória é supervisionada, porque cada árvore é treinada sobre exemplos com a resposta conhecida; é um método de conjunto construído sobre múltiplas árvores de decisão, cuja combinação por voto ou média reduz a variância de uma árvore isolada; e cada árvore é treinada sobre uma amostra aleatória com reposição do conjunto de treinamento, que é exatamente o bootstrap do bagging. A amostragem com reposição é o que torna as árvores diferentes entre si, e é dessa diversidade que vem o ganho do conjunto.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Floresta aleatória: bagging de árvores com amostra bootstrap","citation":null,"trap_note":"Guarde as duas fontes de aleatoriedade da floresta, porque a banca troca uma pela outra: a amostra de dados é sorteada com reposição (bootstrap), e o subconjunto de atributos é sorteado a cada divisão, esse sim sem reposição dentro do nó. Item que diga amostragem sem reposição dos dados, ou que atribua o sorteio de atributos ao boosting, inverteu o mecanismo."}},{"id":"330f96931ed4","number":112,"stem":9,"statement":"Na regressão linear múltipla, a previsão do modelo é um valor entre 0 e 1, tal que 0 indica um evento improvável de acontecer e 1 indica a probabilidade máxima de que esse evento aconteça.","answer":"E","source":{"slug":"STJ_24","ano":2024},"explanation":{"verdict_reason":"A descrição está correta, mas é de outro modelo. Saída confinada ao intervalo de 0 a 1 e lida como probabilidade de ocorrência do evento é a regressão logística, que aplica a função logística à combinação linear das preditoras exatamente para comprimir o resultado nesse intervalo. A regressão linear múltipla prevê um valor contínuo sem limite superior nem inferior, na própria escala da variável resposta.","distortion_type":"troca_de_termo","distorted_span":"Na regressão linear múltipla","corrected_statement":"Na regressão logística, a previsão do modelo é um valor entre 0 e 1, tal que 0 indica um evento improvável de acontecer e 1 indica a probabilidade máxima de que esse evento aconteça.","concept":"Linear prevê valor contínuo; logística, probabilidade entre 0 e 1","citation":null,"trap_note":"Sempre que aparecer o intervalo de 0 a 1, ou a palavra probabilidade, a frase está descrevendo a regressão logística, qualquer que seja o nome que o item assine. O caminho inverso também cai: regressão logística descrita como previsora de valores numéricos contínuos. Leia a saída primeiro e só depois o nome do modelo."}},{"id":"a4c6050b781a","number":118,"stem":10,"statement":"A regressão linear do aprendizado de máquina busca estabelecer uma relação entre as variáveis de entrada de um algoritmo.","answer":"E","source":{"slug":"STJ_24","ano":2024},"explanation":{"verdict_reason":"Falta o outro lado da relação. A regressão linear não modela a relação entre as variáveis de entrada; ela modela a relação entre as variáveis de entrada e uma variável de saída numérica, a variável dependente que se quer prever. A relação entre as próprias preditoras tem outro nome e outro sinal: chama-se multicolinearidade e é um problema do modelo, não o seu objetivo.","distortion_type":"troca_de_termo","distorted_span":"uma relação entre as variáveis de entrada de um algoritmo","corrected_statement":"A regressão linear do aprendizado de máquina busca estabelecer uma relação entre as variáveis de entrada de um algoritmo e uma variável de saída contínua.","concept":"Regressão relaciona preditoras a uma variável resposta","citation":null,"trap_note":"Toda definição de regressão tem de citar os dois lados: as variáveis independentes e a variável dependente contínua. Se o item descreve uma relação só entre entradas, ou só entre saídas, apagou metade da definição. Esse mesmo enunciado aparece na prova em versão correta, com a variável dependente presente — a diferença entre o item certo e o errado é essa única metade."}},{"id":"b4fb68707428","number":82,"stem":11,"statement":"As técnicas de regressão utilizam um conjunto finito de hipóteses para, a partir dos atributos previsores, determinar a categoria de um objeto do conjunto de dados analisado.","answer":"E","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"O que a frase descreve é classificação, não regressão. Conjunto finito de hipóteses e determinar a categoria de um objeto são as marcas do problema de classificação, cujo espaço de saída é um conjunto discreto e enumerável de classes. A regressão trabalha com um espaço de saída contínuo e infinito: ela estima um valor numérico, não escolhe entre categorias.","distortion_type":"troca_de_termo","distorted_span":"As técnicas de regressão","corrected_statement":"As técnicas de classificação utilizam um conjunto finito de hipóteses para, a partir dos atributos previsores, determinar a categoria de um objeto do conjunto de dados analisado.","concept":"Finito e categoria são classificação, não regressão","citation":null,"trap_note":"Finito, categoria, classe, rótulo e discreto pertencem à classificação; contínuo, valor, quantidade e numérico pertencem à regressão. A banca deixa a descrição inteira correta e troca só o nome da família no começo da frase — por isso o nome do método deve ser lido por último, depois de você já ter decidido, pela saída descrita, de que família se trata."}},{"id":"89464edf568c","number":83,"stem":11,"statement":"Os algoritmos SVM (support vector machines) realizam apenas tarefas de regressão.","answer":"E","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"O item inteiro se decide na palavra apenas. A SVM nasceu como classificador binário de margem máxima e é nessa tarefa que é mais usada; a versão para regressão, a SVR, existe e é legítima, mas não é a única coisa que a técnica faz. Dizer que a SVM realiza apenas regressão exclui justamente a sua aplicação principal.","distortion_type":"generalizacao","distorted_span":"realizam apenas tarefas de regressão","corrected_statement":"Os algoritmos SVM (support vector machines) realizam tarefas de classificação e também de regressão.","concept":"SVM faz classificação e também regressão","citation":null,"trap_note":"Localize a palavra de exclusão — apenas, somente, exclusivamente, unicamente — e teste-a com um único contraexemplo antes de avaliar o resto da frase. Neste tópico, quase todo item que fecha a lista de tarefas de um algoritmo está errado, porque as famílias principais atravessam mais de uma tarefa: SVM e árvores fazem classificação e regressão; redes neurais fazem as duas e ainda agrupam."}},{"id":"8effcceaeed5","number":95,"stem":12,"statement":"Classificadores bayesianos são classificadores estatísticos usados para predizer a probabilidade de pertinência de um objeto a determinada classe.","answer":"C","source":{"slug":"BANCO_DO_NORDESTE_22","ano":2022},"explanation":{"verdict_reason":"É a definição corrente na literatura de mineração de dados. Os classificadores bayesianos são estatísticos porque decidem a partir de probabilidades, e não de regras ou de fronteiras geométricas: aplicam o teorema de Bayes para calcular, a partir das evidências observadas no objeto, a probabilidade a posteriori de ele pertencer a cada classe, e atribuem a classe de maior probabilidade.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Classificador bayesiano prediz probabilidade de pertinência a classe","citation":null,"trap_note":"Probabilidade de pertinência é a assinatura dos métodos bayesianos. Quem entrega probabilidade: Naive Bayes, redes bayesianas, regressão logística. Quem entrega diretamente a classe ou o lado da fronteira: SVM, árvore de decisão, k-means. Conferir essa coluna resolve boa parte dos itens de identificação de algoritmo."}},{"id":"aa34c707c900","number":108,"stem":13,"statement":"A classificação Naive Bayes parte da suposição de que as variáveis envolvidas em machine learning são independentes entre si.","answer":"C","source":{"slug":"SEFAZ_CE_21","ano":2021},"explanation":{"verdict_reason":"É exatamente a suposição que dá nome ao algoritmo. O ingênuo do Naive Bayes é admitir que os atributos previsores são condicionalmente independentes entre si dada a classe, o que permite multiplicar as probabilidades individuais em vez de estimar a distribuição conjunta. A suposição raramente se verifica nos dados reais, mas é ela que o algoritmo assume — e é isso que o item afirma.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Naive Bayes supõe independência entre os atributos","citation":null,"trap_note":"O adjetivo naive é a própria suposição de independência. Item que negue a independência no Naive Bayes, ou que transfira a suposição para outro algoritmo, errou o cartão de identidade do método. E note: assumir independência não é o mesmo que exigi-la — o algoritmo funciona bem mesmo quando ela é violada."}},{"id":"1faeb9251c9b","number":109,"stem":13,"statement":"Uma das vantagens da técnica de árvore de decisão para regressão é evitar a propagação de erros, mesmo que uma divisão ocorra indevidamente.","answer":"E","source":{"slug":"SEFAZ_CE_21","ano":2021},"explanation":{"verdict_reason":"O item apresenta como vantagem justamente a fraqueza conhecida da árvore de decisão. A árvore é construída de forma gulosa e hierárquica: escolhida uma divisão, ela nunca é revista, e todos os ramos abaixo dela são construídos dentro da partição que ela criou. Uma divisão indevida no topo, portanto, contamina toda a subárvore — o erro se propaga em vez de ser evitado. É essa instabilidade que motiva os métodos de conjunto, que combinam muitas árvores para diluí-la.","distortion_type":"inversao","distorted_span":"é evitar a propagação de erros, mesmo que uma divisão ocorra indevidamente","corrected_statement":"Uma das limitações da técnica de árvore de decisão para regressão é a propagação de erros, pois uma divisão que ocorra indevidamente contamina todos os ramos construídos abaixo dela.","concept":"Árvore gulosa: divisão errada no topo propaga-se aos ramos","citation":null,"trap_note":"Desvantagem conhecida anunciada como vantagem é um dos movimentos mais repetidos da banca em algoritmos. Sempre que o item abrir com uma das vantagens ou uma das características positivas, verifique se o que vem depois não é, na literatura, uma limitação. Na árvore de decisão as limitações clássicas são a propagação do erro de divisão, a instabilidade diante de pequenas mudanças nos dados e a tendência a superajuste sem poda."}},{"id":"6210d8345f2d","number":111,"stem":14,"statement":"Os principais métodos de análise de agrupamentos em mineração de dados incluem redes neurais, lógica difusa, métodos estatísticos e algoritmos genéticos.","answer":"C","source":{"slug":"TCE_RJ_20","ano":2020},"explanation":{"verdict_reason":"A enumeração está correta e, além disso, é aberta: o verbo é incluem, e não são apenas. Análise de agrupamentos não é sinônimo de um único algoritmo — a literatura de mineração de dados reúne sob ela os métodos estatísticos de particionamento e hierárquicos, as redes neurais de mapas auto-organizáveis, a lógica difusa do agrupamento com pertinência parcial e os algoritmos genéticos que buscam a melhor partição por evolução. Nenhum dos quatro está fora do conjunto.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Agrupamento é família de métodos, não um único algoritmo","citation":null,"trap_note":"Preste atenção ao verbo da enumeração. Incluem, entre outros, tais como e são comuns em deixam a lista aberta e quase sempre sobrevivem à conferência; são apenas, restringem-se a e somente fecham a lista e bastam para derrubar o item se existir um único caso fora. Esse é o teste mais barato deste tópico."}},{"id":"54ae204520ea","number":113,"stem":14,"statement":"No método de mineração de dados por agrupamento (clustering), são utilizados algoritmos com heurísticas para fins de descoberta de agregações naturais entre objetos.","answer":"C","source":{"slug":"TCE_RJ_20","ano":2020},"explanation":{"verdict_reason":"Duas afirmações, as duas corretas. Encontrar a melhor partição de um conjunto de objetos é um problema combinatório intratável, e por isso os algoritmos de agrupamento são heurísticos: o k-means, por exemplo, refina iterativamente centroides a partir de uma inicialização e converge para um ótimo local, não para o ótimo global. E o que ele descobre são agregações naturais, isto é, grupos que emergem da própria proximidade entre os objetos, sem classes definidas previamente por um rótulo.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Agrupamento é heurístico e descobre grupos naturais","citation":null,"trap_note":"Natural, nesse tópico, quer dizer não rotulado previamente: os grupos saem da estrutura dos dados, e não de uma classe informada. Item que faça o agrupamento partir de classes conhecidas, ou que prometa a partição ótima garantida, confundiu agrupamento com classificação ou heurística com solução exata."}},{"id":"eddd8a2b5ee8","number":76,"stem":15,"statement":"Em DataMining, as árvores de decisão podem ser usadas com sistemas de classificação para atribuir informação de tipo.","answer":"C","source":{"slug":"FUNPRESP_16_JUD","ano":2016},"explanation":{"verdict_reason":"A árvore de decisão é, antes de tudo, um classificador: percorrida da raiz até a folha conforme os valores dos atributos do registro, ela devolve na folha a classe atribuída àquele objeto — que é o que o item chama de atribuir informação de tipo. O verbo é permissivo, podem ser usadas, e a capacidade afirmada é real.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Árvore de decisão atribui classe percorrendo raiz até folha","citation":null,"trap_note":"Item que apenas afirma uma capacidade real de um algoritmo, com verbo permissivo (podem, poderia, é possível), costuma ser certo: não há o que exceder. O erro mora nos itens que fecham a capacidade com apenas, ou que descrevem o mecanismo interno de forma invertida."}}]}