{"subject_id":"3a3cc48d0099814597baf1504272d6ee","topico":"Big data: 5 V's, Hadoop, Spark, Kafka, Lambda/Kappa, teorema CAP","stems":["A INFRA S.A. passou a lidar com grandes volumes de dados heterogêneos oriundos de sensores de campo, relatórios de fiscalização, sistemas legados e bases externas. Para ampliar a capacidade analítica, a empresa pública adotou um ecossistema baseado em Apache Hadoop para armazenamento e processamento distribuído, integrando os dados consolidados a dashboards interativos desenvolvidos na ferramenta Qlik, voltados à alta gestão e a órgãos de controle. Com o objetivo de aprimorar a comunicação dos resultados analíticos, a INFRA S.A. também incorporou práticas de storytelling com dados, buscando transformar análises técnicas complexas em narrativas compreensíveis para gestores não técnicos, mantendo rigor informacional e rastreabilidade. A partir da situação hipotética precedente, julgue os itens a seguir.","Julgue os itens seguintes, relativos a big data e a data lake.","Julgue os itens seguintes, relativos à administração de banco de dados Oracle, à modelagem de dados relacional, à normalização de dados e ao data mining.","No que concerne a inteligência artificial, análise de dados e Big Data, julgue os itens que se seguem.","Acerca de deep learning, de Big Data e de redes neurais, julgue os itens subsequentes.","Julgue os próximos itens, relativos às técnicas e aos métodos de BI (business intelligence), aos sistemas de suporte à decisão e gestão de conteúdo e à otimização de bases de dados multidimensionais.","Julgue os itens a seguir, em relação aos serviços de mensageria, webhooks e JSON.","Julgue os próximos itens, a respeito de Big Data, data mining e Oracle Data Integrator (ODI).","A respeito de arquitetura e política de armazenamento de dados e engenharia de dados, julgue os itens subsequentes.","No que se refere a dados estruturados e não estruturados e a técnicas de integração e ingestão de dados, julgue os próximos itens.","Julgue os itens a seguir, a respeito de ingestão de dados.","Acerca do processamento de dados, julgue os itens a seguir.","Com relação a arquitetura e política de armazenamento de dados e engenharia de dados — ingestão e armazenamento de grande quantidade de dados Big Data, julgue os itens subsequentes.","A respeito de Big Data, julgue os próximos itens.","Acerca de Big Data, julgue os próximos itens.","Quanto aos conceitos de Big Data e Analytics, julgue o item a seguir.","Em relação à ciência de dados, julgue os itens que se seguem.","Julgue os itens seguintes, a respeito de ciência de dados e de modelagem de dados.","BIG DATA & ANALYTICS, BUSINESS INTELLIGENCE, INTELIGÊNCIA ARTIFICIAL, INTERNET DAS COISAS E NUVEM COMPUTACIONAL: I BIG DATA &ANALYTICS No que se refere a Big Data e analytics, julgue os itens a seguir.","No que se refere a ferramentas de integração assíncronas, julgue os itens a seguir.","Acerca de arquitetura do sistema de arquivos distribuído, julgue os itens subsecutivos.","A respeito de arquitetura e políticas de armazenamento de dados, engenharia de dados e Big Data, julgue os próximos itens.","Acerca de Big Data, business intelligence e machine learning julgue os itens a seguir.","A respeito do Confluent Kafka, julgue os itens a seguir.","Julgue os itens a seguir, relativos ao Hadoop e ao Spark.","Com relação a inteligência artificial, análise de dados e Big Data, julgue os itens subsequentes.","Julgue os próximos itens com relação aos conceitos de big data.","Acerca de arquiteturas e soluções de Big Data, julgue os itens seguintes.","Com base nos conceitos de dados estruturados e não estruturados, de análise exploratória de dados e de dados abertos, julgue os itens seguintes.","Julgue o item a seguir, relativo ao processamento MapReduce.","No que diz respeito a big data e à Lei n.º 12.527/2011 e suas alterações (Lei de Acesso à Informação), julgue os itens seguintes.","Em relação a big data e analytics, julgue os próximos itens.","Julgue os seguintes itens, relativos a ferramentas de BI e banco de dados NoSQL.","A respeito do software Kafka, julgue os itens a seguir.","Julgue os próximos itens, relativos ao Apache Kafka e ao Kubernetes.","Com relação a Big Data, julgue os itens seguintes.","Com relação a banco de dados, julgue os itens seguintes.","A respeito de banco de dados, julgue os próximos itens."],"questions":[{"id":"0dd99477cadf","number":73,"stem":0,"statement":"O HDFS do Apache Hadoop permite o armazenamento distribuído e tolerante a falhas de grandes volumes de dados não estruturados, sendo adequado, no que concerne às atividades da INFRA S.A., para dados históricos de sensores e registros de campo, por exemplo.","answer":"C","source":{"slug":"INFRASA_26_ANALISTA","ano":2026},"explanation":{"verdict_reason":"Séries de sensores e registros de fiscalização chegam em grande volume, em formatos heterogêneos e para leitura posterior em massa — exatamente o perfil para o qual o HDFS foi desenhado: escrita uma vez, leitura muitas vezes, em blocos grandes replicados entre os nós. O armazenamento distribuído e tolerante a falhas atende ao caso descrito.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"HDFS aplicado a dados históricos brutos e heterogêneos","citation":null,"trap_note":"HDFS é ótimo para arquivo grande lido em varredura e péssimo para muitos arquivos pequenos ou acesso aleatório de baixa latência — para esse caso, HBase. O item contextualizado se julga pelo perfil de acesso."}},{"id":"a0448a231f0e","number":39,"stem":1,"statement":"O modelo MapReduce possibilita o processamento, de modo paralelo, de grandes volumes de dados, de modo que se divida a carga de trabalho entre os diversos nós do cluster.","answer":"C","source":{"slug":"TCE_RS_25","ano":2025},"explanation":{"verdict_reason":"No MapReduce a entrada é fatiada e cada fatia é processada por uma tarefa map em um nó diferente do cluster, com as reduções agregando os resultados parciais. É exatamente a divisão da carga de trabalho entre os nós que dá o processamento paralelo de grandes volumes.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"MapReduce: divisão da carga entre nós do cluster","citation":null,"trap_note":"Mapear é processar fatias em paralelo; reduzir é agregar resultados parciais. Se o item descrever agregação na fase map ou fatiamento na fase reduce, trocou as etapas."}},{"id":"c1509e7f0f9c","number":65,"stem":2,"statement":"A normalização de dados é a estratégia de criação de índices compostos para melhorar a performance das consultas em grandes volumes de dados.","answer":"E","source":{"slug":"STM_25","ano":2025},"explanation":{"verdict_reason":"Normalização é técnica de projeto lógico: decompor tabelas em formas normais para eliminar redundância e anomalias de inserção, atualização e exclusão. Criar índices compostos é sintonia física de desempenho, assunto e objetivo diferentes — a normalização, aliás, tende a exigir mais junções, e não a acelerar consultas.","distortion_type":"atribuicao_errada","distorted_span":"é a estratégia de criação de índices compostos para melhorar a performance das consultas","corrected_statement":"A normalização de dados é a estratégia de decomposição de tabelas em formas normais para eliminar redundâncias e anomalias de atualização.","concept":"Normalização (projeto lógico) × indexação (desempenho físico)","citation":null,"trap_note":"Separe projeto lógico de sintonia física. Normalizar organiza o esquema; indexar, particionar e desnormalizar é que atuam sobre o tempo de resposta."}},{"id":"285cc7296e83","number":69,"stem":3,"statement":"Um dos 5 Vs do Big Data refere-se à variedade, que designa a possibilidade de armazenamento de diferentes tipos de dados: estruturados, semiestruturados e não estruturados.","answer":"C","source":{"slug":"TELEBRAS_25","ano":2025},"explanation":{"verdict_reason":"Variedade é o V que trata da heterogeneidade de formatos: o mesmo repositório recebe tabelas relacionais, arquivos JSON e XML e conteúdo sem esquema algum, como texto, imagem e vídeo. A definição apresentada corresponde ao V nomeado.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Variedade: estruturado, semiestruturado e não estruturado","citation":null,"trap_note":"Três graus de estrutura, e não dois: entre a tabela e o vídeo está o semiestruturado, JSON e XML, que tem marcação mas não esquema rígido. Item que reconheça só dois costuma ser a distorção."}},{"id":"e4cda121efe1","number":70,"stem":3,"statement":"Os agentes de inteligência artificial são programas cujo objetivo é a coleta de informações com o intuito de embasar a tomada de decisão de um usuário humano.","answer":"E","source":{"slug":"TELEBRAS_25","ano":2025},"explanation":{"verdict_reason":"Agente é a entidade que percebe o ambiente por sensores e age sobre ele por atuadores, escolhendo a ação que maximiza seu desempenho — ele decide e atua, com autonomia. Reduzi-lo a coletor de informação para que um humano decida descreve outra coisa: um sistema de apoio à decisão.","distortion_type":"atribuicao_errada","distorted_span":"cujo objetivo é a coleta de informações com o intuito de embasar a tomada de decisão de um usuário humano","corrected_statement":"Os agentes de inteligência artificial são programas que percebem o ambiente por meio de sensores e atuam sobre ele por meio de atuadores, escolhendo autonomamente as ações que maximizam seu desempenho.","concept":"Agente inteligente: percebe e age, não apenas coleta","citation":null,"trap_note":"A palavra que define agente é agir. Qualquer definição que pare na coleta, na consulta ou no relatório está descrevendo ferramenta de apoio, não agente."}},{"id":"ab0f3d9bc03b","number":70,"stem":4,"statement":"A ferramenta Spark é mais eficiente que a Hadoop em tarefas iterativas, pois armazena os dados na memória RAM durante o processamento.","answer":"C","source":{"slug":"STM_25","ano":2025},"explanation":{"verdict_reason":"No MapReduce, cada etapa grava o resultado intermediário em disco e a seguinte o relê, de modo que um algoritmo iterativo paga esse ciclo a cada passada. O Spark mantém o conjunto de dados em memória entre as iterações, com RDDs persistidos e cache explícito, e por isso é substancialmente mais rápido em cargas iterativas, como treinamento de modelos e algoritmos de grafo.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Spark em memória × MapReduce em disco","citation":null,"trap_note":"O par memória × disco explica quase todo item Spark × MapReduce: velocidade em iteração, consumo de RAM, adequação a aprendizado de máquina e a consulta interativa."}},{"id":"6f167b1be554","number":72,"stem":4,"statement":"Em um ambiente de Big Data, a função do HDFS (Hadoop distributed file system) é caracterizada por armazenar grandes volumes de dados de forma distribuída e tolerante a falhas.","answer":"C","source":{"slug":"STM_25","ano":2025},"explanation":{"verdict_reason":"O HDFS é a camada de armazenamento do Hadoop: fatia o arquivo em blocos grandes, espalha-os pelos DataNodes e replica cada bloco em vários nós, o que garante tolerância a falhas sem hardware especializado. Quem processa é o MapReduce ou o Spark; o HDFS guarda.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"HDFS: armazenamento distribuído e tolerante a falhas","citation":"Apache Hadoop — HDFS Architecture","trap_note":"Armazenar, processar, gerenciar recursos: HDFS, MapReduce ou Spark, YARN. Fixada essa tríade, os itens de componente Hadoop se resolvem por eliminação."}},{"id":"78dad176f0aa","number":81,"stem":5,"statement":"Índices bitmap são inadequados para ambientes de data warehouse, pois apresentam baixo desempenho em consultas analíticas que envolvem grandes volumes de dados.","answer":"E","source":{"slug":"TELEBRAS_25","ano":2025},"explanation":{"verdict_reason":"Índice bitmap é a estrutura típica de data warehouse: com atributos de baixa cardinalidade, ele representa cada valor como um vetor de bits e resolve filtros combinados por operações lógicas rápidas, o que favorece justamente a consulta analítica sobre grandes volumes. O que o desaconselha é o ambiente transacional, com atualização intensa, porque cada escrita obriga a reconstruir os vetores.","distortion_type":"inversao","distorted_span":"são inadequados para ambientes de data warehouse","corrected_statement":"Índices bitmap são adequados para ambientes de data warehouse, pois apresentam bom desempenho em consultas analíticas que envolvem grandes volumes de dados.","concept":"Bitmap: bom em OLAP, ruim em OLTP","citation":null,"trap_note":"Índice bitmap para baixa cardinalidade e leitura analítica; árvore B para alta cardinalidade e escrita transacional. Quando a banca inverte o ambiente, inverte também a conclusão de desempenho."}},{"id":"726a07d210ce","number":88,"stem":6,"statement":"No Kafka, embora producer e consumer utilizem a mesma dependência Maven (kafka-clients), cada um exige configurações distintas: o producer requer, por exemplo, serializadores (key.serializer), enquanto o consumer utiliza desserializadores (key.deserializer).","answer":"C","source":{"slug":"TJ_PA_25_SERVIDOR","ano":2025},"explanation":{"verdict_reason":"O Kafka trafega apenas bytes: o cliente é que converte objeto em byte e byte em objeto. Por isso a mesma biblioteca kafka-clients atende os dois papéis, mas o produtor precisa declarar key.serializer e value.serializer, enquanto o consumidor precisa dos correspondentes key.deserializer e value.deserializer. São propriedades obrigatórias em cada lado, e não intercambiáveis.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Kafka: serialização no produtor, desserialização no consumidor","citation":"Apache Kafka — Producer/Consumer Configs (key.serializer, key.deserializer)","trap_note":"Quem escreve serializa, quem lê desserializa. Item que inverta esse par, ou que exija desserializador no produtor, está errado por inversão de papéis."}},{"id":"7f88ff5cb526","number":100,"stem":7,"statement":"Define-se Big Data apenas pelo volume de dados, sendo o armazenamento eficiente desses dados o principal objetivo dos sistemas modernos de processamento de informações.","answer":"E","source":{"slug":"TJ_PA_25_SERVIDOR","ano":2025},"explanation":{"verdict_reason":"Volume é apenas um dos Vs; variedade e velocidade já bastam para caracterizar big data mesmo sem volume extremo, e as formulações mais recentes acrescentam veracidade e valor. Além disso, o objetivo dos sistemas modernos não é guardar de forma eficiente, e sim extrair valor analítico do dado. A palavra apenas condena o item sozinha.","distortion_type":"generalizacao","distorted_span":"apenas pelo volume de dados","corrected_statement":"Define-se Big Data por um conjunto de características — volume, variedade, velocidade, veracidade e valor —, sendo a extração de valor analítico, e não o armazenamento eficiente, o principal objetivo dos sistemas modernos de processamento de informações.","concept":"Big data não se define só por volume","citation":null,"trap_note":"Em big data, todo item que reduz a definição a uma única dimensão (apenas volume, somente dados não estruturados) é errado. A definição é sempre multidimensional."}},{"id":"99a8d3f52754","number":101,"stem":7,"statement":"Em soluções de Big Data orientadas à análise em tempo real, os dados são invariavelmente persistidos antes de serem processados, o que assegura a integridade analítica e a eliminação completa de latência na geração de insights.","answer":"E","source":{"slug":"TJ_PA_25_SERVIDOR","ano":2025},"explanation":{"verdict_reason":"Análise em tempo real existe justamente para processar o dado em movimento, antes ou simultaneamente à persistência — é o oposto de persistir primeiro e processar depois. E nenhuma arquitetura elimina latência: ela é reduzida à casa de milissegundos ou segundos, nunca zerada. Duas afirmações absolutas em uma só frase.","distortion_type":"generalizacao","distorted_span":"os dados são invariavelmente persistidos antes de serem processados","corrected_statement":"Em soluções de Big Data orientadas à análise em tempo real, os dados costumam ser processados em fluxo, antes mesmo de serem persistidos, o que reduz — mas não elimina — a latência na geração de insights.","concept":"Tempo real processa o dado em movimento; latência é reduzida, não eliminada","citation":null,"trap_note":"Guarde o par: lote processa dado em repouso, fluxo processa dado em movimento. E desconfie sempre de eliminação completa, garantia total ou latência zero."}},{"id":"6fdc0cd4300f","number":102,"stem":7,"statement":"Uma das funções de data mining é realizar previsões com base em dados históricos, utilizando algoritmos como regressão, redes neurais e árvores de decisão.","answer":"C","source":{"slug":"TJ_PA_25_SERVIDOR","ano":2025},"explanation":{"verdict_reason":"Predição é uma das tarefas clássicas de mineração de dados, ao lado de classificação, associação, agrupamento e detecção de anomalias. Regressão, redes neurais e árvores de decisão são exatamente os algoritmos supervisionados usados para projetar valores futuros a partir de histórico rotulado.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Tarefas de data mining: predição a partir de dados históricos","citation":null,"trap_note":"Data mining não é só descrever o passado. Descrição e predição são as duas famílias de tarefas; regressão e árvore de decisão pertencem à segunda."}},{"id":"2fc2ef2bc63c","number":104,"stem":7,"statement":"No ODI, os knowledge modules são componentes reutilizáveis que encapsulam as lógicas de integração e transformação e que podem ser personalizados em linguagens como SQL, Groovy e Shell Script.","answer":"C","source":{"slug":"TJ_PA_25_SERVIDOR","ano":2025},"explanation":{"verdict_reason":"No Oracle Data Integrator, o knowledge module é um modelo de código reutilizável: ele encapsula como carregar, integrar, verificar ou fazer engenharia reversa dos dados, separado do mapeamento que descreve o que fazer. Seus passos são editáveis e admitem SQL, Groovy, Jython e scripts de sistema operacional, o que permite personalizar a lógica sem alterar os mapeamentos.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"ODI: knowledge modules como modelos de código reutilizáveis","citation":"Oracle Data Integrator — Knowledge Modules","trap_note":"No ODI a separação é entre o mapeamento (o que integrar) e o knowledge module (como integrar). Item que faça o KM definir regras de negócio, ou o mapeamento gerar o código, inverteu os papéis."}},{"id":"02d3731e37de","number":105,"stem":7,"statement":"O ODI suporta integração nativa com tecnologias Big Data por meio do ODI Big Data Adapter e é capaz de gerar código HiveQL, Spark e Pig sem que o desenvolvedor escreva manualmente tais scripts.","answer":"C","source":{"slug":"TJ_PA_25_SERVIDOR","ano":2025},"explanation":{"verdict_reason":"O ODI gera o código nativo da tecnologia de destino em vez de processar os dados em um motor próprio — é a arquitetura ELT. Aplicada ao ecossistema Hadoop, essa geração cobre HiveQL, Pig Latin e Spark, de modo que o desenvolvedor desenha o mapeamento e a ferramenta emite os scripts.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"ODI para Big Data: geração de código nativo (Hive, Pig, Spark)","citation":"Oracle Data Integrator for Big Data","trap_note":"ODI é ELT, não ETL: a transformação roda no destino, com código gerado para ele. Guarde isso, porque a banca cobra a diferença ETL × ELT nesse mesmo bloco."}},{"id":"04c606387ed2","number":62,"stem":8,"statement":"Na ingestão de dados do tipo streaming, os dados são coletados de forma incremental, ou seja, apenas os dados novos são processados.","answer":"E","source":{"slug":"TCE_AC_24","ano":2024},"explanation":{"verdict_reason":"Coletar apenas o que mudou desde a última execução é carga incremental, variante da ingestão em lote, que continua presa a janelas periódicas. A ingestão em streaming é contínua e orientada a evento: cada registro é capturado e processado no instante em que é gerado, sem ciclo de carga. O item descreve o lote incremental sob o nome de streaming.","distortion_type":"atribuicao_errada","distorted_span":"os dados são coletados de forma incremental, ou seja, apenas os dados novos são processados","corrected_statement":"Na ingestão de dados do tipo streaming, os dados são coletados e processados continuamente, evento a evento, à medida que são gerados.","concept":"Streaming (contínuo, por evento) × lote incremental (periódico, por delta)","citation":null,"trap_note":"Lote tem duas formas, completa e incremental, e as duas são periódicas. Incremental não é sinônimo de tempo real: o que define streaming é a continuidade, não o recorte do que mudou."}},{"id":"ce20939811fb","number":63,"stem":9,"statement":"Dados estruturados normalmente são armazenados em arquivos dos tipos doc, wmv, mpw, mp3, wav, jpg; grandes volumes de dados estruturados são armazenados em data lakes, os quais podem ser acessados quando necessário.","answer":"E","source":{"slug":"MP_TO_24_SERVIDOR","ano":2024},"explanation":{"verdict_reason":"Documento de texto, vídeo, áudio e imagem são justamente os exemplos de dados não estruturados, e o data lake é o repositório que guarda dado bruto, em formato nativo, com esquema aplicado apenas na leitura. Dados estruturados vivem em tabelas de bancos relacionais e data warehouses. As duas metades do item estão trocadas.","distortion_type":"inversao","distorted_span":"Dados estruturados normalmente são armazenados em arquivos dos tipos doc, wmv, mpw, mp3, wav, jpg","corrected_statement":"Dados não estruturados normalmente são armazenados em arquivos dos tipos doc, wmv, mpw, mp3, wav, jpg; grandes volumes desses dados são armazenados em data lakes, os quais podem ser acessados quando necessário.","concept":"Data lake guarda dado bruto; data warehouse guarda dado estruturado e modelado","citation":null,"trap_note":"Lake é esquema na leitura e dado bruto; warehouse é esquema na escrita e dado modelado. Ligar dado estruturado ao lake, ou dado bruto ao warehouse, é a troca que a banca repete."}},{"id":"96784fb56c76","number":71,"stem":10,"statement":"A ingestão de dados em lote pode fornecer insights instantâneos e requer recursos significativos de poder computacional e largura de banda da rede para poder ser executada.","answer":"E","source":{"slug":"PREF_MOSSORO_RN_24","ano":2024},"explanation":{"verdict_reason":"Ingestão em lote agrupa registros e os carrega em janelas periódicas, de modo que o insight só aparece depois do ciclo — a latência é intrínseca. Instantaneidade é característica da ingestão em fluxo. O consumo elevado de processamento e banda, esse sim, é próprio do lote, o que torna a primeira metade a parte falsa.","distortion_type":"atribuicao_errada","distorted_span":"pode fornecer insights instantâneos","corrected_statement":"A ingestão de dados em lote não fornece insights instantâneos e requer recursos significativos de poder computacional e largura de banda da rede para poder ser executada.","concept":"Ingestão em lote: periódica, com latência por construção","citation":null,"trap_note":"Lote e fluxo dividem o mundo da ingestão: janela periódica com alta latência × evento a evento com baixa latência. Atribuir a característica de um ao nome do outro é a distorção padrão."}},{"id":"062f462c5b6c","number":72,"stem":10,"statement":"Streaming data ingestion é uma técnica de ingestão e processamento de grandes volumes de dados ou fontes de dados de sistemas legados, em que não é possível entregar dados em fluxos; ela exige que todos os dados necessários sejam carregados em algum tipo de armazenamento, um banco de dados ou sistema de arquivos para serem processados.","answer":"E","source":{"slug":"PREF_MOSSORO_RN_24","ano":2024},"explanation":{"verdict_reason":"O que o item descreve — impossibilidade de entregar em fluxo e exigência de carregar tudo em um armazenamento antes de processar — é a ingestão em lote. Streaming é o contrário: cada evento é ingerido e processado continuamente, à medida que é gerado, sem esperar a formação de um conjunto completo.","distortion_type":"inversao","distorted_span":"em que não é possível entregar dados em fluxos","corrected_statement":"Streaming data ingestion é uma técnica de ingestão e processamento contínuo de dados, em que cada evento é entregue e tratado à medida que é gerado, sem exigir que todos os dados sejam previamente carregados em um armazenamento para serem processados.","concept":"Ingestão em fluxo × ingestão em lote","citation":null,"trap_note":"Leia a definição inteira antes do nome. Aqui a banca manteve o rótulo streaming e colou embaixo a definição do lote, que é o modo oposto."}},{"id":"a75be584c8cc","number":73,"stem":11,"statement":"MapReduce é uma ferramenta de uso restrito a frameworks de Big Data, como o Hadoop, e deve ser aplicado exclusivamente no tratamento de dados estruturados, sendo ineficiente para processar dados não estruturados.","answer":"E","source":{"slug":"PREF_MOSSORO_RN_24","ano":2024},"explanation":{"verdict_reason":"MapReduce é um modelo de programação genérico, anterior e exterior ao Hadoop, e implementado em outras plataformas. Mais que isso, ele nasceu para dados não estruturados: o exemplo canônico é contar palavras em texto bruto e indexar páginas web. As duas restrições afirmadas são falsas.","distortion_type":"generalizacao","distorted_span":"deve ser aplicado exclusivamente no tratamento de dados estruturados","corrected_statement":"MapReduce é um modelo de programação empregado em frameworks de Big Data, como o Hadoop, e pode ser aplicado tanto a dados estruturados quanto a dados não estruturados.","concept":"MapReduce: modelo genérico, eficaz sobre dado não estruturado","citation":null,"trap_note":"Exclusivamente, restrito e somente são as palavras que mais derrubam neste tópico, porque o ecossistema big data foi desenhado para o caso amplo, não para o restrito."}},{"id":"5db55e2cf6e6","number":74,"stem":11,"statement":"O processamento massivo de dados é necessário para diversos tipos de aplicações, como, por exemplo, a análise de logs de servidores web, o processamento de dados de sensores IoT e a análise de dados climáticos.","answer":"C","source":{"slug":"PREF_MOSSORO_RN_24","ano":2024},"explanation":{"verdict_reason":"Log de servidor web, telemetria de sensores IoT e séries climáticas são os casos típicos de processamento massivo: alto volume, geração contínua e pouca ou nenhuma estrutura prévia. São exatamente as cargas que motivaram o modelo distribuído.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Casos de uso clássicos de processamento massivo","citation":null,"trap_note":"Itens que apenas listam aplicações plausíveis de big data costumam ser Certo. O erro, quando existe, está em uma exclusão embutida na lista, não na lista em si."}},{"id":"8252e713d582","number":75,"stem":12,"statement":"A utilização da ingestão de dados para coletar dados de várias fontes e enviá-los para um repositório Big Data pode apresentar alguns desafios como usar os sistemas escaláveis, para lidar com os grandes volumes de dados, garantir que os dados sejam processados em tempo hábil, ter confiabilidade e ser seguro.","answer":"C","source":{"slug":"MP_GO_24_SERVIDOR","ano":2024},"explanation":{"verdict_reason":"A ingestão é o gargalo típico da plataforma: precisa absorver picos de várias origens heterogêneas, o que exige escalabilidade, entregar em tempo hábil para a análise, garantir que nada se perca nem se duplique e proteger o dado em trânsito. O item apenas enumera esses desafios reais.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Desafios da ingestão: escala, tempestividade, confiabilidade e segurança","citation":null,"trap_note":"Itens que listam desafios de engenharia de dados sem restringir nem absolutizar tendem a ser Certo. Procure a palavra de exclusão antes de suspeitar do conteúdo."}},{"id":"912ebfdff320","number":76,"stem":11,"statement":"O processamento em tempo real geralmente requer menos recursos computacionais em comparação ao processamento offline.","answer":"E","source":{"slug":"PREF_MOSSORO_RN_24","ano":2024},"explanation":{"verdict_reason":"Processar em tempo real significa manter infraestrutura sempre ativa, com estado em memória e capacidade dimensionada para o pico da chegada de eventos, sob restrição de latência. O processamento offline, em lote, pode ser agendado para janelas ociosas e usar disco, o que barateia o recurso. A comparação está invertida.","distortion_type":"inversao","distorted_span":"geralmente requer menos recursos computacionais","corrected_statement":"O processamento em tempo real geralmente requer mais recursos computacionais em comparação ao processamento offline.","concept":"Tempo real custa mais que lote","citation":null,"trap_note":"Latência baixa se compra com recurso e complexidade. Todo item que ofereça tempo real mais barato, mais simples ou mais preciso que o lote inverteu o custo."}},{"id":"d778c6ecef21","number":76,"stem":12,"statement":"Segurança e Acesso, Política de Exclusão, Documentação e Transparência e Retenção de Dados são exemplos de diretrizes para elaboração de uma política de armazenamento de dados.","answer":"C","source":{"slug":"MP_GO_24_SERVIDOR","ano":2024},"explanation":{"verdict_reason":"Uma política de armazenamento de dados trata do ciclo de vida do dado e de seu governo: quem acessa e como é protegido, quanto tempo se retém, quando e como se elimina, e como tudo isso é documentado e tornado transparente. Os quatro itens citados são diretrizes usuais dessa política.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Diretrizes de política de armazenamento de dados","citation":null,"trap_note":"Política de armazenamento é governança, não tecnologia: retenção, exclusão, acesso e documentação. Item que a reduza a escolha de mídia ou de banco confunde política com infraestrutura."}},{"id":"9275c457815a","number":79,"stem":13,"statement":"Em um cubo OLAP, os dados podem ser acumulados e divididos conforme a necessidade de cada usuário, para atender a várias áreas de interesse.","answer":"C","source":{"slug":"TCE_AC_24","ano":2024},"explanation":{"verdict_reason":"O cubo OLAP admite operações de navegação: drill down e roll up mudam o nível de agregação, slice e dice recortam por uma ou mais dimensões e o pivot troca os eixos da visão. É assim que cada área de interesse obtém sua própria leitura do mesmo conjunto consolidado.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Operações OLAP: roll up, drill down, slice, dice e pivot","citation":null,"trap_note":"Roll up agrega e sobe na hierarquia; drill down detalha e desce. A banca inverte esse par com frequência, então associe roll ao enrolar, que é resumir."}},{"id":"8a63ce748370","number":82,"stem":13,"statement":"Uma vantagem do Apache Hadoop é o processamento em grandes computadores, o que facilita o processamento centralizado de dados.","answer":"E","source":{"slug":"TCE_AC_24","ano":2024},"explanation":{"verdict_reason":"A vantagem do Hadoop é o oposto do afirmado: processamento distribuído em clusters de máquinas comuns, com o cálculo levado até o nó que guarda o bloco. Não há dependência de computadores de grande porte nem centralização do processamento — a descentralização é o próprio projeto.","distortion_type":"inversao","distorted_span":"o processamento em grandes computadores, o que facilita o processamento centralizado de dados","corrected_statement":"Uma vantagem do Apache Hadoop é o processamento distribuído em clusters de computadores comuns, o que dispensa o processamento centralizado de dados.","concept":"Hadoop: hardware comum e processamento distribuído","citation":null,"trap_note":"Centralizado, grande porte e servidor único são palavras estranhas ao vocabulário do Hadoop. Ver qualquer uma delas elogiada como vantagem já indica inversão."}},{"id":"a4d292df9007","number":83,"stem":13,"statement":"Assim como os dados estruturados, os dados não estruturados também podem ser armazenados em bancos de dados relacionais.","answer":"E","source":{"slug":"TCE_AC_24","ano":2024},"explanation":{"verdict_reason":"O banco relacional exige esquema definido antes da carga, com linhas e colunas de tipos declarados — é o esquema na escrita. Dado não estruturado não tem esse esquema, e por isso vai para data lakes, bases NoSQL ou repositórios de objetos. A regra vale para o dado estruturado e foi estendida indevidamente ao não estruturado.","distortion_type":"escopo_ampliado","distorted_span":"os dados não estruturados também podem ser armazenados em bancos de dados relacionais","corrected_statement":"Diferentemente dos dados estruturados, os dados não estruturados não se acomodam ao modelo relacional, sendo armazenados em data lakes, bancos NoSQL ou repositórios de objetos.","concept":"Esquema na escrita: limite do modelo relacional","citation":null,"trap_note":"Esquema na escrita é do relacional e do data warehouse; esquema na leitura é do data lake e das bases NoSQL. Toda vez que o item cruza esse limite, cruza o gabarito junto."}},{"id":"63ac672e60a7","number":91,"stem":14,"statement":"A propriedade de volume em Big Data refere-se à diversidade de tipos e formatos de dados coletados, analisados e utilizados.","answer":"E","source":{"slug":"PREF_MOSSORO_RN_24","ano":2024},"explanation":{"verdict_reason":"Diversidade de tipos e formatos é a definição de variedade. Volume é a magnitude da massa de dados armazenada e processada, medida em terabytes, petabytes e adiante. O item aplica a um V a definição do outro.","distortion_type":"troca_de_termo","distorted_span":"A propriedade de volume","corrected_statement":"A propriedade de variedade em Big Data refere-se à diversidade de tipos e formatos de dados coletados, analisados e utilizados.","concept":"Volume (quantidade) × variedade (formatos)","citation":null,"trap_note":"Troca de V é a distorção mais barata deste tópico. Antes de julgar, diga a definição de cada V em uma palavra: volume quanto, variedade que tipo, velocidade quão rápido, veracidade quão confiável, valor para quê."}},{"id":"d9a329a9cb67","number":93,"stem":14,"statement":"No Hive do Apache Hadoop, as consultas são escritas em SQL; para tal, é necessário o conhecimento do MapReduce.","answer":"E","source":{"slug":"PREF_MOSSORO_RN_24","ano":2024},"explanation":{"verdict_reason":"O Hive existe justamente para dispensar o conhecimento de MapReduce: o analista escreve HiveQL, de sintaxe semelhante ao SQL, e o próprio Hive traduz a consulta para tarefas do motor de execução subjacente. Exigir domínio de MapReduce para consultar inverte a finalidade da ferramenta.","distortion_type":"relacao_causal","distorted_span":"é necessário o conhecimento do MapReduce","corrected_statement":"No Hive do Apache Hadoop, as consultas são escritas em HiveQL, linguagem semelhante ao SQL; para tal, não é necessário o conhecimento do MapReduce, pois a própria ferramenta traduz a consulta em tarefas de processamento distribuído.","concept":"Hive: abstração SQL sobre o processamento distribuído","citation":null,"trap_note":"Toda camada de abstração do ecossistema — Hive, Pig, Spark SQL — vende a dispensa do código de baixo nível. Item que reintroduza a exigência que a ferramenta eliminou é errado por causalidade inventada."}},{"id":"b5ebb118db9e","number":94,"stem":14,"statement":"A arquitetura Lambda difere da arquitetura Kappa devido à existência da camada batch, que permite acesso ao histórico dos dados processados.","answer":"C","source":{"slug":"PREF_MOSSORO_RN_24","ano":2024},"explanation":{"verdict_reason":"A Lambda mantém dois caminhos: a camada batch, que reprocessa periodicamente todo o conjunto histórico e produz visões precisas, e a camada de velocidade, que cobre a lacuna com resultados aproximados em tempo real; a camada de serviço reúne as duas. A Kappa suprime a camada batch e trata tudo como fluxo. É essa camada, portanto, a diferença entre as duas.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Lambda × Kappa: a camada batch é a diferença","citation":null,"trap_note":"Lambda paga com código duplicado em duas trilhas a precisão do histórico; Kappa paga com reprocessamento do log a simplicidade de uma trilha só. Sabendo o custo de cada uma, o item se resolve sozinho."}},{"id":"2d5a355a831f","number":106,"stem":15,"statement":"Em uma abordagem de Analytics, a análise descritiva permite que eventos futuros sejam previstos com base em dados históricos e algoritmos de machine learning.","answer":"E","source":{"slug":"TRF6_24","ano":2024},"explanation":{"verdict_reason":"A análise descritiva responde o que aconteceu, resumindo dados passados em indicadores e relatórios. Prever eventos futuros a partir de histórico e algoritmos de aprendizado de máquina é análise preditiva. O item descreve corretamente uma categoria e assina o nome de outra.","distortion_type":"troca_de_termo","distorted_span":"a análise descritiva permite que eventos futuros sejam previstos","corrected_statement":"Em uma abordagem de Analytics, a análise preditiva permite que eventos futuros sejam previstos com base em dados históricos e algoritmos de machine learning.","concept":"Descritiva (o que aconteceu) × preditiva (o que vai acontecer)","citation":null,"trap_note":"Quatro níveis, quatro perguntas: descritiva o que aconteceu, diagnóstica por que aconteceu, preditiva o que vai acontecer, prescritiva o que fazer. A banca casa a pergunta de um nível com o nome do outro."}},{"id":"5995c3782525","number":106,"stem":16,"statement":"O OLAP (online analytical processing) permite a realização de consultas analíticas complexas em grandes volumes de dados, organizados em estruturas multidimensionais, sem impactar negativamente o desempenho dos sistemas transacionais.","answer":"C","source":{"slug":"STJ_24","ano":2024},"explanation":{"verdict_reason":"OLAP opera sobre dados organizados em cubos multidimensionais, já consolidados fora da base operacional, e é isso que permite consulta analítica pesada sem concorrer com o OLTP. A separação de ambientes é o próprio motivo de existir do data warehouse.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"OLAP: consulta multidimensional sem impactar o transacional","citation":null,"trap_note":"OLTP grava muitas transações curtas e normalizadas; OLAP lê poucas consultas longas sobre dado desnormalizado e histórico. Item que misture os dois ambientes na mesma base contraria a separação."}},{"id":"b489c17d9de0","number":107,"stem":16,"statement":"O termo Big Data se refere apenas ao grande volume de dados que uma organização coleta, enquanto analytics é o processo de analisar esses dados para obter insights.","answer":"E","source":{"slug":"STJ_24","ano":2024},"explanation":{"verdict_reason":"A segunda metade do item está correta, mas a primeira reduz big data a volume, ignorando variedade, velocidade, veracidade e valor. Big data designa o conjunto de características que inviabiliza o tratamento pelas ferramentas convencionais, e não apenas o tamanho da coleção.","distortion_type":"generalizacao","distorted_span":"apenas ao grande volume de dados que uma organização coleta","corrected_statement":"O termo Big Data se refere a conjuntos de dados caracterizados por volume, variedade e velocidade, entre outros Vs, enquanto analytics é o processo de analisar esses dados para obter insights.","concept":"Big data × analytics: o dado e o processo de analisá-lo","citation":null,"trap_note":"Metade certa não salva o item. Em Certo/Errado, a frase inteira precisa ser verdadeira: leia a segunda metade correta como isca, não como prova."}},{"id":"270c3ec170a9","number":116,"stem":17,"statement":"Em Big Data, uma das propriedades ACID é a atomicidade, que garante que todas as alterações sejam efetivadas no banco de dados, sem atualização parcial da transação.","answer":"C","source":{"slug":"STJ_24","ano":2024},"explanation":{"verdict_reason":"Atomicidade é a propriedade do tudo ou nada: a transação é uma unidade indivisível, de modo que ou todas as suas alterações são efetivadas ou nenhuma é, sem estado intermediário persistido. É exatamente o que o item descreve.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Atomicidade: tudo ou nada, sem atualização parcial","citation":null,"trap_note":"ACID por uma palavra cada: atomicidade tudo ou nada, consistência regras preservadas, isolamento transações não se enxergam, durabilidade sobrevive à falha. A banca troca a definição de uma pela da outra."}},{"id":"502f8b121560","number":121,"stem":18,"statement":"Em Big Data, um pipeline de dados visa refinar e limpar os dados brutos, facilitando a utilização desses dados pelos usuários finais.","answer":"C","source":{"slug":"SEPLAG_CE_24","ano":2024},"explanation":{"verdict_reason":"O pipeline de dados é a cadeia que move o dado da origem ao consumo, aplicando no caminho ingestão, limpeza, padronização e enriquecimento. Seu produto é o dado refinado e confiável, entregue em forma utilizável pelo analista ou pela aplicação final.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Pipeline de dados: refino do dado bruto até o consumo","citation":null,"trap_note":"Pipeline é caminho, não repositório. Item que confunda pipeline com data lake ou data warehouse trocou o meio de transporte pelo destino."}},{"id":"e5a048390be0","number":122,"stem":18,"statement":"No CRISP-DM, os modelos de dados são definidos na etapa de preparação de dados, com a utilização de técnicas de machine learning.","answer":"E","source":{"slug":"SEPLAG_CE_24","ano":2024},"explanation":{"verdict_reason":"No CRISP-DM a preparação de dados limpa, integra, formata e seleciona os dados; a construção dos modelos, com escolha e calibragem de técnicas de aprendizado de máquina, é a fase de modelagem, que vem depois. Ação real, fase errada.","distortion_type":"atribuicao_errada","distorted_span":"na etapa de preparação de dados","corrected_statement":"No CRISP-DM, os modelos de dados são definidos na etapa de modelagem, com a utilização de técnicas de machine learning.","concept":"CRISP-DM: preparação prepara o dado; modelagem constrói o modelo","citation":"CRISP-DM 1.0 — fases: entendimento do negócio, entendimento dos dados, preparação, modelagem, avaliação e implantação","trap_note":"Memorize as seis fases do CRISP-DM na ordem e o verbo de cada uma. A banca desloca a atividade de uma fase para a vizinha e mantém todo o resto da frase correto."}},{"id":"b843fb88b569","number":125,"stem":18,"statement":"Embora seja viável, a coleta de dados não estruturados torna-se ineficiente quando esses dados são modelados em tabelas convencionais.","answer":"C","source":{"slug":"SEPLAG_CE_24","ano":2024},"explanation":{"verdict_reason":"Dado não estruturado não tem esquema prévio de linhas e colunas — texto livre, imagem, áudio, vídeo. Forçá-lo em tabela convencional exige esquema na escrita, gera colunas esparsas e campos gigantes e perde o conteúdo que interessa. É viável, mas ineficiente, e por isso se usam data lakes e bases NoSQL.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Dado não estruturado × tabela relacional","citation":null,"trap_note":"Viável e adequado não são a mesma coisa. Itens moderados, que admitem a possibilidade mas apontam a ineficiência, costumam ser Certo; os absolutos, Errado."}},{"id":"c80bc34ba8f2","number":130,"stem":19,"statement":"Os brokers são os componentes individuais do Kafka que gerenciam o armazenamento e a replicação dos dados, sendo cada broker responsável por hospedar apenas uma partição de tópicos.","answer":"E","source":{"slug":"SEPLAG_CE_24","ano":2024},"explanation":{"verdict_reason":"O broker é mesmo o servidor que armazena e replica os dados do Kafka, mas cada broker hospeda muitas partições, de muitos tópicos, atuando como líder de algumas e seguidor de outras. Limitá-lo a uma única partição destruiria a escalabilidade do modelo.","distortion_type":"generalizacao","distorted_span":"sendo cada broker responsável por hospedar apenas uma partição de tópicos","corrected_statement":"Os brokers são os componentes individuais do Kafka que gerenciam o armazenamento e a replicação dos dados, podendo cada broker hospedar diversas partições de diversos tópicos.","concept":"Broker hospeda várias partições; a partição é a unidade de paralelismo","citation":null,"trap_note":"A hierarquia do Kafka é cluster, broker, tópico, partição, offset. Item que force relação um para um entre dois desses níveis quase sempre é errado."}},{"id":"a09cc0524a79","number":57,"stem":20,"statement":"Apache Spark é um sistema de processamento de dados paralelos muito utilizado para aplicações de Big Data, porém ele não suporta operações algébricas.","answer":"E","source":{"slug":"CTI_23","ano":2023},"explanation":{"verdict_reason":"O Spark é um motor de processamento paralelo de propósito geral e suporta operações algébricas: além das transformações de álgebra relacional em DataFrames e Spark SQL, o MLlib oferece vetores, matrizes distribuídas e rotinas de álgebra linear. A negação final é o que torna o item errado.","distortion_type":"inversao","distorted_span":"ele não suporta operações algébricas","corrected_statement":"Apache Spark é um sistema de processamento de dados paralelos muito utilizado para aplicações de Big Data, e suporta operações algébricas, inclusive de álgebra linear, por meio de bibliotecas como o MLlib.","concept":"Spark: motor de propósito geral com bibliotecas algébricas","citation":null,"trap_note":"Meia-frase verdadeira e uma negação no fim é formato recorrente da banca. Leia a oração adversativa como o núcleo do item, porque é ali que mora o gabarito."}},{"id":"6152a55e05a9","number":58,"stem":20,"statement":"Uma das desvantagens do sistema de arquivos distribuído Hadoop File System é a impossibilidade de conectá-lo ao sistema de arquivos local de uma máquina.","answer":"E","source":{"slug":"CTI_23","ano":2023},"explanation":{"verdict_reason":"O HDFS integra-se ao sistema de arquivos local sem dificuldade: comandos como put, get, copyFromLocal e copyToLocal movem arquivos entre a máquina e o cluster, e o próprio Hadoop suporta o esquema file para tratar o disco local como sistema de arquivos. A suposta impossibilidade não existe.","distortion_type":"inversao","distorted_span":"a impossibilidade de conectá-lo ao sistema de arquivos local de uma máquina","corrected_statement":"O sistema de arquivos distribuído Hadoop File System pode ser conectado ao sistema de arquivos local de uma máquina, por meio de comandos como copyFromLocal e copyToLocal.","concept":"HDFS: interoperação com o sistema de arquivos local","citation":"Apache Hadoop — File System Shell","trap_note":"As desvantagens reais do HDFS são outras: latência alta para acesso aleatório, ineficiência com muitos arquivos pequenos e escrita apenas por acréscimo. Item que invente uma limitação fora dessa lista costuma ser errado."}},{"id":"0bd7800ad372","number":59,"stem":20,"statement":"O Hadoop MapReduce permite que os arquivos de entrada e saída sejam armazenados em um sistema de arquivos distribuído, de modo que várias máquinas leiam e gravem dados em paralelo.","answer":"C","source":{"slug":"CTI_23","ano":2023},"explanation":{"verdict_reason":"O MapReduce foi desenhado para operar sobre um sistema de arquivos distribuído: a entrada é dividida em splits lidos em paralelo pelos nós e a saída das tarefas de redução é gravada de volta, também em paralelo. É o princípio de levar o processamento até onde o bloco está, em vez de trazer o dado até um processador central.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"MapReduce sobre HDFS: leitura e escrita paralelas","citation":null,"trap_note":"Localidade de dados é a ideia que une HDFS e MapReduce: a tarefa vai ao nó que já tem o bloco. Guardado isso, itens sobre paralelismo de entrada e saída se resolvem direto."}},{"id":"812eebfc90a6","number":60,"stem":20,"statement":"O núcleo do Hadoop File System é um servidor executado em uma máquina chamada NameNode, que recebe e coordena todas as solicitações do sistema de arquivos.","answer":"C","source":{"slug":"CTI_23","ano":2023},"explanation":{"verdict_reason":"O HDFS tem arquitetura mestre-escravo: o NameNode é o nó mestre que guarda os metadados — a árvore de diretórios e o mapa de quais blocos estão em quais nós — e atende às solicitações do sistema de arquivos. Os DataNodes apenas guardam e servem os blocos.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"NameNode guarda metadados; DataNode guarda blocos","citation":"Apache Hadoop — HDFS Architecture (NameNode, DataNode)","trap_note":"O dado nunca passa pelo NameNode: o cliente pergunta a ele onde está o bloco e depois fala direto com o DataNode. Item que faça o NameNode armazenar ou trafegar conteúdo inverteu o papel do mestre."}},{"id":"37b4402bbe04","number":64,"stem":21,"statement":"As ferramentas utilizadas para manipular dados em Big Data são as mesmas utilizadas em bancos de dados relacionais.","answer":"E","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"Big data usa ferramental próprio, nascido para escala horizontal e esquema na leitura: HDFS, MapReduce, Spark, Hive, Kafka, bases NoSQL. O banco relacional tradicional trabalha com SQL sobre esquema fixo em uma máquina que se amplia verticalmente. Há interseção de linguagem, jamais identidade de ferramentas.","distortion_type":"generalizacao","distorted_span":"são as mesmas utilizadas em bancos de dados relacionais","corrected_statement":"As ferramentas utilizadas para manipular dados em Big Data, como Hadoop, Spark e bancos NoSQL, são distintas das utilizadas em bancos de dados relacionais, ainda que muitas ofereçam interfaces em SQL.","concept":"Ferramental de big data × ferramental relacional","citation":null,"trap_note":"Oferecer interface SQL não torna a ferramenta um banco relacional: Hive e Spark SQL falam SQL sobre arquivos distribuídos. Não confunda a linguagem com o motor."}},{"id":"546bb740d96f","number":82,"stem":22,"statement":"A limpeza de dados é uma tarefa de suporte primordial em termos de manutenção dos dados usados como parte do processo de business intelligence.","answer":"C","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"A limpeza corrige duplicidades, valores ausentes, formatos divergentes e inconsistências antes da carga. Sem ela, o indicador do BI reproduz o defeito da origem com aparência de precisão, e é por isso que se trata de tarefa de suporte primordial ao processo.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Limpeza de dados como suporte à qualidade no BI","citation":null,"trap_note":"Qualidade do dado é premissa, não etapa opcional. Itens que valorizam limpeza, padronização e integração no BI costumam ser Certo."}},{"id":"cffd144f4a11","number":83,"stem":22,"statement":"O Hadoop MapReduce possui diversas bibliotecas para manipulação e serialização de arquivos e pode ser utilizado para disponibilizar integrações de interface para outros sistemas.","answer":"E","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"Bibliotecas e utilitários comuns, serialização, chamada remota e abstrações de sistema de arquivos que servem de interface para os demais módulos e para outros sistemas pertencem ao Hadoop Common. O MapReduce é o módulo de processamento distribuído, que executa as tarefas map e reduce. A descrição é real, mas o módulo apontado é outro.","distortion_type":"atribuicao_errada","distorted_span":"O Hadoop MapReduce","corrected_statement":"O Hadoop Common possui diversas bibliotecas para manipulação e serialização de arquivos e pode ser utilizado para disponibilizar integrações de interface para outros sistemas.","concept":"Módulos do Hadoop: Common, HDFS, YARN e MapReduce","citation":null,"trap_note":"Quatro módulos, quatro papéis: Common dá as bibliotecas, HDFS armazena, YARN gerencia recursos, MapReduce processa. A banca descreve um papel corretamente e assina o nome do módulo vizinho."}},{"id":"95ae4edb8a7e","number":84,"stem":22,"statement":"Big Data se refere a grandes e complexos conjuntos de dados, que podem estar alocados em múltiplos servidores, e não necessariamente esses dados precisam estar estruturados.","answer":"C","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"A definição corrente reúne três traços: conjuntos grandes e complexos, armazenamento e processamento distribuídos por vários servidores e ausência de exigência de estrutura prévia. É justamente por dispensar o esquema fixo que o modelo acomoda texto, imagem e telemetria ao lado de tabelas.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Definição de big data: escala, distribuição e estrutura facultativa","citation":null,"trap_note":"Repare na formulação não necessariamente: ela admite o caso sem impor a regra, e é por isso que costuma marcar o item correto. O absoluto é que marca o errado."}},{"id":"52dfdaff98f5","number":88,"stem":23,"statement":"Um tópico pode ser utilizado pela simples adição de um novo evento de mensagem e, se necessário, pode ser editado.","answer":"E","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"O tópico Kafka é um log de acréscimo apenas: o evento é escrito no fim da partição e, uma vez publicado, não pode ser alterado nem removido individualmente. Ele sai por política de retenção, por tempo ou por tamanho, ou por compactação de log que preserva o último valor de cada chave. Editar um evento publicado não é operação disponível.","distortion_type":"inversao","distorted_span":"se necessário, pode ser editado","corrected_statement":"Um tópico pode ser utilizado pela simples adição de um novo evento de mensagem, o qual, uma vez publicado, é imutável, não podendo ser editado.","concept":"Kafka: log imutável, apenas acréscimo","citation":"Apache Kafka — Introduction (topics are append-only, events are immutable)","trap_note":"Kafka é log distribuído, não banco de dados: não há update nem delete de registro. Todo item que ofereça edição, alteração ou exclusão pontual de evento explora essa confusão."}},{"id":"ee9284307946","number":89,"stem":23,"statement":"As partições são capazes de gerenciar eventos, porém os tópicos não podem ser quebrados em partições.","answer":"E","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"Partição não é alternativa ao tópico: é a divisão do próprio tópico. O tópico é quebrado em partições distribuídas entre os brokers, e é essa quebra que permite paralelismo de leitura e escrita, além de determinar a ordenação, garantida apenas dentro de cada partição.","distortion_type":"inversao","distorted_span":"porém os tópicos não podem ser quebrados em partições","corrected_statement":"As partições são capazes de gerenciar eventos, e os tópicos são justamente quebrados em partições distribuídas entre os brokers do cluster.","concept":"Tópico particionado: unidade de paralelismo e de ordenação","citation":null,"trap_note":"A ordem no Kafka existe dentro da partição, nunca no tópico inteiro. Quem entende isso responde tanto o item de particionamento quanto o de ordenação."}},{"id":"73fb663443c1","number":90,"stem":23,"statement":"Um consumer faz a leitura de eventos e pode consumir os registros em qualquer ordem.","answer":"C","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"O consumidor controla seu próprio offset e pode reposicioná-lo para o início, para o fim ou para qualquer ponto do log, relendo o que quiser. Além disso, quando o tópico tem várias partições, não existe ordenação global entre elas: a garantia de ordem é apenas intrapartição. Daí a leitura em qualquer ordem.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Offset controlado pelo consumidor; ordem garantida só na partição","citation":null,"trap_note":"Quem guarda a posição de leitura é o consumidor, não o broker. É por isso que o Kafka permite reprocessar histórico — e é isso que viabiliza a arquitetura Kappa."}},{"id":"a5686b79a583","number":109,"stem":24,"statement":"Hadoop é uma plataforma de código aberto que oferece uma solução tecnológica confiável e escalável para armazenamento e análise de grande quantidade de dados.","answer":"C","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"O Hadoop é projeto de código aberto da Apache, executado em clusters de máquinas comuns, que reúne armazenamento distribuído no HDFS e processamento distribuído, com replicação de blocos e reexecução de tarefas para tolerar falhas. Escalar significa acrescentar nós, não trocar por uma máquina maior.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Hadoop: plataforma aberta, escalável e confiável","citation":null,"trap_note":"Escalabilidade no Hadoop é horizontal e sobre hardware comum. Item que fale em servidores especializados, mainframe ou escala vertical contraria a premissa do projeto."}},{"id":"74ca01b009ce","number":110,"stem":24,"statement":"Spark é uma arquitetura de sistema operacional para trabalhar com dados organizados de forma hierárquica, utilizando-se o módulo Spark SQL, que permite consultar arquivos pelo seu conteúdo.","answer":"E","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"O Spark não é sistema operacional nem trabalha com hierarquia de arquivos: é um motor unificado de processamento distribuído, que roda sobre gerenciadores de recursos como YARN, Kubernetes ou Mesos e lê de sistemas de arquivos e fontes externas. O módulo Spark SQL consulta dados estruturados e semiestruturados por meio de DataFrames, e não arquivos pelo conteúdo.","distortion_type":"troca_de_termo","distorted_span":"uma arquitetura de sistema operacional para trabalhar com dados organizados de forma hierárquica","corrected_statement":"Spark é um motor de processamento distribuído para grandes volumes de dados, que dispõe do módulo Spark SQL, o qual permite consultar dados estruturados e semiestruturados com SQL e DataFrames.","concept":"Spark: motor de processamento, não sistema operacional","citation":null,"trap_note":"Cada peça tem sua categoria: HDFS é sistema de arquivos, YARN é gerenciador de recursos, Spark é motor de processamento, Kafka é log de eventos. Item que mude a categoria da peça está errado antes mesmo do detalhe."}},{"id":"a935a17b85b4","number":118,"stem":25,"statement":"Nas aplicações Big Data, a arquitetura paralela e distribuída (Cluster) é o meio para a criação de soluções capazes de analisar grandes bases de dados, processar seus pesados cálculos e disponibilizar serviços especializados para os mais diversos cenários.","answer":"C","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"A resposta padrão de big data à escala é o cluster: dividir dados e cálculo entre muitas máquinas comuns que trabalham em paralelo, em vez de ampliar um único servidor. É sobre essa arquitetura paralela e distribuída que se constroem os serviços analíticos especializados.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Cluster: arquitetura paralela e distribuída como meio de escalar","citation":null,"trap_note":"Escala horizontal em cluster é o pressuposto do tópico inteiro. Guardado isso, itens que elogiem centralização ou máquinas de grande porte caem sozinhos."}},{"id":"4f1575da8821","number":119,"stem":25,"statement":"Um gráfico muito útil para a etapa de análise de dados é o box plot, que ajuda a identificar a distribuição real ou padrão dos valores dos dados, permite visualizar mediana, quartis, valores mínimos e máximos, além de identificar possíveis outliers.","answer":"C","source":{"slug":"DATAPREV_23","ano":2023},"explanation":{"verdict_reason":"O boxplot resume a distribuição por cinco números: mínimo, primeiro quartil, mediana, terceiro quartil e máximo, com os pontos fora dos limites das hastes exibidos como outliers. Por isso é o gráfico usual da análise exploratória para ver dispersão, assimetria e valores atípicos.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Boxplot: quartis, mediana e outliers","citation":null,"trap_note":"O boxplot mostra mediana e quartis, não média e desvio padrão. Item que atribua média ou desvio à caixa trocou a estatística resumida."}},{"id":"8c9c01b3471e","number":74,"stem":26,"statement":"Big data somente se aplica a dados não estruturados.","answer":"E","source":{"slug":"SEPLAN_RR_22","ano":2022},"explanation":{"verdict_reason":"Big data abrange os três graus de estrutura: tabelas relacionais e planilhas, JSON e XML semiestruturados e conteúdo sem esquema. O predomínio do dado não estruturado nos volumes atuais não converte predomínio em exclusividade.","distortion_type":"generalizacao","distorted_span":"somente se aplica a dados não estruturados","corrected_statement":"Big data aplica-se a dados estruturados, semiestruturados e não estruturados.","concept":"Big data cobre os três graus de estrutura","citation":null,"trap_note":"Este é o eixo mais repetido do tópico e tem duas faces: o item que exclui o estruturado e o item que exclui o não estruturado. Ambos são errados pela mesma razão."}},{"id":"db6252ad53da","number":75,"stem":27,"statement":"No ecossistema Apache Hadoop, as tabelas HBase são distribuídas no cluster por meio de regiões, as quais são automaticamente divididas e redistribuídas à medida que seus dados crescem.","answer":"C","source":{"slug":"SECONT_ES_22","ano":2022},"explanation":{"verdict_reason":"No HBase a tabela é fatiada horizontalmente por faixas contíguas de chave de linha, e cada fatia é uma região servida por um RegionServer. Quando a região ultrapassa o limite configurado, ela sofre split automático e as metades podem ser redistribuídas entre os servidores pelo balanceador — é assim que a tabela escala horizontalmente.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"HBase: particionamento por regiões com split automático","citation":"Apache HBase Reference Guide — Regions","trap_note":"Região no HBase equivale a partição: faixa de row key, split automático por crescimento. Se o item disser que o particionamento é manual ou por coluna, está errado."}},{"id":"9b7543e8756f","number":75,"stem":26,"statement":"Variedade, em big data, refere-se à quantidade de fontes que geram os dados com potencial de serem altamente desestruturados.","answer":"C","source":{"slug":"SEPLAN_RR_22","ano":2022},"explanation":{"verdict_reason":"Variedade abrange tanto a diversidade de formatos quanto a multiplicidade de fontes que os geram — redes sociais, sensores, sistemas legados, bases externas —, fontes essas que tipicamente produzem conteúdo pouco ou nada estruturado. O item descreve o V correto.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Variedade: multiplicidade de fontes e de formatos","citation":null,"trap_note":"Variedade tem duas leituras aceitas pela banca, formatos e fontes, e as duas aparecem como Certo. O que nunca cola em variedade é quantidade de dados, que é volume."}},{"id":"48be09974725","number":76,"stem":27,"statement":"Kappa, uma arquitetura de software usada para processar dados, fornece acesso a métodos de processamento em lote e processamento de fluxo com uma abordagem em quatro camadas.","answer":"E","source":{"slug":"SECONT_ES_22","ano":2022},"explanation":{"verdict_reason":"A descrição de dois caminhos, um em lote e outro em fluxo, organizados em camadas, é da arquitetura Lambda — que tem três camadas: batch, velocidade e serviço. A Kappa nasceu exatamente para eliminar a camada batch: há um único caminho de processamento em fluxo, e o reprocessamento do histórico é feito relendo o log de eventos desde o início.","distortion_type":"atribuicao_errada","distorted_span":"fornece acesso a métodos de processamento em lote e processamento de fluxo com uma abordagem em quatro camadas","corrected_statement":"Kappa, uma arquitetura de software usada para processar dados, trata todo o processamento como fluxo em um único caminho, dispensando a camada de processamento em lote.","concept":"Lambda (duas trilhas, três camadas) × Kappa (só fluxo)","citation":null,"trap_note":"Conte as trilhas: Lambda tem duas (lote e tempo real), Kappa tem uma (fluxo). Qualquer item que atribua camada batch à Kappa, ou negue camada batch à Lambda, caiu na mesma troca."}},{"id":"c6b7384fdc5c","number":77,"stem":28,"statement":"Dados de redes sociais são exemplos de dados não estruturados.","answer":"C","source":{"slug":"SEPLAN_RR_22","ano":2022},"explanation":{"verdict_reason":"Postagem, comentário, imagem e vídeo não têm esquema prévio de linhas e colunas: são texto livre e mídia, com metadados variáveis. Por isso as redes sociais são o exemplo mais citado de fonte de dados não estruturados.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Dados de redes sociais como dados não estruturados","citation":null,"trap_note":"O teste é o esquema, não o formato do arquivo: se para ler é preciso interpretar conteúdo livre, é não estruturado; se há marcação sem esquema rígido, JSON ou XML, é semiestruturado."}},{"id":"1ee9cb46bbfc","number":78,"stem":29,"statement":"A implementação do MapReduce é responsável por quebrar os dados em pedaços, criar várias instâncias das funções map e reduzi-las, alocá-las e ativá-las em máquinas disponíveis na infraestrutura física, além de monitorar os cálculos para eventuais falhas.\n\nCREATE (e1:COLABORADOR, {Empid: '1', Sobrenome:\n'Silva', Nome: 'Pedro', Minimo: 'B'})\nCREATE (e2:COLABORADOR, {Empid: '2', Sobrenome:\n'Ferreira', Nome: 'Bruno'})\nCREATE (e3:COLABORADOR, {Empid: '3', Sobrenome:\n'Abdrade', Nome: 'Alice'})\nCREATE (e4:COLABORADOR, {Empid: '4', Sobrenome:\n'Nascimento', Nome: 'Bruna', Minimo: 'S'})\nCREATE (d1:DEPARTMENTO, {Dno: '5', Dnome:\n'Vendas'})\nCREATE (d2:DEPARTMENTO, {Dno: '4', Dnome:\n'Pessoal'})\nCREATE (e1) – [:TrabalhaEm ] –> (d1)\nCREATE (e3) – [:TrabalhaEm ] –> (d2)\nCREATE (e2) – [:TrabalhaEm ] –> (d1)\nCREATE (e4) – [:TrabalhaEm ] –> (d1)\nMATCH (e:COLABORADOR) - [t:TrabalhaEm]-\n>(d:DEPARTAMENTO)\nreturn e.Nome, t, d.Dnome","answer":"C","source":{"slug":"SECONT_ES_22","ano":2022},"explanation":{"verdict_reason":"O modelo MapReduce não é só o par de funções escritas pelo programador: o framework é que divide a entrada em splits, instancia as tarefas map e reduce, escalona-as nos nós disponíveis, monitora o progresso e reexecuta em outro nó a tarefa que falhou. O programador escreve map e reduce; distribuição, escalonamento e tolerância a falhas são do framework.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"MapReduce: o framework distribui, escalona e tolera falhas","citation":"Dean & Ghemawat, MapReduce: Simplified Data Processing on Large Clusters","trap_note":"A promessa do MapReduce é esconder o paralelismo. Item que exija do desenvolvedor controlar distribuição, sincronização ou reexecução de tarefa contraria essa promessa."}},{"id":"dd2ae6b70470","number":65,"stem":30,"statement":"A Lei de Acesso à Informação não se aplica às entidades privadas sem fins lucrativos, independentemente de elas receberem ou não recursos públicos.","answer":"E","source":{"slug":"TCE_SC_21_AUDITOR","ano":2021},"explanation":{"verdict_reason":"A Lei de Acesso à Informação alcança as entidades privadas sem fins lucrativos que recebam recursos públicos para realização de ações de interesse público, ainda que por subvenção, contrato de gestão, termo de parceria ou convênio. A publicidade, nesse caso, limita-se à parcela de recursos públicos recebidos e à sua destinação. O item nega a incidência justamente na hipótese em que ela existe.","distortion_type":"inversao","distorted_span":"não se aplica às entidades privadas sem fins lucrativos","corrected_statement":"A Lei de Acesso à Informação aplica-se às entidades privadas sem fins lucrativos que recebam recursos públicos para a realização de ações de interesse público, restringindo-se a publicidade à parcela dos recursos públicos recebidos e à sua destinação.","concept":"LAI: alcance sobre entidades privadas que recebem recursos públicos","citation":"Lei n.º 12.527/2011, art. 2º","trap_note":"O critério na LAI é o dinheiro público, não a natureza jurídica. Item que exclua entidade privada em bloco, ou que estenda a publicidade a todo o orçamento dela, errou o recorte."}},{"id":"9eaa06cc1fc4","number":66,"stem":30,"statement":"Big data necessitam de algoritmos de computação mais robustos em comparação aos algoritmos tradicionais de banco de dados, que não são capazes de lidar com os volumes de dados representados em big data.","answer":"C","source":{"slug":"TCE_SC_21_AUDITOR","ano":2021},"explanation":{"verdict_reason":"O banco relacional tradicional escala verticalmente e supõe esquema fixo, o que o torna inviável quando o conjunto passa da escala de uma máquina e mistura formatos. Big data responde com algoritmos distribuídos e paralelos, que fatiam o dado entre nós e levam o processamento até onde ele está.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Big data exige algoritmos distribuídos, não os do banco tradicional","citation":null,"trap_note":"O motivo de existir do ecossistema big data é uma limitação real do modelo anterior: escala vertical e esquema na escrita. Guarde essa causa, porque quase todo item conceitual deriva dela."}},{"id":"3980c97ed4ef","number":67,"stem":30,"statement":"Considera-se integridade, para efeito da Lei de Acesso à Informação, a qualidade da informação não modificada, inclusive quanto à origem, trânsito e destino.","answer":"C","source":{"slug":"TCE_SC_21_AUDITOR","ano":2021},"explanation":{"verdict_reason":"A própria lei define integridade como a qualidade da informação não modificada, inclusive quanto à origem, trânsito e destino. O item reproduz a definição legal, e não uma noção genérica de segurança da informação.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"LAI: definição legal de integridade","citation":"Lei n.º 12.527/2011, art. 4º, VIII","trap_note":"O art. 4º da LAI traz definições prontas: disponibilidade, autenticidade, integridade e primariedade. Autenticidade é sobre quem produziu; integridade é sobre não ter sido modificada; primariedade é sobre a coleta na fonte."}},{"id":"b3dd7f637a24","number":72,"stem":31,"statement":"A coleta de dados por inferência ocorre quando uma nova informação é gerada a partir de uma informação já existente, através de dispositivos eletrônicos.","answer":"C","source":{"slug":"SEFAZ_CE_21","ano":2021},"explanation":{"verdict_reason":"Na classificação por origem, o dado pode ser fornecido pelo titular, observado durante o uso, derivado por cálculo direto ou inferido. O dado inferido é justamente a informação nova produzida a partir de informação já existente, por processamento probabilístico ou dedutivo, e não por captura direta na fonte.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Coleta por inferência: informação nova gerada de informação existente","citation":null,"trap_note":"Fornecido, observado, derivado, inferido. Só o primeiro vem do titular; o inferido é produzido pelo sistema e por isso é o que mais gera discussão de privacidade."}},{"id":"ecf4b303151d","number":73,"stem":31,"statement":"Hive e Sqoop são subprojetos do Hadoop destinados a queries e data warehousing, respectivamente.","answer":"E","source":{"slug":"SEFAZ_CE_21","ano":2021},"explanation":{"verdict_reason":"Consultas e data warehousing são as duas faces do mesmo componente: o Hive é a infraestrutura de data warehouse sobre o Hadoop que permite consultar com HiveQL. O Sqoop não faz nada disso — é a ferramenta de transferência em massa entre o Hadoop e bancos de dados relacionais. O emparelhamento respectivamente atribui ao Sqoop um papel que é do próprio Hive.","distortion_type":"troca_de_termo","distorted_span":"Hive e Sqoop","corrected_statement":"Hive e Sqoop são subprojetos do Hadoop destinados, respectivamente, a queries e data warehousing e à transferência de dados entre o Hadoop e bancos de dados relacionais.","concept":"Hive (consulta e DW) × Sqoop (ingestão relacional)","citation":null,"trap_note":"Decore o ecossistema por verbo: Hive consulta, Pig faz fluxo de dados, Sqoop importa de banco relacional, Flume coleta log, ZooKeeper coordena, Oozie agenda. A banca vive trocando um pelo outro."}},{"id":"d2ee33e02714","number":75,"stem":31,"statement":"A análise de dados começa com as hipóteses iniciais, evoluem para as observações e causas e terminam com as descobertas, tudo consolidado em relatórios analíticos.","answer":"E","source":{"slug":"SEFAZ_CE_21","ano":2021},"explanation":{"verdict_reason":"O ciclo analítico não parte da hipótese: parte da fase de descoberta, em que se enquadra o problema, se levantam os dados disponíveis e só então se formulam as hipóteses iniciais. A ordem apresentada põe no fim aquilo que é o começo do ciclo e trata a hipótese como ponto de partida.","distortion_type":"inversao","distorted_span":"começa com as hipóteses iniciais","corrected_statement":"A análise de dados começa com a descoberta, fase em que o problema é enquadrado e as hipóteses iniciais são formuladas, evolui para as observações e causas e termina com a comunicação dos resultados, consolidada em relatórios analíticos.","concept":"Ciclo de vida da análise: descoberta vem primeiro","citation":null,"trap_note":"Em qualquer ciclo analítico cobrado pela banca — CRISP-DM ou ciclo de vida de data science — a primeira fase é entender o problema, nunca modelar nem hipotetizar no vazio."}},{"id":"1e1d4b446835","number":76,"stem":31,"statement":"Na modelagem dimensional de dados, as tabelas fato armazenam eventos de negócio enquanto as tabelas dimensão representam entidades de negócio.","answer":"C","source":{"slug":"SEFAZ_CE_21","ano":2021},"explanation":{"verdict_reason":"Na modelagem dimensional a tabela fato guarda a ocorrência mensurável do processo de negócio — a venda, o saque, o atendimento — com suas métricas e as chaves estrangeiras. As dimensões guardam o contexto descritivo pelo qual esses eventos são filtrados e agrupados: produto, cliente, tempo, agência.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Fato = evento mensurável; dimensão = contexto descritivo","citation":null,"trap_note":"Fato responde quanto e quando aconteceu; dimensão responde quem, o quê e onde. Item que ponha métrica na dimensão ou atributo textual descritivo como fato inverteu o par."}},{"id":"58395970fdc5","number":77,"stem":31,"statement":"Um dos três Vs de big data refere-se à variedade, que está relacionada a métodos para identificar se um conjunto de dados pode ser considerado big data.","answer":"E","source":{"slug":"SEFAZ_CE_21","ano":2021},"explanation":{"verdict_reason":"Variedade é de fato um dos três Vs, mas designa a diversidade de tipos e formatos do dado — estruturado, semiestruturado e não estruturado —, e não um método de aferir se um conjunto de dados se qualifica como big data. A definição colada ao termo correto é que torna o item errado.","distortion_type":"atribuicao_errada","distorted_span":"está relacionada a métodos para identificar se um conjunto de dados pode ser considerado big data","corrected_statement":"Um dos três Vs de big data refere-se à variedade, que está relacionada à diversidade de tipos e formatos dos dados: estruturados, semiestruturados e não estruturados.","concept":"Variedade = diversidade de formatos, não critério de enquadramento","citation":null,"trap_note":"Os Vs são características do dado, não testes de classificação. Leia o V e a definição como um par e confira um contra o outro antes de julgar."}},{"id":"469974de5950","number":80,"stem":32,"statement":"O Hadoop pode ser configurado em clusters de servidores para implementação de projetos de big data, podendo o ZooKeeper ser utilizado nesse caso como provedor de serviço centralizado para fornecer informações de configuração, sincronização e serviços de grupo nesses clusters.","answer":"C","source":{"slug":"SEFAZ_CE_21","ano":2021},"explanation":{"verdict_reason":"O ZooKeeper é o serviço de coordenação do ecossistema Hadoop: mantém informação de configuração, nomeação, sincronização distribuída e serviços de grupo, com eleição de líder e detecção de falhas. Ele não armazena nem processa o dado do negócio — coordena os nós que fazem isso.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"ZooKeeper: serviço centralizado de coordenação","citation":"Apache ZooKeeper — Overview","trap_note":"Separe armazenar (HDFS, HBase), processar (MapReduce, Spark), gerenciar recursos (YARN) e coordenar (ZooKeeper). Quase todo item de ecossistema Hadoop se resolve nessa divisão."}},{"id":"42a89f5a6ced","number":83,"stem":33,"statement":"Conexões entre producers e consumers suportam mecanismos de autenticação capazes de criptografar com SSL.","answer":"C","source":{"slug":"SERPRO_21","ano":2021},"explanation":{"verdict_reason":"O Kafka suporta segurança nas conexões cliente-broker: criptografia em trânsito por SSL/TLS e autenticação por SSL com certificado do cliente ou por SASL. Portanto os canais usados por produtores e consumidores admitem autenticação com criptografia SSL.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Kafka: SSL/TLS para criptografia e autenticação de clientes","citation":"Apache Kafka — Security (SSL, SASL, ACLs)","trap_note":"Em mensageria, separe três coisas: criptografia em trânsito (TLS), autenticação (SSL mútuo ou SASL) e autorização (ACL). Item que negue qualquer uma delas ao Kafka está errado."}},{"id":"5edaabb3da4e","number":84,"stem":33,"statement":"É possível fazer uso da API consumer para publicar eventos em tópicos Kafka.","answer":"E","source":{"slug":"SERPRO_21","ano":2021},"explanation":{"verdict_reason":"Publicar evento em tópico é função da Producer API. A Consumer API faz o inverso: assina tópicos e lê os registros, controlando offsets. As duas APIs são distintas e não intercambiáveis, e o nome citado é o do lado que lê.","distortion_type":"troca_de_termo","distorted_span":"a API consumer para publicar eventos em tópicos Kafka","corrected_statement":"É possível fazer uso da API producer para publicar eventos em tópicos Kafka.","concept":"Producer API publica; Consumer API assina e lê","citation":"Apache Kafka — APIs (Producer, Consumer, Streams, Connect, Admin)","trap_note":"Cinco APIs do Kafka: Producer, Consumer, Streams, Connect e Admin. A troca mais barata da banca é dar a ação de uma ao nome da outra — leia o verbo antes do nome."}},{"id":"010289e33122","number":121,"stem":34,"statement":"O Apache Kafka provê serviço de mensageria e integração de dados, de forma assíncrona, em que produtores e consumidores ficam desacoplados e agnósticos entre si.","answer":"C","source":{"slug":"SEFAZ_CE_21","ano":2021},"explanation":{"verdict_reason":"O Kafka é um log distribuído em que o produtor publica em um tópico e segue adiante, sem saber quem lerá, quando ou quantos lerão. O consumidor lê no seu próprio ritmo, controlando o offset. Essa mediação pelo tópico é exatamente o desacoplamento assíncrono entre produtores e consumidores.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Kafka: mensageria assíncrona com produtor e consumidor desacoplados","citation":"Apache Kafka — Introduction","trap_note":"Desacoplamento é a razão de existir de toda mensageria: quem publica não conhece quem consome. Item que faça o produtor esperar resposta do consumidor descreve chamada síncrona, não mensageria."}},{"id":"b86d2122fd9d","number":109,"stem":35,"statement":"Os fatores críticos de sucesso da análise de Big Data incluem uma sólida infraestrutura de dados, além de ferramentas analíticas e pessoal habilitado para lidar com elas.","answer":"C","source":{"slug":"TCE_RJ_20","ano":2020},"explanation":{"verdict_reason":"Análise de big data depende de três pilares simultâneos: infraestrutura capaz de armazenar e processar o volume, ferramental analítico adequado e pessoas com competência para usá-lo e interpretar o resultado. Faltando o terceiro, a plataforma existe e o valor não aparece.","distortion_type":"correto","distorted_span":null,"corrected_statement":null,"concept":"Fatores críticos de sucesso: infraestrutura, ferramentas e pessoas","citation":null,"trap_note":"Itens amplos e razoáveis, que somam fatores em vez de excluir, tendem a ser Certo. O que derruba em big data é a exclusividade, não a abrangência."}},{"id":"5016b9e036db","number":110,"stem":35,"statement":"Volume, variedade e visualização são as três características, conhecidas como 3 Vs, utilizadas para definir Big Data.","answer":"E","source":{"slug":"TCE_RJ_20","ano":2020},"explanation":{"verdict_reason":"Os três Vs originais são volume, variedade e velocidade. Visualização não é V de big data: é etapa de apresentação do resultado analítico. Trocou-se o terceiro V por um termo vizinho do vocabulário de analytics.","distortion_type":"troca_de_termo","distorted_span":"Volume, variedade e visualização","corrected_statement":"Volume, variedade e velocidade são as três características, conhecidas como 3 Vs, utilizadas para definir Big Data.","concept":"Os 3 Vs: volume, variedade e velocidade","citation":null,"trap_note":"Só entram na lista palavras com V que descrevem o dado: volume, variedade, velocidade, veracidade, valor, variabilidade. Visualização, virtualização e validação são iscas."}},{"id":"056c577dfd0a","number":79,"stem":36,"statement":"As soluções de big data focalizam dados que já existem, descartam dados não estruturados e disponibilizam os dados estruturados.","answer":"E","source":{"slug":"EBSERH_18_ADMINISTRATIVO","ano":2018},"explanation":{"verdict_reason":"Big data não descarta o dado não estruturado: ele é a maior parte do que se coleta e a razão de existirem data lakes e bases NoSQL. A plataforma também não se limita ao dado que já existe, pois incorpora fluxos gerados continuamente por sensores, aplicações e redes sociais.","distortion_type":"inversao","distorted_span":"descartam dados não estruturados","corrected_statement":"As soluções de big data tratam tanto dados já existentes quanto fluxos novos e processam dados não estruturados, além dos estruturados.","concept":"Big data incorpora o dado não estruturado","citation":null,"trap_note":"Este tópico tem um eixo que se repete em quase um item de cada oito: negar ou excluir o dado não estruturado. Sempre que o item exclui um grau de estrutura, desconfie primeiro dele."}},{"id":"8f2d2cfc34ab","number":97,"stem":37,"statement":"Uma big data não engloba dados não estruturados, mas inclui um imenso volume de dados estruturados suportado por tecnologias como o DataMining e o DataWarehouse para a obtenção de conhecimento a partir da manipulação desses dados.","answer":"E","source":{"slug":"FUNPRESP_16_JUD","ano":2016},"explanation":{"verdict_reason":"Big data engloba o dado não estruturado — texto, imagem, áudio, vídeo, log —, que é precisamente o que os bancos convencionais não tratavam bem e o que motivou o ecossistema distribuído. Restringir o conceito ao volume de dados estruturados sustentado por data mining e data warehouse descreve o BI tradicional, não big data.","distortion_type":"inversao","distorted_span":"não engloba dados não estruturados","corrected_statement":"Uma big data engloba dados não estruturados, além de imenso volume de dados estruturados, podendo valer-se de tecnologias como DataMining e DataWarehouse para a obtenção de conhecimento a partir da manipulação desses dados.","concept":"Big data inclui o não estruturado; BI tradicional trata o estruturado","citation":null,"trap_note":"Data warehouse e data mining não deixam de existir em big data, mas não o definem. Quando o item troca big data por essa dupla, está descrevendo a geração anterior de análise."}}]}