Questão nº 71

Questão de Fluência em Dados · FGV Receita Federal do Brasil 2023 - Manhã (nº 71)

FGV2023Auditor-Fiscal da Receita Federal do BrasilFluência em Dados
Gabarito: Bver comentário ↓

No contexto dos algoritmos utilizados em análise de dados, considere os passos a seguir:

  1. recebe os dados de treinamento como entrada, que incluem atributos e categorias;
  2. calcula a probabilidade de cada categoria ocorrer com base na quantidade de exemplos de cada categoria no conjunto de dados;
  3. calcula a probabilidade condicional para cada atributo, ou seja, a probabilidade de um atributo dada uma categoria;
  4. para uma nova entrada, calcula a probabilidade de cada categoria dada a entrada;
  5. seleciona a categoria com a maior probabilidade condicional como a previsão para a nova entrada;
  6. repete os passos 4 e 5 para todas as entradas desconhecidas.

Assinale o algoritmo que é implementado nos passos acima.

Resposta comentada

Gabarito Alternativa B

O Naive Bayes é um algoritmo de classificação que usa o Teorema de Bayes com uma suposição de independência "ingênua" entre os atributos (características) para prever a probabilidade de uma instância pertencer a uma determinada categoria.

  • (A) Incorreta: A Regressão Logística é um modelo de classificação que estima a probabilidade de uma instância pertencer a uma classe usando uma função sigmoide, mas não calcula explicitamente probabilidades condicionais de atributos dadas categorias como o Naive Bayes.
  • (B) Correta: Os passos descrevem perfeitamente o algoritmo Naive Bayes: ele calcula as probabilidades a priori de cada categoria (passo 2) e as probabilidades condicionais de cada atributo dado uma categoria (passo 3), e então usa o Teorema de Bayes para calcular a probabilidade de cada categoria para uma nova entrada (passo 4), selecionando a de maior probabilidade.
  • (C) Incorreta: K-Means é um algoritmo de agrupamento (clustering), ou seja, não supervisionado, que agrupa dados em K clusters com base na similaridade, e não um classificador que usa categorias de treinamento.
  • (D) Incorreta: Random Forest é um algoritmo de ensemble que constrói múltiplas árvores de decisão e combina suas previsões. Embora seja um classificador, sua metodologia de construção de árvores e votação é distinta dos cálculos de probabilidade descritos.
  • (E) Incorreta: Regressão Linear é um algoritmo de regressão usado para prever valores contínuos, e não para classificação de categorias discretas como descrito nos passos.

Fonte: FGV Receita Federal do Brasil 2023 - Manhã Auditor-Fiscal da Receita Federal do Brasil (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho