Questão nº 71
Questão de Fluência em Dados · FGV Receita Federal do Brasil 2023 - Manhã (nº 71)
FGV2023Auditor-Fiscal da Receita Federal do BrasilFluência em Dados
Gabarito: Bver comentário ↓
No contexto dos algoritmos utilizados em análise de dados, considere os passos a seguir:
- recebe os dados de treinamento como entrada, que incluem atributos e categorias;
- calcula a probabilidade de cada categoria ocorrer com base na quantidade de exemplos de cada categoria no conjunto de dados;
- calcula a probabilidade condicional para cada atributo, ou seja, a probabilidade de um atributo dada uma categoria;
- para uma nova entrada, calcula a probabilidade de cada categoria dada a entrada;
- seleciona a categoria com a maior probabilidade condicional como a previsão para a nova entrada;
- repete os passos 4 e 5 para todas as entradas desconhecidas.
Assinale o algoritmo que é implementado nos passos acima.
- ARegressão Logística.
- BNaive Bayes. (alternativa correta)
- CK-Means.
- DRandom Forest.
- ERegressão Linear.
Resposta comentada
Gabarito Alternativa B
O Naive Bayes é um algoritmo de classificação que usa o Teorema de Bayes com uma suposição de independência "ingênua" entre os atributos (características) para prever a probabilidade de uma instância pertencer a uma determinada categoria.
- (A) Incorreta: A Regressão Logística é um modelo de classificação que estima a probabilidade de uma instância pertencer a uma classe usando uma função sigmoide, mas não calcula explicitamente probabilidades condicionais de atributos dadas categorias como o Naive Bayes.
- (B) Correta: Os passos descrevem perfeitamente o algoritmo Naive Bayes: ele calcula as probabilidades a priori de cada categoria (passo 2) e as probabilidades condicionais de cada atributo dado uma categoria (passo 3), e então usa o Teorema de Bayes para calcular a probabilidade de cada categoria para uma nova entrada (passo 4), selecionando a de maior probabilidade.
- (C) Incorreta: K-Means é um algoritmo de agrupamento (clustering), ou seja, não supervisionado, que agrupa dados em K clusters com base na similaridade, e não um classificador que usa categorias de treinamento.
- (D) Incorreta: Random Forest é um algoritmo de ensemble que constrói múltiplas árvores de decisão e combina suas previsões. Embora seja um classificador, sua metodologia de construção de árvores e votação é distinta dos cálculos de probabilidade descritos.
- (E) Incorreta: Regressão Linear é um algoritmo de regressão usado para prever valores contínuos, e não para classificação de categorias discretas como descrito nos passos.
Fonte: FGV Receita Federal do Brasil 2023 - Manhã Auditor-Fiscal da Receita Federal do Brasil (Caderno Tipo 1). Reproduzida para fins de estudo.