Questão nº 80
Questão de Tecnologia da Informação · FGV TCE-ES 2022 (nº 80)
Com o objetivo de minimizar os riscos na concessão de crédito, um banco contratou uma empresa especializada em sistemas digitais para desenvolver um classificador de requisitantes de crédito em bons ou maus pagadores. Ao entregar o modelo de classificação para o banco, a empresa afirmou que o classificador havia obtido nos testes uma precisão de mais de 95%. No entanto, após alguns meses, o banco notou que o desempenho do classificador estava aquém do esperado, ficando abaixo de 60%.
Essa situação apresenta um problema de:
- Aunderfitting, que se caracteriza pelo classificador estar subajustado aos exemplos do mundo real;
- Boverfitting, que se caracteriza pelo classificador estar superajustado aos exemplos de treinamento; (alternativa correta)
- Cundersampling, que se caracteriza pela quantidade de exemplos do mundo real ser pequena;
- Doversampling, que se caracteriza pela quantidade de exemplos de treinamento ser excessiva;
- Eoutliers, que se caracteriza pela presença de exemplos do mundo real muito distintos dos exemplos de treinamento.
Resposta comentada
Gabarito Alternativa B
Overfitting ocorre quando um modelo de inteligência artificial se ajusta tão perfeitamente aos dados que usou para aprender (dados de treinamento) que ele memoriza detalhes irrelevantes ou ruídos, perdendo a capacidade de prever corretamente novos dados que nunca viu antes.
(A) Incorreta: underfitting significa que o modelo é muito simples e não conseguiu aprender nem mesmo os padrões básicos dos dados de treinamento, resultando em baixo desempenho tanto nos testes quanto no mundo real. O cenário mostra alto desempenho nos testes. A armadilha é focar apenas no "subajustado aos exemplos do mundo real" sem considerar o alto desempenho inicial nos testes, que contradiz o underfitting.
(B) Correta: overfitting se encaixa perfeitamente na situação, pois o modelo obteve alta precisão nos testes (dados de treinamento/validação), mas falhou drasticamente ao ser aplicado a novos dados do mundo real, indicando que ele memorizou os dados de treinamento em vez de aprender padrões generalizáveis.
(C) Incorreta: undersampling é uma técnica para lidar com desequilíbrio de classes em um conjunto de dados, não um problema de ajuste do modelo que causa a discrepância de desempenho descrita.
(D) Incorreta: oversampling é outra técnica para lidar com desequilíbrio de classes, e não o problema de ajuste do modelo que causa a queda de desempenho em dados novos.
(E) Incorreta: outliers (pontos de dados atípicos) podem afetar o treinamento, mas a presença deles não é a causa direta da discrepância entre o desempenho em testes e no mundo real; o overfitting é a descrição do problema de ajuste que resulta dessa discrepância.
Fonte: FGV TCE-ES 2022 Auditor de Controle Externo - Tecnologia da Informação (Caderno Tipo 1). Reproduzida para fins de estudo.