Questão nº 60
Questão de Análise de Sistemas · CESGRANRIO BNDES 01/2024 (nº 60)
Uma rede neural é um programa de aprendizado de máquina que toma decisões utilizando processos que imitam a forma como os neurônios biológicos funcionam.
Com relação ao funcionamento, à aplicação e à modelagem quando se utilizam redes neurais, verifica-se que
- Aas redes neurais profundas sempre convergem mais rapidamente do que redes neurais rasas devido à sua maior capacidade de modelagem.
- Bas redes neurais não podem ser utilizadas para problemas de regressão; elas são exclusivamente usadas para problemas de classificação.
- Ca função de ativação ReLU (Rectified Linear Unit) é preferida em redes neurais profundas porque ajuda a mitigar o problema do gradiente desaparecendo. (alternativa correta)
- Da regularização em redes neurais, como o dropout, é usada para aumentar o sobreajuste (overfitting) ao treinamento.
- Eo treinamento de redes neurais é independente da função de ativação utilizada; qualquer função de ativação pode ser usada sem afetar o resultado.
Resposta comentada
Gabarito Alternativa C
Conceito-chave: Redes neurais aprendem ajustando pesos internos, e esse ajuste depende do cálculo do gradiente (a "direção" do erro). Em redes profundas, funções de ativação que saturam (como sigmoide) fazem esse gradiente ficar minúsculo nas camadas iniciais, travando o aprendizado — é o gradiente desaparecendo. A ReLU (que retorna se , senão 0) mantém o gradiente constante para valores positivos, evitando esse travamento.
- (A) Incorreta: Redes profundas não convergem sempre mais rápido; elas têm mais parâmetros e podem até demorar mais ou sofrer com gradiente desaparecendo, dependendo da arquitetura e dos dados.
- (B) Incorreta: Redes neurais são amplamente usadas em regressão (prever valores contínuos, como preço de imóvel), bastando ajustar a camada de saída (ex.: função linear).
- (C) Correta: A ReLU é preferida em redes profundas porque, para entradas positivas, seu gradiente é constante (igual a 1), o que mitiga o problema do gradiente desaparecendo — ao contrário de sigmoide/tanh, que comprimem o gradiente perto de zero.
- (D) Incorreta: Dropout (desligar neurônios aleatoriamente durante o treino) é uma técnica de regularização que reduz o overfitting, não o aumenta.
- (E) Incorreta: A escolha da função de ativação afeta diretamente o resultado (convergência, capacidade de modelar não-linearidades, e problemas como gradiente desaparecendo/explodindo).
Armadilha da banca na (A): O distrator mais tentador é a letra (A), pois parece "lógico" que mais capacidade = convergência mais rápida. Mas a banca explora a confusão entre capacidade de modelagem e velocidade de treinamento — redes profundas têm mais capacidade, porém o treinamento é mais difícil e lento na prática, especialmente sem técnicas como ReLU ou normalização em lote.
Fonte: CESGRANRIO BNDES 01/2024 Analista - Análise de Sistemas (Desenvolvimento) (Caderno Prova 3). Reproduzida para fins de estudo.