Questão nº 51
Questão de Análise de Informação · FGV CGE-SC 2022 (nº 51)
Sobre modelos de otimização de redes neurais, assinale a afirmativa incorreta.
- AO gradiente descendente é um algoritmo de otimização de redes neurais em que a derivada da função de otimização leva a direção mais baixa do gráfico da função de custo.
- BA ideia da Regularização é adicionar um termo extra à função de custo. Intuitivamente, o efeito da regularização é fazer com que a rede prefira aprender pesos pequenos, minimizando a função de custo.
- CO momento acumula pesos anteriores para estabilizar a convergência da rede; o objetivo é ajudar a desviar de mínimos locais e pode acelerar treinamento em regiões muito planas da superfície de erro.
- DO algoritmo de otimização ADAM guarda, além dos valores dos pesos passados, o decaimento exponencial da média de gradientes passados e possui o mesmo objetivo do momento.
- EA regularização L1 transforma valores pequenos em zeros e, consequentemente, permite reduzir o número de pesos, enquanto a regularização L2 procura manter todos os pesos pequenos de forma que maximiza a função de custo. (alternativa correta)
Resposta comentada
Gabarito Alternativa E
A otimização em redes neurais é o processo de ajustar os pesos (parâmetros) da rede para minimizar uma função de custo (que mede o erro), permitindo que a rede aprenda e faça previsões precisas.
(A) Incorreta: O gradiente descendente move-se na direção oposta ao gradiente (derivada), pois o gradiente aponta para a direção de maior aumento da função de custo, não para a direção mais baixa.
(B) Incorreta: A regularização adiciona um termo à função de custo, e o objetivo é minimizar a função de custo regularizada (original + termo de regularização), não apenas a função de custo original isoladamente.
(C) Incorreta: O momento acumula uma fração do vetor de atualização anterior (velocidade), que é baseado nos gradientes, e não diretamente os "pesos anteriores".
(D) Incorreta: O ADAM guarda o decaimento exponencial da média de gradientes e dos gradientes quadrados, mas não armazena "valores dos pesos passados" diretamente.
(E) Correta: A regularização L1 de fato transforma pesos pequenos em zeros, promovendo esparsidade. No entanto, a regularização L2 procura manter todos os pesos pequenos minimizando a função de custo (somada ao termo de regularização), e não maximizando-a. O erro está em "maximiza a função de custo".
Fonte: FGV CGE-SC 2022 Auditor do Estado - Ciências da Computação (Caderno Tipo 1). Reproduzida para fins de estudo.