Questão nº 62

Questão de Tecnologia da Informação · CEBRASPE SEFAZ-RN 2025 - P2 Conhecimentos Complementares (nº 62)

CEBRASPE2025Auditor Fiscal de Receitas EstaduaisTecnologia da Informação
Gabarito: Dver comentário ↓

Uma secretaria de fazenda estadual recebe diariamente milhões de notas fiscais eletrônicas (NF-e). Um desafio central da fiscalização é validar se a descrição textual dos itens comercializados é condizente com o código NCM (nomenclatura comum do Mercosul) declarado. Para automatizar essa classificação semântica em larga escala, utiliza-se processamento de linguagem natural (PLN) e redes neurais.

Assinale a opção em que são apresentadas a técnica adequada para esse cenário e sua descrição.

Resposta comentada

Gabarito Alternativa D

O conceito-chave é que classificar texto (como uma descrição de produto) exige entender o contexto e a relação entre as palavras, e não apenas palavras isoladas. Para isso, modelos como o Transformer usam um mecanismo de atenção que “presta atenção” em todas as palavras da frase ao mesmo tempo, capturando nuances e sinônimos — algo essencial para comparar “tela de celular” com um NCM de vidro temperado, por exemplo.

  • (A) Incorreta: Lemmatization é uma técnica de normalização morfológica (reduzir palavras à forma canônica, ex.: “correndo” → “correr”), e não um método de agrupamento não supervisionado; além disso, a classificação fiscal exige rótulos (NCM) para treinar o modelo, então não prescinde deles.
  • (B) Incorreta: Stemming também é redução morfológica (corta sufixos, ex.: “correndo” → “corr”), mas não gera vetores numéricos densos — isso é função de word embeddings; e ele não preserva semântica contextual completa, pois ignora o sentido da frase.
  • (C) Incorreta: Word embeddings são, de fato, vetores que aproximam palavras semelhantes (ex.: “notebook” e “laptop”), mas não capturam dependências de longo alcance nem o contexto completo da frase — eles geram um vetor fixo por palavra, independente da posição na descrição; por isso, sozinhos, são insuficientes para a tarefa complexa de compatibilizar com NCM.
  • (D) Correta: Arquiteturas Transformer (como BERT) usam atenção para analisar a frase inteira de uma vez, ponderando a importância de cada termo em relação aos demais — isso permite entender que “vidro temperado para celular” se refere a um componente eletrônico, não a um copo, e é a técnica mais eficaz para classificação semântica de texto em larga escala, como a validação de NCM.
  • (E) Incorreta: Tokenização é apenas a etapa de quebrar o texto em unidades menores (palavras ou subpalavras) para o modelo processar; ela não detecta anomalias sintáticas nem substitui modelos preditivos — é um pré-processamento, não uma solução de classificação.

Fonte: CEBRASPE SEFAZ-RN 2025 - P2 Conhecimentos Complementares Auditor Fiscal de Receitas Estaduais. Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho