Questão nº 69
Questão de Estatística · FGV MP-SC 2022 (nº 69)
Um modelo semântico vetorial foi criado com a seguinte definição:
onde é o vetor correspondente à palavra , é o i-ésimo documento da coleção de artigos da Wikipédia, ordenados alfabeticamente por título, e e são, respectivamente, as funções de frequência de termo e inverso da frequência em documentos.
A alternativa que classifica corretamente o modelo acima descrito e apresenta a razão correta para a classificação é:
- Alatente, pois descreve uma distribuição de tópicos em ;
- Blatente, pois o modelo produz vetores densos;
- Cexplícito, pois há uma interpretação intrínseca ao modelo para cada dimensão dos vetores; (alternativa correta)
- Dlatente, pois o modelo é construído de forma não supervisionada;
- Eexplícito, pois a informação do modelo é específica a um corpus.
Resposta comentada
Gabarito Alternativa C
O conceito-chave é: em semântica vetorial explícita, cada dimensão do vetor tem um significado claro e pré-definido (aqui, a dimensão é o documento ). Em modelos latentes (como LSA), as dimensões são tópicos abstratos, sem interpretação direta.
- (A) Incorreta: não descreve tópicos, mas sim a importância da palavra em cada documento específico; a distribuição é sobre documentos, não sobre tópicos latentes.
- (B) Incorreta: vetores densos (com poucos zeros) não definem latência; o modelo TF-IDF é esparso e explícito, e densidade não é critério de classificação.
- (C) Correta: o modelo é explícito porque cada dimensão do vetor corresponde a um documento da coleção, dando interpretação intrínseca e direta a cada coordenada (o valor é para aquele documento).
- (D) Incorreta: ser não supervisionado não torna o modelo latente; TF-IDF é não supervisionado, mas as dimensões são observáveis e nomeáveis (documentos).
- (E) Incorreta: ser específico a um corpus é característica de qualquer modelo vetorial (inclusive latentes); a especificidade não é o que define a natureza explícita ou latente.
Armadilha da banca (distrator mais tentador, B): a pegadinha está em associar "vetores densos" a "latente". Na verdade, latência se refere a dimensões ocultas/não observáveis (como tópicos), e não à densidade dos vetores. O TF-IDF produz vetores esparsos (muitos zeros), mas mesmo que fossem densos, continuariam explícitos, pois cada posição ainda representaria um documento conhecido.
Fonte: FGV MP-SC 2022 Analista de Dados e Pesquisas (Caderno Tipo 1). Reproduzida para fins de estudo.