Questão nº 57
Questão de Estatística · FCC TRT17 2022 (nº 57)
Atenção: Para responder às questões de números 57 e 58, considere o código na linguagem R.
Y<-c(2,3,2,4,3,5,6,3,4) #1 X1<-c(10,13,9,18,12,22,27,13,21) #2 X2<-c(6,10,4,10,10,17,16,9,13) #3 dados<-data.frame(cbind(Y,X1,X2)) #4 modelo <- lm(Y ~ X1 + X2, data = dados) #5 summary(modelo) #6 coef(modelo) #7 formula(modelo) #8 plot(modelo) #9 p <- as.data.frame(cbind(13,4)) #10 colnames(p) <- cbind("X1","X2") #11 predict(modelo, newdata=p) #12 vcov(modelo) #13 Intercept<-rep(1,times=9) #14 X<-cbind(Intercept,X1,X2) #15 t(solve(t(X)%*%X)%*%t(X)%*%Y) #16 residuals(modelo) #17
É correto afirmar que
Este texto de apoio vale também pra questão nº 58.
- Ao comando da linha 6 calcula o somatório dos valores de Y, X1 e X2, gerando um vetor com esses três valores.
- Bo comando da linha 9 gera um único gráfico de dispersão em 3 dimensões representando os pontos (Y, X1, X2).
- Co comando da linha 4 realiza o cálculo matricial , onde é a transposta de X1.
- Dos comandos das linhas 10 a 12 calculam, baseado no modelo de regressão linear denominado "modelo", uma previsão para o valor de Y com os valores X1 = 13 e X2 = 4. (alternativa correta)
- Eo comando da linha 7 obtém o valor do coeficiente de determinação () do modelo de regressão linear ajustado.
Resposta comentada
Gabarito Alternativa D
O conceito-chave aqui é a regressão linear múltipla em R, que modela a relação de uma variável dependente (Y) com duas ou mais variáveis independentes (X1, X2). O código demonstra como ajustar esse modelo, obter seus parâmetros e, crucialmente, como usá-lo para fazer previsões para novos dados.
(A) Incorreta: O comando summary(modelo) (linha 6) gera um relatório estatístico completo do modelo de regressão linear, incluindo coeficientes, erros padrão, valores p, R-quadrado, etc., e não apenas o somatório dos valores de Y, X1 e X2.
(B) Incorreta: O comando plot(modelo) (linha 9) para um objeto lm (modelo de regressão linear) gera uma série de gráficos de diagnóstico em 2 dimensões (geralmente 4 gráficos diferentes), como resíduos vs. valores ajustados, Q-Q normal, etc., e não um único gráfico de dispersão em 3 dimensões.
(C) Incorreta: O comando dados<-data.frame(cbind(Y,X1,X2)) (linha 4) combina os vetores Y, X1 e X2 como colunas para formar uma matriz e, em seguida, converte essa matriz em um data frame (estrutura de dados tabular). Ele não realiza o cálculo matricial ; essa notação não se aplica ao que cbind e data.frame fazem. Armadilha da banca: Esta alternativa tenta confundir o aluno com notação de álgebra linear, mas cbind simplesmente concatena colunas e data.frame cria uma tabela.
(D) Correta: Os comandos das linhas 10 a 12 preparam um novo conjunto de dados (p) com os valores X1 = 13 e X2 = 4 e, em seguida, usam a função predict() com o modelo de regressão linear ajustado (modelo) para calcular a previsão do valor de Y para esses novos valores de X1 e X2.
(E) Incorreta: O comando coef(modelo) (linha 7) extrai os coeficientes de regressão (intercepto e inclinações para X1 e X2) do modelo. O coeficiente de determinação () é uma medida da proporção da variância da variável dependente que é explicada pelas variáveis independentes e é obtido através do comando summary(modelo) (linha 6), não de coef(modelo).
Fonte: FCC TRT17 2022 Analista Judiciário - Área Apoio Especializado - Especialidade Estatística (Caderno Tipo 001). Reproduzida para fins de estudo.