A partir de sua base de dados, um advogado está analisando a relação entre o valor das indenizações (indenização) e duas variáveis explicativas – tempo de litígio em anos (litígio) e número de testemunhas no processo (testemunhas). Ele utiliza o seguinte código em R, onde ajusta um modelo de regressão linear múltipla usando sua base de dados armazenada no objeto dados e faz algumas análises adicionais: modelo <- lm(indenizacao ~ litigio + testemunhas, data = dados) summary(modelo) vif(modelo) plot(modelo) Com base no código descrito, assinale a afirmativa INCORRETA.
- A)A função lm não pode ser utilizada para o ajuste de um modelo de regressão logística.
Errada: lm() ajusta regressão linear, enquanto regressão logística é feita normalmente com glm() e família binomial.
- B)O comando vif(modelo) é utilizado para verificar se há multicolinearidade entre as variáveis explicativas.
Certa: vif(modelo) é usado para verificar multicolinearidade entre as variáveis explicativas.
- C)Se for de interesse incluir a interação entre as variáveis litigio e testemunhas, pode ser utilizado o comando modelo <- lm(indenizacao ~ litigio*testemunhas, data = dados) .
Certa: o operador * inclui os efeitos principais e a interação entre litigio e testemunhas.
- D)O gráfico de diagnóstico criado por plot(modelo) permite visualizar graficamente possíveis problemas com os resíduos do modelo, como a não normalidade e pontos de influência.
Certa: plot(modelo) gera gráficos de diagnóstico que ajudam a avaliar resíduos, normalidade aproximada e pontos influentes.
- E)O comando summary(modelo) fornece um resumo do ajuste do modelo, incluindo os coeficientes estimados e seus respectivos valores-p, além da estatística do teste de heterocedasticidade dos resíduos.
Errada: summary(modelo) traz coeficientes e valores-p, mas não fornece estatística de teste de heterocedasticidade dos resíduos por padrão.
Gabarito: E
O comando lm() em R é o queridinho da regressão linear: ele ajusta um modelo em que a variável resposta é contínua, como indenização. No caso do enunciado, o modelo tenta explicar a indenização a partir de litígio e testemunhas, e summary(modelo) mostra o resumo clássico do ajuste: coeficientes estimados, erros-padrão, estatísticas t, valores-p e medidas globais como R-quadrado. Já vif(modelo) serve para investigar multicolinearidade entre as variáveis explicativas, isto é, se elas estão “andando coladas demais”. E plot(modelo) abre os gráficos de diagnóstico do ajuste, úteis para enxergar resíduos, pontos influentes e problemas de pressupostos. A pegadinha da questão está na alternativa que fala em heterocedasticidade. O summary() não traz, por padrão, teste de heterocedasticidade dos resíduos. Ele resume o modelo, mas não faz esse teste específico sozinho. Para avaliar heterocedasticidade, normalmente você usa inspeção gráfica dos resíduos ou testes próprios, como Breusch-Pagan, em pacotes apropriados. Outro detalhe importante: lm() é para regressão linear. Se o interesse fosse regressão logística, o caminho usual seria glm(..., family = binomial), e não lm(). Em prova, a banca costuma misturar funções e saídas para ver se você sabe o papel de cada comando sem se empolgar com o que ele não faz. Então o erro da questão está em atribuir ao summary(modelo) uma estatística de heterocedasticidade que não pertence ao seu resultado padrão. É o tipo de detalhe que parece inocente, mas derruba quem confunde “resumo do modelo” com “pacote completo de diagnósticos”.