Se uma densidade pertence à família exponencial, então ela podeser escrita como f(x) = a(θ)b(x) exp{c(θ)d(x)}, sendo a, b, c e d funções. Lembremos que se uma amostra aleatória X1, X2, ..., Xn é obtida de uma densidade que pertence à família exponencial, então, pelo critério de fatorização, uma estatística suficiente é dada por
- A)∑ d(Xi)}
Correta, porque a estatística suficiente na família exponencial é a soma de d(Xi), que reúne a informação da amostra sobre o parâmetro.
- B)exp{∑ d(Xi)}
Errada, porque aplicar exponencial à soma não é a forma indicada pelo critério de fatorização nem corresponde à estatística suficiente.
- C)c(∑(Xi)}
Errada, porque a suficiência não vem de c aplicado à soma de Xi, e sim da função que aparece ligada aos dados no expoente.
- D)∑ c(Xi)}
Errada, porque a soma de c(Xi) não é a estrutura que o modelo exponencial fornece como estatística suficiente.
- E)n∑ c(Xi)
Errada, porque o fator n multiplicando a soma de c(Xi) não tem suporte na fatorização e altera indevidamente a forma da estatística.
Gabarito: A
Quando a densidade pertence à família exponencial, ela pode ser escrita na forma f(x) = a(\theta)b(x)exp\{c(\theta)d(x)\}. O ponto importante aqui é enxergar quem carrega a informação sobre o parâmetro e quem depende só da amostra. Pelo critério de fatorização, a estatística suficiente deve concentrar a parte da amostra que aparece ligada ao parâmetro no termo exponencial. Se você tem uma amostra aleatória X1, X2, ..., Xn, a densidade conjunta vira o produto das densidades individuais. Ao juntar esses termos, a parte que depende dos dados entra como soma no expoente, isto é, aparece em função de \sum d(Xi). É exatamente essa soma que resume a amostra para fins de inferência sobre o parâmetro. Por isso, a estatística suficiente é dada por \sum d(Xi). As demais parcelas, como o produto de b(Xi), ficam separadas e não interferem na informação sobre \theta. Esse é o espírito do Teorema da Fatorização: separar o que interessa ao parâmetro do que é apenas “cenário de fundo”. Então, o gabarito A está correto porque identifica justamente a soma da função d aplicada aos dados, que é a estatística suficiente natural na família exponencial. Em concursos, a banca costuma cobrar essa leitura direta da forma da densidade, sem rodeios.