O processo de integração de dados demanda um conjunto de ações envolvendo tarefas no contexto do que usualmente se chama “limpeza de dados” (ou data cleansing). E um dos desafios enfrentados nesse processo é a forma pela qual serão tratados os dados ausentes. A ausência de um dado atende a um mecanismo específico. O mecanismo conhecido como MAR (Missing at Random) é aquele no qual a ausência
- A)causa a remoção de linhas completas de dados que apresentam qualquer coluna com dado ausente.
Errada, porque remover linhas inteiras com qualquer valor ausente é uma técnica de tratamento, não o conceito de mecanismo de ausência de dados.
- B)elimina os registros de dados segundo algum critério, como sua matriz de correlação.
Errada, porque eliminar registros por correlação é um critério artificial de filtragem e não define MAR.
- C)está relacionada aos dados observados na coluna do conjunto de dados na qual a ausência ocorre.
Errada, porque isso descreve ausência ligada ao próprio valor da coluna, o que não é MAR.
- D)está relacionada aos demais dados das demais colunas do conjunto de dados, que não a coluna sendo observada.
Certa, porque no MAR a ausência depende de outras variáveis observadas no conjunto, e não do valor faltante em si.
- E)não tem relação alguma com os dados do conjunto de dados, acontecendo de forma aleatória.
Errada, porque ausência totalmente aleatória e sem relação com os dados corresponde ao conceito de MCAR, não MAR.
Gabarito: D
Em limpeza de dados, a primeira pergunta importante sobre valores ausentes é: eles faltam por acaso ou existe um padrinho escondido influenciando essa ausência? É aí que entram os mecanismos MCAR, MAR e MNAR. No MAR (Missing at Random), a ausência de um dado não depende do valor que está faltando, mas pode depender de outras variáveis observadas no conjunto. Em outras palavras, o sumiço tem explicação nos dados que voce já tem na mão, não no próprio valor ausente. Isso costuma aparecer muito em questões de provas porque os nomes parecem parecidos, mas a lógica é diferente. No MAR, por exemplo, a falta de renda pode estar relacionada à escolaridade, idade ou região, que são outras colunas observadas. O ponto central é: a ausência está associada a outras variáveis do banco, e não ao item ausente em si. Por isso, a alternativa D está correta: ela diz que a ausência está relacionada aos demais dados das demais colunas do conjunto de dados, e não à coluna sendo observada. Isso descreve exatamente o mecanismo MAR. Já a ideia de ausência totalmente aleatória, sem relação com nada, seria outra categoria. Em prova, pense assim: MAR é quando o dado sumiu, mas deixou pistas nas outras colunas. A banca FGV gosta dessa distinção fina e troca facilmente "relacionado à coluna ausente" por "relacionado às outras colunas" para testar se voce entendeu o conceito de verdade.