A indexação automática é um processo, estudado pelo campo da ciência da informação, que investiga a geração, a coleta, a organização, a interpretação, o armazenamento, a recuperação, a disseminação, a transformação e o uso da informação, com ênfase particular na aplicação de tecnologias modernas nessas atividades. As formas conhecidas de indexação automática são por extração e por atribuição. A partir das informações apresentadas, assinale a opção correta.
- A)Os sistemas baseados em indexação por extração automática cumprem as seguintes tarefas: (1) contar palavras num texto; (2) cotejá-las com uma lista de palavras proibidas; (3) eliminar palavras não significativas; e (4) ordenar as palavras de acordo com sua frequência.
Certa: descreve operações típicas da indexação por extração automática, como contagem de palavras, eliminação de palavras vazias e ordenação por frequência.
- B)O vocabulário controlado é a lista de termos autorizados que serve para controlar os sinônimos. Têm-se, até o momento, apenas dois tipos de vocabulários controlados: listas de cabeçalhos de assuntos e de tesauros.
Errada: vocabulário controlado não se limita a cabeçalhos de assunto e tesauros, pois há outros instrumentos e formas de controle terminológico.
- C)O processo de indexação automática requer que se priorize a incidência de palavras e termos em um texto e não o conceito que elas representam, por isso é prescindível a análise semântica.
Errada: a indexação automática não dispensa análise semântica, porque trabalhar só com frequência de termos pode gerar ruído e perder o sentido do documento.
- D)A indexação automática apresenta resultados totalmente satisfatórios e suas soluções contribuem para significativas melhoras no processo de indexação manual, eliminando-a.
Errada: a automação não torna a indexação manual dispensável, pois os resultados não são totalmente satisfatórios e geralmente exigem revisão humana.
- E)A indexação por subtração é aquela em que os termos de indexação são retirados do texto, ou seja, são construídos a partir de palavras que aparecem no documento original.
Errada: a descrição confunde termos e ainda inventa uma lógica de 'subtração'; na indexação por extração, os termos são obtidos do próprio texto, mas não com essa definição.
Gabarito: A
A indexação automática usa algoritmos para ajudar a transformar o texto em termos de busca, reduzindo o trabalho humano e padronizando parte do processo. Em linhas gerais, ela pode ocorrer por extração, quando o sistema retira do próprio documento as palavras ou expressões mais relevantes, e por atribuição, quando associa ao texto termos escolhidos a partir de um vocabulário controlado. Na prática, isso ajuda a acelerar o tratamento documental, mas não faz milagre: ainda há limitações semânticas e necessidade de supervisão humana em muitos contextos. O ponto central da questão está na indexação por extração. Nesse modelo, o sistema costuma contar palavras, comparar com listas de exclusão, retirar termos sem valor informativo e ordenar por frequência ou relevância para sugerir descritores. É exatamente essa lógica que a alternativa A descreve. Ela está alinhada com a ideia clássica de extração automática, em que o próprio texto fornece os candidatos a termos de indexação. Já a indexação por atribuição trabalha com termos pré-estabelecidos, normalmente de um vocabulário controlado, como cabeçalhos de assunto ou tesauros. Isso significa que o sistema ou o indexador não depende só do que aparece literalmente no documento, mas também do conceito representado. Por isso, a análise semântica não é prescindível: ela continua importante para evitar ruído e melhorar a recuperação da informação. Em provas CESPE/CEBRASPE, costuma aparecer essa troca sutil entre texto e conceito, além da tentativa de vender a automação como solução perfeita. Desconfie: em Biblioteconomia, tecnologia ajuda muito, mas não substitui totalmente a inteligência documental.