Um sistema de informações deve ser implementado com a finalidade de compilar dados relacionados à opinião dos usuários sobre uma determinada instituição, considerando as publicações de conteúdos na Web. A técnica empregada para navegar automaticamente por páginas Web e extrair informações relevantes para o contexto de aplicação recebe o nome de
- A)Mineração de Dados.
Errada, porque mineração de dados é a análise de grandes conjuntos de dados para encontrar padrões, e não a navegação automática em páginas Web.
- B)Aprendizado de Máquina.
Errada, porque aprendizado de máquina é uma técnica para treinar modelos a partir de dados, não para extrair conteúdo de sites.
- C)Raspagem de Dados em Redes.
Certa, porque raspagem de dados em redes, ou web scraping, é a técnica de acessar páginas Web automaticamente e extrair informações relevantes.
- D)Interface de Programação de Aplicações.
Errada, porque API é uma interface para comunicação entre sistemas, não um processo de varrer páginas Web para coletar dados.
- E)Descoberta de Conhecimento em Bases de Dados.
Errada, porque descoberta de conhecimento em bases de dados é um processo mais amplo de análise e descoberta de padrões, não a extração automática de conteúdo de páginas.
Gabarito: C
A questão fala de uma técnica usada para visitar páginas da Web de forma automática e puxar delas as informações que interessam ao sistema. Pense assim: em vez de alguém abrir site por site e copiar os dados na mão, um programa faz esse trabalho e coleta o conteúdo de maneira organizada. Isso é muito comum quando se quer acompanhar opiniões de usuários, comentários, avaliações e menções sobre uma instituição na internet. O nome dessa técnica, no contexto da Web, é raspagem de dados, também chamada de web scraping. Ela pode envolver o acesso automatizado a páginas, a leitura do HTML e a extração de trechos relevantes, como texto, links, preços, comentários ou classificações. Em temas de concurso, a banca costuma cobrar essa ideia com a expressão mais direta possível: navegar automaticamente e extrair informações. Por isso, o gabarito é a alternativa C. As outras opções parecem próximas porque também lidam com dados e informação, mas não descrevem esse processo específico de coleta automática em páginas Web. Aqui o foco não é analisar dados já organizados, nem treinar algoritmos, nem integrar sistemas por interface: é varrer a Web e capturar o que interessa. Em resumo: se a questão fala de monitorar conteúdos publicados na Web e coletar automaticamente o que aparece nas páginas, você deve pensar em raspagem de dados. É a velha assistente digital fazendo o serviço braçal da internet sem reclamar e sem tomar café.