Sobre as redes neurais convolucionais (CNNs) é correto afirmar que
- A)ao treinar CNNs utilizando transferência de aprendizado, começamos com um modelo pré-treinado e executamos numa nova tarefa qualquer, sem precisar se preocupar com o formato e o tipo de dados.
Errada: transferência de aprendizado não dispensa a preocupação com o tipo e o formato dos dados, porque a entrada ainda precisa ser compatível com a arquitetura e com o pré-processamento esperado.
- B)ao treinar CNNs utilizando transferência de aprendizado para ajuste fino, começamos com um modelo pré-treinado e atualizamos todos os parâmetros do modelo para nossa nova tarefa, basicamente retreinando todo o modelo.
Certa: no ajuste fino, você parte de um modelo pré-treinado e atualiza seus parâmetros para adaptá-lo à nova tarefa.
- C)uma rede neural convolucional pode ser utilizada para reconhecer os mais variados tipos de dados. Por exemplo, textos, imagens e dados de clientes. Para isso, basta que os dados de entrada sejam transformados por alguma técnica de extração de características em simples vetores de características.
Errada: CNNs são mais naturais para dados com estrutura espacial, como imagens, e não basta transformar qualquer dado em vetor para tornar a CNN a escolha ideal.
- D)as últimas camadas convolucionais de uma rede neural CNN são capazes de extrair características mais baixo nível dos dados, como linhas, círculos e pontos, enquanto as primeiras camadas extraem características mais alto nível, detalhes mais específicos dos objetos reconhecidos.
Errada: está invertido, pois as primeiras camadas capturam padrões mais simples e as camadas mais profundas aprendem características mais abstratas e de alto nível.
- E)as camadas de pooling das CNNS são capazes de extrair características de médio nível, reconhecendo características que são mais detalhadas que as primeiras camadas convolucionais.
Errada: pooling serve principalmente para reduzir dimensionalidade e reter informação relevante, não para extrair características de médio nível.
Gabarito: B
As CNNs são redes muito usadas quando os dados têm estrutura espacial, como imagens, porque elas aprendem filtros que capturam padrões locais em camadas sucessivas. Em geral, as primeiras camadas aprendem traços mais simples, como bordas e texturas, e as camadas mais profundas combinam esses traços para formar conceitos mais complexos, como partes de objetos e objetos inteiros. O pooling ajuda a reduzir a dimensão e a manter o que é mais relevante, não a criar uma nova camada de interpretação "média" como a alternativa sugere. Quando você usa transferência de aprendizado, a ideia é aproveitar um modelo já treinado em uma base grande e reaproveitar esse conhecimento em uma nova tarefa. Isso costuma ser muito eficiente, principalmente quando você não tem muitos dados na tarefa nova. No ajuste fino (fine tuning), você pega esse modelo pré-treinado e atualiza parte ou até todos os seus parâmetros para adaptar o comportamento ao novo problema. É exatamente por isso que a letra B está correta: no ajuste fino, o modelo pré-treinado é reaproveitado e seus parâmetros são atualizados para a nova tarefa, o que na prática pode significar retreinar boa parte ou a totalidade da rede. As outras alternativas tentam misturar conceitos de forma bonita, mas trocam a ordem das camadas, exageram a liberdade da transferência de aprendizado ou confundem o papel do pooling.