As Redes Neurais Convolucionais (Convolutional Neural Network - CNNs) são amplamente utilizadas em tarefas de reconhecimento de imagens. Sobre as características e as arquiteturas das CNNs, avalie as afirmativas a seguir. I. Uma camada que compõe uma CNN é a camada convolucional. Nela ocorre a subamostragem da imagem, com o objetivo de se diminuir a carga computacional, o uso de memória e o número de parâmetros necessários. II. LeNet-5, AlexNet e ResNet são exemplos de arquiteturas CNN. III. A arquitetura de uma CNN é composta exclusivamente por camadas convolucionais e camadas de pooling. Está correto o que se afirma em
- A)I, apenas.
A alternativa afirma que somente a afirmativa I estaria correta. O problema é que a I confunde a função da camada convolucional com a da camada de pooling: a convolução serve para extrair características por filtros, enquanto a subamostragem para reduzir dimensão, memória e custo computacional é típica do pooling ou de mecanismos de downsampling. Como a questão também traz a afirmativa II como correta, a alternativa fica incorreta por deixar de fora essa parte verdadeira.
- B)II, apenas.
A alternativa reúne apenas a afirmativa II. Isso está correto porque LeNet-5, AlexNet e ResNet são arquiteturas clássicas de redes neurais convolucionais, amplamente usadas em visão computacional. As afirmativas I e III estão conceitualmente erradas, já que a subamostragem não é a função definidora da camada convolucional e uma CNN não se limita exclusivamente a convolução e pooling.
- C)I e II, apenas.
A alternativa sustenta que I e II estariam corretas. Embora a II esteja certa ao citar arquiteturas CNN conhecidas, a I erra ao atribuir à camada convolucional a subamostragem da imagem, pois essa redução dimensional é feita, em regra, pelo pooling e não pela própria convolução. Assim, o conjunto proposto mistura uma afirmação verdadeira com outra falsa.
- D)I e III, apenas.
A alternativa diz que I e III estariam corretas. Isso não se sustenta porque a I associa indevidamente a camada convolucional à subamostragem, quando sua função principal é aplicar filtros e gerar mapas de características, e a III restringe em excesso a arquitetura de uma CNN ao ignorar outras camadas comuns, como ativação, normalização, flatten e, em muitas redes, camadas densas. Portanto, ela reúne duas formulações que distorcem a estrutura real das CNNs.
- E)II e III, apenas
A alternativa indica que II e III estariam corretas. A II realmente está certa ao apontar LeNet-5, AlexNet e ResNet como exemplos de arquiteturas CNN, mas a III é excessiva ao afirmar que a CNN é composta exclusivamente por camadas convolucionais e de pooling. Na prática, CNNs também incluem outras operações e camadas, de modo que a alternativa não pode ser aceita como correta.
Gabarito: B
CNNs sao redes muito usadas em visao computacional porque conseguem extrair padroes da imagem em varias escalas, como bordas, texturas e formas. O bloco mais famoso e a camada convolucional, que aplica filtros para detectar caracteristicas locais da imagem. Depois disso, normalmente entram camadas de pooling, que reduzem a dimensao espacial e ajudam a diminuir custo computacional e a trazer certa invariancia a pequenas translacoes. A afirmativa I esta errada porque atribui a subamostragem a camada convolucional. Em geral, quem faz a subamostragem e a camada de pooling, nao a convolucao. A convolucao serve principalmente para extracao de caracteristicas. A afirmativa II esta certa: LeNet-5, AlexNet e ResNet sao arquiteturas classicas de CNN, muito citadas em livros e provas. A LeNet-5 e uma das pioneiras, a AlexNet popularizou o uso de deep learning em imagens, e a ResNet ficou famosa pelas conexoes residuais, que ajudam a treinar redes mais profundas. A afirmativa III esta errada porque uma CNN nao e composta exclusivamente por camadas convolucionais e de pooling. Normalmente ha tambem camadas de ativacao, normalizacao, flatten e camadas totalmente conectadas, dependendo da arquitetura. Por isso, o gabarito correto e B, apenas a II.