A evolução das redes neurais impulsionou significativamente o avanço da inteligência artificial, resultando em arquiteturas inovadoras. Entre elas, uma se sobressai por sua habilidade em gerenciar sequências de tamanho variável, eficiência em treinamentos com grandes volumes de dados e pela implementação do mecanismo de atenção, o que possibilita uma análise ponderada e dinâmica das entradas. Essa arquitetura é denominada.
- A)Transformer.
Certa, porque o Transformer usa mecanismo de atenção e é especialmente eficiente no processamento de sequências e no treinamento em larga escala.
- B)Rede Neural Convolucional (CNN).
Errada, porque CNNs são mais voltadas para extração de padrões locais, como em imagens, e não são marcadas por atenção como elemento central.
- C)Perceptron Multicamadas (MLP).
Errada, porque MLPs são redes feedforward simples e não tratam bem dependências sequenciais nem possuem atenção nativa.
- D)Rede Neural Recorrente (RNN).
Errada, porque RNNs lidam com sequências, mas de forma recorrente e sequencial, sem o mecanismo de atenção como característica principal.
- E)Rede Neural de Memória Longa de Curto Prazo (LSTM).
Errada, porque LSTM melhora a RNN para dependências de longo prazo, mas ainda não é a arquitetura conhecida por atenção e paralelismo em larga escala.
Gabarito: A
Quando a questão fala em lidar com sequências de tamanho variável, treinar bem com grandes volumes de dados e usar mecanismo de atenção, ela está apontando para o Transformer. Essa arquitetura mudou o jogo em tarefas como tradução, resumo e geração de texto, porque consegue focar nas partes mais relevantes da entrada sem depender de processar tudo em ordem, passo a passo. A grande sacada do Transformer é o self-attention, ou atenção própria: ele compara cada parte da sequência com as demais e atribui pesos diferentes conforme a importância de cada elemento. Assim, o modelo entende contexto de forma mais eficiente e paralela, o que ajuda muito no treinamento com grandes massas de dados. Isso o diferencia das RNNs e LSTMs, que foram muito importantes antes, mas sofrem mais com dependências longas e processamento sequencial. Já CNNs e MLPs não foram feitas para esse tipo de leitura contextual de sequências com atenção dinâmica. Em resumo: se a questão citou atenção e alta eficiência em escala, a resposta tem cheiro forte de Transformer.