A tradução automática de texto, embora possua raízes na metade do século passado, vem recebendo melhorias substanciais na última década, alimentadas pelo crescimento do poder computacional, disponibilidade de dados linguísticos e inovações técnicas. Com relação às inovações, e levando em consideração os recursos mencionados, a alternativa que apresenta apenas vantagens da Tradução Automática Neural (NMT) sobre técnicas de Tradução Automática Estatística (SMT) é:
- A)os modelos são mais efetivamente modularizáveis e possuem menos parâmetros totais;
Errada, porque a NMT não é conhecida por ser mais modular e, em geral, tende a ter muitos parâmetros, não menos.
- B)todos os parâmetros do modelo são ajustados independentemente, e o processo pode ser escalonado com o aumento da memória disponível;
Errada, porque os parâmetros não são ajustados independentemente; na NMT o aprendizado é conjunto e integrado.
- C)os parâmetros de modelos já construídos podem ser facilmente reaproveitados, e há menor dependência dos dados linguísticos;
Errada, porque embora haja reaproveitamento em alguns cenários de transfer learning, a NMT não se destaca por menor dependência de dados linguísticos.
- D)os modelos obtidos são mais interpretáveis, e o processo pode ser escalonado com o aumento da memória disponível;
Errada, porque modelos neurais costumam ser menos interpretáveis do que os estatísticos, embora possam ser escalonados em hardware paralelo.
- E)todos os parâmetros do modelo são ajustados conjuntamente e o processo pode ser paralelizado.
Certa, porque na NMT o treinamento é feito de forma conjunta e o modelo é altamente compatível com paralelização em hardware moderno.
Gabarito: E
A Tradução Automática Estatística (SMT) foi por muito tempo baseada em módulos separados, como alinhamento, modelo de tradução, modelo de linguagem e reordenação. Isso dava mais “encaixes manuais” no processo, mas também mais limitações na qualidade final. Já a Tradução Automática Neural (NMT) costuma tratar a tradução de forma end-to-end, aprendendo tudo em um único modelo treinado de ponta a ponta. Na prática, a grande sacada da NMT é que os parâmetros são ajustados conjuntamente. Em vez de cada pedaço ser otimizado de forma independente, a rede aprende as representações e as decisões de tradução ao mesmo tempo, por retropropagação. Isso melhora a capacidade de capturar contexto, dependências longas e nuances linguísticas. Outra vantagem importante é a paralelização do treinamento, especialmente nas arquiteturas modernas baseadas em atenção e Transformers. Como as operações são mais adequadas a GPUs e processamento paralelo, o treino fica muito mais eficiente do que em abordagens clássicas mais fragmentadas. Em outras palavras: menos “colagem de peças” e mais modelo único aprendendo de forma integrada. Por isso, o gabarito é a letra E: em NMT, os parâmetros são ajustados conjuntamente e o processo pode ser paralelizado. As outras alternativas misturam características que não são vantagens típicas da NMT, como modularização excessiva, menor número de parâmetros ou maior interpretabilidade, que não representam o padrão dessa técnica.