Conhecimento aberto · Ciência para todos
Tecnologia

Modelos de Linguagem de Grande Escala: como os LLM aprendem, raciocinam, erram e transformam a produção do conhecimento

Os modelos de linguagem de grande escala (Large Language Models, LLM) constituem uma classe de redes neuronais treinadas em grandes colecções de texto para estimar a probabilidade de sequências linguísticas.

Imagem de apoio: Modelos de Linguagem de Grande Escala: como os LLM aprendem, raciocinam, erram e transformam a produção do conhecimento

Da previsão de palavras a uma infraestrutura intelectual

Um modelo de linguagem atribui probabilidades a sequências. Dada uma sequência de tokens x1, x2, ..., xt, um modelo autoregressivo estima:

P(x1:T) = ∏t=1T P(xt | x<t)

Nesta expressão, P representa a probabilidade, xt corresponde ao token previsto na posição t e x<t representa todos os tokens anteriores.

Durante o treino, os parâmetros são ajustados para aumentar a probabilidade do token correcto em cada posição. A função de perda mais comum é a entropia cruzada negativa:

L = −∑t=1T log Pθ(xt | x<t)

Nesta equação, L representa a perda do modelo, θ representa o conjunto de parâmetros aprendidos e log corresponde ao logaritmo da probabilidade atribuída ao token correcto.

Esta formulação parece modesta: prever o próximo fragmento textual. Contudo, para fazer boas previsões em milhares de milhões ou biliões de contextos, o modelo aprende regularidades gramaticais, relações semânticas, padrões discursivos, factos recorrentes, estilos, estruturas de código e correlações sobre o mundo descrito nos dados. Isso não prova que possua consciência ou compreensão humana. Mostra que o objectivo preditivo força a construção de representações internas úteis.

O termo grande escala não possui um limiar universal. Pode referir-se ao número de parâmetros, ao volume de dados, ao custo computacional ou à diversidade das tarefas. O aspecto central é que o modelo é pré-treinado de forma geral e depois reutilizado, adaptado ou instruído para muitos fins. Essa mudança transformou o processamento de linguagem natural: em vez de construir um sistema isolado para cada tarefa, desenvolve-se um modelo-base e condiciona-se o seu comportamento por exemplos, instruções, ajuste fino ou acesso a ferramentas.

Uma breve genealogia: de Shannon ao Transformer

A modelação estatística da linguagem antecede a inteligência artificial moderna. Claude Shannon relacionou linguagem, probabilidade e teoria da informação. Durante décadas, modelos de n-gramas estimaram uma palavra a partir de poucas palavras anteriores, sofrendo com contextos curtos e combinações raras. Redes neuronais recorrentes e LSTM ampliaram a memória, mas processavam sequências passo a passo, o que dificultava o treino em grande escala e a conservação de dependências longas.

Em 2017, Vaswani e colaboradores apresentaram o Transformer no artigo Attention Is All You Need. A arquitectura substituiu a recorrência por mecanismos de atenção, permitindo que cada posição ponderasse directamente outras posições e que muitas operações fossem calculadas em paralelo (Vaswani et al., 2017). O artigo foi originalmente orientado para tradução automática, mas o mecanismo mostrou-se suficientemente geral para sustentar modelos bidireccionais, como BERT, e modelos autoregressivos, como a família GPT.

O BERT demonstrou o poder do pré-treino bidireccional para compreender e classificar texto (Devlin et al., 2019). O GPT-3 mostrou que um modelo autoregressivo de grande escala podia executar diversas tarefas a partir de instruções e poucos exemplos no contexto, sem actualização dos seus parâmetros para cada tarefa (Brown et al., 2020). A partir daí, o campo passou a combinar aumento de escala, dados mais bem seleccionados, treino optimizado, janelas de contexto maiores, multimodalidade e pós-treino orientado por preferências.

A arquitectura Transformer

Arquitectura completa do Transformer, com codificador, descodificador e mecanismos de atenção

Figura 1. Arquitectura completa do Transformer, incluindo blocos de codificação, descodificação, atenção multi-cabeça, ligações residuais e redes feed-forward. Autor: dvgodoy. Fonte: Wikimedia Commons. Licença: CC BY 4.0. Sem alterações.

Tokenização e representações vectoriais

Antes de processar texto, o sistema divide-o em tokens. Um token pode ser uma palavra, parte de uma palavra, sinal de pontuação ou unidade de bytes. Algoritmos de subpalavras equilibram dois problemas: vocabulários compostos apenas por palavras tornam-se enormes e desconhecem palavras novas; caracteres isolados produzem sequências demasiado longas.

Cada token é convertido num vector denso chamado embedding. Tokens usados em contextos semelhantes adquirem representações relacionadas, embora o significado contextual final seja produzido ao longo das camadas. A posição também precisa ser codificada, pois a atenção, isoladamente, não conhece a ordem da sequência.

A tokenização não é linguisticamente neutra. Línguas bem representadas no treino tendem a ser segmentadas de maneira mais eficiente. Palavras de línguas com poucos dados podem ser fragmentadas em muitos tokens, aumentando custo, reduzindo o contexto útil e prejudicando o desempenho. Para línguas africanas, ortografias, variação dialectal, mistura linguística e escassez de corpora tornam esta questão especialmente relevante.

Auto-atenção

No mecanismo de atenção, cada token origina vectores de consulta (query), chave (key) e valor (value). A atenção escalada pode ser expressa como:

Atenção(Q, K, V) = softmax[(QKT) / √dk]V

O produto entre consultas e chaves determina quanto cada posição deve considerar as demais; a função softmax converte pontuações em pesos; a combinação ponderada dos valores transporta informação contextual. A divisão pela raiz quadrada de dk estabiliza as magnitudes durante o treino.

Na atenção multi-cabeça, várias operações ocorrem em paralelo. Diferentes cabeças podem especializar-se em relações locais, concordância, referência, estrutura sintáctica ou padrões mais abstractos. Seria, contudo, excessivo atribuir a cada cabeça uma função humana fixa: as representações são distribuídas e a interpretação mecanística permanece uma área activa.

Camadas, resíduos e normalização

Um Transformer empilha blocos de atenção e redes feed-forward. Ligações residuais permitem que a informação e os gradientes atravessem muitas camadas; normalização estabiliza a aprendizagem. Em modelos autoregressivos, uma máscara causal impede que a posição actual veja tokens futuros durante o treino. Assim, o modelo aprende exactamente a tarefa que enfrentará ao gerar: prever o próximo token usando apenas o contexto anterior.

Codificador, descodificador e modelos apenas descodificadores

O Transformer original possui codificador e descodificador. O codificador lê a sequência de entrada; o descodificador produz a saída condicionado pela entrada e pelos tokens já gerados. BERT utiliza essencialmente o codificador e aprende representações bidireccionais. Muitos LLM generativos modernos utilizam apenas o descodificador com máscara causal. Modelos de conversão de texto em texto, como T5, preservam a estrutura formada por codificador e descodificador.

Como um LLM é construído

1. Dados e preparação

O pré-treino pode combinar páginas web, livros, artigos, código, fóruns, documentos e conjuntos especializados. Antes do treino, equipas removem duplicados, conteúdo corrompido, spam e parte do material indesejado; classificam qualidade; equilibram domínios; aplicam filtros de segurança e, idealmente, documentam proveniência. Nenhum filtro é perfeito. Dados web carregam desigualdades, preconceitos, erros, propaganda e material pessoal.

Deduplicação é importante por razões científicas e jurídicas. Duplicados alteram a distribuição, favorecem memorização e podem contaminar conjuntos de avaliação. A ausência de transparência sobre os dados dificulta auditorias de direitos, enviesamentos e cobertura linguística, um problema destacado por Bender et al. (2021).

2. Pré-treino auto-supervisionado

“Auto-supervisionado” significa que os rótulos derivam do próprio texto: a sequência fornece o alvo seguinte ou os tokens ocultados. O treino distribui lotes por aceleradores, calcula previsões, mede a perda e actualiza milhares de milhões de pesos por retropropagação e optimização.

Os pesos não formam uma colecção legível de documentos. Constituem uma representação distribuída. Contudo, dizer que o modelo “não guarda textos” de modo absoluto também seria incorrecto: modelos podem memorizar sequências, sobretudo quando aparecem repetidamente ou são raras, e ataques podem extrair exemplos de treino. Aprendizagem estatística e memorização coexistem.

3. Leis de escala

Estudos empíricos observaram relações aproximadamente previsíveis entre perda, parâmetros, dados e computação. Mais recursos tendem a melhorar o desempenho médio, mas a alocação importa. Hoffmann et al. (2022) treinaram mais de 400 modelos e concluíram que muitos sistemas grandes estavam subtreinados: dentro de um orçamento de computação, aumentar parâmetros sem aumentar proporcionalmente os tokens não era óptimo. O modelo Chinchilla, com 70 mil milhões de parâmetros e mais dados, superou modelos maiores em várias avaliações.

As leis de escala não garantem que “maior é sempre melhor”. Qualidade dos dados, arquitectura, objectivo, pós-treino, eficiência e tarefa podem dominar a comparação. Além disso, reduzir a perda média não assegura factualidade, segurança ou justiça.

4. Pós-treino e alinhamento

Um modelo-base completa texto, mas não é necessariamente um assistente útil. O ajuste supervisionado usa pares formados por instruções e respostas. Em seguida, métodos baseados em preferências comparam respostas e optimizam o modelo para comportamentos desejados. No RLHF, avaliadores humanos ordenam respostas; um modelo de recompensa aprende essas preferências; o modelo de linguagem é actualizado por aprendizagem por reforço.

O trabalho sobre InstructGPT mostrou que avaliadores preferiram respostas de um modelo de 1,3 mil milhões de parâmetros pós-treinado às de um GPT-3 de 175 mil milhões sem o mesmo alinhamento (Ouyang et al., 2022). A conclusão não é que modelos pequenos sejam sempre superiores, mas que pós-treino e objectivo de uso importam tanto quanto escala.

Métodos posteriores utilizam preferências directamente, crítica assistida por modelos e regras explícitas. “Alinhamento”, porém, não é um valor único: prestatividade, veracidade, segurança, liberdade, privacidade e adequação cultural podem entrar em tensão. Quem define os exemplos e critérios influencia o comportamento final.

Como o texto é gerado

Na inferência, o modelo calcula uma distribuição sobre o próximo token. Escolher sempre o token mais provável pode produzir texto rígido e repetitivo. Amostragem introduz diversidade. A temperatura altera a concentração da distribuição: valores baixos favorecem escolhas previsíveis; valores altos aumentam variedade e risco. Estratégias top-k e top-p restringem a amostragem aos candidatos mais plausíveis.

Após seleccionar um token, o sistema repete o processo. Por isso, uma resposta longa é uma cadeia de decisões condicionais. Um erro inicial pode alterar o contexto e induzir erros posteriores. A fluência decorre da coerência probabilística, não de um verificador de verdade embutido.

Janela de contexto e memória

A janela de contexto limita quantos tokens podem participar directamente numa inferência. Contextos extensos permitem documentos maiores, mas aumentam custo e não garantem que toda informação seja usada com igual precisão. O modelo pode perder detalhes, confundir versões ou prestar atenção insuficiente a elementos no meio do contexto.

O histórico visível não deve ser confundido com memória permanente. Sistemas podem acrescentar camadas externas de memória, perfis ou bases vectoriais, mas isso é arquitectura do produto, não uma propriedade inevitável do LLM.

Aprendizagem em contexto, ferramentas e agentes

Um LLM pode adaptar-se temporariamente a uma tarefa a partir de instruções e exemplos incluídos no prompt, fenómeno chamado aprendizagem em contexto. Os parâmetros não mudam; muda o estado activado pelo contexto. Essa capacidade sustenta zero-shot, one-shot e few-shot prompting.

Ferramentas ampliam o sistema. Um LLM pode formular uma pesquisa, executar código, consultar uma base, usar uma calculadora ou chamar uma API. O resultado retorna ao contexto e condiciona a resposta. A distinção é fundamental: o modelo sozinho gera a partir dos parâmetros e do contexto; o sistema composto pode observar dados actuais e executar acções.

Agentes acrescentam ciclos de planeamento, acção, observação e revisão. Podem manter memória de curto e longo prazo e avaliar os próprios passos. Isso aumenta autonomia, mas também cria novas superfícies de falha: repetição infinita, uso inadequado de ferramentas, propagação de uma instrução maliciosa recuperada de um documento e dificuldade de atribuir responsabilidade.

Arquitectura de agente reflexivo com memória, avaliação e interacção com o ambiente

Figura 2. Exemplo de arquitectura de agente reflexivo. O LLM interage com o ambiente, recebe avaliação, produz reflexão e consulta memória de curto e longo prazo. Autores: Noah Shinn, Federico Cassano, Edward Berman, Ashwin Gopinath, Karthik Narasimhan e Shunyu Yao. Fonte: Wikimedia Commons, baseada em Shinn et al. (2023). Licença: CC BY 4.0. Sem alterações.

RAG: separar linguagem de conhecimento recuperável

Na geração aumentada por recuperação (Retrieval-Augmented Generation, RAG), uma pergunta é usada para procurar passagens numa colecção externa. As passagens mais relevantes são inseridas no contexto, e o modelo produz uma resposta condicionada por elas. Lewis et al. (2020) combinaram memória paramétrica e um índice não paramétrico de documentos, obtendo respostas mais específicas e factuais em tarefas intensivas em conhecimento.

Diagrama de geração aumentada por recuperação com documentos externos, prompt e LLM

Figura 3. Fluxo simplificado de RAG. Documentos externos e a entrada do utilizador são recuperados e combinados no contexto enviado ao LLM. Autor: Turtlecrown. Fonte: Wikimedia Commons. Licença: CC BY-SA 4.0. Sem alterações.

RAG oferece actualização mais rápida, possibilidade de citar fontes e controlo sobre o corpus. Não elimina alucinações. O recuperador pode seleccionar documentos irrelevantes; a base pode estar desactualizada; o modelo pode distorcer a passagem; e uma citação pode existir sem sustentar a afirmação. Um sistema rigoroso precisa avaliar separadamente recuperação, fidelidade à fonte, cobertura, resposta e qualidade das referências.

Componente Função Falha típica
Índice documental Armazenar passagens pesquisáveis Conteúdo ausente, antigo ou duplicado
Embedding e recuperador Localizar informação semanticamente próxima Recuperar texto parecido, mas não pertinente
Reordenador Priorizar as melhores passagens Valorizar pistas superficiais
LLM gerador Sintetizar a resposta Inventar ligações ou ultrapassar a evidência
Camada de citações Associar afirmações a fontes Citação decorativa ou fonte que não confirma a frase

O problema das alucinações

Uma alucinação é conteúdo gerado que não é sustentado pela fonte, pelo contexto ou por factos verificáveis. Pode ser intrínseca, quando contradiz a informação fornecida, ou extrínseca, quando acrescenta alegações não suportadas. Ji et al. (2023) mostram que o fenómeno atravessa tradução, resumo, diálogo e geração aberta.

Alucinações não são apenas “bugs ocasionais”; resultam de uma diferença estrutural entre o objectivo de prever texto provável e o objectivo de afirmar apenas o que é verdadeiro. Dados contraditórios, lacunas de conhecimento, prompts ambíguos, amostragem, pressão para responder e cadeias longas de geração contribuem para o problema.

Mitigação inclui RAG, ferramentas, treino de factualidade, respostas com abstinência, verificação posterior, decomposição de tarefas e exigência de evidência. Em medicina, direito, finanças e ciência, respostas devem ser tratadas como rascunhos ou hipóteses até serem confrontadas com fontes primárias. Uma referência com aparência académica pode ser inventada; DOI, título, autores e conteúdo precisam ser verificados.

Avaliação: medir o quê, para quem e em que condições?

Perplexidade mede a capacidade preditiva, mas não resume utilidade. Benchmarks testam conhecimento, raciocínio, programação, tradução, segurança e seguimento de instruções. O HELM propôs avaliação multidimensional com cenários e métricas de precisão, calibração, robustez, justiça, enviesamento, toxicidade e eficiência (Liang et al., 2023).

Comparações exigem cautela. Um benchmark pode ter vazado para os dados de treino; perguntas podem favorecer inglês e contextos ocidentais; métricas automáticas podem premiar semelhança superficial; pequenas mudanças no prompt alteram resultados; e a escolha do avaliador-modelo pode favorecer determinados estilos. Resultados agregados escondem subgrupos e tarefas críticas.

Uma avaliação responsável deve incluir:

  1. conjunto de teste separado e documentado;
  2. tarefas representativas do uso real;
  3. análise por língua, região e grupo;
  4. repetição com diferentes prompts e amostras;
  5. exactidão factual e qualidade das citações;
  6. robustez a instruções adversariais;
  7. calibração e capacidade de recusar quando não sabe;
  8. custo, latência e consumo de recursos;
  9. revisão humana especializada em aplicações de alto risco.

Línguas africanas e desigualdade de representação

A maior parte da investigação, dos dados e dos benchmarks históricos concentra-se no inglês. Muitas línguas africanas dispõem de poucos textos digitalizados, ortografias padronizadas de forma desigual e menos ferramentas de processamento. Comunidades como Masakhane demonstraram que investigação participativa, criação local de dados e colaboração aberta podem avançar tradução e tecnologias linguísticas africanas.

Para Moçambique, o problema não se limita ao português. Makhuwa, Changana, Sena, Lomwe e outras línguas nacionais estão sub-representadas. Um modelo pode falar português formal razoavelmente bem e falhar variedades locais, nomes, instituições, práticas culturais e alternância entre línguas. Isso cria uma desigualdade dupla: menor qualidade e maior custo em tokens.

Soluções incluem recolha consentida de corpora, digitalização de conteúdos, documentação linguística, avaliação por falantes, modelos multilingues, adaptação eficiente e governação local dos dados. “Adicionar África” como amostra tardia não substitui participação africana na definição de tarefas, riscos e benefícios.

Enviesamento, poder e trabalho humano

LLM aprendem associações presentes nos dados. Podem reproduzir estereótipos de género, raça, nacionalidade, deficiência, religião e classe. Filtragem e alinhamento reduzem algumas manifestações, mas podem introduzir outras assimetrias. Bender et al. (2021) alertaram que a escala pode amplificar danos ambientais, enviesamentos documentais e a aparência enganadora de significado.

Há trabalho humano em todas as etapas: autores dos textos, moderadores, anotadores, especialistas, engenheiros e avaliadores. A narrativa de uma máquina autónoma obscurece essas contribuições e as condições de trabalho. Também concentra poder em organizações capazes de adquirir dados, chips e centros de dados.

Mitigar enviesamento requer mais do que bloquear palavras. É necessário definir o dano, identificar quem é afectado, testar situações reais, permitir contestação, monitorizar após implantação e documentar decisões. Justiça pode envolver desempenho equivalente, ausência de estereótipos, acesso linguístico ou distribuição de benefícios; métricas diferentes podem entrar em conflito.

Privacidade, memorização e direitos de autor

Textos públicos podem conter dados pessoais. Modelos podem memorizar sequências e revelar informação sob certos ataques. Medidas incluem remoção de identificadores, deduplicação, filtros, privacidade diferencial, controlos de acesso e processos para pedidos de remoção. Nenhuma medida deve ser presumida sem documentação e teste.

Direitos de autor envolvem questões distintas: legitimidade de usar obras no treino, retenção de expressões, imitação de estilos, atribuição e propriedade das saídas. As respostas jurídicas variam por jurisdição e continuam em evolução. Do ponto de vista científico e editorial, organizações devem conhecer a proveniência, respeitar licenças, evitar solicitar reproduções extensas e manter revisão humana.

Segurança e ataques

Um LLM pode ser manipulado por prompt injection: texto fornecido pelo utilizador ou escondido num documento tenta substituir instruções do sistema. Num chatbot isolado, o dano pode ser uma resposta inadequada; num agente com e-mail, ficheiros ou pagamentos, pode tornar-se uma acção externa.

Outros riscos incluem produção de desinformação, engenharia social, código vulnerável, automatização de abuso e dependência excessiva. Defesas eficazes combinam menor privilégio, isolamento de ferramentas, aprovação humana para acções relevantes, validação de entradas e saídas, registos, limites de taxa, testes adversariais e resposta a incidentes. Não existe prompt de segurança perfeito.

Energia, água e eficiência

Treinar e servir LLM exige aceleradores, memória, redes, refrigeração e electricidade. O impacto depende do hardware, duração, localização, intensidade carbónica e taxa de utilização. A inferência pode superar o treino quando milhões de utilizadores consultam o sistema continuamente. A Agência Internacional de Energia analisa a crescente procura eléctrica da IA e salienta tanto riscos para redes e emissões como oportunidades de eficiência noutros sectores (IEA, 2025).

Números isolados por consulta são frequentemente enganosos porque dependem do modelo, comprimento, lote, centro de dados e fronteiras do cálculo. Relatórios científicos devem divulgar energia, emissões, água, hardware e método, distinguindo estimativas de medições.

Eficiência melhora por modelos menores, quantização, destilação, adaptação de poucos parâmetros, mixture-of-experts, caching, hardware especializado e encaminhamento de cada tarefa ao menor modelo competente. A questão não é apenas “quanto custa treinar?”, mas “qual benefício verificável justifica o ciclo de vida completo?”.

O que um LLM sabe e o que não sabe

Um LLM contém conhecimento paramétrico: regularidades comprimidas nos pesos. Pode responder correctamente a perguntas, resumir, traduzir, escrever código e combinar conceitos. Mas não possui acesso automático à data actual, a uma base documental verificável ou às consequências reais das suas afirmações.

É útil distinguir:

  • fluência: produzir texto gramatical e coerente;
  • competência: resolver uma classe de tarefas com desempenho demonstrado;
  • factualidade: formular afirmações correctas;
  • fidelidade: permanecer apoiado numa fonte fornecida;
  • calibração: associar confiança adequada à probabilidade de acerto;
  • compreensão: conceito filosófico e científico mais forte, que não pode ser inferido apenas da aparência conversacional;
  • agência: perseguir objectivos por ciclos de acção, normalmente uma propriedade do sistema envolvente, não do modelo isolado.

Atribuir mente humana ao sistema pode melhorar a intuição na conversa, mas prejudica a avaliação. A posição oposta, que consiste em considerá-lo uma simples ferramenta de busca ou colagem, também ignora generalização, representação e produção de sequências novas. A descrição cientificamente produtiva situa-se entre essas caricaturas.

LLM na investigação científica e na educação

Na investigação, LLM podem ajudar a gerar termos de busca, estruturar código, converter formatos, resumir artigos já fornecidos, classificar textos e produzir rascunhos. Não substituem revisão da literatura, método, análise estatística nem responsabilidade autoral. Devem ser documentados quando influenciam substancialmente o trabalho, conforme as regras da instituição ou revista.

Na educação, podem explicar conceitos em níveis diferentes, criar exercícios e oferecer feedback. O risco é transformar aprendizagem em terceirização cognitiva. Uma prática mais robusta pede ao estudante que critique a resposta, confirme fontes, reproduza cálculos e compare alternativas. A competência central deixa de ser apenas “obter uma resposta” e passa a incluir validação.

Para uso científico responsável:

  1. não inserir dados confidenciais sem autorização;
  2. verificar cada citação e referência;
  3. executar e testar código gerado;
  4. conservar versões de prompts, modelo e data quando a reprodutibilidade importar;
  5. separar conteúdo do modelo de conteúdo recuperado;
  6. procurar fontes primárias;
  7. declarar limitações e intervenção humana;
  8. não atribuir autoria ao sistema nem transferir responsabilidade para ele.

Tendências de investigação

O campo desloca-se de uma única corrida por parâmetros para várias linhas: dados de maior qualidade, modelos especializados, multimodalidade, contexto longo, modelos esparsos, geração estruturada, recuperação, uso de ferramentas, agentes, computação adicional em tempo de inferência e interpretabilidade mecanística.

Modelos de raciocínio podem usar mais passos ou amostras antes de responder. Isso melhora tarefas verificáveis, mas não garante raciocínio humano nem imunidade a erros. Sistemas compostos, capazes de pesquisar, calcular e testar, podem ser mais confiáveis do que um modelo que tenta conter todo o conhecimento nos pesos.

A questão decisiva será menos “qual modelo parece mais inteligente numa conversa?” e mais “qual sistema produz benefícios verificáveis, com que evidência, custo, riscos, direitos e mecanismos de responsabilização?”.

Conclusão

Os LLM representam uma conquista notável da aprendizagem estatística. O Transformer tornou possível relacionar elementos distantes de uma sequência e treinar em escala; o pré-treino converte grandes colecções textuais em representações reutilizáveis; o pós-treino aproxima o comportamento das instruções humanas; RAG, ferramentas e agentes conectam o modelo a informação e acções externas.

As mesmas propriedades que tornam esses sistemas poderosos explicam as limitações. Um objectivo de previsão produz fluência, não um compromisso intrínseco com a verdade. Escala melhora médias, mas pode ampliar custos, enviesamentos e concentração. Acesso a documentos aumenta factualidade, mas não substitui validação. Avaliação precisa ser multidimensional, localizada e contínua.

O uso cientificamente maduro de LLM exige abandonar dois extremos: tratá-los como consciências infalíveis ou como simples copiadores sem capacidade de generalização. São máquinas probabilísticas complexas, inseridas em infraestruturas humanas. O seu valor depende de dados, desenho, supervisão, contexto cultural e da disciplina com que distinguimos uma resposta plausível de conhecimento comprovado.

Palavras-chave: modelos de linguagem de grande escala; LLM; Transformer; atenção; aprendizagem profunda; IA generativa; RAG; alinhamento; alucinação; ética da inteligência artificial

Referências

Bender, E. M., Gebru, T., McMillan-Major, A., & Shmitchell, S. (2021). On the dangers of stochastic parrots: Can language models be too big? Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency, 610 a 623. https://doi.org/10.1145/3442188.3445922

Brown, T. B., Mann, B., Ryder, N., et al. (2020). Language models are few-shot learners. Advances in Neural Information Processing Systems, 33, 1877 a 1901. https://proceedings.neurips.cc/paper/2020/hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html

Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of deep bidirectional transformers for language understanding. Proceedings of NAACL-HLT 2019, 4171 a 4186. https://doi.org/10.18653/v1/N19-1423

Hoffmann, J., Borgeaud, S., Mensch, A., et al. (2022). Training compute-optimal large language models. Advances in Neural Information Processing Systems, 35, 30016 a 30030. https://arxiv.org/abs/2203.15556

International Energy Agency. (2025). Energy and AI. https://www.iea.org/reports/energy-and-ai

Ji, Z., Lee, N., Frieske, R., et al. (2023). Survey of hallucination in natural language generation. ACM Computing Surveys, 55(12), Article 248. https://doi.org/10.1145/3571730

Lewis, P., Perez, E., Piktus, A., et al. (2020). Retrieval-augmented generation for knowledge-intensive NLP tasks. Advances in Neural Information Processing Systems, 33, 9459 a 9474. https://proceedings.neurips.cc/paper/2020/hash/6b493230-Abstract.html

Liang, P., Bommasani, R., Lee, T., et al. (2023). Holistic evaluation of language models. Transactions on Machine Learning Research. https://arxiv.org/abs/2211.09110

Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems, 35, 27730 a 27744. https://arxiv.org/abs/2203.02155

Shinn, N., Cassano, F., Berman, E., Gopinath, A., Narasimhan, K., & Yao, S. (2023). Reflexion: Language agents with verbal reinforcement learning. Advances in Neural Information Processing Systems, 36. https://arxiv.org/abs/2303.11366

Strubell, E., Ganesh, A., & McCallum, A. (2019). Energy and policy considerations for deep learning in NLP. Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 3645 a 3650. https://doi.org/10.18653/v1/P19-1355

Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention is all you need. Advances in Neural Information Processing Systems, 30. https://proceedings.neurips.cc/paper/2017/hash/3f5ee243547dee91fbd053c1c4a845aa-Abstract.html

Comunidade

Converse sobre este artigo

Partilhe dúvidas, ideias e perspectivas com outros leitores.

0

Deixe o seu comentário

Após uma breve revisão editorial, o seu comentário aparecerá nesta página.

Entre 10 e 2000 caracteres.

Comentários publicados

0

A conversa começa consigo

Ainda não há comentários publicados. Partilhe a primeira reflexão sobre este artigo.

Continue a explorar
Imagem de apoio: Teoria do caos e efeito borboleta quando leis determinísticas produzem futuros imprevisíveis
Ambiente

Teoria do caos e efeito borboleta quando leis determinísticas produzem futuros imprevisíveis

Imagem de apoio: Nanopartículas biogénicas: como combatem micróbios
Saúde

Nanopartículas biogénicas: como combatem micróbios

Imagem de apoio: Buracos negros: como se formam e quais são as suas propriedades
Espaço

Buracos negros: como se formam e quais são as suas propriedades