O que são LLMs e como eles realmente funcionam
Uma explicação honesta sobre modelos de linguagem: tokens, atenção, janela de contexto e por que eles às vezes inventam respostas.

Modelos de linguagem grandes (LLMs, do inglês Large Language Models) deixaram de ser assunto de laboratório e viraram parte do dia a dia de quem escreve código, texto ou e-mail. Mas por trás da conversa fluida existe uma mecânica surpreendentemente simples de descrever — e entendê-la muda a forma como você usa a ferramenta.
A ideia central: prever a próxima palavra
No fundo, um LLM faz uma coisa só: dado um texto, ele estima qual é o próximo pedaço de texto mais provável. Só isso. Toda a aparência de raciocínio emerge de fazer essa previsão muito bem, bilhões de vezes, sobre uma quantidade gigantesca de texto.
Esse "pedaço de texto" não é exatamente uma palavra. O modelo trabalha com tokens — fragmentos que podem ser uma palavra inteira, parte de uma palavra ou até um sinal de pontuação. A frase "programação assíncrona" pode virar algo como program, ação, assín, crona. É por isso que limites de modelos são medidos em tokens, não em caracteres ou palavras.
Atenção: o mecanismo que mudou tudo
A arquitetura que tornou os LLMs viáveis se chama Transformer, apresentada em 2017. Seu ingrediente-chave é o mecanismo de atenção: para cada token, o modelo pesa a relevância de todos os outros tokens da entrada. Isso permite capturar dependências longas — entender que o "ele" no fim de um parágrafo se refere ao sujeito lá do começo.
Atenção não é magia: é uma soma ponderada. O que impressiona é que, com dados e escala suficientes, essas ponderações passam a codificar gramática, fatos e até estilo.
Janela de contexto: a memória de trabalho
Tudo que o modelo "vê" de uma vez cabe na janela de contexto — o número máximo de tokens que ele processa em uma única passagem. Se a conversa cresce além disso, o começo é esquecido. Modelos modernos têm janelas de dezenas ou centenas de milhares de tokens, mas o princípio permanece: fora da janela, não existe.
Na prática, isso significa três coisas para quem usa a ferramenta:
Contexto é tudo. Instruções claras no início da conversa influenciam todas as respostas seguintes.
Documentos gigantes precisam de estratégia. Resumir ou recuperar só os trechos relevantes costuma funcionar melhor do que despejar tudo.
Conversas longas degradam. Quando o começo sai da janela, o modelo perde o fio.
Por que eles "alucinam"
O modelo não consulta um banco de fatos — ele gera o texto mais plausível. Quando a resposta plausível também é verdadeira, ótimo. Quando não, temos uma alucinação: uma afirmação confiante e incorreta. Não é um bug pontual; é uma consequência direta de como o modelo funciona.
Algumas formas de reduzir o problema:
Peça fontes e verifique-as — a existência de uma citação não garante que ela seja real.
Forneça o material de referência no próprio prompt, em vez de confiar na memória do modelo.
Desconfie de precisão excessiva: datas, números e nomes próprios são onde o erro mais aparece.
O que isso muda para você
Entender que um LLM é um previsor de tokens — poderoso, mas sem acesso à verdade — transforma a ferramenta de "oráculo" em "assistente". Ela acelera rascunhos, explica conceitos e sugere caminhos; a responsabilidade pela verificação continua sendo humana. É exatamente essa combinação que a torna útil sem ser perigosa.

