Context Window, ou janela de contexto, é o limite de informação que um modelo de inteligência artificial consegue levar em conta ao responder algo. Em vez de ser medida em páginas ou palavras, essa capacidade é contada em tokens, e funciona como uma memória de curto prazo: tudo o que está dentro é usado, o que fica fora simplesmente deixa de existir para o modelo.

Adicione ao Google Notícias
Neste artigo
  1. Como funciona a janela de contexto na prática?
  2. Exemplo no dia a dia: atendimento com histórico de cliente
  3. Quando a janela de contexto faz diferença e quando não resolve?
  4. Context Window (Janela de Contexto) e os termos vizinhos
  5. Perguntas frequentes

A janela de contexto de um modelo de linguagem grande (LLM) é, na prática, a quantidade máxima de texto — convertido em tokens — que pode ser carregada de uma vez para o modelo analisar e gerar uma resposta. Entram aí sua pergunta, o histórico recente da conversa, instruções ocultas do sistema e até documentos anexados. Quando esse limite estoura, partes mais antigas ou menos prioritárias precisam ser cortadas, resumidas ou ficam de fora, o que afeta diretamente a coerência e a precisão das respostas.

Como funciona a janela de contexto na prática?

Para entender a janela de contexto, é preciso dar um passo atrás e olhar como um LLM realmente lê texto. O primeiro passo é a tokenização do conteúdo: o texto bruto é quebrado em pedaços menores, chamados tokens. Um token pode ser uma palavra inteira, parte de uma palavra, um sinal de pontuação ou até um espaço, dependendo do modelo e do idioma.

A janela de contexto é justamente o número máximo de tokens que o modelo consegue considerar em uma única interação. Pense assim: “nesta rodada, a IA só consegue enxergar até X tokens”. Dentro desse espaço entram:

  • Seu prompt: pergunta, instruções, colagens de texto, código.
  • Histórico da conversa: as mensagens anteriores que foram mantidas.
  • Instruções do sistema: regras internas que definem o comportamento do chatbot.
  • Conteúdos recuperados: trechos de documentos que sistemas de busca (como em RAG) colocam no prompt.
  • A resposta da própria IA: o texto que o modelo está gerando agora também consome parte da janela.

Se tudo isso somado ultrapassa o limite do modelo, algo precisa sair ou ser compactado. Em chatbots simples, o corte costuma ser direto: as mensagens mais antigas vão sendo descartadas no esquema “primeiro a entrar, primeiro a sair”. Em sistemas mais avançados, o histórico é resumido em etapas, condensando blocos de conversa (“o cliente pediu A, depois decidiu B…”) para liberar espaço e ainda preservar o contexto principal.

Exemplo no dia a dia: atendimento com histórico de cliente

Imagine um banco digital brasileiro usando um assistente virtual baseado em um LLM como base, integrado ao app de celular. A proposta é que o cliente, usando ChatGPT ou Claude no back-end, consiga tirar dúvidas sobre fatura, limites, investimentos e renegociação de dívida em uma conversa contínua, sem repetir tudo a cada mensagem.

Cada vez que o cliente manda algo pelo chat do app, o sistema monta um pacote de contexto para o modelo, que pode incluir:

  • Um texto oculto com regras: “você é um assistente do Banco X, responda em português, não dê conselhos ilegais etc.”
  • As últimas mensagens do próprio chat (cliente e assistente).
  • Trechos da base de conhecimento interna (por exemplo, a política atual de parcelamento de fatura).
  • Dados dinâmicos autorizados, como o valor da fatura atual ou o limite disponível.

Tudo isso precisa caber dentro da janela de contexto do modelo escolhido. Em uma conversa longa, com o cliente pedindo simulações, voltando atrás, revisando condições antigas, o histórico cresce e passa a disputar espaço com as regras do sistema e com os dados mais recentes da conta. Quando a janela estoura, o sistema é forçado a resumir as primeiras partes da conversa (“o cliente pediu A, depois decidiu B…”) ou simplesmente descartar as mensagens mais antigas. Quando esse gerenciamento falha, o resultado aparece do outro lado da tela: o assistente “esquece” uma preferência já registrada, se contradiz ou volta a pedir as mesmas informações.

Quando a janela de contexto faz diferença e quando não resolve?

Uma janela de contexto maior permite que o modelo leve em conta mais detalhes de uma vez só. Isso aparece com impacto em tarefas como:

  • Conversas longas: atendimento prolongado, mentoria de estudos, sessões de brainstorming extensas.
  • Análise de documentos grandes: contratos, relatórios de dezenas de páginas, códigos extensos.
  • Agentes de IA com várias etapas: fluxos em que a IA faz consultas em APIs, bancos de dados e precisa relembrar resultados anteriores.

Por outro lado, jogar mais contexto não é garantia de resposta melhor. Alguns limites importantes:

  • O custo e o tempo de resposta aumentam com mais tokens: mais dados para processar significam mais computação.
  • Contexto em excesso atrapalha: o modelo fica exposto a muita informação irrelevante e tende a se perder em detalhes.
  • Existe o problema do “lost in the middle”: estudos mostram que modelos tendem a usar melhor as informações do começo e do fim do contexto, e pior o que fica enterrado no meio.

A janela de contexto também não resolve tudo. Ela não substitui memória de longo prazo (guardar preferências entre sessões), não corrige por conta própria dados errados na base e não compensa prompts mal escritos. Em muitos cenários, organizar melhor o que entra na janela e filtrar ruído rende ganhos práticos maiores do que simplesmente selecionar um modelo com contexto maior.

Context Window (Janela de Contexto) e os termos vizinhos

A janela de contexto costuma ser confundida com outros conceitos próximos no glossário de IA, como memória e dados de treinamento. A distinção entre esses blocos é direta:

Janela de contexto x memória de longo prazo
Context window é uma memória temporária, válida só durante a interação atual. Quando a conversa termina ou o sistema descarta o histórico, o modelo não “lembra” de nada na próxima vez. Já a memória de longo prazo, quando existe, é construída por sistemas externos: banco de dados, CRM, notas salvas. Em soluções com agentes de IA, o histórico importante é gravado fora do modelo e reintroduzido na janela de contexto quando fizer sentido.

Janela de contexto x dados de treinamento
Os dados de treinamento são o conjunto gigantesco de textos, códigos e exemplos usados para ensinar o modelo antes dele ficar disponível. Essa etapa molda o “conhecimento geral” do LLM, como vocabulário, fatos históricos, padrões de código. Já a janela de contexto contém apenas o que o modelo está vendo agora, em tempo real. A IA não “aprende” de forma permanente com o que entra na janela, a menos que um sistema externo grave isso e use depois.

Outros termos que aparecem perto deste tema no glossário de IA são tokens, prompt e RAG (Retrieval-Augmented Generation). Todos se conectam diretamente à forma como a janela de contexto é preenchida e gerenciada.

Perguntas frequentes

O que é, em termos simples, a janela de contexto de uma IA?

A janela de contexto é o “tamanho da mesa” onde a IA espalha todas as informações relevantes antes de responder. Nessa mesa entram sua pergunta, o histórico da conversa, instruções internas e documentos anexos, tudo convertido em tokens. O modelo só consegue raciocinar sobre o que está em cima dessa mesa. Se faltar espaço, algo precisa ser resumido ou removido, e o que sair deixa de influenciar a resposta.

Qual é a janela de contexto de cada IA e por que isso varia?

Cada modelo de linguagem é projetado com um limite próprio de contexto, definido na arquitetura e nas restrições de computação. Modelos mais antigos tinham janelas de poucos milhares de tokens; gerações recentes chegam a centenas de milhares ou até cerca de um milhão de tokens, como descrito em documentações de serviços como Claude e outros LLMs modernos. Esse número varia porque aumentar a janela exige mais memória, mais processamento e técnicas específicas de atenção. Na prática, provedores equilibram tamanho do contexto, custo por chamada e velocidade de resposta. Uma mesma empresa costuma oferecer versões “leves” com contexto menor (mais rápidas e baratas) e versões premium com janelas grandes para casos mais complexos.

O que exatamente é “contexto” na IA generativa?

Na IA generativa, “contexto” é todo o conjunto de informações que o modelo recebe junto com a sua pergunta, dentro da janela de contexto. Isso inclui o texto do usuário, instruções do sistema, histórico de mensagens, resultados de busca, saídas de ferramentas e até partes das respostas anteriores. Esse pacote de contexto diz à IA “sobre o que estamos falando agora” e guia a geração da próxima resposta. O contexto não é permanente: se não for reintroduzido numa nova chamada, ele some.

Por que a janela de contexto é medida em tokens e não em palavras?

Os modelos não trabalham com palavras diretamente, e sim com tokens, que são pedaços de texto criados por um tokenizador. Um token pode ser uma palavra inteira, parte dela ou apenas um símbolo. Medir a janela de contexto em tokens é mais exato, porque duas frases com o mesmo número de palavras podem gerar quantidades bem diferentes de tokens, dependendo da língua, dos acentos e da forma de segmentação. Em termos práticos, isso quer dizer que “X tokens de contexto” não correspondem a um número fixo de páginas, mas a ordem de grandeza ajuda: centenas de milhares de tokens permitem livros inteiros, enquanto poucos milhares limitam a análise a trechos curtos.

O que acontece quando a conversa ou o documento passa do limite da janela?

Quando o conteúdo total (prompt, histórico, documentos, instruções e a própria resposta) ultrapassa a janela de contexto, o sistema precisa cortar ou comprimir alguma coisa. Em interfaces simples, isso geralmente significa descartar as primeiras mensagens do histórico. Em sistemas mais avançados, é comum usar sumarização progressiva, em que blocos antigos são transformados em resumos mais curtos, ou seleção inteligente de trechos, em que só os pedaços mais relevantes de documentos são enviados. Se esse gerenciamento for mal planejado, a IA passa a responder com base em um quadro incompleto, o que aumenta o risco de contradições e respostas erradas.

Janelas de contexto enormes resolvem o problema de “esquecimento” da IA?

Janelas maiores ajudam a manter mais informação acessível ao mesmo tempo, mas não eliminam o problema por completo. Primeiro, porque mesmo com muitos tokens há limites de custo e tempo de resposta. Segundo, porque pesquisas apontam que modelos não usam todas as partes do contexto com a mesma eficiência: conteúdos posicionados no meio de um prompt muito longo tendem a ser menos considerados (“lost in the middle”). E, por fim, porque a janela de contexto continua sendo memória de curto prazo: ao encerrar a sessão, tudo se perde se não houver um sistema externo de armazenamento. Na prática, o cenário mais sólido combina janelas de contexto amplas com técnicas de engenharia de contexto, RAG e memória persistente quando necessário.