Pesquisadores de Meta, MIT e Universidade de Washington apresentam Context Language Models (CLMs), uma abordagem inovadora que permite modelos de linguagem gerenciar e editar seu próprio contexto, oferecendo ganhos substanciais em desempenho e eficiência computacional.
A abordagem CLM trata o contexto como um arquivo que o modelo pode atualizar sem restrições, oferecendo alternativa às estratégias convencionais de gestão de contexto como compactação, offloading e retrieval. Os métodos tradicionais enfrentam limitações específicas: resumização pode descartar detalhes críticos ou introduzir imprecisões, compactação depende de regras predefinidas, e memória externa exige que agentes decidam qual informação trazer de volta ao contexto.
Um CLM consegue reescrever mensagens antigas, preservar fatos importantes, remover informações irrelevantes, manter notas de progresso e aprender suas próprias estratégias de gestão de contexto. Os pesquisadores enfatizam que modelos de linguagem podem aprender estratégias que superam abordagens projetadas por humanos, potencialmente indo além dos "priors existentes".
O deslocamento do controle de gestão de contexto de mecanismos externos para comportamento intrínseco do modelo naturalmente habilita aprendizado em contexto e aprendizado paramétrico para gestão de contexto. Usuários podem controlar a gestão de contexto simplesmente informando ao agente a estratégia desejada em linguagem natural. CLMs também podem desenvolver documentos de skill que capturam procedimentos úteis de gestão de contexto para reutilização futura.
Comportamentos novos que CLMs aprendem incluem criar notas internas, remover resultados intermediários irrelevantes enquanto preservam informações úteis, e rastrear experimentos malsucedidos ao lado de ideias a explorar.
Os pesquisadores exploraram três abordagens distintas para gestão de contexto. A primeira, gestão zero-shot, onde o CLM não recebeu treinamento específico. A segunda, in-context learning, onde o CLM recebeu instruções em linguagem natural sobre como gerenciar seu contexto e refinou sua estratégia através de loop iterativo de otimização de skill. A terceira, reinforcement learning, onde o CLM aprendeu estratégias de gestão de contexto usando sucesso na tarefa como objetivo primário e eficiência computacional como critério de otimização adicional.
Os resultados experimentais demonstram ganhos substanciais. CLMs zero-shot alcançaram 11,4% maior acurácia com 21,5% menos FLOPs no BrowseComp-Plus, 5% maior pontuação com 59% menos FLOPs no EdgeBench de 12 horas, e 65% maior melhoria com o mesmo compute em tarefa de agent-swarm multi-repositório de 24 horas.
CLMs usando in-context learning melhoraram acurácia em tarefas ContextBench em até 35,9 pontos percentuais com menor compute. Reinforcement learning melhorou performance de Qwen3.5-9B de 28,8% para 42,5% no BrowseComp-Plus, representando melhoria relativa de 47,6% enquanto usava 12% menos FLOPs.
Os pesquisadores reconhecem desafios não resolvidos. Primeiro, um CLM pode descartar informações importantes que não podem ser recuperadas posteriormente. Segundo, permitir que CLMs editem seu próprio contexto introduz novos riscos de segurança, pois o contexto editável "pode se tornar outro canal através do qual prompt injections ou instruções auto-geradas persistem entre turnos". Mais importante, maior controle sobre contexto não necessariamente se traduz em melhor comportamento, pois modelos ainda podem fazer decisões pobres sobre o que reter, modificar ou descartar.










