Corte 15% dos tokens do agente em 5 passos Um founder me perguntou uma coisa simples ontem: "por que o agente de IA ficou caro se ele só lê log e responde ticket?" A resposta curta: porque agente come contexto como adolescente em rodízio. Log, JSON, histórico, arquivo, resultado de ferramenta. Tudo entra na conta.
Corte 15% dos tokens do agente em 5 passos
Um founder me perguntou uma coisa simples ontem: "por que o agente de IA ficou caro se ele só lê log e responde ticket?"

A resposta curta: porque agente come contexto como adolescente em rodízio. Log, JSON, histórico, arquivo, resultado de ferramenta. Tudo entra na conta.
TL;DR:
- Eu validaria compressão de contexto antes de cortar modelo ou desligar automação.
- O Headroom promete 15% a 20% menos tokens em agentes de código e 60% a 95% em JSON.
- Eu usaria o método CORTA: custo, origem, redução, teste e alerta.
O problema
Eu gosto de agente de IA. Mas existe uma parte chata que quase ninguém mostra no demo: o custo do contexto.
O agente não paga só pela resposta bonita. Ele paga para ler tudo que você joga nele.
Um fluxo simples de suporte pode mandar histórico do cliente, contrato, logs, status do pedido e resposta anterior. Se ninguém coloca limite, o agente vira uma caçamba de texto.
Aí aparece a reunião clássica: "vamos trocar para um modelo mais barato".
Às vezes faz sentido. Às vezes é só trocar pneu furado por pneu careca. Barato, até bater.
O sinal que me chamou atenção hoje veio do Headroom, um projeto open source que se define como uma camada de compressão de contexto para agentes de IA. O repositório diz que comprime tool outputs, logs, arquivos, dados de RAG e histórico antes de mandar para o modelo.
No README, eles mostram quatro números úteis: 92% de economia em busca de código, 92% em debug de incidente SRE, 73% em triagem de issues e 47% em exploração de codebase.
Eu não compraria o número sem testar. Mas eu compraria a pergunta: quanto contexto inútil o seu agente está lendo todo dia?
O método CORTA
Eu usaria o método CORTA antes de mexer em modelo, prompt ou fornecedor.
CORTA significa: custo, origem, redução, teste e alerta.
1. Custo
Pegue uma automação real. Não use demo.
Escolha algo repetido e caro: resumo de reunião, triagem de lead, atendimento interno ou análise de log.
Anote três números por execução:
- tokens de entrada;
- tokens de saída;
- custo estimado.
Se você não mede isso, você não tem projeto de IA. Você tem fé com cartão corporativo.
2. Origem
Separe de onde vem o contexto.
Eu gosto de quatro baldes:
- histórico da conversa;
- dados do CRM ou ERP;
- saída de ferramenta;
- arquivos ou base de conhecimento.
Normalmente o vilão não é o prompt. É o anexo gigante que ninguém leu.
3. Redução
Agora corte antes de trocar o modelo.
Você pode testar três caminhos:
- resumir logs antes de enviar;
- mandar só campos úteis do JSON;
- usar uma camada de compressão como Headroom quando fizer sentido técnico.
O Headroom tem biblioteca, proxy, servidor MCP e wrapper para ferramentas como Claude Code, Codex, Cursor e Aider. Isso importa porque dá para testar sem reescrever a aplicação inteira.
4. Teste
Faça 20 execuções com o fluxo atual e 20 com compressão.
Compare quatro coisas:
- custo;
- tempo de resposta;
- acerto da tarefa;
- casos em que o agente pediu o dado original de volta.
A última métrica é importante. Compressão boa reduz gordura, não arranca o osso.
5. Alerta
Defina uma linha vermelha.
Exemplo: se o acerto cair mais de 3 pontos percentuais ou se o agente pedir contexto original em mais de 10% dos casos, você pausa e revisa.
Sem alerta, toda economia vira desculpa para piorar o serviço.
Como aplicar hoje
Eu faria um teste de 30 minutos.
Passo 1: escolha um fluxo caro
Pegue um agente que roda todo dia. Se você não tem agente, escolha um prompt operacional usado pelo time.
Exemplo bom: "leia estes logs e diga por que o pagamento falhou".
Passo 2: salve 20 entradas reais
Remova dados sensíveis. Corte nome, e-mail, telefone e qualquer informação de cliente.
Use casos reais, não texto inventado.
Passo 3: rode a versão atual
Guarde tokens, custo, tempo e resposta.
Se a ferramenta não mostra tokens, registre tamanho aproximado em caracteres. Não é perfeito, mas já tira você do escuro.
Passo 4: aplique compressão
Teste um corte simples primeiro: remova campos vazios, logs duplicados e mensagens antigas que não mudam a decisão.
Depois teste uma camada como Headroom em ambiente separado. O README mostra instalação com uv tool install "headroom-ai[all]" e uso com headroom proxy --port 8787 ou headroom wrap para alguns agentes.
Não faça isso direto em produção. Eu sei que parece óbvio. Justamente por isso alguém vai fazer.
Passo 5: compare com uma tabela pequena
Use esta tabela:
| Caso | Custo atual | Custo comprimido | Acertou? | Observação |
|---|---|---|---|---|
| 1 | R$ X | R$ Y | sim/não | faltou contrato? |
| 2 | R$ X | R$ Y | sim/não | log duplicado |
Se a economia apareceu e a qualidade ficou de pé, você ganhou um argumento bom para escalar.
Resultados esperados
Eu esperaria três ganhos.
Primeiro: menos custo em fluxos com muito JSON, log e resultado de ferramenta. É onde o desperdício costuma morar.
Segundo: mais velocidade em algumas tarefas, porque o modelo recebe menos texto para processar.
Terceiro: mais disciplina. Quando você mede contexto, descobre que metade do que mandava para a IA era lixo educado.
O próprio Headroom fala em 15% a 20% menos tokens para agentes de código e 60% a 95% em JSON. Eu trataria isso como hipótese, não como promessa.
Na prática, se o seu fluxo gasta R$ 10 mil por mês com entrada de contexto, uma redução de 15% já paga várias horas de teste. Se não reduzir nada, você pelo menos descobriu onde está o custo.
FAQ
O que é compressão de contexto em IA?
É reduzir o texto enviado ao modelo sem tirar a informação necessária para a tarefa. Eu penso nisso como limpar a mesa antes de chamar alguém para decidir.
Headroom substitui um modelo barato?
Não. Ele ataca outro problema. Modelo barato reduz preço por token. Compressão reduz a quantidade de tokens. Em muitos casos, eu testaria os dois separadamente.
Posso usar compressão em dados sensíveis?
Eu só usaria depois de entender onde o dado passa e onde ele fica salvo. O Headroom se apresenta como local-first e reversível, mas política de dado sensível não se decide lendo README com café na mão.
Quando compressão não vale a pena?
Quando o prompt é pequeno, raro ou muito sensível a cada detalhe. Se você economiza centavos e cria risco operacional, parabéns: inventou economia burra.
Qual métrica eu acompanho primeiro?
Eu começaria por custo por execução e taxa de acerto. Custo sozinho engana. Acerto sozinho também.
Conclusão
Eu não começaria a reduzir custo de IA trocando tudo para o modelo mais barato da semana.
Eu começaria olhando para o prato do agente.
Se ele está lendo log duplicado, JSON inchado e histórico sem valor, o problema não é só o modelo. É falta de corte.
Teste o método CORTA em uma automação hoje. Se aparecer economia sem piorar a resposta, você ganha um argumento bom para levar para o time.
E se não aparecer, ótimo também. Você matou uma hipótese barata antes de transformar em projeto caro.
Leia também: Roteamento de modelos de IA e Handoff entre agentes de IA.
Fonte usada: repositório Headroom no GitHub.