TL;DR
Descobri por que sessões do Claude Code esgotam bem antes do esperado: e não é culpa do seu uso
Três causas específicas: mudança silenciosa no cache, limites dinâmicos em pico, e contexto inflado por padrões do próprio Claude Code
Você vai aprender: como usar
/clear,/compact,Esc+Esc//rewindde forma integradaInclui: como enxugar o CLAUDE.md e recuperar até 792k tokens por sessão
Bônus: o que você genuinamente não controla: e como trabalhar dentro disso
Tutorial em Vídeo
Demos completas de cada situação: com o /cost mostrando antes e depois de cada comando, e a comparação do CLAUDE.md enxuto vs inchado em números reais:
O Problema Que Eu Tinha
Durante semanas eu achei que o problema era eu.
Abria uma sessão, mandava três perguntas sobre um arquivo que o Claude já conhecia: e o /cost já mostrava 40 mil tokens consumidos. Sessão nova. Projeto do dia a dia. Nenhum arquivo grande aberto.
Cortei coisas. Mensagens mais curtas. Sessões menores. Não adiantou.
Então comecei a investigar o número. O /cost não fechava com o que eu esperava baseado no meu plano.
O que eu não sabia: o Claude Code não estava esgotando por causa do meu uso. Estava esgotando por causa do que ele faz sozinho, antes de você digitar qualquer coisa.
A Descoberta
O sistema de rate limit do Claude Code tem duas janelas simultâneas: 5 horas e 7 dias. As duas contam ao mesmo tempo. Você pode travar porque a janela semanal esgotou, e o Claude Code não avisa qual das duas te bloqueou.
Os números por plano são referência, não garantia: Pro tem cerca de 45 mensagens por janela de 5 horas, Max tem cerca de 225. Mas o que esgota a cota não é a mensagem em si: é o peso dela em tokens.
Cada mensagem carrega o histórico inteiro. Você digita uma linha, o Claude processa tudo desde o início. E Opus custa cerca de 3x mais tokens que Sonnet: o que significa que suas 45 mensagens viram 15 na prática se você usar Opus para tudo.
Passei uma semana investigando por que ficou pior de repente. Encontrei três motivos: e nenhum foi anunciado com destaque.
Tutorial Passo-a-Passo
Por Que Ficou Pior: Os 3 Motivos
Motivo 1: A Anthropic encurtou o cache
Em abril de 2026, devs começaram a reportar que o TTL do cache caiu de 1 hora para 5 minutos.
Antes: você saía pra uma reunião de 30 minutos e voltava: o contexto ainda estava salvo, você pagava pouco pela retomada. Agora: qualquer pausa maior que 5 minutos e o Claude recomeça do zero. Cada retomada custa como se fosse a primeira mensagem da sessão.
Isso não está na documentação oficial. Foi identificado pela comunidade de devs em abril. Mas o impacto no custo real de sessões com pausa é imediato.
Motivo 2: Os limites encolhem em horário de pico
A Anthropic confirmou: quando a demanda sobe, as cotas de sessão são reduzidas automaticamente. Aquelas 45 mensagens do papel podem ser menos dependendo do horário que você está usando. Você não recebe aviso: simplesmente acaba mais cedo.
Isso você não controla. Mas o terceiro motivo: esse você pode corrigir agora.
Motivo 3: Comportamentos do Claude Code que inflam o contexto
Dois comportamentos inflam o contexto sem você fazer nada:
O primeiro: quando uma tarefa é interrompida por um erro: como atingir o rate limit no meio de uma execução: o Claude Code não descarta a resposta incompleta. Ele carrega o erro junto e tenta continuar a partir daí. Você paga por lixo no meio dos seus tokens.
O segundo: instruções detalhadas no CLAUDE.md são carregadas no contexto do início ao fim da sessão: mesmo quando você está trabalhando em algo completamente diferente. A própria Anthropic recomenda mover essas instruções para skills, porque skills só carregam quando você as chama. A maioria das pessoas nem sabe disso e coloca tudo no CLAUDE.md.
Passo 1: Os 3 comandos que mudam o dia a dia
Três situações que acontecem toda sessão, com o que fazer em cada uma:
Situação 1: Terminei uma tarefa, a próxima é outra coisa
/clear
O histórico da conversa anterior não precisa ir junto. O /clear limpa o contexto sem fechar a sessão. Use antes de mudar de assunto: você começa a próxima tarefa sem carregar o peso da anterior.
Situação 2: Sessão longa, quero continuar mas o contexto está pesado
/compact
O /compact resume o histórico inteiro e substitui o contexto pelo resumo. Diferente do /clear, você mantém o que importa: estado atual, decisões tomadas, arquivos relevantes. O ruído de troca de mensagens fica de fora.
Importante: use o /compact antes do contexto inflar demais. Depois de inflado, ele comprime o histórico, mas o custo da próxima mensagem já foi feito no carregamento. O momento certo é quando o /cost indicar crescimento relevante: não quando a sessão já está pesada demais.
/cost
# Input tokens: 45.230 → Cost: $0.47
/compact
# [Claude gera resumo estruturado]
/cost
# Input tokens: 8.400 → Cost: $0.09
Situação 3: O Claude errou e eu ia ajustar o prompt
Esse é o caso onde mais gente desperdiça tokens sem perceber. A maioria reescreve o prompt e manda de novo: pagando duas vezes pelo mesmo trabalho.
# Aperta Esc duas vezes → abre menu de restauração
# ou usa o comando:
/rewind
A resposta errada some. Você corrige e manda o prompt ajustado sem carregar o custo da resposta incorreta. O /rewind restaura o estado anterior da conversa.
Passo 2: CLAUDE.md enxuto vs inchado
O CLAUDE.md é carregado no contexto toda vez que você começa uma sessão, do início ao fim. Cada linha desnecessária é token gasto em toda mensagem: não uma vez, toda mensagem.
A diferença em números reais: um CLAUDE.md com 448 linhas vs 33 linhas representa −17.6k tokens por mensagem e −792k tokens por sessão de trabalho.
A regra que eu sigo: menos de 300 linhas. O que fica deve ser o que o Claude genuinamente não sabe:
✅ Manter no CLAUDE.md:
- Convenções de nomenclatura específicas do projeto
- Restrições de arquitetura (o que não fazer)
- Regras de negócio que não estão no código
- Padrões de commit, PR e review do time
❌ Remover do CLAUDE.md:
- Como rodar o servidor (ele já sabe)
- Estrutura de pastas óbvia
- Frameworks e libs padrão
- Instruções que mudam por tarefa
Para partes específicas: schema do banco, regras de uma área: separe em arquivos e linke no CLAUDE.md. O Claude só carrega quando precisar, não em toda mensagem.
Caso de Uso
Semana passada, debug num módulo de autenticação com contexto já alto: sessão que eu abri de manhã e voltei depois do almoço (mais de 5 minutos de pausa: cache zerado, custo de retomada como primeira mensagem).
O fluxo completo:
Abri o projeto →
/costmostrou 48k tokens de retomada pós-pausaTarefa anterior finalizada →
/clearantes de começar o debugApós 40 minutos de análise →
/costindicando $0,44 → rodei/compactO Claude sugeriu uma abordagem que violava as convenções do projeto →
Esc+Escpara restaurar, ajustei o contexto doCLAUDE.mde mandei novamenteContinuei a sessão com custo incremental muito menor
Total: mesma sessão que antes eu reiniciaria duas vezes e perderia o contexto entre elas.
O Que Você Não Controla
Os ajustes acima resolvem o que está na sua mão. Mas tem uma parte que não resolve com configuração:
Os limites nos horários de pico e o cache mais curto são decisões de infraestrutura da Anthropic. Configuração não resolve.
O que dá pra fazer: trabalhar em blocos menores. Ao invés de uma sessão longa que vai acumulando contexto, divida em sessões focadas com o /clear entre elas. Você usa o mesmo número de mensagens, mas cada uma pesa menos.
Recursos
CLAUDE.md de Referência
Menos de 300 linhas, só o que o Claude genuinamente não sabe: convenções de projeto, regras de negócio, restrições de banco. Pronto pra você adaptar:
Se essa análise foi útil
O vídeo completo tem as demos com o /cost mostrando antes e depois de cada comando e a comparação do CLAUDE.md enxuto vs inchado em números reais. Se ainda não assistiu, está no link acima.
Se curtiu o conteúdo, deixa um like e se inscreve no canal, ajuda o algoritmo a mostrar isso pra mais devs que estão perdendo cota sem entender por quê.
Para quem quer ir além: o programa de membros do canal financia as horas de análise que viram demo. É o que viabiliza investigações como essa ir até o código fonte, testar em sessões reais, medir antes e depois. O link está aqui: https://www.youtube.com/@adriano_viana/membership
Adriano Viana
System Architect | AI-Native Content Creator
