← Alle Playbooks
Playbook· setup

Cost controls de Claude Code para uso diario, quedarte bajo 30 dólares al día en 10 pasos

Cómo controlar el consumo de tokens, elegir el modelo correcto y reducir el overhead de MCP. Slash commands concretos, settings y patrones del día a día real.

El propio Anthropic dice que la media está en 13 dólares por desarrollador y día. El 90 por ciento se queda por debajo de 30 dólares. Cuando te disparas por arriba, casi nunca es por el modelo. Casi siempre es por el contexto que se arrastra, por servidores MCP que no hacen nada, por un Opus que hace un arreglo de formato. Este playbook muestra cómo lo controlo yo en el día a día. No necesitas un tracker extra, Claude Code lo trae todo consigo.

1. Pulsa /usage una vez por hora

El comando integrado se llama /usage. Los alias /cost y /stats hacen lo mismo. Lo que muestra: coste total (estimación local a partir de los recuentos de tokens), duración de la API, duración real, líneas añadidas/eliminadas. El signo del dólar es una estimación, no la factura. Para la facturación real está la página de uso en la Claude Console.

Mi workflow: pulso /usage al principio de una sesión y después de cada bloque grande. Si después de 30 minutos ya voy por 4 dólares aunque la tarea era pequeña, sé que algo ha salido mal. Normalmente un servidor MCP que carga tools sin control o un archivo que se vuelve a leer una y otra vez.

Quien esté en Claude Pro o Max no ve un valor en dólares sino límites de uso del plan. Aun así es útil, ves lo rápido que quemas tu cuota.

2. Cambia de /model a conciencia, no todo en Opus

La recomendación oficial es clara: Sonnet para casi todo, Opus solo para decisiones de arquitectura complejas o razonamiento multi-paso. Haiku para tareas simples de subagente.

Yo casi siempre empiezo en Sonnet. Cuando noto que la tarea es trivial (arreglo de formato, actualización de docs, refactor con un patrón claro), cambio con /model a Haiku. Cuando noto que esto se va a poner difícil (arquitectura nueva, debug de rendimiento, bug peliagudo), voy a Opus. Pero a conciencia y de vuelta cuando ya no hace falta.

Fijar el default va a través de /config. Si hasta ahora empezabas en Opus, ponlo en Sonnet. Apenas perderás calidad.

3. Pon los subagentes en haiku

Cuando escribes subagentes o slash commands, en el frontmatter YAML va un campo de modelo. Ejemplo para un comando de formato:

---
description: Format code file
model: haiku
---

Haiku es una fracción del coste y hace esas tareas sin problema. Si no te acostumbras a esto, cada pequeña sub-llamada corre en el modelo que esté activo en ese momento. Con un default de Opus eso sale carísimo, porque los subagentes a menudo corren en loop.

La regla general que uso: format / lint / json-parse / clasificación pequeña → haiku. Code review / refactor / escribir test → sonnet. Planificar arquitectura → opus.

4. /clear entre tareas no relacionadas

El contexto rancio cuesta tokens en cada mensaje de seguimiento. Cuando acabas de arreglar un bug en el componente de auth y ahora quieres hacer algo en el layout del newsletter, el viejo contexto de auth tiene valor cero. Pero se envía con cada prompt.

/clear hace un corte en seco. Pulsa /rename antes para volver a encontrar la sesión más tarde, luego /resume por si tienes que volver. Ese es el único comando con el que de verdad te deshaces de tokens, todo lo demás solo comprime.

Mi ritmo: cada 60 a 90 minutos o cuando cambio de tema. Mejor demasiado a menudo que demasiado poco.

5. Lee /context para ver quién come espacio de verdad

/context muestra qué hay en la ventana de contexto. Quien come espacio ahí, fuera. Sospechosos clásicos son: servidores MCP que cargan sus tools por completo, archivos enormes que Claude arrastró hace 20 mensajes, outputs de tools largos de pasos anteriores.

Si /context muestra que un servidor MCP concreto ocupa 8000 tokens aunque no lo hayas usado esta sesión, plantéate si de verdad tiene que entrar. Sacarlo del .mcp.json o desactivarlo con el toggle de plugin suele ser la solución limpia.

6. Usa /compact con tus propias instrucciones

Cuando te acercas al límite, Claude Code resume automáticamente. El comportamiento por defecto está bien, pero puedes controlar qué se conserva. Ejemplo:

/compact Focus on code samples and API usage

Esto suele salvar el 30 por ciento que de verdad era relevante. La compactación por defecto a veces tira justo las rutas de archivo que necesitas en el siguiente paso.

También puedes fijar instrucciones de compactación en CLAUDE.md para que cada compact corra igual:

# Compact instructions

When you are using compact, please focus on test output and code changes

7. Prefiere herramientas CLI antes que servidores MCP cuando sea posible

La documentación de Anthropic lo dice ella misma: las definiciones de tools MCP se cargan de forma diferida (solo cargan los nombres hasta que se usa un tool), pero en cuanto haces una llamada a un tool entra la definición completa. Las herramientas CLI como gh, aws, gcloud, docker no necesitan servidor MCP, Claude puede llamarlas vía Bash y el output es pequeño de forma determinista.

Así que si puedes elegir entre el servidor MCP de GitHub y simplemente gh pr list vía Bash, Bash suele ser más barato y rápido. Los servidores MCP merecen la pena sobre todo para superficies de API complejas (Stripe, Notion, backends propios) donde falta una CLI o es dolorosa.

8. Anticipa la auto-compactación en vez de que te sorprenda

Claude Code compacta automáticamente cuando te acercas al límite de contexto. El problema: la compactación misma cuesta tokens y pierdes detalle. Si lo ves con suficiente antelación, puedes pulsar /clear o /compact a conciencia antes de que actúe el comportamiento automático.

/usage te muestra los recuentos de tokens actuales. Una configuración de statusline que muestre esto de forma permanente ayuda enormemente. Arriba en la documentación de Anthropic está el aviso: configure your status line to display it continuously. Hazlo. Un segundo de setup, ahorra sorpresas para siempre.

9. Fija límites de gasto a nivel de workspace

Si corres por la API (no Pro/Max), puedes fijar límites de gasto de workspace en la Claude Console. Ese es el único freno duro. Anthropic aplica rate limits en tres ejes: RPM (requests por minuto), ITPM (input tokens por minuto) y OTPM (output tokens por minuto), por clase de modelo y por usage tier.

Límites concretos de Tier 1 según la documentación oficial: Sonnet 4.x u Opus 4.x están en 50 RPM con 30.000 ITPM y 8.000 OTPM. Haiku 4.5 tiene 50 RPM con 50.000 ITPM y 10.000 OTPM. Tier 2 salta a 1.000 RPM con 450.000 ITPM para Sonnet/Opus/Haiku-4.5. Tier 3 son 2.000 RPM, Tier 4 son 4.000 RPM. Pasas al siguiente tier cuando alcanzas el umbral de crédito respectivo (Tier 1 a partir de 5 USD ingresados, Tier 2 a partir de 40 USD, Tier 3 a partir de 200 USD, Tier 4 a partir de 400 USD).

Importante para la optimización de coste del daily driver: las lecturas de caché NO cuentan contra tu límite de ITPM en la mayoría de los modelos. Solo se cuentan input_tokens (después del último cache breakpoint) y cache_creation_input_tokens. cache_read_input_tokens es gratis. Así que con una tasa de aciertos de caché del 80 por ciento obtienes 5x el throughput efectivo del mismo límite de tier. Fija los límites de gasto de workspace en la Console, freno duro activo.

Pro/Max usa cuotas de plan en vez de límites de gasto. Si estás en un plan y ves cuotas desgarrándose, eso normalmente significa que no necesitas ninguna herramienta de coste, necesitas disciplina de cuota.

Con Bedrock, Vertex o Foundry no hay métricas de Anthropic, ahí la documentación recomienda LiteLLM como tracker de código abierto. No auditado por Anthropic, así que decide a conciencia.

10. Usa agent teams solo con plan

Los agent teams (varias instancias de Claude Code trabajando en paralelo) escalan el consumo de tokens linealmente con el tamaño del equipo. Cada teammate tiene su propio contexto, carga CLAUDE.md, servidores MCP, skills. Eso se pone caro rápido.

Defaults según la documentación de Anthropic: los agent teams están apagados por defecto. Tienes que poner CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1 en settings.json o el entorno. Si los usas, tres reglas: Sonnet para los teammates (no Opus), mantén los equipos pequeños, termina los equipos cuando el trabajo esté hecho (los teammates ociosos siguen quemando tokens).

Esa es justo la palanca con la que 30 dólares al día se convierten rápido en 200 dólares, si no tienes cuidado.

Qué viene después

Cuando tengas todo esto montado y aun así corras demasiado alto, mira el playbook hooks-gegen-halluzinationen. Las llamadas a tools equivocadas que corren en loop suelen ser el verdadero asesino de tokens, no el modelo. Y la recipe 2.5-github-mcp muestra cómo configuras servidores MCP de forma más ligera.

Source

  • code.claude.com/docs/en/costs (oficial, consultado 2026-04-27)
  • code.claude.com/docs/en/commands (oficial, consultado 2026-04-27)
  • Frontmatter field model, github.com/anthropics/claude-code Plugin-Dev Skills (oficial)
  • platform.claude.com/docs/en/api/rate-limits (oficial, tablas de tier consultadas 2026-04-27)
  • CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS confirmado vía github.com/anthropics/claude-code issues #23420, #25375, #29660, #29766, #32368