Contexto y tokens, lo que ve el modelo
Por qué el modelo olvida tras 50 mensajes y qué puedes hacer al respecto.
¿Qué es un token?
Un token es una unidad de palabra para el modelo. A grandes rasgos: 1 palabra = 1 a 2 tokens en castellano, un poco menos en inglés. "Alucinar" son unos 4 tokens.
¿Qué es la ventana de contexto?
La cantidad máxima de tokens que el modelo puede "ver" a la vez. Como cuánto texto cabe en una mesa. Si metes más, lo más viejo se cae.
Tamaños típicos (estado abril 2026, cambia rápido):
- GPT-5: 128k estándar, 200k vía API
- Claude Opus: 1M tokens en modo 1M
- Gemini 2.5 Pro: 2M tokens
200k tokens son unas 400 páginas de texto. 1M son unas 2.000 páginas. Las cifras crecen, lo que hoy es el máximo, en seis meses probablemente sea el estándar.
Por qué es importante
En un chat largo, en algún momento la parte más vieja de la conversación se elimina del contexto. El modelo "olvida" lo que se habló al principio. No es un bug, es la arquitectura.
Para ti significa:
- Si necesitas mucho contexto, vuelve a mencionar los puntos clave
- Resume documentos largos antes de pegarlos
- En temas realmente complejos: empieza una sesión nueva con contexto limpio
Caché de contexto
Los modelos modernos cachean prompts repetidos. Si reutilizas el mismo bloque de texto (system prompt, documento) a menudo, se cachea, lo que ahorra coste y tiempo. Lo explicamos en el Nivel 2.
Effort levels y token budget
En Claude Code desde abril 2026 hay un segundo dial junto al modelo: el effort level. Menos effort = menos tokens para reasoning interno = más barato y rápido, pero menos profundo. Más effort = más reasoning tokens = mejor en tareas complejas, pero más caro.
Los cinco niveles desde Opus 4.7 (16 de abril de 2026):
- low: respuestas rápidas, apenas thinking. Bueno para lookups simples, refactors fáciles, código boilerplate.
- medium: reasoning estándar. Default para la mayoría de casos.
- high: reasoning profundo. Para decisiones de arquitectura, sesiones de debug que no quieres escarbar tú mismo, migraciones difíciles.
- xhigh: introducido con Opus 4.7. Entre high y max. Para problemas donde realmente necesitas análisis profundo pero quieres evitar el coste de max. En la variante Opus top actual, xhigh es el default.
- max: reasoning máximo. Para sesiones realmente complicadas donde necesitas una respuesta muy buena de una sola vez.
¿Qué cuesta? En la variante Opus actual los reasoning tokens cuestan igual que los output tokens (25 USD por millón de tokens). Una sesión xhigh puede quemar fácilmente 30 a 60 por ciento más tokens que una medium. En Max Plan es flat-rate, en API pagas por token.
Tip práctico: pon default en medium o high, usa xhigh o max deliberadamente para las tareas duras del día. En ~/.bashrc como CLAUDE_CODE_EFFORT_LEVEL=high o en ~/.claude/settings.json, más override por flag por sesión si hace falta. Si todavía no estás en max con Opus pero el modelo responde demasiado superficial en tareas duras, xhigh suele ser el término medio mejor.
Lo que cambia desde el Nivel 4
A partir del Nivel 4 aprendes sistemas de memoria que van más allá del contexto. Esa es la salida al problema del "modelo que olvida".