← SCRAM AI Lab
Aprende a diseñar un router de cuatro tiers para chatbots. Reduce costos hasta un 81% y mejora la latencia asignando cada mensaje al modelo adecuado.
May 21, 2026
503 lecturas

Si mides los mensajes reales que llegan a un chatbot de producción, vas a encontrar una distribución brutal: el 60% es acknowledgment trivial, el 30% es pregunta de bajo contexto, el 8% requiere razonamiento real, y el 2% son los casos críticos donde un error sale caro. Pagar Opus 4.7 (~$15/MTok output según la documentación oficial de precios de Anthropic) para responder "de nada" a alguien que dijo "gracias" es indefendible. Y sin embargo lo hace la mayoría de los chatbots que usan "un solo modelo bueno".
Necesitas un router de modelos si tu sistema supera los 3,000 mensajes diarios y el costo de inferencia impacta el margen unitario, o bien cuando la latencia en interacciones triviales degrada la retención del usuario. Si tu tráfico es menor o estrictamente uniforme, la sobrecarga de mantener múltiples integraciones superará el ahorro económico obtenido.
En operaciones empresariales en América Latina, este umbral se vuelve aún más sensible. Dado que la facturación de las APIs de modelos de lenguaje se liquida en dólares estadounidenses mientras que los ingresos de los negocios suelen estar denominados en monedas locales sujetas a volatilidad cambiaria, reducir el consumo innecesario de tokens no es una optimización marginal: es la diferencia entre la viabilidad financiera o el cierre de un canal conversacional automatizado.
El patrón que SCRAM corre en producción tiene cuatro niveles, cada uno con un modelo distinto calibrado para un equilibrio específico entre costo, velocidad y capacidad cognitiva:
| Tier | Modelo asignado | Costo Input (USD/MTok) | Latencia p50 | Criterio de activación | Caso de uso principal |
|---|---|---|---|---|---|
| Tier 0 | Gemini 3 Flash | $0.075 | ~300ms | <= 2 palabras o regex de cortesía | Agradecimientos, confirmaciones, despedidas |
| Tier 1 | gpt-4o-mini | $0.15 | ~600ms | <= 12 palabras sin objeciones en contexto | Extracción de entidades, navegación y FAQs |
| Tier 2 | Claude Sonnet 4.6 | $3.00 | ~1.2s | Default para consultas abiertas complejas | Manejo de objeciones de venta y síntesis RAG |
| Tier 3 | Claude Opus 4.7 | $15.00 | ~2.5s | Deal alto valor en CRM o falla crítica detectada | Negociaciones avanzadas y soporte técnico raíz |
type Tier = 0 | 1 | 2 | 3;
function determineTier(message: string, ctx: Context): Tier {
const trimmed = message.trim().toLowerCase();
const wordCount = trimmed.split(/\s+/).length;
// Tier 0: acknowledgment puro
const ackPatterns = /^(gracias|ok|listo|perfecto|sale|va|si|no|excelente)[.!]?$/;
if (ackPatterns.test(trimmed) || wordCount <= 2) return 0;
// Tier 3: señales de criticidad
if (ctx.isHighValueDeal || ctx.isEscalated) return 3;
if (/error|stack trace|no funciona|urgente|critic/i.test(message) && wordCount > 15) return 3;
// Tier 1: preguntas cortas con baja complejidad
if (wordCount < 12 && !ctx.hasOpenObjection) return 1;
// Tier 2: default productivo
return 2;
}
Las señales que importan en producción: longitud del mensaje, presencia de keywords técnicos, valor del deal en el CRM, etapa del funnel. No te compliques con clasificadores ML: una función pura con heurísticas explícitas es 5ms, debugeable y la puedes ajustar viendo logs.
En un chatbot con 12,000 mensajes/día y 60% acknowledgments antes del router (mediciones tomadas en infraestructura de clientes de SCRAM AI Lab):
La sorpresa: la calidad percibida sube, no baja. Los mensajes de tier 0 responden en 300ms en lugar de 2s, lo que da al usuario sensación de fluidez. Los de tier 3 reciben razonamiento real en lugar del compromiso mediocre de un modelo "para todo".
Cada tier tiene fallback al siguiente superior si: (a) el provider devuelve 429/529, (b) latencia rebasa SLO, (c) el modelo expresó duda ("no estoy seguro" en la respuesta, detectable con un patrón corto). El fallback no es retry; es escalar. Y se loguea: si el 15% de los tier 1 escala a tier 2, tu clasificación está mal calibrada.
Aparte del costo, hay un tema de latencia. Opus 4.7 a ~2.5s de TTFT es genial para razonamiento, pero para "¿cuál es su horario?" se siente lento. La percepción de inteligencia en un chatbot está dominada por fluidez en lo trivial y profundidad en lo importante. Un router te da las dos. Un solo modelo te da una a costa de la otra.
En el mercado hispanohablante, más del 80% de las interacciones automatizadas ocurren a través de canales como WhatsApp Business API o mensajería web móvil. Este entorno introduce dos factores clave que alteran el comportamiento del router:
determineTier.¿Cuántos de los mensajes de tu chatbot del último mes eran "gracias"? Si no lo sabes, ese es el primer dato que vale la pena medir antes de discutir routers.
Artículos relacionados
Claude Opus 5.5 y Sonnet 5.5: precios, benchmarks y qué cambia en la API
Anthropic lanzó Opus 5.5 ($4/$20) y Sonnet 5.5 ($2/$10) en seis días. Sonnet supera a Opus en Terminal-Bench. Precios, cambios de API y cómo migrar.
Claude Fable 5.1 y Mythos 5.1: precio, benchmarks y qué cambia en tu enrutador de modelos
Anthropic lanzó Claude Fable 5.1 y Mythos 5.1 el 1 de septiembre de 2026: $10/$50 por millón de tokens, lectura de caché a $0.25 (75% menos), cinco niveles de esfuerzo y retención cero. Comparativa contra Fable 5 y Opus 5, y cómo decidir si migras.
Claude Opus 5: precio, contexto de 1M y por qué reordena tu router de LLMs
Claude Opus 5 introduce 1M de tokens y rendimiento de frontera a precio accesible. Analizamos costos, benchmarks y cómo reconfigurar tu router de LLMs.