Inicio/Blog/Desarrollo de Software
Desarrollo de Software

Qué Modelo de IA Usar en tu Empresa en 2026 (y Cuánto Cuesta de Verdad)

Fable 5.1 y GPT-6 Astra llegaron en septiembre de 2026: qué modelo usar para cada tarea de tu empresa, cuánto cuesta y cómo decidir sin casarte con un titular.

·

September 10, 2026

·

9 min de lectura

Qué Modelo de IA Usar en tu Empresa en 2026 (y Cuánto Cuesta de Verdad)

En cuatro días de septiembre de 2026 salieron dos modelos de frontera: Claude Fable 5.1 el 1 de septiembre y GPT-6 Astra el 4. Si diriges una empresa mediana en México, la pregunta no es cuál es "el mejor". Es cuál conviene para cada tarea que ya haces con IA, cuánto cuesta cada mil conversaciones y qué pasa con tu factura cuando el proveedor cambia el precio sin avisarte, como acaba de pasar con Sonnet 5.

Esta guía está escrita para quien decide presupuesto de tecnología, no para quien programa. Vas a salir con una tabla de precios verificados, una regla para asignar modelo por tarea y un plan de dos semanas para probar un modelo nuevo sin romper lo que ya funciona.

Resumen ejecutivo

  • Un modelo de frontera no es para todo: el 90% de las tareas de una empresa (clasificar correos, extraer datos de facturas, contestar soporte) se resuelven con modelos de $3 por millón de tokens o menos.
  • Claude Fable 5.1 cuesta $10 de entrada y $50 de salida por millón de tokens, pero su lectura de caché bajó 75%, a $0.25: conviene en agentes que repiten contexto, no en chats sueltos.
  • GPT-6 Astra se anunció sin precio ni fecha de API para todos; no se puede presupuestar hasta que OpenAI lo publique.
  • Sonnet 5 subió de $2/$10 a $3/$15 el 1 de septiembre: si tu presupuesto asumía el precio promocional, ya está 50% corto.
  • Un modelo nuevo entra a producción cuando gana en tus propias pruebas, no en el benchmark del proveedor.

¿Qué modelos de IA existen hoy para una empresa y cuánto cuestan?

Los precios verificados al 10 de septiembre de 2026 son estos. Donde no hay precio publicado lo decimos, en vez de inventar uno.

ModeloEntrada / salida por millón de tokens (USD)Para qué sirve en una empresaFuente
Claude Sonnet 5 (Anthropic)$3 / $15 desde el 1 de septiembreVolumen: clasificar, extraer, resumir, chat de soporte de primer nivelAnthropic
Claude Opus 5 (Anthropic)$5 / $25Análisis y código de uso cotidiano; el mejor equilibrio precio-calidad hoyAnthropic
Claude Fable 5.1 (Anthropic)$10 / $50; caché $0.25Agentes largos, problemas difíciles, cargas con mucho contexto repetidoAnuncio de Anthropic
GPT-6 Astra (OpenAI)No publicadoPor evaluar cuando haya precio y acceso generalAl Jazeera
Gemini 3.6 Flash (Google)Consultar en Google CloudTareas de volumen dentro de Google Workspace y CloudGoogle
DeepSeek V4-Flash (abierto, MIT)$0.14 / $0.28 vía APIPiso de costo; requiere evaluar privacidad de datos y proveedor de hospedajeDeepSeek

Un millón de tokens son, en números redondos, unas 750,000 palabras en español. Un chat de soporte típico consume entre 2,000 y 6,000 tokens por conversación completa. Con Sonnet 5, mil conversaciones de soporte cuestan entre $9 y $27 dólares. Con Fable 5.1, entre $30 y $90. Esa diferencia es la razón por la que el modelo caro no debe atender el mostrador.

¿Por qué el descuento de caché de Fable 5.1 cambia el cálculo?

Porque un agente que ejecuta tareas no manda cada mensaje una vez: vuelve a mandar el contexto completo en cada paso. En nuestro propio asistente, el de cuatro agentes que atiende ventas y soporte, medimos en julio de 2026 que el 71% de los tokens de entrada de un turno promedio eran contexto repetido. Con la lectura de caché a $0.25 por millón, ese 71% cuesta 40 veces menos que la entrada normal. Para un agente así, Fable 5.1 puede salir más barato que Fable 5 aunque el precio de lista sea el mismo. Para un chat suelto que no repite nada, no cambia.

Mi postura: la mayoría de las empresas que conozco no tienen un agente que repita contexto. Tienen un chat. Para ellas, el titular de Fable 5.1 no cambia el presupuesto de 2026.

¿Qué pasó con GPT-6 Astra y por qué no puedes presupuestarlo?

OpenAI lo anunció el 4 de septiembre como su modelo "más inteligente y alineado", primero para un grupo limitado de organizaciones y para el público general "en los próximos días". No publicó precio ni ventana de contexto. Las cifras de 1 millón de tokens de contexto y de benchmarks casi perfectos que circulan en redes vienen de sitios de terceros, no de OpenAI. Y el anuncio llegó con presión política: en Estados Unidos se discute una ley para pausar el desarrollo de IA avanzada, y varios académicos cuestionaron el ritmo de lanzamientos.

Para ti, eso significa dos cosas. Sin precio no hay costo por conversación, y sin costo por conversación no hay decisión de compra seria. Y los proveedores van a cambiar reglas de uso y filtros de seguridad más seguido; tu integración tiene que aguantar que una llamada que ayer pasaba hoy sea rechazada.

¿Cómo se asigna un modelo a cada tarea?

Con una regla de tres niveles que aplicamos en todos los sistemas que construimos. Primero, el modelo barato por defecto. Segundo, escalar solo cuando una señal lo pide (la respuesta no cabe, el usuario pregunta algo fuera del guion, hay que razonar sobre varios documentos). Tercero, el modelo de frontera como último recurso, con un tope de gasto diario.

Tarea de la empresaNivelModelo sugerido hoy
Clasificar y enrutar correos, tickets y WhatsApp1Sonnet 5 o Gemini 3.6 Flash
Extraer datos de facturas, órdenes y contratos1Sonnet 5
Responder soporte de primer nivel con base de conocimiento1 con escalamientoSonnet 5, escala a Opus 5
Redactar cotizaciones y propuestas a partir del ERP2Opus 5
Analizar ventas, tendencias y excepciones de logística2Opus 5
Agentes que ejecutan procesos largos con muchas herramientas3Fable 5.1 (medir caché primero)

En una distribuidora de refacciones de Cuautitlán Izcalli con 60 empleados, ese enrutador resolvió el 91% de las consultas del asistente de ventas con el nivel 1 durante agosto de 2026; solo 34 de 380 conversaciones escalaron al nivel 2 y ninguna al 3. El costo mensual del modelo quedó por debajo de lo que la empresa pagaba de tiempo aire para un solo vendedor. No tengo la cifra exacta de su factura de tiempo aire, pero el dueño la usó como comparación y no la discutió nadie.

¿Cómo probar un modelo nuevo sin romper lo que ya funciona?

Con dos semanas y una regla: el modelo nuevo no toca a tus clientes hasta que gane en tus propias conversaciones. Así lo hacemos nosotros con cada lanzamiento, y así lo vamos a hacer con Fable 5.1 y con GPT-6 Astra cuando tenga precio.

  1. Toma 100 conversaciones reales y anonimizadas de tu asistente, con la respuesta correcta marcada por una persona.
  2. Corre el modelo nuevo en paralelo durante una semana, sin que el cliente lo vea, y compara calidad, costo por conversación resuelta y tiempo de respuesta.
  3. La segunda semana, dale el 10% del tráfico real. Si mejora las tres medidas, sube al 50%. Si empeora una, se regresa y se documenta por qué.
  4. Nunca cambies de modelo y de instrucciones al mismo tiempo. Si cambias las dos cosas, no sabrás cuál mejoró.

Pero hay algo que casi nadie dice: el paso más caro no es el modelo, es la conversación etiquetada. Cien conversaciones bien marcadas te sirven para todos los modelos que salgan en 2026 y 2027. Es la inversión que sí se amortiza.

¿Y la privacidad de los datos de mis clientes?

Depende del contrato, no del modelo. Anthropic anunció que Fable 5.1 se puede usar con retención cero de datos para clientes elegibles mientras llega Enterprise Frontier Safeguards en otoño de 2026, que guarda el monitoreo en la infraestructura del propio cliente. Google ofrece en Workspace que los datos no entrenan modelos, pero un Gemini en un teléfono personal no está bajo ese contrato. Y un modelo abierto como DeepSeek solo es privado si lo hospedas tú o un proveedor que firme por ello. Antes de mandar datos de clientes a cualquier modelo, pide el contrato de retención por escrito. Si no existe, ese modelo no toca datos de clientes; puede clasificar correos anónimos, nada más.

Preguntas frecuentes

Las respuestas cortas están en el bloque de preguntas al final del artículo.

Lo que haría el lunes

Revisar la factura de IA de agosto y separar cuánto fue nivel 1, 2 y 3. Si más del 20% del gasto está en el nivel 3, algo escala de más. Si tu proveedor te cobraba Sonnet 5 a precio promocional, corregir el presupuesto del último trimestre. Y si no tienes cien conversaciones etiquetadas, empezar hoy: es lo único de esta lista que ningún lanzamiento va a volver obsoleto.

Si quieres que lo hagamos contigo, agenda un diagnóstico de tu asistente de IA: revisamos tu enrutador, tu factura y tu contrato de datos en una sesión, sin costo. Y si tu operación todavía no tiene asistente, empieza por la guía de cómo empezar con IA en la empresa o por qué hacen los agentes de IA en una empresa.

#inteligencia artificial
#modelos de IA
#Claude
#GPT-6
#Gemini
#costos
#agentes IA
#desarrollo de software

Preguntas frecuentes

¿Necesitas ayuda con tecnología?

SCRAM Consulting lleva 29 años integrando soluciones de tecnología para empresas en México.

Hablar con un experto
Armando Cortés
Armando Cortés

Armando Cortés forma parte del equipo de SCRAM Consulting, integradora B2B de soluciones IT empresariales con presencia en México y Estados Unidos desde 1997, y partner de Google en Cloud, Workspace y Maps. Acompaña a empresas mid-market mexicanas en proyectos de infraestructura, ciberseguridad, hardware industrial, soporte 24/7 e integración de IA aplicada al stack operativo del negocio.