LLM API PricingAI Model ComparisonAPI Cost Optimization

Precios de LLM APIs 2026: todos los modelos comparados

1 min de lectura

Un millón de tokens de salida cuesta $0.15 en DeepSeek-V3, $30 en GPT-5.5 y $45 en o1-Pro. Eso es una brecha de 300x —entre modelos que, para una gran parte de las cargas de producción, producen resultados indistinguibles. Si elegiste el modelo equivocado y nunca miraste atrás, tu factura de API lo está contando ahora mismo.

La brecha es real y crece. En los últimos dieciocho meses, los precios de los modelos frontier han subido a medida que se expandían las capacidades de razonamiento, mientras una ola paralela de modelos de alta eficiencia —DeepSeek, Gemini Flash, Llama 4— ha llevado el piso a casi cero. El resultado es un mercado donde dos equipos con cargas similares pueden pagar $300/mes o $9,000/mes, y el más barato suele dar la mejor experiencia al usuario porque responde más rápido.

Cerrar esa brecha no requiere rehacer la infraestructura. Un equipo enruta los “hola” y “gracias” por un clasificador liviano en lugar de un modelo de razonamiento y recorta $7,500 de una factura mensual de $9,700 —una caída del 78%— mientras la latencia mejora. Otro habilita prompt caching en prompts de sistema repetitivos y ahorra 50% en costos de tokens de entrada sin tocar el código. Los datos agregados de despliegues en producción muestran que el enrutamiento sistemático por niveles de modelo más el caching suele recuperar el 60–80% del gasto en LLM APIs.

Esto es lo que te llevarás: una tabla de precios de cuatro niveles que cubre todos los modelos que importan en julio de 2026, un ranking de calidad por dólar que te dice qué modelo realmente entrega por lo que pagas, tres recomendaciones por perfil de lector (no niveles de presupuesto genéricos) y un marco de decisión que responde “qué modelo para qué” en una frase.

La tabla completa de precios de LLM APIs 2026

Hay más de 180 modelos disponibles a través de las APIs principales a mediados de 2026. La mayoría nunca los usarás. Lo que importa es entender la estructura de precios —no memorizar cada número. Los modelos se agrupan en cuatro niveles según capacidad y costo. Esto es lo que necesitas saber de cada uno.

Nivel 1: Modelos frontier ($2–30 por millón de tokens)

Estos son los buques insignia. Los corres cuando la tarea exige máxima profundidad de razonamiento: sesiones de depuración complejas, flujos de agentes de varios pasos, análisis de documentos legales donde una alucinación cuesta más que el request a la API.

ModeloProveedorInput ($/1M tok)Output ($/1M tok)Ventana de contextoSWE-bench Verified
GPT-5.5OpenAI$5.00$30.001M88.7%
GPT-5.5 ProOpenAI$30.00$180.00
Claude Opus 4.8Anthropic$5.00$25.001M88.6%
Claude Sonnet 4.6Anthropic$3.00$15.001M~85%
Gemini 3.1 ProGoogle$2.00 ($4 >200K)$12.00 ($18 >200K)1M (2M preview)80.6%

GPT-5.5 y Claude Opus 4.8 están estadísticamente empatados en la cima del leaderboard de SWE-bench Verified. En la práctica, el factor decisivo no es la capacidad —es el ecosistema. GPT-5.5 tiene el ecosistema más grande de plugins y SDKs. Claude Opus tiene el protocolo nativo de uso de herramientas más fuerte y el pensamiento extendido. Gemini 3.1 Pro es la opción de valor en este nivel: 2,5x más barato que GPT-5.5 en salida, con el mejor nivel gratis (1,500 requests al día vía Google AI Studio) y el único modelo con soporte multimodal nativo —video, audio e imágenes procesados en un solo request.

El nivel GPT-5.5 Pro a $30/$180 por millón de tokens existe para cargas donde la profundidad máxima de razonamiento es innegociable: simulaciones de descubrimiento de fármacos, verificación formal de sistemas críticos de seguridad, investigación frontier. Para el 99,7% de los casos de uso, el GPT-5.5 base es la elección correcta.

Nivel 2: Frontera de valor ($0.50–2 por millón de tokens)

Aquí es donde ocurrió la revolución de precio-rendimiento de 2026. Los modelos de este nivel obtienen 80%+ en SWE-bench Verified —competitivos con los modelos frontier de hace 18 meses— a un costo 5–20x menor.

ModeloProveedorInput ($/1M tok)Output ($/1M tok)ContextSWE-bench
DeepSeek V4 ProDeepSeek$0.435$0.871M~85%
Qwen3.7 MaxAlibaba$1.25$3.751M80.4%
MiniMax M3MiniMax$0.60$2.401M80.5%
Kimi K2.6Moonshot$0.95$4.00256K80.2%
GLM-5.2Z.AI$1.40$4.401M
Mistral Large 3Mistral$0.50$1.50262K

El destacado de este nivel es MiniMax M3: a $0.03 por punto SWE-bench —la mejor capacidad de código por dólar de cualquier modelo del mercado. DeepSeek V4 Pro es el líder general de valor: 1/34 del costo de salida de GPT-5.5 mientras entrega calidad de código indistinguible de los modelos frontier para ~85% de las tareas del mundo real.

Mistral Large 3 merece una mención especial para equipos de la UE: compatible con GDPR, alojado en la UE, nivel gratis disponible y el único modelo de este nivel con una historia clara de residencia de datos.

Nivel 3: Caballos de batalla económicos ($0.10–$0.50 por millón de tokens)

Para cargas de alto volumen y sensibles al costo donde no se requiere capacidad frontier absoluta:

ModeloProveedorInput ($/1M tok)Output ($/1M tok)ContextMejor para
DeepSeek V4 FlashDeepSeek$0.14$0.281MGeneración de texto, clasificación, código simple
GPT-5.4 NanoOpenAI$0.20$1.25128KEcosistema de OpenAI, necesidades de calidad moderada
GPT-4.1 NanoOpenAI$0.10$0.401MContexto largo, precios OpenAI más bajos
Gemini 3.1 FlashGoogle$0.50$3.001MCargas de volumen multimodales
Qwen3-32BAlibaba$0.18$0.2832KMultilingüe (árabe, japonés, coreano)
Llama 4 ScoutMeta (alojado)$0.11$0.3410MVentana de contexto más larga de este nivel

DeepSeek V4 Flash a $0.14/$0.28 es el ancla de este nivel. Obtiene 92% en HumanEval (código) —0,5 puntos por debajo de GPT-4o— a 1/40 del precio de salida. Para clasificación de texto, resumen, Q&A simple y generación de código boilerplate, no hay razón para usar algo más caro.

Nivel 4: Modelos gratis (permanentes)

No son pruebas. Son gratis para siempre —con límites de rate y advertencias que debes entender antes de construir sobre ellos.

ModeloProveedorLímite de tasaContextAdvertencia
GLM-4.7 FlashZ.AI~1,000 req/day128KCompletamente gratis, documentación prioritaria en chino
Gemini 2.5 FlashGoogle1,500 req/day1MPuede usar datos para entrenamiento (nivel gratis)
Modelos gratuitos de GroqGroq30 RPM / 14,400 RPDVariosInferencia más rápida (300–500 tok/s)
Cerebras freeCerebras30 RPM / 1M tok/dayVariosMayor rendimiento por lotes (2,500+ tok/s)
OpenRouter freeOpenRouter20 RPM / 200 RPDVarios35+ modelos gratis, una sola API key

Los niveles gratis son para prototipos y herramientas personales. En el momento en que necesitas confiabilidad, un SLA o garantías de privacidad de datos, cambia a un nivel de pago —o mejor, a una plataforma de agregación que te permite escalar del prototipo gratis al pago de producción sin cambiar tu endpoint de API.

Para un desglose completo de las capacidades de los niveles gratis —incluyendo qué puedes construir realmente con $0— consulta nuestra guía de proveedores de LLM API más baratos (artículo #3 de esta serie).

La brecha de precios de 300x

El modelo más barato de esta tabla es $0.10 por millón de tokens de entrada (GPT-4.1 Nano). El más caro es $30 por millón (GPT-5.5 Pro) —una brecha de 300x solo en entrada. En salida, la brecha es aún mayor: de $0.01/M (Qwen3-8B, GLM-4-9B en el piso absoluto) a $180/M (GPT-5.5 Pro) —hasta 18,000x de diferencia entre el token de salida más barato y el más caro.

¿Qué impulsa esta brecha? Tres cosas: capacidad del modelo (profundidad de razonamiento, precisión de código, soporte multimodal), costo de inferencia (los modelos más grandes necesitan más horas de GPU) y posición de mercado (OpenAI y Anthropic imponen precios premium por su foso de ecosistema —cada tutorial, SDK y herramienta los soporta primero).

La pregunta práctica no es “qué modelo es el más barato”. Es “qué modelo es suficientemente bueno para mi tarea, y cuánto estoy pagando de más por capacidad que no necesito?”

El prompt caching cambia drásticamente el precio efectivo. Anthropic ofrece 90% de descuento en entrada cacheada, los hits de caché de DeepSeek cuestan solo $0.0036/M, y con 80% de cobertura de caché tu costo efectivo de entrada cae ~72%. Para la estrategia completa de caching entre proveedores y la guía de implementación, consulta nuestra guía de implementación de caching.

Quién debería usar qué modelo: por perfil de lector

Los “niveles de presupuesto de $50/$500/$5,000” genéricos no sirven sin contexto. Aquí está quién eres y qué deberías usar.

El desarrollador independiente

Estás construyendo un side project, un prototipo o un SaaS pequeño. Tus restricciones: presupuesto ($20–50/mes para APIs), tiempo (eres el único desarrollador) y fricción (no quieres crear cinco cuentas de proveedor). Necesitas: un modelo barato que maneje el 90% de tus tareas + un respaldo premium para el otro 10%.

Stack: DeepSeek V4 Flash como tu modelo diario ($0.14/$0.28). Para el ~10% de requests que necesitan más profundidad, enruta a Claude Sonnet 4.6 ($3/$15) o GPT-5.4 Mini ($0.75/$4.50). Costo esperado: $25–50/mes con ~2 millones de tokens de salida. Todo accesible a través de un solo endpoint de agregación —sin cuentas separadas de proveedores.

Camino de crecimiento: cuando tu side project llegue a 10,000 requests/día, has superado los niveles gratis pero aún no necesitas infraestructura empresarial. Una plataforma de agregación te permite mantener el mismo código, el mismo endpoint y solo aumentar tu saldo prepagado. Sin migración. Para la configuración completa, mira la guía de enrutamiento multi-modelo.

El CTO de startup

Diriges un equipo de 3–8 desarrolladores. Tu app de producción hace 50,000–200,000 requests de API al mes. Tus restricciones: confiabilidad (el downtime cuesta usuarios), predictibilidad de costos (las facturas descontroladas matan el runway) y velocidad de desarrollo (tu equipo no debería pasar tiempo administrando cuentas de proveedores).

Stack: DeepSeek V4 Pro como tu modelo de código principal ($0.44/$0.87) —maneja el 70% de tus requests con calidad cercana a la frontier. Claude Sonnet 4.6 para depuración compleja y revisión de PR ($3/$15). GPT-5.4 Mini para flujos de agentes ($0.75/$4.50). Gemini 3 Flash para tareas multimodales ($0.50/$3). Costo esperado: $400–$1,200/mes.

Dos decisiones arquitectónicas que importan más que la elección del modelo: (1) Implementa fallback de modelos —tu app nunca debería devolver “modelo no disponible” a un usuario porque un proveedor se cayó. Un try/except de dos líneas que cambia de Claude a GPT-5.5 en errores 429 o 5xx es la diferencia entre “incidente” y “nadie se enteró”. (2) Pon techos de costo por request. No presupuestos mensuales —límites por request. Un loop de agente descontrolado puede quemar $50 en tokens antes de que dispare una alerta mensual.

Las plataformas de agregación manejan el fallback y el enrutamiento de costos a nivel de infraestructura. Si tu equipo pasa más de 2 horas al mes administrando paneles de proveedores, estás pagando un impuesto oculto que el precio directo de la API no muestra. Para las matemáticas de comparación de costos, lee por qué los desarrolladores migran a plataformas de agregación.

El arquitecto empresarial

Estás evaluando infraestructura LLM para un equipo de 50+ desarrolladores o un producto orientado al cliente a escala. Tus restricciones: cumplimiento (SOC 2, HIPAA, EU AI Act, residencia de datos), gobernanza (quién usó qué modelo, cuándo, a qué costo) y gestión de proveedores (no puedes renegociar contratos con cinco proveedores cada trimestre).

Stack: tu combinación de modelos depende de la carga —pero tu infraestructura importa más que tu selección de modelos. A escala empresarial, tres cosas determinan el costo total: tasa de hits de prompt caching (apunta a >60% para reducir a la mitad los costos de entrada), utilización del batch API (cada carga no-realtime debería usar batch con 50% de descuento) y eficiencia del enrutamiento multi-modelo (la diferencia entre “todos los requests a GPT-5.5” y “enrutamiento inteligente” es típicamente una reducción de 60–80%).

Auto-alojar un gateway como LiteLLM te da control total sobre residencia de datos, gestión de claves y registros de auditoría —pero requiere inversión DevOps. Las plataformas de agregación gestionadas proveen la misma capa de gobernanza (claves virtuales con presupuestos por equipo y allowlists de modelos, rutas de auditoría unificadas, opciones de residencia de datos) sin la sobrecarga de infraestructura.

Para la línea base de seguridad que todo despliegue LLM empresarial necesita, empieza con la guía de gestión de API keys. Luego agrega los requisitos de cumplimiento específicos de tu industria. Pero seguridad y cumplimiento son solo la mitad de la ecuación de costos empresarial —la otra mitad es qué pasa cuando tu equipo necesita cambiar de rumbo.

El costo oculto que nadie rastrea: la migración. Cada vez que cambias de modelo, vuelves a hacer benchmark de tus prompts. Un equipo de cinco ingenieros gastando dos días por migración a $500/día quema $5,000 por cada cambio de modelo. Los equipos que corren tres modelos detrás de una capa de enrutamiento cambian de modelo en producción cambiando un valor de configuración —y miden los resultados en tráfico real con rollout del 5%. Mismo resultado. Cero costo de migración. La tabla de precios de arriba muestra costos por token. Lo que no muestra es que la diferencia real de costo entre una configuración de un modelo y una de varios modelos no es el precio del token —es la fricción organizacional del cambio. Cuando los precios de los modelos cambian cada trimestre y nuevos contendientes emergen cada mes, la capacidad de cambiar de modelo sin sobrecarga de ingeniería vale más que cualquier descuento por token.

Calidad por dólar: el único ranking de valor que importa (a julio de 2026)

Los puntajes de benchmark sin precios son marketing. Los precios sin puntajes de benchmark son comprar a ciegas —plataformas independientes como Artificial Analysis rastrean ambos en todos los proveedores importantes. La métrica que importa es calidad entregada por dólar gastado.

SWE-bench Verified por dólar (valor de código)

Este ranking divide el puntaje SWE-bench Verified de cada modelo por su precio de salida por millón de tokens. Cuanto más alto, mejor —significa más capacidad de código por dólar.

ModeloSWE-benchOutput $/MPuntuación por dólar
DeepSeek V4 Flash~78%$0.28279
DeepSeek V4 Pro~85%$0.8798
MiniMax M380.5%$2.4034
Qwen3.7 Max80.4%$3.7521
Kimi K2.680.2%$4.0020
Gemini 3.1 Pro80.6%$12.007
Claude Opus 4.888.6%$25.003.5
GPT-5.588.7%$30.003.0

Fórmula: porcentaje SWE-bench ÷ dólares de salida por millón de tokens. Cuanto más alto, más capacidad de código por dólar.

DeepSeek V4 Flash entrega 279 puntos de código por dólar —93x el valor de GPT-5.5 (3.0). Incluso DeepSeek V4 Pro, un modelo cercano a la frontier, proporciona 28x el valor de código por dólar. La etiqueta “económico” subestima lo que está pasando: estos modelos entregan código competitivo con la frontier a precios que hacen que los stacks completamente frontier se vean desperdiciados en retrospectiva.

La interpretación que importa: si gastas $1,000/mes en GPT-5.5 para tareas de código, cambiar a DeepSeek V4 Flash te daría salida de calidad similar por aproximadamente $11/mes. Cambiar a DeepSeek V4 Pro: aproximadamente $30/mes. La brecha entre “lo que pagas” y “lo que podrías estar pagando” es más amplia de lo que la mayoría de los equipos cree.

Esta métrica expone algo que la tabla de precios cruda no muestra. GPT-5.5 obtiene 88.7% en SWE-bench —el más alto de esta comparación. Pero cuesta 93x más por punto de benchmark que DeepSeek V4 Flash. Para un equipo que gasta $5,000/mes en APIs de código, ese multiplicador de 93x es la diferencia entre una factura de $5,000 y una de $54 por rendimiento de benchmark equivalente. La brecha de calidad —3 puntos porcentuales en SWE-bench— se traduce en aproximadamente una solución correcta adicional por cada 33 tareas de código. Si eso vale $4,946 al mes es una decisión de negocio, no técnica. La mayoría de los equipos, una vez que hacen los números, descubren que necesitan modelos frontier para alrededor del 5% de su carga real.

MMLU-Pro por dólar (valor de razonamiento general)

ModeloMMLU-ProOutput $/MPuntuación por dólar
DeepSeek V4 Flash85.5$0.28305
DeepSeek V4 Pro~87$0.87100
Qwen3.7 Max~86$3.7523
Claude Opus 4.8~89$25.003.6
GPT-5.5~89$30.003.0

Para tareas de conocimiento general y razonamiento, la brecha de valor es incluso más amplia que para el código. DeepSeek V4 Flash puntúa dentro de 3,5 puntos de GPT-5.5 en MMLU-Pro —a 1/100 del precio por punto de razonamiento.

El punto óptimo de valor

Si graficas todos los modelos en un scatter chart —puntaje SWE-bench en el eje X, precio de salida en el eje Y— ves tres clústeres:

  • La esquina premium (arriba a la derecha): GPT-5.5 y Claude Opus 4.8. Puntajes más altos, precios más altos. Mejores para: tareas donde una respuesta incorrecta cuesta más que el request.
  • El punto óptimo de valor (medio-alto, lejos a la izquierda): DeepSeek V4 Pro, MiniMax M3, Qwen3.7 Max. 80%+ SWE-bench a $0.87–3.75. Mejores para: el 90% de las cargas de producción.
  • La zona económica (medio, lejos a la izquierda): DeepSeek V4 Flash, GPT-4.1 Nano, Qwen3-32B. Calidad suficientemente buena a costo casi cero. Mejores para: clasificación, extracción, resumen, generación de boilerplate.

Los modelos que no tienen sentido en este gráfico: cualquier cosa por debajo de 75% SWE-bench con salida >$5/M. Estás pagando precios frontier por calidad no-frontier. Revisa tu versión de modelo —podrías estar ejecutando un modelo obsoleto que fue reemplazado por una versión más barata y mejor hace seis meses.

Cómo las plataformas de agregación cambian la ecuación de valor. La demanda agregada de una gran base de usuarios desbloquea precios por token por debajo de lo que cualquier equipo individual puede negociar directamente —el mismo principio económico que hace accionable la tabla de calidad por dólar de este artículo. Añade enrutamiento basado en costo que envía cada request al modelo más barato capaz de manejarlo, y un stack combinado (DeepSeek V4 Flash para el 70% del tráfico + Claude Sonnet para el 20% + GPT-5.5 para el 10%) opera 30–50% por debajo de una línea base totalmente frontier. Los usuarios finales no perciben diferencia de calidad porque cada request aterriza en un modelo acorde a su complejidad.

Marco de decisión rápido

Si necesitas generación de código —DeepSeek V4 Pro (mejor valor), Claude Opus 4.8 (mejor calidad). Fallback: GPT-5.5.

Si necesitas análisis de documentos largos (>100K tokens) —Gemini 3.1 Pro (contexto 2M, más barato por token para documentos largos). Fallback: GPT-4.1 Nano (contexto 1M, $0.10/M de entrada).

Si necesitas multilingüe (no inglés) —Qwen3.7 Max o DeepSeek V4 Pro (ambos superan a GPT-5.5 en C-Eval, japonés, coreano, árabe). Fallback: Claude Opus 4.8.

Si necesitas visión/multimodal —Gemini 3.1 Pro (video nativo + audio + imagen). Fallback: GPT-5.5.

Si necesitas flujos de agentes (tool calling) —GPT-5.5 (function calling más confiable, mejor ejecución paralela de herramientas). Fallback: Claude Opus 4.8 (mejor razonamiento complejo de varios pasos).

Si necesitas el costo absolutamente más bajo —DeepSeek V4 Flash ($0.14/$0.28). Gratis: GLM-4.7 Flash (nivel gratis permanente, contexto 128K).

Si el acceso directo es limitado donde estás —Usa una plataforma de agregación que brinde acceso a todos los modelos a través de un endpoint. Sin barreras de pago por proveedor. Una API key.

FAQ

¿Qué modelo es el más barato en general en 2026?

DeepSeek V4 Flash a $0.14 de entrada / $0.28 de salida por millón de tokens. Para acceso permanente gratis: GLM-4.7 Flash (sin tarjeta de crédito, contexto 128K, compatible con OpenAI).

¿Vale Claude Opus 5x el precio de DeepSeek V4 Pro?

Solo si necesitas funciones de protocolo nativo de Anthropic (pensamiento extendido, computer use) o los últimos ~3 puntos porcentuales de capacidad SWE-bench para depuración compleja. Para el 95% de las tareas de código, DeepSeek V4 Pro entrega calidad indistinguible a 1/29 del costo de salida. Comparación detallada: mira nuestra comparación OpenAI vs Anthropic vs Google vs DeepSeek.

¿Las plataformas de agregación realmente ahorran dinero frente a la API directa?

Aplica la lógica de costo por punto de benchmark de la sección de calidad por dólar a tu factura mensual y la respuesta se vuelve clara. Tres mecanismos se combinan: (1) el poder de compra agregado baja las tarifas por token por debajo de lo que califican las cuentas individuales, (2) dejas de estacionar $50–200 en depósitos mínimos que quedan ociosos en los paneles de proveedores, y (3) el enrutamiento basado en costo aplica la misma lógica de niveles que mapea este artículo —consultas simples a modelos de $0.14/M, razonamiento complejo a modelos de $3/M, trabajo de profundidad frontier solo a modelos de $30/M. Los equipos que corren tres o más modelos suelen ver 30–50% menos en su gasto total de LLM frente a mantener cuentas directas separadas sin esa capa de enrutamiento.

¿Con qué frecuencia cambian estos precios?

Los proveedores chinos (DeepSeek, Qwen, MiniMax, Kimi, GLM) recortaron precios seis veces solo en la primera mitad de 2026. Los proveedores estadounidenses (OpenAI, Anthropic) ajustan trimestralmente. Google ajusta cada 2–3 meses. Si usas datos de precios de más de 60 días, probablemente estés pagando de más.

¿Qué hay del precio del batch API?

OpenAI, Anthropic y Google ofrecen ~50% de descuento por procesamiento por lotes asíncrono (turnaround de 24 horas). El precio del batch de DeepSeek es el mismo que el real-time —sin descuento, pero también sin penalización de demora. Para estrategias de optimización de costos con datos de antes/después, la guía de tácticas para recortar la factura lo cubre en detalle.

¿Puedo usar APIs de nivel gratis en producción?

No. Los niveles gratis se limitan a 15–30 requests por minuto, no tienen SLA y algunos (el nivel gratis de Google) pueden usar tus datos para entrenamiento. Úsalos para prototipos y proyectos personales. Cuando estés listo para producción, una plataforma de agregación te permite pasar del prototipo gratis a la producción de pago sin cambiar tu endpoint de API.

Las tablas de precios solo son útiles si actúas sobre ellas. Pasar del stack por defecto que usa la mayoría —todos los requests a GPT-5.5— a un stack multi-modelo optimizado con enrutamiento inteligente suele dar una reducción del 80% en costos con cero pérdida de calidad. Los números están en este artículo.

Esto es lo que debes hacer a continuación: elige un modelo del nivel 2 o 3 en la tabla de arriba. Enruta el 20% de tu tráfico a él esta semana. Mide la calidad. Si es suficientemente buena —y para el 85% de las cargas lo será— acabas de reducir tu factura en un 80%. Ese no es un número aspiracional. Es la matemática de la sección de calidad por dólar.

Los equipos que tratan los precios como una verificación periódica —“veremos los precios de los modelos el próximo trimestre”— son los que descubren que han estado pagando de más por 80% durante seis meses. Los precios se mueven demasiado rápido para revisiones trimestrales. Pon un recordatorio en el calendario para el primer día de cada mes. Revisa la tabla de precios. Ajusta tus reglas de enrutamiento. Cinco minutos. Esa es la diferencia entre una factura de $1,000 y una de $200 —no mejores modelos, no ingenieros más inteligentes, solo un evento recurrente en el calendario.

Los datos de precios de las tablas anteriores fueron verificados contra paneles de proveedores y respuestas de API en julio de 2026. Confirma los números con tus propios prompts —mismo modelo, mismos parámetros, compara el costo por token— usando el playground de TokSpan, que reporta precios entre modelos lado a lado sin requerir cuentas de proveedores. Un saldo prepagado de $5 es suficiente para hacer benchmark de todos los modelos de los niveles 2 y 3.