A 100 millones de tokens por día, las cloud APIs queman $180,000/mes mientras que self-hosting cuesta aproximadamente $22,000 —una brecha del 88% que hace que la decisión se vea obvia. A 10 millones, el TCO completo de self-hosting —GPUs reservados ociosos en los valles nocturnos, 0.3–0.5 FTE de overhead de MLOps, el retraso de 2–6 semanas detrás de cada lanzamiento de modelo— rutinariamente supera a la cloud API. La mayoría de los equipos caen entre estos extremos, y equivocarse en el cálculo cuesta dos o tres veces lo que deberían estar pagando. A continuación un framework completo de TCO. Inserta tus propios números para encontrar tu punto de equilibrio —no la regla empírica de alguien más.
Por qué “el cloud es caro” y “self-hosting es gratis” están ambos equivocados
La trampa del costo cloud
A 100 millones de tokens por día con precios de GPT-4o, tu factura mensual de API llega a aproximadamente $18,750. Ese número se ve alarmante —pero asume cero optimización. En la práctica, la mayoría de los equipos operando a esa escala están pagando 30–50% de más porque no han implementado enrutamiento por niveles de modelo, prompt caching o uso de batch API. Optimizar tu gasto cloud —cubierto exhaustivamente en nuestra guía de 12 formas de optimización de costos— típicamente cuesta menos que un mes de reservas de GPU y entrega ahorros dentro del mismo ciclo de facturación. Agota la optimización cloud antes de considerar self-hosting.
La trampa de los costos ocultos del self-hosting
Dos instancias reservadas de H100 cuestan alrededor de $4,200 por mes. Comparado con esa factura cloud de $18,750, parece un ahorro del 78%. Pero el hardware es alrededor del 30–40% del costo real. Agrega 0.5–1.0 FTE de ingeniero MLOps ($6,000–12,000/mes), el riesgo de utilization de GPU (70% de tiempo ocioso durante los valles de tráfico = efectivamente pagando por compute que no usas), el mantenimiento de actualizaciones de modelos (2–6 semanas por ciclo de upgrade) y el costo de oportunidad de no tener acceso inmediato a nuevos modelos frontier. Por debajo de 50 millones de tokens por día, el TCO completo de self-hosting a menudo supera los costos de cloud API —a veces sustancialmente.
La idea fundamental
Las cloud APIs cobran un markup por token. El self-hosting conlleva overhead fijo de infraestructura e ingeniería. Cuál es más barato depende enteramente de dónde cae tu uso en la curva de costos. El cloud gana en volumen bajo a moderado y cargas con picos. El self-hosting gana en volumen alto y estable. El híbrido gana para casi todos los que están en el medio.
El modelo financiero: qué entra realmente en el TCO
Costos de cómputo
| GPU | Por hora (reservado) | Tokens/seg (modelo 8B) | Ideal para |
|---|---|---|---|
| H100 | ~$2.10 | 2,500+ | Modelos 70B+, alto rendimiento (precios contrastados con Artificial Analysis) |
| A100 | ~$1.20 | 1,500+ | Modelos 8–70B, rendimiento moderado |
| RTX 4090 | ~$0.10 (equivalente a hardware propio) | 100+ | Modelos 8B, servicio de bajo volumen |
La cuantización —4-bit GPTQ o AWQ— reduce los requisitos de VRAM 60–75% con un trade-off de calidad de 1–3 puntos. Para un Qwen3-8B, esa es la diferencia entre necesitar una A100 y correr cómodamente en una RTX 4090. Prueba el impacto en la calidad en tu carga específica antes de comprometerte con un nivel de cuantización.
Trabajo de ingeniería
Aquí es donde se derrumban la mayoría de los modelos de TCO. Self-hosting no es “se configura una vez y corre”. Es un pipeline de producción continuo: procura de GPUs y gestión de compatibilidad de drivers, selección de frameworks y upgrades de versión (vLLM, SGLang o TGI), autoescalado y gestión de colas, monitoreo y rotación on-call, ciclos de upgrade de modelos con A/B testing, parches de seguridad y mitigación de riesgos de cadena de suministro. El incidente de malware LiteLLM de marzo 2026 no fue un caso aislado —es la nueva normalidad para infraestructura auto-gestionada. Presupuesta 0.5–1.0 FTE para cualquier deployment self-hosted que maneje tráfico de producción.
Riesgo de utilization
Tu tráfico cae al 10% del pico entre 1 AM y 5 AM. Esos H100 siguen corriendo, siguen consumiendo energía, siguen costándote $2.10/hora cada uno. Las instancias reservadas garantizan disponibilidad pero exigen pronósticos de capacidad precisos. Las spot instances ahorran 60–80% pero pueden ser reclamadas con 30 segundos de aviso —inaceptable para cargas de producción. Las cloud APIs cobran cero por tiempo ocioso. El self-hosting cobra precio completo 24/7.
Costo de oportunidad de frescura de modelo
Sale un nuevo modelo insignia. Los usuarios de cloud API cambian un string model y despliegan en minutos. Los usuarios de self-hosting comienzan un ciclo de evaluación y migración de dos a seis semanas: descargar pesos, comparar contra el modelo actual, re-optimizar prompts, A/B test, rollout de producción. Para productos donde la diferenciación competitiva depende de la calidad del modelo, este retraso tiene costo real de negocio —potencialmente superando el ahorro de infraestructura.
Inserta tus propios números en el modelo de arriba. Para fundamentar el análisis en precios reales, aquí está cómo se descompone el TCO en tres escalas representativas —cubriendo el rango donde operan la mayoría de los equipos hoy.
Análisis de punto de equilibrio en tres escalas
Pequeño: 10M tokens/día (~300M/mes)
Cloud API: Tarifa combinada de $2/M tokens con enrutamiento por niveles —$600/día, ~$18K/mes.
Self-hosted: 1×H100 reservado ($1,512/mes) + 0.3 FTE MLOps ($3,600/mes) + overhead de infraestructura ($500/mes) —~$5,612/mes.
En papel, self-hosting ahorra 69%. Pero esto asume >85% de utilization de GPU y un 0.3 FTE que realmente existe y no es también tu ingeniero backend líder. Al 50% de utilization (tráfico con picos), el costo de self-hosting sube a ~$7,500/mes —el ahorro se encoge a 58%. Al 30% de utilization (común para productos en etapa temprana), el ahorro cae por debajo del 40% —y un solo incidente de driver de GPU borra meses de ahorro en tiempo de ingeniería.
Veredicto: Cloud, con optimización de costos. Implementa primero enrutamiento por niveles y prompt caching. Reevalúa a 50M tokens/día.
Mediano: 50M tokens/día (~1.5B/mes)
Cloud API: ~$90K/mes tarifa combinada.
Self-hosted: 2×H100 ($3,024) + 0.5 FTE MLOps ($6,000) + infraestructura dedicada ($1,000) —~$10,024/mes.
Self-hosting ahora es claramente más barato —ahorro del 60–70%— incluso contando el riesgo de 40% de utilization y el overhead completo de ingeniería. Esta es la zona de cruce donde self-hosting se gana su complejidad operacional.
Veredicto: Self-hosting, o híbrido. Empieza a planear la procura de GPUs a 30M tokens/día para estar operativo para cuando los costos cloud lleguen a $75K/mes.
Grande: 100M+ tokens/día (~3B/mes)
Cloud API: $180K+/mes.
Self-hosted: cluster de 4–8×H100 ($6–12K) + 1.0 FTE MLOps ($10K) + infraestructura dedicada ($2K) —$18–24K/mes.
La ventaja de self-hosting se amplía a 80%+. A esta escala, probablemente ya tienes un equipo de infraestructura dedicado —los cálculos de TCO deben incluir depreciación, espacio de centro de datos, ancho de banda de red y redundancia.
Veredicto: Self-hosting es el claro ganador económico. Pero a esta escala, no estás decidiendo entre self-hosting y cloud —estás operando una arquitectura híbrida donde self-hosted maneja la base y el cloud provee overflow y acceso a modelos frontier.
La fila híbrida
70% del tráfico rutinario —self-hosted o API barata (DeepSeek V3.2 a $0.27/M de entrada). 30% del tráfico complejo —modelos frontier de cloud (Claude Sonnet 4, GPT-5.5). Total híbrido a 50M tokens/día: ~$32K/mes vs. cloud puro $90K/mes —64% de ahorro manteniendo acceso a los mejores modelos disponibles.
Elegir el modelo correcto para cada nivel requiere datos de precios actuales. Nuestra comparación de precios de LLM API 2026 rankea cada modelo importante por costo y capacidad por tipo de tarea —para que tus decisiones de enrutamiento reflejen los precios de este mes, no los del trimestre pasado.
La arquitectura híbrida: cómo se ve realmente “lo mejor de ambos”
Esta sección te da el panorama arquitectónico y la justificación de costos para cada patrón híbrido. Para implementaciones completas en Python con código de enrutamiento, pegamento de infraestructura y la arquitectura del clasificador PII, mira S10: Arquitectura LLM híbrida —Guía de implementación.
Patrón 1: Enrutamiento de modelos por niveles
Todo el tráfico fluye a través de un gateway de API unificado. Un clasificador ligero determina la complejidad. Las tareas simples (clasificación, extracción, Q&A simple) se enrutan a modelos baratos —Qwen3-8B self-hosted o DeepSeek V3.2 vía API. Las tareas medias se enrutan a modelos cloud de nivel medio. Las tareas complejas —razonamiento de múltiples pasos, codificación agéntica, interacciones sensibles con clientes— se enrutan a modelos frontier de cloud.
La infraestructura clave: una URL base, una API key, lógica de enrutamiento en la capa del gateway. El código de la aplicación no sabe ni le importa dónde se ejecuta un request. Mira nuestra guía de arquitectura multi-modelo para la implementación.
Patrón 2: Base self-hosted + overflow cloud
La inferencia self-hosted maneja la carga base —el tráfico predecible de estado estable por el que de otro modo pagarías markup cloud. Cuando la demanda sube más allá de la capacidad, el overflow se enruta automáticamente a endpoints de cloud API. El stack self-hosted mantiene alta utilization. El cloud provee elasticidad sin sobre-aprovisionar. La pieza de infraestructura crítica: monitoreo de profundidad de cola en el gateway con un disparador de autoescalado que activa el enrutamiento cloud cuando la latencia self-hosted excede el umbral.
Patrón 3: Sensible local + general cloud
PII, PHI u otros datos regulados —inferencia self-hosted. Los datos nunca salen de tu red. El checklist de cumplimiento se mantiene en verde. Consultas generales, datos públicos, cargas no sensibles —cloud API para acceso a los modelos frontier más recientes. La misma aplicación. El mismo código. El mismo formato de API. Solo difiere la regla de enrutamiento —el clasificador PII etiqueta el request, el gateway enruta en consecuencia.
Contraargumentos y limitaciones honestas
”Los modelos de pesos abiertos están cerrando la brecha —pronto no habrá razón para pagar por cloud APIs.”
En benchmarks amplios, sí: DeepSeek V3.2 le sigue el paso a GPT-4o por menos de 5 puntos en MMLU. En tareas específicas de alto riesgo —codificación agéntica de múltiples pasos (SWE-bench verified), razonamiento de nivel frontier (GPQA Diamond), comprensión multimodal de video— los modelos propietarios aún lideran por 8–15 puntos. Si la diferenciación competitiva de tu producto depende de estas capacidades frontier, el self-hosting puro aún no es viable. También: las capacidades multimodales (video, audio) siguen siendo significativamente más débiles en modelos de pesos abiertos. Para una vista lado a lado de las brechas de capacidad por categoría de tarea —no solo puntajes agregados de benchmark— mira el directorio de modelos de TokSpan con precios actuales y etiquetas de capacidad para cada modelo soportado.
”vLLM y Ollama hacen trivial el self-hosting.”
Hacen trivial correr un modelo —de días de configuración a minutos. Correr un modelo no es operar un servicio de producción. Autoescalado a través de múltiples GPUs, degradación elegante durante actualizaciones de modelos, servicio multi-modelo con colas justas, integración de observabilidad, infraestructura de A/B testing —vLLM y Ollama no resuelven esto. Aún necesitas 0.3–0.5 FTE para readiness de producción, incluso con las mejores herramientas.
”Mi equipo necesita soberanía de datos —self-hosting es nuestra única opción.”
Si tus requisitos de cumplimiento exigen que los datos nunca salgan de tu red, la inferencia self-hosted para cargas sensibles no es negociable. Pero eso no significa 100% self-hosting. El Patrón híbrido 3 —datos sensibles locales, todo lo demás cloud— preserva el acceso a modelos frontier mientras satisface los requisitos de cumplimiento más estrictos.
FAQ
¿A qué volumen self-hosting se vuelve más barato?
El cruce está alrededor de 50M tokens por día (1.5B/mes) para la mayoría de los escenarios. Entre 10–50M, la respuesta depende de las tasas de utilization, la capacidad de ingeniería y las características de la carga. Por debajo de 10M, la cloud API es casi siempre más económica. El consejo más práctico: corre en cloud, instrumenta todo, recoge tres meses de datos reales de uso, luego modela tu punto de equilibrio específico. No hagas self-hosting basado en volumen proyectado —hazlo basado en volumen medido.
¿Puedo simplemente usar modelos más baratos en lugar de self-hosting?
DeepSeek V3.2 a $0.27/M tokens de entrada se acerca al costo marginal por token del self-hosting. Para muchos escenarios, el enrutamiento por niveles con modelos cloud baratos logra la mayor parte de la reducción de costos del self-hosting sin ninguno de los overheads operacionales. Agota la optimización de enrutamiento —usar el modelo correcto para cada nivel de complejidad— antes de considerar self-hosting. Entrega una reducción de costos del 50–70% con cero cambios de infraestructura. Nuestro ranking de proveedores de LLM API más baratos actualizado regularmente rastrea qué modelos ofrecen precios sub-$0.15 por millón de tokens de entrada cada mes —una referencia rápida al asignar modelos a tus niveles inferiores.
¿Cada cuánto necesitan upgrade los modelos self-hosted?
Las principales familias de modelos de pesos abiertos (Llama, Qwen, DeepSeek, Gemma) lanzan versiones nuevas significativas cada 4–6 meses. Cada upgrade requiere 2–6 semanas para evaluación, re-optimización de prompts, A/B testing y rollout de producción. Esto no es una disrupción ocasional —es un compromiso recurrente de ingeniería que debería incluirse en la planificación de capacidad del equipo.
¿La arquitectura híbrida es más simple, o solo estoy agregando complejidad?
El híbrido introduce lógica de enrutamiento y gestión multi-entorno —complejidad adicional real. Pero si usas una plataforma de API unificada como gateway, la mayor parte de la complejidad de enrutamiento se absorbe en la capa de infraestructura. Tu código de aplicación ve un solo endpoint. Los spans emitidos por el gateway (mira nuestra guía de observabilidad) muestran todos los endpoints —self-hosted y cloud— en un solo dashboard. La ganancia operacional del híbrido es que no estás forzado a una decisión de todo o nada. Empieza solo con cloud. Agrega self-hosted para niveles específicos cuando los datos lo apoyen.
¿Qué hay de usar TokSpan u OpenRouter versus ir directo?
Las plataformas de agregación de API proporcionan precios mayoristas 15–35% por debajo de las tarifas directas de retail de API —la primera y más fácil palanca de costos para usuarios de cloud API. También proporcionan enrutamiento por niveles, observabilidad centralizada y facturación unificada entre proveedores a través de un solo endpoint. Si estás considerando self-hosting para reducir costos, prueba primero los precios de plataformas de agregación. El ahorro puede ser suficiente para mantenerte en cloud —con cero cambios de infraestructura. La lógica de enrutamiento por niveles que impulsa estos ahorros está cubierta en la documentación de enrutamiento personalizado —enrutamiento basado en reglas, enrutamiento semántico y fallback automático de modelos desde un solo endpoint de API.
“Self-host vs. cloud” es un problema de matemáticas, no de filosofía. Las matemáticas dicen: cloud gana por debajo de 10M tokens/día, híbrido gana de 10 a 100M, y la ventaja del self-hosting se vuelve decisiva por encima de 100M —pero incluso entonces, híbrido con overflow cloud para acceso a modelos frontier es el ganador práctico para la mayoría de los equipos.
Empieza con cloud. Instrumenta todo. Recoge datos reales. Modela tu punto de equilibrio. La reserva de GPU puede esperar. La optimización de costos —enrutamiento por niveles, prompt caching, uso de batch API— no puede.
¿Quieres ver cómo se comparan los precios de TokSpan con las tarifas directas de proveedores y los costos de self-hosting a tu escala? Explora los precios de TokSpan —acceso API unificado a 200+ modelos con tarifas mayoristas 15–35% por debajo del retail directo.