DeepL dice que es el mejor. GPT dice que es el mejor. Tu glosario no está de acuerdo con ninguno de los dos —en algún punto entre el primer lote y el último, el término aprobado para “Plan” se convirtió silenciosamente en otra cosa, y los tickets de soporte llegaron antes de que alguien se diera cuenta.
La traducción IA es el cuello de botella silencioso de la localización en 2026: la industria está haciendo benchmarks activos de los LLMs contra la traducción automática neuronal, pero el pipeline del lado del desarrollador —aplicación del glosario, chunking, puertas de calidad, costo por millón de palabras— sigue mayormente sin documentar. El marketing de los proveedores dice “nuestro modelo es el mejor”, los papers académicos miden lo que no puedes desplegar, y la capa intermedia que de verdad corre en producción no existe.
Esta guía cubre ambas mitades: lo que los benchmarks de los proveedores realmente muestran (con la metodología para correr los tuyos) y el pipeline de producción que hemos construido —glosario → chunking → traducción → enforcement → QA— con los controles de costos que mantienen asequible un mes de un millón de palabras.
Qué cambia realmente la traducción con LLMs
En resumen: la traducción con LLMs reemplaza “correcto” por “correcto en contexto” —y eso cambia el pipeline, no solo el motor.
La traducción automática neuronal traduce oraciones. Los LLMs traducen con contexto: pueden respetar un glosario, mantener una voz de marca, seguir guías de estilo y manejar ambigüedades que los sistemas a nivel de oración aplastan. Tres capacidades marcan la diferencia:
- Control de terminología. Un glosario es una entrada, no una esperanza. Al modelo se le puede exigir que use el término aprobado para un nombre de producto o una frase legal —aplicado, no solicitado.
- Ventanas de contexto. Un párrafo, una página, un documento —el modelo ve más de una oración, lo que corrige los errores de referencias entre oraciones que plagan a la traducción automática.
- Salida configurable por instrucciones. Tono, formalidad, audiencia —“formal para legal, amigable para onboarding” es un prompt, no un cambio de modelo.
El concepto erróneo a eliminar: la traducción con LLMs no es “mejor MT”. Es una herramienta distinta con costos distintos —mayor costo por palabra, mayor control. El pipeline de abajo existe precisamente para que el costo valga la pena.
Por qué construir tu propio pipeline de traducción
En resumen: el pipeline existe porque los proveedores venden motores, no garantías —el control del glosario, la calidad medible y la caída de costos de los modelos son cosas que construyes tú.
Tres razones para ser dueño del pipeline en lugar de alquilar un proveedor de traducción:
- La terminología es un contrato. Nombres de marca, términos legales, strings de producto —tu glosario es un activo de negocio, y solo un pipeline puede aplicarlo de forma consistente en cada lote y en cada idioma.
- La calidad debe ser medible. “Se ve bien” no sobrevive a una revisión de producto. Un pipeline con una etapa de QA automatizada produce un puntaje por lote y por idioma —la misma disciplina de evaluación que nuestra guía de testing aplica a todo lo demás.
- Los costos de los modelos siguen cayendo. Cada generación de modelos baja el precio por palabra. Un pipeline que trata al modelo como un componente configurable captura esas caídas automáticamente; un contrato con un proveedor no.
La alternativa —un proveedor de traducción— compra conveniencia y vende lock-in. El duelo de valor de esta serie muestra por qué la capa de modelos debería seguir siendo una decisión que controlas, y la misma lógica aplica a la traducción.
El benchmark de proveedores: calidad, costo y latencia por par de idiomas
En resumen: los rankings de calidad son específicos por par de idiomas y caducan en meses —corre tu propio corpus y trata cualquier ranking publicado, incluido el nuestro, como una foto instantánea.
El panorama de 2026 está genuinamente disputado: evaluaciones independientes como el benchmark de traducción con LLMs de intlpull y la encuesta de modelos 2026 de Lokalise muestran a los modelos de frontera intercambiando posiciones según el par de idiomas y el tipo de tarea, con los modelos económicos cerrando la brecha en los pares comunes. Lo que es estructuralmente cierto:
- Los modelos de frontera lideran en pares con pocos recursos y en registros matizados —la brecha es real donde los datos de entrenamiento son escasos.
- Los modelos económicos y open-weight están cerca en los pares de alto recurso —inglés↔español, francés, alemán, japonés— donde “suficientemente bueno” está a medio camino de “excelente”.
- La dispersión entre proveedores es menor que la dispersión entre diseños de prompt. La inyección del glosario y el chunking mueven la calidad más que la elección del modelo en la mayoría de los pares.
En el lado del costo: el precio por millón de palabras varía con el nivel del modelo y el comportamiento del caché —los niveles de frontera cuestan múltiplos de los niveles económicos, y el caching sobre segmentos estables (boilerplate, strings repetidos) comprime la tarifa real. El catálogo de modelos rastrea la disponibilidad actual; verifica las tarifas en las páginas de los proveedores al momento de comprar, porque los presupuestos de traducción son sensibles exactamente a estos números.
Tu propio benchmark, en una tarde: toma 20 strings representativos por idioma de destino, pásalos por dos modelos candidatos más tu MT actual, y pide a un hablante nativo que los califique a ciegas. Es el mismo método que usan los artículos de la industria, y responde la única pregunta que importa —para tu producto, tus idiomas.
Cómo construir el pipeline: Glosario → Chunking → Traducción → Enforce → QA
En resumen: cinco etapas, un contrato —el glosario son datos, la etapa de QA es una puerta, y todo lo de en medio es mecánica.
El esqueleto, sobre un endpoint de chat unificado:
import json
from openai import OpenAI
client = OpenAI(base_url="https://api.tokspan.com") # unified endpoint — one key for every model
GLOSSARY = [ # enforced, not suggested
{"source": "Checkout", "target": "Finalizar Compra", "lang": "es"},
{"source": "Plan", "target": "Tarifa", "lang": "es"},
]
def translate(text, lang, model="gpt-4o-mini"):
sys = (
"You are a professional translator. Use the glossary exactly; "
"never translate glossary terms differently. Keep the brand voice."
f"\n\nGlossary: {json.dumps(GLOSSARY)}"
)
return client.chat.completions.create(
model=model,
messages=[{"role": "system", "content": sys},
{"role": "user", "content": text}],
).choices[0].message.content
# Stage 5: the gate
def qa(original, translated, lang):
verdict = client.chat.completions.create(
model="gpt-4o", # a different model as judge — never the translator
messages=[{"role": "user", "content":
f"Rate this translation 0-10 for accuracy, terminology, and tone: "
f"\nSource: {original}\nTarget: {translated}"}],
).choices[0].message.content
return float(verdict) >= 7
Cinco etapas, cada una con una regla:
- Glosario —datos estructurados, inyectados en el system prompt. El contrato es “exacto”, no “preferible”.
- Chunking —a nivel de párrafo, no de oración, para que el contexto sobreviva; mantén intactos los segmentos que contienen terminología.
- Traducción —el nivel del modelo es una decisión de routing: nivel económico para boilerplate, nivel de frontera para el copy de marketing (routing personalizado lo hace por segmento).
- Enforce —escanea la salida buscando términos del glosario; cualquier fallo se vuelve a traducir con el glosario resaltado. Este bucle es lo que convierte la terminología en una garantía en lugar de una esperanza.
- QA —una puerta LLM-as-judge con un modelo distinto al del traductor, calificada por umbral en cada segmento. Los lotes que no superan la puerta no se publican; la metodología de evaluación enlazada arriba aplica.
Cómo controlar calidad y costo
En resumen: el costo por millón de palabras es un parámetro de diseño —el tiering, el caching y el batching suelen recortarlo 60-80% sin tocar la calidad.
El modelo de costos, en una línea: costo por millón de palabras = tarifa del modelo × factor de expansión de tokens (las traducciones inflan los tokens: un corpus de 1M de palabras normalmente se convierte en 1.3-1.6M de tokens después del overhead del prompt). Tres palancas:
- Haz tiering por tipo de segmento. El boilerplate, los strings de UI y el boilerplate legal corren en modelos económicos; el copy de marketing y marca corre en el nivel de frontera. La mezcla normalmente aterriza 50-70% por debajo de una configuración 100% de modelos de frontera.
- Cachea el 80% estable. Menús, etiquetas, bloques repetidos —los prefijos estables en segmentos recurrentes alcanzan el precio de caché a una fracción de la tarifa de entrada. La traducción es una de las mejores cargas para caching que existen, porque los mismos strings se repiten en cada lote de idiomas.
- Haz batching del flujo offline. La traducción de documentos completos, los dumps de strings y las sincronizaciones nocturnas toleran retrasos —el patrón de descuento por batch de esta serie aplica el 50% de descuento exactamente a estas cargas.
Y el lado de la calidad de la misma moneda: el umbral de la puerta de QA y el modelo juez están versionados como código. Cada upgrade de modelo re-ejecuta el set de evaluación antes de tocar producción —la disciplina que evita que “el modelo mejoró” se convierta en “el glosario empeoró”.
Errores comunes que rompen la calidad de traducción
En resumen: cuatro fallas —cada una invisible en un demo y cara en producción.
- Deriva del glosario. Sin bucle de enforcement ni escaneo de salida, el término aprobado se convierte en “usualmente”. El enforcement es una etapa, no una preferencia.
- Chunking que mata el contexto. Los chunks a nivel de oración rompen las referencias entre oraciones y parten las frases que contienen terminología. El chunking a nivel de párrafo con límites conscientes del glosario es el piso.
- Evaluación de métrica única. BLEU por sí solo recompensa “literalmente correcto” y castiga “naturalmente correcto”. Usa calificación con juez más muestreo con hablantes nativos —el mismo patrón de doble vía que en toda otra evaluación de salida de LLMs.
- Localización aplanada por máquina. Traducir no es localizar: las fechas, monedas, unidades y referencias culturales necesitan manejo de locale después de la traducción, no en lugar de ella. La última etapa del pipeline es la adaptación de locale, y saltársela es cómo “la página de precios” se convierte en el ticket de soporte.
FAQ
¿Es la traducción con LLMs mejor que DeepL o Google MT?
En control de terminología y registro, sí —los LLMs siguen glosarios e instrucciones de estilo que la MT no puede. En costo por palabra y pares simples de alto recurso, la MT sigue ganando. La decisión es control-versus-costo, no bueno-versus-malo.
¿Cómo evalúo la calidad de la traducción?
Calificación con juez (un modelo distinto al del traductor) más muestreo con hablantes nativos sobre un set de evaluación fijo. BLEU por sí solo engaña —mide solapamiento literal, no naturalidad. Versiona el set de evaluación y re-ejecútalo en cada upgrade de modelo.
¿Cuánto cuesta traducir por millón de palabras?
Aproximadamente la tarifa del modelo por una expansión de tokens de 1.3-1.6× —los niveles económicos aterrizan muy por debajo de los niveles de frontera, y el caching más el batching comprimen aún más la tarifa real. Construye el modelo, no la conjetura; la fórmula de esta guía es el punto de partida.
¿Cómo aplico la terminología?
Inyección del glosario más un escaneo de enforcement en la salida: cada segmento se revisa contra el glosario, y los fallos se vuelven a traducir con el término resaltado. “Preferir” es una esperanza; “escaneo y reintento” es una garantía.
¿Debería hacer batching de mis trabajos de traducción?
La traducción offline —dumps de strings, sincronización de documentos, flujos nocturnos— es la carga batch canónica: tolera retrasos, es de alto volumen y tiene 50% de descuento en el nivel batch de todos los proveedores importantes. La traducción interactiva de UI se mantiene en tiempo real.
¿Puede un modelo económico manejar la traducción?
En pares de alto recurso, sí —la brecha con el modelo de frontera es pequeña donde los datos de entrenamiento abundan. Los pares con pocos recursos y el registro matizado todavía justifican el nivel de frontera. La decisión de routing por segmento es para lo que existe el pipeline.
Resumen
La traducción IA con LLM APIs es una jugada de control, no de modelo: el enforcement del glosario convierte la terminología en un contrato, una puerta de QA con juez hace la calidad medible, y el tiering, el caching y el batching hacen del costo un parámetro de diseño. Los rankings de proveedores son fotos instantáneas —corre tu propio corpus, en tus pares de idiomas, con el método que usa todo benchmark serio. Luego construye el pipeline una vez, y cada generación de modelos lo hace más barato.
Tus idiomas, tu corpus, tu veredicto. Obtén tu API key de TokSpan y pasa los mismos strings por varios modelos; $5 en créditos gratis cubren el primer lote del benchmark.