TranslationLLM APILocalization

Dịch thuật AI với LLM API: benchmark và pipeline (2026)

1 phút đọc

DeepL nói nó là tốt nhất. GPT nói nó là tốt nhất. Glossary của bạn không đồng ý với cả hai — ở đâu đó giữa batch đầu tiên và batch cuối cùng, thuật ngữ đã được duyệt cho “Plan” âm thầm biến thành một thứ khác, và ticket hỗ trợ đến trước khi bất kỳ ai kịp nhận ra.

Dịch thuật bằng AI là điểm nghẽn localization thầm lặng của năm 2026: ngành đang tích cực benchmark LLM so với neural machine translation, nhưng phần pipeline phía developer — thực thi glossary, chunking, cổng chất lượng, chi phí mỗi triệu từ — vẫn gần như chưa được ghi chép. Marketing của nhà cung cấp nói “model của chúng tôi là tốt nhất”, các bài báo học thuật đo lường những thứ bạn không thể đưa vào sản xuất, và lớp giữa thực sự chạy trong production thì đang thiếu.

Hướng dẫn này bao quát cả hai nửa: các benchmark của nhà cung cấp thực sự cho thấy điều gì (kèm phương pháp để bạn tự chạy), và pipeline production chúng tôi đã xây — glossary → chunk → translate → enforce → QA — với các biện pháp kiểm soát chi phí giúp một tháng triệu từ luôn trong tầm giá.

Điều dịch thuật bằng LLM thực sự thay đổi

Điểm chính: dịch thuật bằng LLM thay thế “đúng” bằng “đúng theo ngữ cảnh” — và điều đó thay đổi pipeline, không chỉ engine bên dưới.

Neural MT dịch từng câu. LLM dịch có ngữ cảnh: chúng tôn trọng glossary, giữ được giọng thương hiệu, tuân thủ style guide, và xử lý được sự mơ hồ mà các hệ thống cấp câu làm phẳng. Ba năng lực tạo nên khác biệt:

  1. Kiểm soát thuật ngữ. Glossary là một đầu vào, không phải một hy vọng. Model có thể bị yêu cầu bắt buộc dùng đúng thuật ngữ đã duyệt cho tên sản phẩm hoặc cụm từ pháp lý — được thực thi, không phải được đề nghị.
  2. Cửa sổ ngữ cảnh. Một đoạn văn, một trang, một tài liệu — model nhìn thấy nhiều hơn một câu, điều này khắc phục các lỗi tham chiếu chéo câu vốn hoành hành trong MT.
  3. Đầu ra theo chỉ dẫn. Giọng điệu, mức độ trang trọng, đối tượng độc giả — “trang trọng cho văn bản pháp lý, thân thiện cho onboarding” là một prompt, không phải việc đổi model.

Quan niệm sai lầm cần loại bỏ: dịch thuật bằng LLM không phải là “MT tốt hơn”. Nó là một công cụ khác với chi phí khác — chi phí mỗi từ cao hơn, mức kiểm soát cao hơn. Pipeline bên dưới tồn tại chính là để khiến chi phí đó trở nên xứng đáng.

Vì sao nên tự xây pipeline dịch thuật

Điểm chính: pipeline tồn tại vì nhà cung cấp bán engine, không bán cam kết — kiểm soát glossary, chất lượng đo lường được, và chi phí model ngày càng giảm đều là thứ bạn phải tự xây.

Ba lý do để sở hữu pipeline thay vì thuê một nhà cung cấp dịch thuật:

  1. Thuật ngữ là một hợp đồng. Tên thương hiệu, thuật ngữ pháp lý, chuỗi sản phẩm — glossary của bạn là một tài sản kinh doanh, và chỉ có pipeline mới thực thi nó một cách nhất quán qua mọi batch và mọi ngôn ngữ.
  2. Chất lượng phải đo lường được. “Trông ổn” không qua nổi một buổi duyệt sản phẩm. Pipeline có giai đoạn QA tự động tạo ra điểm số cho từng batch, từng ngôn ngữ — cùng kỷ luật đánh giá mà hướng dẫn kiểm thử của chúng tôi áp dụng cho mọi thứ khác.
  3. Chi phí model ngày càng giảm. Mỗi thế hệ model đều hạ giá mỗi từ. Pipeline coi model là một thành phần cấu hình được sẽ tự động hưởng lợi từ những lần giảm giá đó; hợp đồng với nhà cung cấp thì không.

Phương án thay thế — một nhà cung cấp dịch thuật — mua sự tiện lợi và bán sự khóa chặt. Bài so sánh giá trị trong loạt bài này cho thấy vì sao lớp model nên là quyết định bạn kiểm soát, và logic tương tự áp dụng cho dịch thuật.

Benchmark nhà cung cấp: chất lượng, chi phí và độ trễ theo cặp ngôn ngữ

Điểm chính: xếp hạng chất lượng phụ thuộc vào cặp ngôn ngữ và lỗi thời chỉ sau vài tháng — hãy tự chạy trên corpus của bạn, và coi mọi xếp hạng công bố, kể cả của chúng tôi, chỉ là một bức ảnh chụp tại một thời điểm.

Bức tranh 2026 thực sự cạnh tranh: các đánh giá độc lập như benchmark dịch thuật LLM của intlpullkhảo sát model 2026 của Lokalise cho thấy các model hàng đầu đổi vị trí cho nhau theo cặp ngôn ngữ và loại tác vụ, trong khi model giá rẻ đang thu hẹp khoảng cách trên các cặp phổ biến. Những gì đúng về mặt cấu trúc:

  1. Model hàng đầu dẫn đầu ở các cặp ngôn ngữ ít tài nguyên và sắc thái biểu đạt tinh tế — khoảng cách là có thật ở nơi dữ liệu huấn luyện mỏng.
  2. Model giá rẻ và open-weight gần bằng ở các cặp ngôn ngữ giàu tài nguyên — Anh↔Tây Ban Nha, Pháp, Đức, Nhật — nơi “đủ tốt” đã đi được phần lớn chặng đường tới “tuyệt vời”.
  3. Chênh lệch giữa các nhà cung cấp nhỏ hơn chênh lệch giữa các thiết kế prompt. Việc tiêm glossary và chunking cải thiện chất lượng nhiều hơn là lựa chọn model trên hầu hết các cặp ngôn ngữ.

Về chi phí: giá mỗi triệu từ thay đổi theo tầng model và hành vi cache — các tầng hàng đầu cao gấp nhiều lần tầng giá rẻ, và caching trên các phân đoạn ổn định (văn bản boilerplate, chuỗi lặp lại) nén tỷ lệ giá thực xuống. Danh mục model theo dõi tính khả dụng hiện tại; hãy xác minh mức giá trên trang nhà cung cấp tại thời điểm mua, vì ngân sách dịch thuật nhạy cảm với chính những con số này.

Benchmark của riêng bạn, chỉ trong một buổi chiều: lấy 20 chuỗi đại diện cho mỗi ngôn ngữ đích, chạy qua hai model ứng viên cộng với hệ thống MT hiện tại, và nhờ người bản ngữ chấm điểm mù. Đó cũng chính là phương pháp các bài viết trong ngành dùng, và nó trả lời câu hỏi duy nhất quan trọng — với sản phẩm của bạn, ngôn ngữ của bạn.

Cách xây pipeline: Glossary → Chunk → Translate → Enforce → QA

Điểm chính: năm giai đoạn, một hợp đồng — glossary là dữ liệu, giai đoạn QA là cổng chặn, và mọi thứ giữa chúng chỉ là cơ chế vận hành.

Khung cơ bản, trên endpoint hợp nhất:

import json
from openai import OpenAI

client = OpenAI(base_url="https://api.tokspan.com")  # unified endpoint — one key for every model

GLOSSARY = [  # enforced, not suggested
    {"source": "Checkout", "target": "Finalizar Compra", "lang": "es"},
    {"source": "Plan", "target": "Tarifa", "lang": "es"},
]

def translate(text, lang, model="gpt-4o-mini"):
    sys = (
        "You are a professional translator. Use the glossary exactly; "
        "never translate glossary terms differently. Keep the brand voice."
        f"\n\nGlossary: {json.dumps(GLOSSARY)}"
    )
    return client.chat.completions.create(
        model=model,
        messages=[{"role": "system", "content": sys},
                  {"role": "user", "content": text}],
    ).choices[0].message.content

# Stage 5: the gate
def qa(original, translated, lang):
    verdict = client.chat.completions.create(
        model="gpt-4o",  # a different model as judge — never the translator
        messages=[{"role": "user", "content":
            f"Rate this translation 0-10 for accuracy, terminology, and tone: "
            f"\nSource: {original}\nTarget: {translated}"}],
    ).choices[0].message.content
    return float(verdict) >= 7

Năm giai đoạn, mỗi giai đoạn một quy tắc:

  1. Glossary — dữ liệu có cấu trúc, được tiêm vào system prompt. Hợp đồng là “chính xác”, không phải “ưu tiên”.
  2. Chunking — ở cấp đoạn văn, không phải cấp câu, để ngữ cảnh sống sót; giữ nguyên vẹn các phân đoạn mang thuật ngữ.
  3. Translate — tầng model là một quyết định định tuyến: tầng giá rẻ cho văn bản boilerplate, tầng hàng đầu cho nội dung marketing (custom routing giúp việc này theo từng phân đoạn).
  4. Enforce — quét đầu ra để tìm các thuật ngữ trong glossary; bất kỳ chỗ sai nào sẽ được dịch lại với glossary được làm nổi bật. Vòng lặp này chính là thứ biến thuật ngữ thành một cam kết thay vì một hy vọng.
  5. QA — một cổng chặn LLM-as-judge dùng model khác với model dịch, chấm điểm theo ngưỡng cho từng phân đoạn. Batch nào không vượt qua cổng thì không được phát hành; phương pháp đánh giá được liên kết ở trên được áp dụng.

Cách kiểm soát chất lượng và chi phí

Điểm chính: chi phí mỗi triệu từ là một tham số thiết kế — phân tầng, caching và batching thường cắt giảm 60-80% mà không đụng đến chất lượng.

Mô hình chi phí, gọn trong một dòng: chi phí mỗi triệu từ = giá model × hệ số phình token (dịch thuật làm phình token: một corpus 1M từ thường trở thành 1.3-1.6M token sau phần chi phí prompt). Ba đòn bẩy:

  1. Phân tầng theo loại phân đoạn. Văn bản boilerplate, chuỗi UI và boilerplate pháp lý chạy trên model giá rẻ; nội dung marketing và thương hiệu chạy trên tầng hàng đầu. Sự kết hợp này thường đưa chi phí xuống thấp hơn 50-70% so với dùng toàn tầng hàng đầu.
  2. Cache 80% ổn định. Menu, nhãn, khối lặp lại — các prefix ổn định trên những phân đoạn tái diễn chạm vào giá cache chỉ bằng một phần nhỏ giá đầu vào. Dịch thuật là một trong những khối lượng công việc tận dụng caching tốt nhất hiện có, vì cùng một chuỗi lặp lại qua mọi batch ngôn ngữ.
  3. Batch luồng xử lý offline. Dịch toàn bộ tài liệu, xuất chuỗi hàng loạt và đồng bộ ban đêm đều chấp nhận độ trễ — mô hình chiết khấu batch trong loạt bài này áp dụng mức giảm 50% cho chính những khối lượng công việc này.

Và mặt chất lượng của cùng một đồng xu: ngưỡng của cổng QA và model giám khảo được quản lý phiên bản như code. Mỗi lần nâng cấp model đều chạy lại bộ đánh giá trước khi nó chạm tới production — kỷ luật giúp “model tốt hơn” không trở thành “glossary tệ đi”.

Những sai lầm phổ biến phá hỏng chất lượng dịch thuật

Điểm chính: bốn kiểu thất bại — từng cái đều vô hình trong demo và đắt đỏ trong production.

  1. Glossary trôi dạt. Không có vòng lặp thực thi, không quét đầu ra — thuật ngữ đã duyệt trở thành “thường là”. Thực thi là một giai đoạn, không phải một sở thích.
  2. Chunking giết chết ngữ cảnh. Chunk cấp câu phá vỡ các tham chiếu chéo câu và cắt đôi những cụm từ mang thuật ngữ. Chunking cấp đoạn văn với ranh giới nhận biết glossary là mức sàn.
  3. Đánh giá bằng một thước đo duy nhất. Riêng BLEU khen thưởng “đúng theo nghĩa đen” và phạt “đúng tự nhiên”. Hãy dùng chấm điểm dựa trên judge cộng với lấy mẫu người bản ngữ — cùng mô hình hai đường ray như mọi đánh giá đầu ra LLM khác.
  4. Localization bị san phẳng cơ học. Dịch thuật không phải localization: ngày tháng, tiền tệ, đơn vị và các tham chiếu văn hóa cần xử lý locale sau khi dịch, chứ không phải thay cho việc dịch. Giai đoạn cuối của pipeline là chuyển đổi locale, và bỏ qua nó chính là cách “trang pricing” trở thành ticket hỗ trợ.

Câu hỏi thường gặp

Dịch thuật bằng LLM có tốt hơn DeepL hay Google MT không?

Về kiểm soát thuật ngữ và sắc thái biểu đạt, có — LLM tuân theo glossary và chỉ dẫn phong cách mà MT không làm được. Về chi phí mỗi từ và các cặp ngôn ngữ giàu tài nguyên đơn giản, MT vẫn thắng. Quyết định nằm ở kiểm soát-so-với-chi phí, không phải tốt-so-với-xấu.

Làm sao để đánh giá chất lượng dịch thuật?

Chấm điểm dựa trên judge (một model khác với model dịch) cộng với lấy mẫu người bản ngữ trên một bộ đánh giá cố định. Riêng BLEU gây hiểu lầm — nó đo độ trùng khớp theo nghĩa đen, không đo độ tự nhiên. Hãy quản lý phiên bản cho bộ đánh giá và chạy lại sau mỗi lần nâng cấp model.

Dịch thuật tốn bao nhiêu mỗi triệu từ?

Gần bằng giá model nhân với hệ số phình token 1.3-1.6× — tầng giá rẻ thấp hơn hẳn tầng hàng đầu, và caching cộng batching nén tỷ lệ giá thực xuống thêm nữa. Hãy xây mô hình tính toán, đừng đoán; công thức trong hướng dẫn này là điểm khởi đầu.

Làm sao để thực thi thuật ngữ?

Tiêm glossary cộng với quét thực thi đầu ra: mọi phân đoạn đều được đối chiếu với glossary, và chỗ sai được dịch lại với thuật ngữ được làm nổi bật. “Ưu tiên” là một hy vọng; “quét và dịch lại” là một cam kết.

Tôi có nên batch các công việc dịch thuật không?

Dịch thuật offline — xuất chuỗi hàng loạt, đồng bộ tài liệu, luồng chạy ban đêm — là khối lượng công việc batch chuẩn mực: chấp nhận độ trễ, khối lượng lớn, và giảm 50% trên tầng batch của mọi nhà cung cấp lớn. Dịch giao diện tương tác vẫn giữ realtime.

Model giá rẻ có đảm đương được việc dịch thuật không?

Với các cặp ngôn ngữ giàu tài nguyên, có — khoảng cách tới model hàng đầu là nhỏ ở nơi dữ liệu huấn luyện dồi dào. Các cặp ít tài nguyên và sắc thái biểu đạt tinh tế vẫn biện minh cho việc dùng tầng hàng đầu. Quyết định định tuyến theo từng phân đoạn chính là mục đích của pipeline.

Tóm tắt

Dịch thuật AI với LLM API là cuộc chơi của sự kiểm soát, không phải của model: thực thi glossary biến thuật ngữ thành hợp đồng, cổng QA dựa trên judge biến chất lượng thành thứ đo lường được, và phân tầng, caching, batching biến chi phí thành tham số thiết kế. Các xếp hạng của nhà cung cấp chỉ là ảnh chụp tại một thời điểm — hãy tự chạy corpus của bạn, trên cặp ngôn ngữ của bạn, với phương pháp mà mọi benchmark nghiêm túc đều dùng. Rồi xây pipeline một lần, và mỗi thế hệ model mới sẽ làm nó rẻ hơn.

Ngôn ngữ của bạn, corpus của bạn, phán quyết của bạn. Lấy API key TokSpan của bạn và chạy cùng một bộ chuỗi qua nhiều model; $5 tín dụng miễn phí đủ cho batch benchmark đầu tiên.