«Nên fine-tune, xây RAG hay chỉ viết prompt tốt hơn?» CTO của bạn cần câu trả lời trước sáng mai —các lead của bạn bất đồng quan điểm, còn CFO muốn con số cứng, không phải bài blog.
Chọn sai, bạn đốt $50K và một quý vào chiến lược sụp đổ khi mở rộng quy mô.
Bài viết này cung cấp khung quyết định 7 trục dựa trên dữ liệu và playbook mặc định 6 bước hoạt động cho 80% đội ngũ mà không cần đụng vào trọng số model.
Bạn sẽ học sự khác biệt giữa hành vi và kiến thức, so sánh TCO 6 tháng và ba phản biện mà dữ liệu bác bỏ.
Vì sao «chọn một» là mô hình tư duy sai
Sự khác biệt hành vi so với kiến thức
Chỉ riêng khung này đã giải quyết một nửa mọi tranh luận về tùy chỉnh trước khi bắt đầu phân tích chi phí.
Khoảng cách hành vi. Định dạng đầu ra không nhất quán. Sai giọng điệu. Từ chối khi nên trả lời. Trả lời khi nên từ chối. Model có thể làm nhiệm vụ nhưng không làm theo cách bạn cần. Sửa: fine-tuning —nướng hành vi mong muốn vào trọng số. Hoặc: prompt engineering toàn diện với few-shot examples mạnh —thử cái này trước, vì nó nhanh hơn và rẻ hơn.
Khoảng cách kiến thức. Model không biết danh mục sản phẩm, chính sách trả hàng, tài liệu nội bộ hoặc bản cập nhật giá tuần trước của bạn. Sửa: RAG —cung cấp kiến thức tại thời điểm truy vấn. Không bao giờ fine-tune để thêm kiến thức. Sự kiện thay đổi. Trọng số không cập nhật cho đến khi bạn huấn luyện lại.
Sai lầm đắt nhất trong tùy chỉnh LLM: fine-tune để thêm kiến thức. Mỗi bản cập nhật sản phẩm, mỗi thay đổi chính sách, mỗi điều chỉnh giá khiến model fine-tuned của bạn sai thêm. Kiến thức thuộc về truy hồi, không phải trọng số. Hành vi thuộc về trọng số, không phải prompt. Chỉ riêng quy tắc này đã cứu bạn khỏi sai lầm đốt nhiều ngân sách LLM hơn bất kỳ sai lầm nào khác.
Ba thay đổi xáo trộn nền kinh tế
Prompt caching đập tan lập luận «prompt dài đắt». Cả OpenAI và Anthropic giờ tính ~10% giá đầu vào tiêu chuẩn cho token đã cache. Điểm giao cũ —khoảng 10,000 yêu cầu/ngày, trên đó fine-tune để rút ngắn prompt có ý nghĩa tài chính— đã dịch lên 50,000–100,000 yêu cầu/ngày. Với hầu hết đội ngũ, phép tính không còn nghiêng về fine-tune chỉ dựa trên chi phí. (Cơ chế caching được trình bày sâu trong hướng dẫn prompt caching của chúng tôi.)
Fine-tuning được quản lý đang thu hẹp. OpenAI đóng fine-tuning self-serve cho tổ chức mới từ tháng 5/2026. Mọi công việc huấn luyện chấm dứt hoàn toàn vào ngày 6/1/2027, chỉ còn fine-tuning tăng cường o4-mini. Anthropic chỉ cung cấp Claude 3 Haiku SFT qua Amazon Bedrock —không có fine-tuning model tiên phong. Tinh chỉnh Gemini 3.x của Google chỉ ở bản xem trước trên tầng Flash nhỏ. Con đường bền vững là model trọng số mở —Qwen, Llama, Gemma, Mistral— với LoRA/QLoRA trên hạ tầng bạn kiểm soát.
Tối ưu prompt trở thành một ngành kỹ thuật thực sự. DSPy, GEPA (ICLR 2026 Oral, xem kỷ yếu ICLR 2026) và MIPROv2 đã biến tối ưu prompt từ «dành hàng giờ vọc chữ trong playground» thành «chạy tối ưu Bayes trên các ứng viên prompt và thu lại 2–6 điểm chính xác». Giờ bạn có thể cải thiện hiệu suất prompt bằng lập trình —với kết quả đo được, tái lập được— thay vì dựa vào trực giác và thử-sai.
Thực tế hệ thống tổng hợp
Hệ thống LLM sản xuất năm 2026 gần như phổ quát kết hợp cả ba cách tiếp cận. Fine-tune cho hình thức: giọng điệu nhất quán, hành vi từ chối, cấu trúc đầu ra nướng vào trọng số. RAG cho sự kiện: kiến thức mới, trích dẫn được, kiểm soát truy cập. Prompt để điều phối: chỉ dẫn, định nghĩa tool, định hình từng yêu cầu. Paper BetterTogether cho thấy việc xen kẽ tối ưu prompt và trọng số vượt trội tới 6% so với chỉ dùng prompt và tới 60% so với chỉ dùng trọng số. Tư duy «hoặc» gây hại nhiều hơn chính lựa chọn.
Dữ liệu đằng sau mỗi cách tiếp cận
Kinh tế học Prompt Engineering
Thiết lập: $0 (chỉ token). Hàng tháng: ~$120 ở 100K truy vấn (tầng GPT-4o Mini). Chu kỳ lặp: triển khai ngay trong ngày. Khả chuyển model: 70–85% giữa các nhà cung cấp. Khả dụng: mọi API —GPT-5.5, Claude Opus, Gemini— đều hỗ trợ.
Trần: tối ưu prompt nâng độ chính xác 2–6 điểm. Nếu đường cơ sở của bạn thấp hơn mức chất lượng hơn 10 điểm, riêng prompt không đóng được khoảng cách.
Kinh tế học RAG
Thiết lập: ~$400 (vector DB + pipeline embedding). Hàng tháng: ~$200 (embedding + hosting vector DB + token truy hồi). Độ chính xác lĩnh vực: 94–98% khi tinh chỉnh đúng cách. Chi phí ẩn: bảo trì cơ sở tri thức —làm sạch dữ liệu, tinh chỉnh chunk, lập chỉ mục lại định kỳ, di trú model embedding— tiêu tốn 30–50% TCO RAG trong hầu hết triển khai. Báo giá nhà cung cấp hiếm khi bao gồm nó. Xem hướng dẫn sản xuất RAG đầy đủ của chúng tôi cho toàn bộ pipeline.
Kinh tế học Fine-tuning
Thiết lập: $1,600–200K+ tùy quy mô dữ liệu và chiến lược GPU. Hàng tháng: ~$60 (phục vụ model trọng số mở nhỏ). ROI dương: ~12 tháng ở >1M cuộc gọi/tháng. Chi phí ẩn: rủi ro ngừng hỗ trợ model gốc (model fine-tuned của bạn chết khi model gốc nghỉ hưu), trì hoãn chu kỳ lặp (2–8 tuần mỗi chu kỳ huấn luyện so với cập nhật prompt trong ngày), và bùng nổ tinh chỉnh mỗi khách thuê (100 khách thuê = 100 model fine-tuned = 100 pipeline triển khai/giám sát/cập nhật).
Điểm giao chi phí ở hai quy mô
| Cách tiếp cận | 100K Queries/Month (6 tháng) | 1M Queries/Month (6 tháng) |
|---|---|---|
| Prompt Engineering | $720 | $7,200 |
| Prompt + Caching | $420 | $4,200 |
| RAG | $1,600 | $3,200 |
| Fine-tuning | $1,960 (không bao giờ hòa vốn) | $3,960 (hòa vốn từ tháng 8-12) |
Hiểu biết chính: với đội ngũ dưới 500K truy vấn/tháng cho một nhiệm vụ duy nhất, fine-tuning gần như không bao giờ thắng về chi phí thuần. Giá trị của nó là đóng khoảng cách hành vi —giọng điệu, định dạng, hiệu chỉnh từ chối— không phải tiết kiệm chi phí. Nếu bạn fine-tune để tiết kiệm tiền ở lưu lượng vừa, bạn đang giải bài toán sai bằng công cụ đắt.
Giá model thay đổi hàng tháng và chênh lệch tới 10x giữa các nhà cung cấp cho cùng tầng năng lực. Trước khi cam kết một chiến lược, hãy xác minh giá hiện tại để đặt tính TCO của bạn trên con số thực.
Khung quyết định 7 trục
Trục 1: Khoảng cách chất lượng từ đường cơ sở
Sau tối ưu prompt toàn diện, độ chính xác cách mục tiêu bao xa? Dưới 5 điểm: prompt + RAG để neo kiến thức là đủ. 5–10 điểm: thêm định tuyến model phân tầng và cân nhắc chưng cất sang model nhỏ hơn. Trên 10 điểm: đường đi đầy đủ gồm cả fine-tuning đặt lên bàn.
Chẩn đoán: chạy DSPy MIPROv2 100–200 bước tối ưu. Nhìn vào điểm bão hòa hội tụ. Nếu nó ổn định dưới mục tiêu 5+ điểm, fine-tuning vào cuộc đàm thoại.
Trục 2: Chi phí của sai lầm
Lĩnh vực rủi ro cao —y tế, pháp lý, tài chính— nơi một câu trả lời sai có thể tốn $10K+ hoặc châm ngòi vi phạm tuân thủ: lợi thế hiệu chỉnh của fine-tuning (tốt hơn 5–15% độ chính xác từ chối và nhất quán đầu ra so với chỉ prompt) biện minh chi phí và thời gian. Lĩnh vực rủi ro thấp —đề xuất nội dung, công cụ nội bộ, nguyên mẫu— prompt cộng RAG là đủ.
Trục 3: Lưu lượng
Trên 1 triệu cuộc gọi API mỗi tháng cho một nhiệm vụ hẹp duy nhất, kinh tế mỗi cuộc gọi của fine-tuning bắt đầu thắng —Qwen3-8B fine-tuned tự lưu trữ có thể giảm hơn 90% chi phí mỗi token so với giá API GPT-4o. Dưới 100K cuộc gọi mỗi tháng, prompt thắng gần như luôn luôn về chi phí thuần —chi phí thiết lập cố định của fine-tuning phân bổ trên quá ít yêu cầu.
Trục 4: Ngân sách độ trễ
Mục tiêu dưới 200ms: model lớn với prompt phình to, hàng nghìn token few-shot examples và ngữ cảnh RAG sẽ không qua. Model nhỏ fine-tuned —Qwen3-8B với system prompt tối thiểu— có thể. Mục tiêu trên 500ms: tối ưu prompt thoải mái nằm trong ngân sách; lợi thế độ trễ của fine-tuning là thật nhưng không bắt buộc.
Trục 5: Yêu cầu phong cách và định dạng
Nếu vấn đề cốt lõi là nhất quán giọng điệu, cấu trúc đầu ra hoặc hành vi từ chối —fine-tuning là công cụ mạnh nhất. Trọng số trực tiếp mã hóa mẫu hành vi mong muốn. Nếu vấn đề cốt lõi là chính xác thực tế —trọng số là đòn bẩy sai. Sự kiện thay đổi. Trọng số không cập nhật cho đến khi bạn huấn luyện lại.
Trục 6: Nhạy cảm dữ liệu và đa khách thuê
Cần cô lập mỗi khách thuê? Đừng fine-tune mỗi khách thuê. Một trăm khách thuê nghĩa là 100 model, 100 pipeline triển khai, 100 dashboard giám sát. Thay vào đó: fine-tune một model gốc dùng chung. Dùng RAG trên chỉ mục cô lập mỗi khách thuê cho kiến thức. Dùng prompt cho tùy chỉnh giọng điệu và hành vi mỗi khách thuê.
Trục 7: Tốc độ lặp
Ra mắt tuần này: chỉ tối ưu prompt. Ra mắt quý này với đội ML chuyên trách: fine-tuning khả thi. Nếu bạn chọn fine-tuning nhưng cần lặp nhanh hơn —LoRA/QLoRA với Unsloth nén huấn luyện từ vài ngày xuống vài giờ trên GPU tiêu dùng.
Playbook mặc định 2026
Bước 1: Viết chương trình DSPy sạch
Định nghĩa nhiệm vụ của bạn bằng chữ ký có kiểu, không phải chuỗi thô. Việc này mất một ngày và trả công mãi mãi —mỗi bước tiếp theo đòi hỏi chương trình đo được và bộ đánh giá.
Bước 2: Tối ưu prompt với MIPROv2 hoặc GEPA
Chạy 100–200 bước tối ưu Bayes trên các ứng viên prompt. Lợi ích điển hình: 2–6 điểm chính xác. Nếu bạn vượt mức chính xác ở đây, ra mắt. Xong. 80% đội ngũ dừng ở đây.
Bước 3: Thêm prompt caching
Cấu trúc lại prompt: nội dung tĩnh trước (system prompt, tool schema, few-shot examples), nội dung biến thiên sau. Marker cache_control của Anthropic hoặc caching tự động của OpenAI. Cắt chi phí đầu vào 60–90%. Không đổi hành vi. Tối ưu chi phí thuần. Hầu hết đội ngũ dừng ở đây.
Bước 4: SFT model nhỏ hơn trên prompt đã tối ưu
Nếu bước 2 và 3 vẫn để bạn vượt ngân sách chi phí hoặc độ trễ, hãy tạo completion từ model tiên phong đã tối ưu prompt trên vài nghìn đầu vào. SFT sang Qwen3-8B —điểm ngọt hiện tại của tỷ lệ hiệu suất-trên-chi phí phục vụ. Dùng Unsloth với QLoRA. Tương thích GPU tiêu dùng.
Bước 5: GRPO với phần thưởng xác minh được hoặc dựa trên giám khảo
Cho nhiệm vụ có bộ xác minh thật (toán, code, trích xuất có cấu trúc): GRPO qua Unsloth. Cho nhiệm vụ agent không có ground truth: ART + RULER với model giám khảo. Chỉ huấn luyện trên 10% ví dụ khó nhất —«Hard Examples Are All You Need» cho thấy điều này vượt trội tới 30 điểm so với huấn luyện trên tập con ngẫu nhiên hoặc dễ.
Bước 6: Tối ưu lại prompt cho model đã fine-tune
Model fine-tuned phản ứng với prompt khác model lớn gốc. Chạy lại GEPA trên model fine-tuned. Thu thêm 2–5 điểm. Đây là vòng khép: tối ưu trọng số —tối ưu prompt —ra mắt.
Phản biện và trả lời
«Playbook 6 bước này thiết kế thừa. Tôi chỉ cần fine-tune rồi xong chứ?»
Fine-tune mà không có hạ tầng đánh giá và đường cơ sở tối ưu prompt nghĩa là chi $10K+ cho model có thể kém model gốc —và bạn sẽ không bao giờ biết, vì bạn bỏ qua bước 1 (không có bộ đánh giá thì không có đo lường). Tối thiểu, bạn phải làm bước 1 (bộ đánh giá), bước 2 (đường cơ sở prompt), và chỉ sau đó cân nhắc bước 4 (fine-tune dựa trên đường cơ sở đó). Bỏ bước là bay trong đêm.
«Chỉ RAG là đủ. Fine-tuning thừa với trường hợp của tôi.»
Nếu khoảng cách hành vi —định dạng đầu ra, giọng điệu, hành vi từ chối— đã được prompt engineering giải quyết, bạn đúng. RAG cộng prompt tối ưu tốt là stack đúng cho hầu hết ứng dụng thâm dụng kiến thức. Nhưng nếu tối ưu prompt đã cạn và khoảng cách hành vi còn trên 5 điểm, fine-tuning là đòn bẩy duy nhất còn lại có thể đóng nó. Kiểm tra: điểm đánh giá của bạn có vượt ngưỡng sau bước 2 không? Có, dừng. Không, tiếp tục.
«Model chẳng phải đang giỏi đến mức tùy chỉnh không còn quan trọng sao?»
Model tiên phong giỏi hơn bao giờ hết. Nhưng «giỏi» không nghĩa là «hiểu thuật ngữ nội bộ, giọng thương hiệu và quy tắc kinh doanh của bạn». GPT-5.5 vẫn không thể phân biệt bản địa chính sách nâng cấp của ba tầng khách hàng. Cải thiện model đã thu hẹp khoảng cách tùy chỉnh nhưng không xóa bỏ —nó dịch khoảng cách từ «model không trả lời được» sang «model trả lời đúng nhưng sai định dạng hoặc giọng điệu». Khoảng cách mới đó chính là nơi fine-tuning vượt trội.
Câu hỏi thường gặp
Sai lầm đắt nhất đội ngũ mắc phải là gì?
Fine-tune để thêm kiến thức. Mỗi bản cập nhật sản phẩm, thay đổi giá hoặc sửa chính sách làm model fine-tuned của bạn cũ đi. Kiến thức thuộc về truy hồi (RAG). Dùng fine-tuning để định hình cách model trả lời —không phải những gì nó biết.
Tôi có thể fine-tune GPT-5.5, Claude Opus hoặc Gemini 3.1 không?
Trạng thái hiện tại (tháng 7/2026): OpenAI đóng fine-tuning self-serve cho tổ chức mới từ tháng 5/2026, mọi công việc huấn luyện kết thúc ngày 6/1/2027 —chỉ còn fine-tuning tăng cường o4-mini. Anthropic chỉ cung cấp Claude 3 Haiku SFT qua Bedrock. Tinh chỉnh Gemini 3.x của Google chỉ ở bản xem trước trên tầng Flash. Con đường bền vững: model trọng số mở (Qwen 3/4, Llama 4, Gemma 3/4, Mistral) với LoRA/QLoRA trên hạ tầng bạn kiểm soát.
Playbook đầy đủ mất bao lâu?
Bước 1–3: một đến hai tuần, giả định đã có hạ tầng đánh giá. Bước 4–6: bốn đến tám tuần, tùy chuẩn bị dữ liệu và hạ tầng huấn luyện. Hầu hết đội không bao giờ cần bước 4–6 —họ đạt mức chất lượng ở bước 2 hoặc 3.
Prompt caching có thực sự đổi kinh tế học không?
Điểm giao cũ (~10K yêu cầu/ngày) khiến fine-tune có ý nghĩa tài chính khi prompt dài tạo chi phí lặp cao. Điểm giao mới (~50–100K yêu cầu/ngày) phản ánh caching giảm 90% chi phí đầu vào. Prompt caching là thứ gần nhất với tiền miễn phí trong LLM API —và nó đẩy lý do tài chính của fine-tuning lên lưu lượng cao hơn nhiều. Cơ chế caching đầy đủ được trình bày trong hướng dẫn prompt caching liên kết ở trên.
Điều gì thay đổi nếu tôi định tuyến qua nhiều nhà cung cấp thay vì gắn với một?
Đường tùy chỉnh của bạn —prompt, RAG hay fine-tuning— vận hành đơn giản hơn khi cả ba chạy qua cùng một lớp tích hợp. Thử prompt giữa các model: một base URL, đổi tham số model. Pipeline RAG: embedding và chat trên cùng một hóa đơn. Model fine-tuned tự lưu trữ định tuyến cùng API đám mây: một dashboard quan sát, một báo cáo chi phí. Benchmark độc lập như LMSYS Chatbot Arena cung cấp dữ liệu chất lượng xuyên model quyết định model nào giành slot trong mỗi tầng định tuyến. Khung không đổi. Gánh nặng vận hành thực thi nó giảm đáng kể.
Cuộc tranh luận giữa fine-tuning, RAG và prompt engineering đã khép lại
Cuộc tranh luận giữa fine-tuning, RAG và prompt engineering đã khép lại —không phải bằng cách chọn một, mà bằng cách hiểu thứ tự. Bắt đầu với prompt. Thêm RAG cho kiến thức. Chỉ với fine-tuning khi khoảng cách hành vi sống sót qua tối ưu prompt toàn diện. Với 80% đội ngũ, hành trình kết thúc ở bước 2 —với prompt tốt hơn và đường cơ sở đánh giá đo được. Với 20% còn lại, playbook 6 bước cung cấp đường đi tuần tự tránh các sai lầm $10K.
Dù chọn đường nào, hãy xây hạ tầng đánh giá trước. Không có nó, bạn không đang ra quyết định —bạn đang đặt cược.