Fine-tuningRAGPrompt EngineeringDecision FrameworkLLM APICost Optimization

微調 vs RAG vs 提示工程:2026 決策指南

閱讀 1 分鐘

「我們該微調、做 RAG,還是只是寫更好的提示詞?」你的 CTO 需要在天亮前拿到答案——你的主管們意見不合,而 CFO 要的是硬數字,不是部落格文章。

選錯了,你就把 $50K 和一季燒在一套一擴張就崩潰的策略上。

這篇文章提供一套有資料佐證的 7 軸決策框架,以及一個在不碰模型權重的前提下、對 80% 團隊都有效的 6 步驟預設劇本。

你會學到「行為 vs 知識」的區別、6 個月 TCO 比較,以及三個被資料推翻的反駁論點。

為什麼「挑一個」是錯誤的思維模式

行為 vs 知識的區別

光是這一個框架,就能在開始任何成本分析之前,化解一半的客製化爭論。

行為落差。 輸出格式不一致。語氣不對。該答的時候拒絕,該拒絕的時候回答。模型做這個任務,但不是用你要的方式做。修正:微調——把想要的行為燒進權重。或者:用強力 few-shot 範例做徹底的提示工程——先試這個,因為它更快、更便宜。

知識落差。 模型不知道你的產品目錄、退貨政策、內部文件、或上週的價格更新。修正:RAG——在查詢當下提供知識。永遠不要為了加知識而微調。事實會變。權重在你重新訓練之前不會更新。

LLM 客製化裡最貴的錯誤:為了加知識而微調。每一次產品更新、每一次政策變更、每一次價格調整,都會讓你的微調模型變得更錯。知識屬於檢索,不屬於權重。行為屬於權重,不屬於提示詞。光這一條規則,就能讓你避開比其他任何原因燒掉更多 LLM 預算的那個錯誤。

三個改寫經濟學的變化

提示詞快取砸碎了「長提示詞很貴」的論點。 OpenAI 和 Anthropic 現在對快取 token 只收標準輸入價格的約 10%。舊的交叉點——每天約 10,000 次請求以上,微調以縮短提示詞就划得來——已經移到每天 50,000–100,000 次請求。對多數團隊來說,光靠成本,微調的數學已經不站在你這邊。(快取的機制在我們的提示詞快取指南裡有深入說明。)

受管微調正在縮水。 OpenAI 在 2026 年 5 月對新組織關閉了自助式微調。訓練任務在 2027 年 1 月 6 日全部結束,只剩 o4-mini 的強化式微調。Anthropic 只透過 Amazon Bedrock 提供 Claude 3 Haiku SFT——沒有前沿模型微調。Google 的 Gemini 3.x 調教只在小型 Flash 層開放預覽。長久的路是開源權重模型——Qwen、Llama、Gemma、Mistral——在你掌控的基礎設施上用 LoRA/QLoRA。

提示詞最佳化變成真正的工程學科。 DSPy、GEPA(ICLR 2026 Oral,見 ICLR 2026 會議論文集)、MIPROv2,把提示詞最佳化從「在沙盒裡花幾小時調文字」變成「對提示詞候選跑貝氏最佳化、要回 2–6 個準確度分數」。你現在可以用程式化、可測量、可重現的方式改善提示詞效能——而不是靠直覺和試誤。

複合系統的現實

2026 年的生產 LLM 系統幾乎無一例外地把三種做法全部組合起來。為形式而微調:一致的語氣、拒絕行為、輸出結構燒進權重。為事實而 RAG:新鮮、可引用、有存取控制權的知識。用提示詞做編排:指令、工具定義、每個請求的塑形。BetterTogether 論文顯示,交替做提示詞與權重最佳化,比只做提示詞好到 6%、比只做權重好到 60%。「非此即彼」的思考,比真正的選擇本身傷害更大。

每個做法背後的資料

提示工程的經濟學

設定: $0(只有 token)。月費: 100K 查詢下約 $120(GPT-4o Mini 層)。迭代週期: 當天部署。模型可移植性: 供應商之間 70–85%。可用性: 每個 API——GPT-5.5、Claude Opus、Gemini——都支援。

天花板:提示詞最佳化能提升 2–6 個準確度分數。如果你的基準比品質線低了超過 10 分,光靠提示詞補不上這個洞。

RAG 的經濟學

設定: 約 $400(向量 DB+嵌入管線)。月費: 約 $200(嵌入+向量 DB 託管+檢索 token)。領域準確度: 調教得當時 94–98%。隱藏成本: 知識庫維護——資料清理、切塊調教、排程重新索引、嵌入模型遷移——在多數部署中吃掉 RAG TCO 的 30–50%。廠商報價很少包含它。完整管線見我們的完整 RAG 生產指南

微調的經濟學

設定: 依資料規模與 GPU 策略 $1,600–$200K 以上。月費: 約 $60(小型開源權重模型服務)。ROI 轉正: 每月 >1M 次呼叫時約 12 個月。隱藏成本: 基礎模型淘汰風險(基礎模型退休時你的微調模型跟著死)、迭代週期延遲(每次訓練週期 2–8 週,對比當天的提示詞更新)、以及每個租戶的調教爆炸(100 個租戶=100 個微調模型=100 條部署/監控/更新管線)。

兩個規模的成本交叉點

做法每月 10 萬次查詢(6 個月)每月 100 萬次查詢(6 個月)
Prompt Engineering$720$7,200
Prompt + Caching$420$4,200
RAG$1,600$3,200
Fine-tuning$1,960(無法損益兩平)$3,960(第 8–12 個月損益兩平)

關鍵洞察:對單一任務每月低於 500K 次查詢的團隊,微調在純成本上幾乎永遠不會贏。它的價值主張是補行為落差——語氣、格式、拒絕校準——不是省成本。如果你在中等流量下為了省錢而微調,你是在用貴工具解錯題。

模型定價每月都在變,同一能力層在不同供應商之間最多差到 10 倍。在投入某個策略之前,先核對當前定價,讓你的 TCO 計算建立在真實數字上。

7 軸決策框架

軸 1:與基準的品質落差

徹底的提示詞最佳化之後,準確度離目標多遠?低於 5 分: 提示詞+RAG 做知識落地就夠了。5–10 分: 加入分層模型路由,考慮蒸餾到更小的模型。超過 10 分: 包含微調的完整路徑進到檯面上。

診斷法:跑 DSPy MIPROv2 做 100–200 個最佳化步驟。看收斂的平台期。如果它停在比目標低 5 分以上的地方,微調就進入討論。

軸 2:錯誤的成本

高風險領域——醫療、法律、金融——一個錯答案可能害你賠 $10K 以上或踩到合規紅線:微調的校準優勢(拒絕準確度與輸出一致性比只靠提示詞好 5–15%)讓它的成本與時程划得來。低風險領域——內容推薦、內部工具、原型——提示詞加 RAG 就夠了。

軸 3:流量

單一狹窄任務每月超過 100 萬次 API 呼叫時,微調的每次呼叫經濟學開始勝出——自架微調的 Qwen3-8B 可以比 GPT-4o API 定價降低 90% 以上的每 token 成本。每月低於 100K 次呼叫時,提示詞在純成本上幾乎每次都贏——微調的固定設定成本分攤在太少的請求上。

軸 4:延遲預算

200ms 以下的目標:提示詞臃腫、塞滿數千 token few-shot 範例和 RAG 上下文的大型模型過不了關。微調過的小型模型——Qwen3-8B 配最小系統提示詞——可以。500ms 以上的目標:提示詞最佳化輕鬆放進預算;微調的延遲優勢是真的,但不是必要。

軸 5:風格與格式需求

如果你的核心問題是語氣一致、輸出結構或拒絕行為——微調是最強的工具。權重直接編碼想要的行為模式。如果你的核心問題是事實準確度——權重是錯的槓桿。事實會變。權重在你重新訓練之前不會更新。

軸 6:資料敏感度與多租戶

需要每個租戶隔離?不要每個租戶微調。一百個租戶等於 100 個模型、100 條部署管線、100 個監控儀表板。改成:微調一個共享基礎模型。知識用「在每個租戶隔離的索引上做 RAG」。每個租戶的語氣與行為客製化用提示詞。

軸 7:迭代速度

這週要出貨:只做提示詞最佳化。這季要出貨且有專任 ML 團隊:微調可行。如果你選了微調但需要更快的迭代——Unsloth 搭配 LoRA/QLoRA 可以把訓練從數天壓縮到數小時,用消費級 GPU 就行。

2026 年預設劇本

步驟 1:寫一個乾淨的 DSPy 程式

把你的任務定義成型別化的簽名,而不是原始字串。這要花一天,但永遠回本——之後的每一步都需要一個可測量的程式和一組評估集。

步驟 2:用 MIPROv2 或 GEPA 最佳化提示詞

對提示詞候選跑 100–200 步貝氏最佳化。典型提升:2–6 個準確度分數。如果在這裡就過了你的準確度線,出貨。你完成了。 80% 的團隊就是停在這一步。

步驟 3:加入提示詞快取

重構提示詞:靜態內容放前面(系統提示詞、工具 schema、few-shot 範例),動態內容放最後。Anthropic 的 cache_control 標記或 OpenAI 的自動快取。輸入成本砍 60–90%。行為不變。純粹的成本最佳化。多數團隊停在這裡。

步驟 4:用最佳化後的提示詞對較小模型做 SFT

如果步驟 2 和 3 之後成本或延遲還是爆預算,就用你提示詞最佳化過的前沿模型,在幾千個輸入上生成完成。SFT 到 Qwen3-8B——目前效能對服務成本比的最佳甜蜜點。用 Unsloth 搭配 QLoRA。消費級 GPU 相容。

步驟 5:用可驗證或法官式獎勵做 GRPO

有真正驗證器的任務(數學、程式、結構化抽取):用 Unsloth 跑 GRPO。沒有 ground truth 的代理任務:用法官模型做 ART+RULER。只訓練最難的 10% 範例——「Hard Examples Are All You Need」顯示這比訓練隨機或簡單子集好到 30 分。

步驟 6:為微調模型重新最佳化提示詞

微調模型對提示詞的反應和原始大型模型不同。在微調模型上重跑 GEPA。再要回 2–5 分。這就是閉環:權重最佳化——提示詞最佳化——出貨。

反駁與回應

「這個 6 步驟劇本過度設計了。我不能直接微調就完事嗎?」

沒有評估基礎設施和提示詞最佳化基準的微調,意味著把 $10K 以上花在一台可能比基礎模型更差的模型上——而且你永遠不會知道,因為你跳過了步驟 1(沒有評估集就沒有測量)。至少,你必須做步驟 1(評估集)、步驟 2(提示詞基準),然後才考慮步驟 4(針對那個基準微調)。跳步驟等於閉眼飛行。

「光 RAG 就夠了。微調對我的場景太超過了。」

如果你的行為落差——輸出格式、語氣、拒絕行為——已經被提示工程解決了,那你說得對。RAG 加上最佳化好的提示詞,是大多數知識密集型應用正確的技術棧。但如果提示詞最佳化已經用盡、行為落差還留在 5 分以上,微調是剩下唯一能補上它的槓桿。測試:步驟 2 之後你的評估分數過門檻了嗎?過了,停。沒過,繼續。

「模型不是會好到客製化不再重要嗎?」

前沿模型比以往更能幹。但「能幹」不表示「懂你的內部術語、品牌語音和商業規則」。GPT-5.5 到現在也無法原生分辨你三個客戶層的升級政策。模型進步縮小了客製化落差,但沒有消滅它——它把落差從「模型答不出來」移到「模型答對了,但格式或語氣不對」。而這個新落差,正是微調最擅長的地方。

常見問題

團隊最貴的錯誤是什麼?

為了加知識而微調。每一次產品更新、價格變更或政策修訂,都讓你的微調模型更過時。知識屬於檢索(RAG)。用微調來塑造模型怎麼答——而不是它知道什麼

我可以微調 GPT-5.5、Claude Opus 或 Gemini 3.1 嗎?

現況(2026 年 7 月):OpenAI 在 2026 年 5 月對新組織關閉了自助式微調,所有訓練任務在 2027 年 1 月 6 日結束——只有 o4-mini 的強化式微調活著。Anthropic 只透過 Bedrock 提供 Claude 3 Haiku SFT。Google 的 Gemini 3.x 調教只在 Flash 層開放預覽。長久的路:開源權重模型(Qwen 3/4、Llama 4、Gemma 3/4、Mistral)搭配 LoRA/QLoRA,在你掌控的基礎設施上。

完整劇本要多久?

步驟 1–3:一到兩週,假設已有評估基礎設施。步驟 4–6:四到八週,取決於資料準備與訓練基礎設施。多數團隊永遠不需要步驟 4–6——他們在步驟 2 或 3 就達標了。

提示詞快取真的會改變經濟學嗎?

舊的交叉點(約 10K 次請求/天)讓微調在長提示詞產生高重複成本時划得來。新的交叉點(約 50–100K 次請求/天)反映快取讓輸入成本降 90%。提示詞快取是 LLM API 裡最接近免費午餐的東西——而且它把微調的財務理由推到高得多的流量。完整快取機制見上面連結的提示詞快取指南。

如果我在多個供應商之間路由、而不是綁定一家,會有什麼不同?

你的客製化路徑——提示詞、RAG 或微調——在三者都走同一個整合層時會更好運作。跨模型測提示詞:一個 base URL,改 model 參數。RAG 管線:嵌入和聊天在同一張帳單上。微調自架模型和雲端 API 並行路由:一個可觀測性儀表板、一份成本報告。像 LMSYS Chatbot Arena 這種獨立基準,提供了決定每個路由層該給誰的模型槽位的跨模型品質資料。框架不變。執行它的營運負擔大幅下降。

微調、RAG 與提示工程的爭論已經塵埃落定

微調、RAG 與提示工程的爭論已經塵埃落定——不是靠挑一個,而是靠理解順序。從提示詞開始。知識加 RAG。只有當行為落差在徹底的提示詞最佳化之後依然存在,才伸手拿微調。對 80% 的團隊,旅程在步驟 2 結束——帶着更好的提示詞和一套可測量的評估基準。對其餘 20%,6 步驟劇本提供一條避開 $10K 錯誤的有序路徑。

不管你走哪條路,先把評估基礎設施蓋好。沒有它,你不是在做決定——你是在下注。