「ファインチューニングすべきか、RAGを構築すべきか、それともより良いプロンプトを書くべきか?」あなたのCTOは朝までに答えを求めています——リーダーたちは意見が割れ、CFOはブログ記事ではなく確かな数字を求めています。
間違えると、$50Kと四半期を、スケールすると崩壊する戦略に費やすことになります。
この記事は、データに裏付けられた7軸の意思決定フレームワークと、モデルウェイトに触れずにチームの80%で機能する6ステップのデフォルトプレイブックを提供します。
行動と知識の区別、6ヶ月間のTCO比較、そしてデータが反証する3つの反論を学べます。
「どれか1つを選ぶ」が誤った思考モデルである理由
行動と知識の区別
この単一のフレームワークだけで、コスト分析を始める前にカスタマイズに関する議論の半分が解決します。
行動ギャップ。 出力フォーマットの不整合。間違ったトーン。答えるべきときに拒否する。拒否すべきときに答える。モデルはタスクをこなせるのに、あなたが必要とする方法ではこなしていません。修正:ファインチューニング——望ましい行動をウェイトに焼き込みます。あるいは:強力なfew-shot examplesを使った徹底的なプロンプトエンジニアリング——これを先に試してください。より速く、より安いからです。
知識ギャップ。 モデルがあなたの製品カタログ、返品ポリシー、社内ドキュメント、先週の価格更新を知りません。修正:RAG——クエリ時に知識を提供します。知識を追加するためにファインチューニングしてはいけません。事実は変わります。ウェイトは再トレーニングするまで更新されません。
LLMカスタマイズで最も高くつく失敗:知識を追加するためのファインチューニング。製品アップデートのたびに、ポリシー変更のたびに、価格調整のたびに、ファインチューニング済みモデルはより間違ったものになります。知識は検索に属し、ウェイトには属しません。行動はウェイトに属し、プロンプトには属しません。このルールだけで、他のどの原因よりも多くのLLM予算を燃やす失敗からあなたを救います。
経済性を組み替えた3つの変化
プロンプトキャッシングが「長いプロンプトは高い」という主張を打ち砕きました。 OpenAIとAnthropicの両方が現在、キャッシュ済みトークンに標準入力価格の約10%を請求しています。古いクロスポイント——1日あたり約10,000リクエストを超えると、プロンプトを短縮するためのファインチューニングが金銭的に合理的になる境界——は、1日あたり50,000〜100,000リクエストに移動しました。ほとんどのチームにとって、コストだけを根拠にファインチューニングが有利になる計算はもう成立しません。(キャッシングの仕組みはプロンプトキャッシングガイドで詳しく解説しています。)
マネージドファインチューニングは縮小しています。 OpenAIは2026年5月、新規組織向けのセルフサービス型ファインチューニングを停止しました。トレーニングジョブは2027年1月6日に完全に終了し、o4-miniの強化学習ファインチューニングのみが残ります。AnthropicはAmazon Bedrock経由でClaude 3 Haiku SFTのみを提供——フロンティアモデルのファインチューニングはありません。GoogleのGemini 3.xのチューニングは小規模なFlash層でのプレビュー限定です。永続的な道はオープンウェイトモデル——Qwen、Llama、Gemma、Mistral——を、あなたが管理するインフラ上でLoRA/QLoRAを使って微調整することです。
プロンプト最適化が本物のエンジニアリング分野になりました。 DSPy、GEPA(ICLR 2026のOral、ICLR 2026 proceedings参照)、MIPROv2は、プロンプト最適化を「プレイグラウンドで何時間も言葉をいじる」ことから、「プロンプト候補に対してベイズ最適化を実行し、2〜6ポイントの精度を回復する」ことへと変えました。直感と試行錯誤ではなく、測定可能で再現可能な結果として、プログラムによってプロンプトの性能を改善できるようになったのです。
複合システムの現実
2026年のプロダクションLLMシステムは、ほぼ例外なく3つのアプローチすべてを組み合わせています。形式のためにファインチューニング:一貫したトーン、拒否行動、出力構造をウェイトに焼き込みます。事実のためにRAG:新鮮で、引用可能で、アクセス制御された知識を提供します。オーケストレーションのためにプロンプト:指示、ツール定義、リクエストごとの整形を行います。BetterTogether論文は、プロンプト最適化とウェイト最適化を交互に行うことで、プロンプトのみに比べて最大6%、ウェイトのみに比べて最大60%優れていることを示しました。「どちらか一方」という思考は、実際の選択そのものよりも大きな害をもたらします。
各アプローチの背後にあるデータ
プロンプトエンジニアリングの経済性
セットアップ: $0(トークンのみ)。月額: 100Kクエリで約$120(GPT-4o Mini層)。イテレーションサイクル: 当日デプロイ。モデル移植性: プロバイダー間で70〜85%。可用性: すべてのAPI——GPT-5.5、Claude Opus、Gemini——がサポートしています。
上限:プロンプト最適化で精度は2〜6ポイント向上します。ベースラインが品質基準より10ポイント以上低い場合、プロンプトだけではギャップを埋められません。
RAGの経済性
セットアップ: 約$400(ベクトルDB+エンベディングパイプライン)。月額: 約$200(エンベディング+ベクトルDBホスティング+リトリーバルトークン)。ドメイン精度: 適切に調整すると94〜98%。隠れたコスト: ナレッジベースのメンテナンス——データクレンジング、チャンク調整、定期再インデックス、エンベディングモデル移行——が、ほとんどのデプロイでRAGのTCOの30〜50%を消費します。ベンダーの見積もりに含まれることはほとんどありません。完全なパイプラインは完全なRAGプロダクションガイドをご覧ください。
ファインチューニングの経済性
セットアップ: データ規模とGPU戦略により$1,600〜$200K以上。月額: 約$60(小規模オープンウェイトモデルのサービング)。ROIがプラスになる時期: 月100万回以上の呼び出しで約12ヶ月。隠れたコスト: ベースモデル廃止リスク(ベースモデルが引退すると、ファインチューニング済みモデルも終了します)、イテレーションサイクルの遅延(トレーニングサイクルごとに2〜8週間。当日のプロンプト更新と比較)、テナントごとのチューニング爆発(100テナント=100のファインチューニング済みモデル=100のデプロイ・監視・更新パイプライン)。
2つの規模でのコストクロスオーバー
| アプローチ | 100K Queries/Month(6ヶ月間) | 1M Queries/Month(6ヶ月間) |
|---|---|---|
| Prompt Engineering | $720 | $7,200 |
| Prompt + Caching | $420 | $4,200 |
| RAG | $1,600 | $3,200 |
| Fine-tuning | $1,960(損益分岐点に達しない) | $3,960(8〜12ヶ月目に損益分岐点に達する) |
重要な洞察:単一タスクで月50万クエリ未満のチームにとって、ファインチューニングは純粋なコストでは実質的に決して勝ちません。その価値提案は行動ギャップの解消——トーン、フォーマット、拒否のキャリブレーション——であり、コスト削減ではありません。中規模のボリュームでコストを節約するためにファインチューニングしているなら、高価なツールで間違った問題を解こうとしています。
モデル価格は毎月変わり、同じ能力層でもプロバイダー間で最大10倍の差があります。戦略を確定する前に、現在の価格を確認してTCO計算を実数で根拠づけてください。
7軸の意思決定フレームワーク
軸1:ベースラインからの品質ギャップ
徹底的なプロンプト最適化の後、精度は目標からどれだけ離れていますか?5ポイント未満: 知識グラウンディングのためのプロンプト+RAGで十分です。5〜10ポイント: 階層化モデルルーティングを追加し、より小さなモデルへの蒸留を検討します。10ポイント超: ファインチューニングを含むフルパスが選択肢に入ります。
診断:DSPy MIPROv2を100〜200の最適化ステップ実行します。収束プラトーを確認します。目標より5ポイント以上低い位置で安定するなら、ファインチューニングが議論に入ってきます。
軸2:エラーのコスト
ハイステークスの領域——医療、法務、金融——では、1つの誤回答が$10K以上またはコンプライアンス違反を引き起こしかねません:ファインチューニングのキャリブレーション優位(プロンプトのみと比較して拒否精度と出力一貫性が5〜15%向上)が、そのコストと期間を正当化します。ローリスクの領域——コンテンツレコメンデーション、社内ツール、プロトタイプ——では、プロンプト+RAGで十分です。
軸3:ボリューム
単一の狭いタスクで月100万回以上のAPI呼び出しがある場合、ファインチューニングの呼び出しあたりの経済性が有利になり始めます——セルフホストのQwen3-8Bファインチューニングは、GPT-4o API価格と比較してトークンあたりのコストを90%以上削減できます。月10万回未満では、プロンプトが純粋なコストでほぼ常に勝ちます——ファインチューニングの固定セットアップコストが、あまりに少ないリクエストでしか償却されないからです。
軸4:レイテンシ予算
200ms未満の目標:数千トークンのfew-shot examplesとRAGコンテキストでプロンプトが肥大化した大規模モデルでは間に合いません。最小限のシステムプロンプトを持つファインチューニング済み小規模モデル——Qwen3-8B——なら可能です。500ms超の目標:プロンプト最適化で予算内に収まります。ファインチューニングのレイテンシ優位は本物ですが、必須ではありません。
軸5:スタイルとフォーマットの要件
中心的な問題がトーンの一貫性、出力構造、拒否行動なら——ファインチューニングが最強のツールです。ウェイトが望ましい行動パターンを直接エンコードします。中心的な問題が事実の正確さなら——ウェイトは間違ったレバーです。事実は変わります。ウェイトは再トレーニングするまで更新されません。
軸6:データ感度とマルチテナンシー
テナントごとの分離が必要ですか?テナントごとにファインチューニングしてはいけません。100テナントは100モデル、100デプロイパイプライン、100監視ダッシュボードを意味します。代わりに:共有ベースモデルを1つファインチューニングします。知識にはテナントごとに分離されたインデックス上のRAGを使います。トーンと行動のテナントごとのカスタマイズにはプロンプトを使います。
軸7:イテレーション速度
今週中に出荷:プロンプト最適化のみ。専任のMLチームで今四半期中に出荷:ファインチューニングが現実的です。ファインチューニングを選ぶが、より速いイテレーションが必要なら——Unslothを使ったLoRA/QLoRAが、コンシューマーGPUでトレーニングを数日から数時間に圧縮します。
2026年のデフォルトプレイブック
ステップ1:クリーンなDSPyプログラムを書く
タスクを生の文字列ではなく、型付きシグネチャとして定義します。これに1日かかりますが、永遠に報われます——その後のすべてのステップは、測定可能なプログラムと評価セットを必要とします。
ステップ2:MIPROv2またはGEPAでプロンプトを最適化する
プロンプト候補に対して100〜200ステップのベイズ最適化を実行します。典型的な向上:2〜6精度ポイント。ここで精度の基準をクリアしたら、出荷してください。完了です。 ここでチームの80%が停止します。
ステップ3:プロンプトキャッシングを追加する
プロンプトを再構成します:静的コンテンツを先に(システムプロンプト、ツールスキーマ、few-shot examples)、変動コンテンツを最後に。Anthropicのcache_controlマーカーまたはOpenAIの自動キャッシング。入力コストを60〜90%削減します。行動の変化はありません。純粋なコスト最適化です。ほとんどのチームはここで停止します。
ステップ4:最適化済みプロンプトで小規模モデルをSFTする
ステップ2と3を終えてもコストまたはレイテンシが予算を超える場合、プロンプト最適化済みのフロンティアモデルに数千の入力でコンプリーションを生成させます。Qwen3-8BにSFTします——性能対サービングコスト比の現在のスイートスポットです。UnslothをQLoRAと一緒に使います。コンシューマーGPU対応。
ステップ5:検証可能またはジャッジベースの報酬でGRPO
真の検証器があるタスク(数学、コード、構造化抽出):Unsloth経由のGRPO。グラウンドトゥルースのないエージェントタスク:ジャッジモデルを使ったART+RULER。最も難しい上位10%の例だけでトレーニングします——「Hard Examples Are All You Need」は、これがランダムまたは簡単なサブセットでのトレーニングを最大30ポイント上回ることを示しました。
ステップ6:ファインチューニング済みモデル用にプロンプトを再最適化する
ファインチューニング済みモデルは、元の大規模モデルとはプロンプトに対する反応が異なります。ファインチューニング済みモデルでGEPAを再実行します。さらに2〜5ポイント回復します。これが閉環です:ウェイト最適化——プロンプト最適化——出荷。
反論と回答
「この6ステップのプレイブックは過剰設計です。ファインチューニングして終わりではダメですか?」
評価インフラとプロンプト最適化ベースラインなしのファインチューニングは、ベースモデルより悪いかもしれないモデルに$10K以上を費やすことを意味します——しかもステップ1を飛ばしたので(評価セットがなければ測定がなく)、それに気づくこともありません。最低でも、ステップ1(評価セット)、ステップ2(プロンプトベースライン)を行い、その後にのみステップ4(そのベースラインに対するファインチューニング)を検討してください。ステップを飛ばすことは盲目的な飛行です。
「RAGだけで十分です。私のユースケースにファインチューニングは過剰です。」
行動ギャップ——出力フォーマット、トーン、拒否行動——がすでにプロンプトエンジニアリングで解決されているなら、あなたは正しいです。RAG+よく最適化されたプロンプトは、ほとんどの知識集約型アプリケーションにとって正しいスタックです。しかし、プロンプト最適化を使い果たしても行動ギャップが5ポイント以上残っている場合、それを埋められるレバーはファインチューニングだけです。テスト:ステップ2の後に評価スコアはしきい値を通過しましたか?はいなら、停止してください。いいえなら、続行してください。
「モデルがこれほど良くなっているのに、カスタマイズは重要でなくならないのですか?」
フロンティアモデルはかつてないほど高性能です。しかし「高性能」は「あなたの社内用語、ブランドボイス、ビジネスルールを理解する」ことを意味しません。GPT-5.5は今でも、あなたの3つの顧客層のアップグレードポリシーをネイティブに区別できません。モデルの改善はカスタマイズギャップを縮めましたが、なくしませんでした——ギャップが「モデルが答えられない」から「モデルは正しく答えるが、間違ったフォーマットやトーンで答える」へと移行しました。その新しいギャップこそ、ファインチューニングが最も得意とする場所です。
FAQ
チームが犯す最も高くつく失敗は何ですか?
知識を追加するためのファインチューニング。製品アップデート、価格変更、ポリシー改定のたびに、ファインチューニング済みモデルはより陳腐化します。知識は検索(RAG)に属します。ファインチューニングはモデルの答え方——知っている内容ではなく——を形作るために使ってください。
GPT-5.5、Claude Opus、Gemini 3.1をファインチューニングできますか?
現在の状況(2026年7月):OpenAIは2026年5月に新規組織向けのセルフサービス型ファインチューニングを停止し、すべてのトレーニングジョブは2027年1月6日に終了——生き残るのはo4-miniの強化学習ファインチューニングのみです。AnthropicはBedrock経由でClaude 3 Haiku SFTのみを提供。GoogleのGemini 3.xチューニングはFlash層でのプレビュー限定。永続的な道:あなたが管理するインフラ上で、オープンウェイトモデル(Qwen 3/4、Llama 4、Gemma 3/4、Mistral)をLoRA/QLoRAで使うことです。
フルプレイブックにはどのくらい時間がかかりますか?
ステップ1〜3:既存の評価インフラがあれば1〜2週間。ステップ4〜6:データ準備とトレーニングインフラにより4〜8週間。ほとんどのチームはステップ4〜6を必要としません——ステップ2または3で品質基準に達します。
プロンプトキャッシングは本当に経済性を変えますか?
古いクロスポイント(約10Kリクエスト/日)は、長いプロンプトが高い繰り返しコストを生む場合、ファインチューニングが金銭的に合理的になる境界でした。新しいクロスポイント(約50〜100Kリクエスト/日)は、キャッシングによる90%の入力コスト削減を反映しています。プロンプトキャッシングはLLM APIで無料のお金に最も近い存在です——そしてファインチューニングの金銭的正当性をはるかに高いボリュームへと押し上げます。キャッシングの完全な仕組みは、上でリンクしたプロンプトキャッシングガイドで説明しています。
1つのプロバイダーに固定するのではなく、複数のプロバイダーにルーティングしている場合はどう変わりますか?
カスタマイズの道——プロンプト、RAG、ファインチューニング——は、3つすべてが同じ統合レイヤーを通って実行される場合、運用がより簡単になります。モデル横断のプロンプトテスト:1つのベースURLで、modelパラメータを変更するだけです。RAGパイプライン:エンベディングとチャットを同じ請求書で。ファインチューニング済みセルフホストモデルをクラウドAPIと並べてルーティング:1つのオブザーバビリティダッシュボード、1つのコストレポート。独立したベンチマークであるLMSYS Chatbot Arenaは、各ルーティング層でどのモデルがスロットを獲得するかを判断するクロスモデル品質データを提供します。フレームワークは変わりません。それを実行する運用オーバーヘッドは大幅に低下します。
ファインチューニング、RAG、プロンプトエンジニアリングの議論は決着しています
ファインチューニング、RAG、プロンプトエンジニアリングの議論は決着しています——1つを選ぶことによってではなく、順序を理解することによって。プロンプトから始めます。知識のためにRAGを追加します。徹底的なプロンプト最適化を経ても行動ギャップが残る場合にのみ、ファインチューニングに手を伸ばします。チームの80%にとって、旅はステップ2で終わります——より良いプロンプトと測定可能な評価ベースラインとともに。残りの20%にとって、6ステップのプレイブックは、$10Kの失敗を避ける順序立てられた道を提供します。
どの道を選んでも、最初に評価インフラを構築してください。それなしでは、あなたは決断を下しているのではなく、賭けをしています。