Fine-tuningRAGPrompt EngineeringDecision FrameworkLLM APICost Optimization

Файн-тюнинг против RAG против промпт-инжиниринга: гид по выбору 2026

1 мин чтения

«Файн-тюнить, собрать RAG или просто написать лучшие промпты?» Вашему CTO нужен ответ к утру — ваши лиды не согласны друг с другом, а CFO хочет конкретных цифр, а не постов в блоге.

Ошибётесь — и вы сожжёте $50K и квартал на стратегии, которая разваливается при масштабировании.

Эта статья даёт обоснованный данными семиосевой каркас решений и дефолтный плейбук из шести шагов, который работает для 80% команд без касания весов модели.

Вы узнаете различие «поведение против знаний», сравнение TCO за 6 месяцев и три контраргумента, которые данные опровергают.

Почему «выбери одно» — неправильная ментальная модель

Различие «поведение против знаний»

Один этот каркас снимает половину всех споров о кастомизации ещё до начала анализа затрат.

Поведенческий разрыв. Непоследовательное форматирование вывода. Неверный тон. Отказывается, когда должен отвечать. Отвечает, когда должен отказаться. Модель может выполнить задачу, но делает это не так, как вам нужно. Исправление: файн-тюнинг — запечь желаемое поведение в веса. Или: исчерпывающий промпт-инжиниринг с сильными few-shot примерами — попробуйте сначала это, потому что это быстрее и дешевле.

Разрыв в знаниях. Модель не знает ваш каталог продуктов, политику возврата, внутреннюю документацию или обновление цен за прошлую неделю. Исправление: RAG — предоставить знания во время запроса. Никогда не файн-тюньте, чтобы добавить знания. Факты меняются. Веса не обновляются, пока вы не переобучите.

Самая дорогая ошибка в кастомизации LLM: файн-тюнинг для добавления знаний. Каждое обновление продукта, каждое изменение политики, каждая корректировка цен делает вашу файн-тюненную модель более неверной. Знания принадлежат поиску, а не весам. Поведение принадлежит весам, а не промптам. Одно это правило убережёт вас от ошибки, которая сжигает больше LLM-бюджетов, чем любая другая.

Три изменения, перетасовавшие экономику

Кэширование промптов уничтожило аргумент «длинные промпты дороги». И OpenAI, и Anthropic теперь берут ~10% от стандартной цены входа за кэшированные токены. Старая точка кроссовера — примерно 10,000 запросов в день, выше которой файн-тюнинг для сокращения промптов имел финансовый смысл — сместилась до 50,000–100,000 запросов в день. Для большинства команд расчёт больше не в пользу файн-тюнинга на одной лишь основе стоимости. (Механика кэширования подробно описана в нашем руководстве по кэшированию промптов.)

Управляемый файн-тюнинг сжимается. OpenAI закрыл self-serve файн-тюнинг для новых организаций в мае 2026 года. Обучающие задания полностью прекращаются 6 января 2027 года, остаётся только файн-тюнинг с подкреплением o4-mini. Anthropic предлагает только Claude 3 Haiku SFT через Amazon Bedrock — без файн-тюнинга фронтирных моделей. Тюнинг Google Gemini 3.x — только превью на малых уровнях Flash. Устойчивый путь — модели с открытыми весами — Qwen, Llama, Gemma, Mistral — с LoRA/QLoRA на инфраструктуре, которой вы управляете.

Оптимизация промптов стала настоящей инженерной дисциплиной. DSPy, GEPA (ICLR 2026 Oral, см. материалы ICLR 2026) и MIPROv2 превратили оптимизацию промптов из «потратить часы на подбор слов в песочнице» в «прогнать байесовскую оптимизацию по кандидатам промптов и вернуть 2–6 пунктов точности». Теперь вы можете улучшать производительность промптов программно — с измеримыми, воспроизводимыми результатами — вместо интуиции и проб и ошибок.

Реальность композитных систем

Продакшен-LLM-системы 2026 года почти универсально сочетают все три подхода. Файн-тюнинг для формы: последовательный тон, поведение отказа, структура вывода, запечённые в веса. RAG для фактов: свежие, цитируемые знания с контролем доступа. Промпт для оркестрации: инструкции, определения инструментов, формирование под каждый запрос. Работа BetterTogether показала, что чередование оптимизации промптов и весов превосходит только промпты до 6% и только веса до 60%. Мышление «или» вредит больше, чем сам выбор.

Данные, стоящие за каждым подходом

Экономика промпт-инжиниринга

Настройка: $0 (только токены). Ежемесячно: ~$120 при 100K запросов (уровень GPT-4o Mini). Цикл итераций: развёртывание в тот же день. Переносимость моделей: 70–85% между провайдерами. Доступность: поддерживается каждым API — GPT-5.5, Claude Opus, Gemini.

Потолок: оптимизация промптов поднимает точность на 2–6 пунктов. Если ваш базовый уровень более чем на 10 пунктов ниже планки качества, одни промпты разрыв не закроют.

Экономика RAG

Настройка: ~$400 (векторная БД + пайплайн эмбеддингов). Ежемесячно: ~$200 (эмбеддинги + хостинг векторной БД + токены поиска). Точность домена: 94–98% при правильной настройке. Скрытая стоимость: сопровождение базы знаний — очистка данных, настройка чанков, плановая переиндексация, миграции моделей эмбеддингов — потребляет 30–50% TCO RAG в большинстве развёртываний. Вендорские расценки редко включают её. Полный конвейер — в нашем полном руководстве по продакшн-RAG.

Экономика файн-тюнинга

Настройка: $1,600–200K+ в зависимости от масштаба данных и стратегии GPU. Ежемесячно: ~$60 (сервинг малой модели с открытыми весами). ROI становится положительным: ~12 месяцев при >1M вызовов/мес. Скрытые затраты: риск прекращения поддержки базовой модели (ваша файн-тюненная модель умирает, когда её базовая модель уходит на пенсию), задержка цикла итераций (2–8 недель на цикл обучения против обновлений промптов в тот же день) и взрыв тюнинга на арендатора (100 арендаторов = 100 файн-тюненных моделей = 100 пайплайнов деплоя/мониторинга/обновления).

Кроссовер затрат на двух масштабах

Подход100K Queries/Month (за 6 месяцев)1M Queries/Month (за 6 месяцев)
Prompt Engineering$720$7,200
Prompt + Caching$420$4,200
RAG$1,600$3,200
Fine-tuning$1,960 (окупаемости не достигает)$3,960 (окупается на 8–12-м месяце)

Ключевой вывод: для команд с менее чем 500K запросов в месяц по одной задаче файн-тюнинг практически никогда не выигрывает на чистой стоимости. Его ценностное предложение — закрытие поведенческого разрыва: тон, формат, калибровка отказов — а не экономия. Если вы файн-тюните, чтобы экономить при умеренном объёме, вы решаете неправильную проблему дорогим инструментом.

Цены моделей меняются ежемесячно и варьируются до 10 раз между провайдерами на том же уровне возможностей. Прежде чем выбрать стратегию, проверьте текущие цены, чтобы обосновать расчёты TCO реальными цифрами.

Семиосевой каркас решений

Ось 1: Разрыв в качестве от базового уровня

После исчерпывающей оптимизации промптов, насколько точность далека от вашей цели? Менее 5 пунктов: достаточно промптов + RAG для фактологической обоснованности. 5–10 пунктов: добавьте многоуровневую маршрутизацию моделей и рассмотрите дистилляцию в меньшую модель. Более 10 пунктов: на столе полный путь, включая файн-тюнинг.

Диагностика: запустите DSPy MIPROv2 на 100–200 шагов оптимизации. Посмотрите на плато сходимости. Если оно стабилизируется на 5+ пунктов ниже цели, файн-тюнинг входит в обсуждение.

Ось 2: Стоимость ошибки

Домены с высокими ставками — медицина, юриспруденция, финансы — где один неверный ответ может стоить $10K+ или вызвать нарушение соответствия: преимущество калибровки файн-тюнинга (на 5–15% лучшая точность отказов и согласованность вывода против только промптов) оправдывает его стоимость и сроки. Домены с низкими ставками — рекомендации контента, внутренние инструменты, прототипы — достаточно промптов плюс RAG.

Ось 3: Объём

При более чем 1 млн вызовов API в месяц по одной узкой задаче экономика на вызов у файн-тюнинга начинает выигрывать — файн-тюненный Qwen3-8B на самохостинге может снизить стоимость за токен более чем на 90% против цен API GPT-4o. Ниже 100K вызовов в месяц промпты выигрывают на чистой стоимости почти всегда — фиксированные затраты на настройку файн-тюнинга амортизируются на слишком малое число запросов.

Ось 4: Бюджет задержки

Цель ниже 200 мс: большая модель с раздутыми промптами, тысячами токенов few-shot примеров и RAG-контекстом не пройдёт. Файн-тюненная малая модель — Qwen3-8B с минимальным системным промптом — сможет. Цель выше 500 мс: оптимизация промптов комфортно вписывается в бюджет; преимущество файн-тюнинга по задержке реально, но не обязательно.

Ось 5: Требования к стилю и формату

Если ваша ключевая проблема — согласованность тона, структура вывода или поведение отказа — файн-тюнинг самый сильный инструмент. Веса напрямую кодируют желаемый паттерн поведения. Если ваша ключевая проблема — фактическая точность — веса это неправильный рычаг. Факты меняются. Веса не обновляются, пока вы не переобучите.

Ось 6: Чувствительность данных и мультиарендность

Требуется изоляция по арендатору? Не файн-тюньте на каждого арендатора. Сто арендаторов — это 100 моделей, 100 пайплайнов развёртывания, 100 дашбордов мониторинга. Вместо этого: файн-тюньте одну общую базовую модель. Используйте RAG по изолированным по арендатору индексам для знаний. Используйте промпты для кастомизации тона и поведения на каждого арендатора.

Ось 7: Скорость итераций

Отгружаете на этой неделе: только оптимизация промптов. Отгружаете в этом квартале с выделенной ML-командой: файн-тюнинг жизнеспособен. Если вы выбрали файн-тюнинг, но нужна более быстрая итерация — LoRA/QLoRA с Unsloth сжимает обучение с дней до часов на потребительских GPU.

Дефолтный плейбук 2026

Шаг 1: Напишите чистую программу DSPy

Определите задачу как типизированные сигнатуры, а не сырые строки. Это займёт один день и окупается навсегда — каждый последующий шаг требует измеримой программы и набора оценки.

Шаг 2: Оптимизируйте промпты с MIPROv2 или GEPA

Прогоните 100–200 шагов байесовской оптимизации по кандидатам промптов. Типичный прирост: 2–6 пунктов точности. Если вы прошли планку точности здесь — отгружайте. Вы закончили. Именно здесь останавливаются 80% команд.

Шаг 3: Добавьте кэширование промптов

Перестройте промпты: статический контент первым (системный промпт, схемы инструментов, few-shot примеры), переменный контент последним. Маркеры cache_control Anthropic или автоматическое кэширование OpenAI. Снижает затраты на вход на 60–90%. Без изменения поведения. Чистая оптимизация затрат. Большинство команд останавливаются здесь.

Шаг 4: Сделайте SFT меньшей модели на оптимизированных промптах

Если шаги 2 и 3 всё ещё оставляют вас сверх бюджета по стоимости или задержке, сгенерируйте завершения из вашей оптимизированной по промптам фронтирной модели на нескольких тысячах входов. SFT в Qwen3-8B — текущую золотую середину по соотношению «производительность-стоимость сервинга». Используйте Unsloth с QLoRA. Совместимо с потребительскими GPU.

Шаг 5: GRPO с проверяемыми или судейскими вознаграждениями

Для задач с настоящим верификатором (математика, код, структурированное извлечение): GRPO через Unsloth. Для агентных задач без эталонной истины: ART + RULER с моделью-судьёй. Тренируйтесь только на самых сложных 10% примеров — «Hard Examples Are All You Need» показал, что это превосходит обучение на случайных или простых подмножествах до 30 пунктов.

Шаг 6: Переоптимизируйте промпт для файн-тюненной модели

Файн-тюненная модель реагирует на промпты иначе, чем исходная большая модель. Перезапустите GEPA на файн-тюненной модели. Верните ещё 2–5 пунктов. Это замыкание: оптимизация весов — оптимизация промптов — отгрузка.

Контраргументы и ответы

«Этот плейбук из 6 шагов — переусложнение. Нельзя ли просто файн-тюнить и покончить с этим?»

Файн-тюнинг без инфраструктуры оценки и базовой линии оптимизации промптов означает трату $10K+ на модель, которая может работать хуже базовой — и вы никогда не узнаете, потому что пропустили шаг 1 (без набора оценки нет измерения). Как минимум вы должны сделать шаг 1 (набор оценки), шаг 2 (базовая линия промптов) и только затем рассматривать шаг 4 (файн-тюнинг против этой базовой линии). Пропуск шагов — полёт вслепую.

«Одного RAG достаточно. Файн-тюнинг избыточен для моего случая.»

Если ваш поведенческий разрыв — формат вывода, тон, поведение отказа — уже решён промпт-инжинирингом, вы правы. RAG плюс хорошо оптимизированные промпты — правильный стек для большинства приложений, интенсивно работающих со знаниями. Но если оптимизация промптов исчерпана, а поведенческий разрыв остаётся выше 5 пунктов, файн-тюнинг — единственный оставшийся рычаг, который может его закрыть. Тест: ваши оценки прошли порог после шага 2? Если да — остановитесь. Если нет — продолжайте.

«Разве модели не становятся настолько хорошими, что кастомизация не будет иметь значения?»

Фронтирные модели способнее, чем когда-либо. Но «способная» не означает «понимает вашу внутреннюю терминологию, голос бренда и бизнес-правила». GPT-5.5 до сих пор не может нативно различать политики апгрейда ваших трёх сегментов клиентов. Улучшение моделей сузило разрыв кастомизации, но не устранило его — оно сдвинуло разрыв с «модель не может ответить» на «модель отвечает правильно, но в неверном формате или тоне». Именно на этом новом разрыве файн-тюнинг и преуспевает.

FAQ

Какая самая дорогая ошибка команд?

Файн-тюнинг для добавления знаний. Каждое обновление продукта, изменение цен или пересмотр политики делает вашу файн-тюненную модель более устаревшей. Знания принадлежат поиску (RAG). Используйте файн-тюнинг, чтобы формировать, как модель отвечает, — а не что она знает.

Могу ли я файн-тюнить GPT-5.5, Claude Opus или Gemini 3.1?

Текущее состояние (июль 2026): OpenAI закрыл self-serve файн-тюнинг для новых организаций в мае 2026 года, все обучающие задания заканчиваются 6 января 2027 года — выживает только файн-тюнинг с подкреплением o4-mini. Anthropic предлагает только Claude 3 Haiku SFT через Bedrock. Тюнинг Google Gemini 3.x — только превью на уровнях Flash. Устойчивый путь: модели с открытыми весами (Qwen 3/4, Llama 4, Gemma 3/4, Mistral) с LoRA/QLoRA на инфраструктуре, которой вы управляете.

Сколько времени занимает весь плейбук?

Шаги 1–3: одна-две недели при существующей инфраструктуре оценки. Шаги 4–6: четыре-восемь недель в зависимости от подготовки данных и инфраструктуры обучения. Большинству команд шаги 4–6 никогда не нужны — они достигают планки качества на шаге 2 или 3.

Действительно ли кэширование промптов меняет экономику?

Старая точка кроссовера (~10K запросов/день) делала файн-тюнинг финансово осмысленным, когда длинные промпты порождали высокие повторные затраты. Новый кроссовер (~50–100K запросов/день) отражает снижение затрат на вход на 90% за счёт кэширования. Кэширование промптов — самое близкое к бесплатным деньгам в LLM API — и оно отодвигает финансовое обоснование файн-тюнинга на гораздо более высокие объёмы. Полная механика кэширования описана в руководстве по кэшированию промптов, указанном выше.

Что изменится, если я маршрутизирую между несколькими провайдерами вместо привязки к одному?

Ваш путь кастомизации — промпты, RAG или файн-тюнинг — становится проще в эксплуатации, когда все три работают через один и тот же интеграционный слой. Тестирование промптов между моделями: один базовый URL, меняете параметр model. Пайплайн RAG: эмбеддинги и чат на одном счёте. Файн-тюненные самохостинговые модели, маршрутизируемые рядом с облачными API: один дашборд наблюдаемости, один отчёт о затратах. Независимые бенчмарки, такие как LMSYS Chatbot Arena, дают кросс-модельные данные о качестве, которые определяют, какие модели получают слоты в каждом слое маршрутизации. Каркас не меняется. Операционные издержки его исполнения существенно снижаются.

Спор между файн-тюнингом, RAG и промпт-инжинирингом решён

Спор между файн-тюнингом, RAG и промпт-инжинирингом решён — не выбором одного, а пониманием порядка. Начните с промптов. Добавьте RAG для знаний. Беритесь за файн-тюнинг, только когда поведенческие разрывы переживают исчерпывающую оптимизацию промптов. Для 80% команд путь заканчивается на шаге 2 — с лучшими промптами и измеримой базовой линией оценки. Для остальных 20% плейбук из 6 шагов даёт последовательный путь, который избегает ошибок на $10K.

Какой бы путь вы ни выбрали, сначала постройте инфраструктуру оценки. Без неё вы не принимаете решений — вы делаете ставки.