При 100 миллионах токенов в день облачные API сжигают $180,000/мес, тогда как самохостинг обходится примерно в $22,000 — разрыв в 88%, который делает решение очевидным. При 10 миллионах полностью загруженный TCO самохостинга — зарезервированные GPU, простаивающие в ночные провалы трафика, 0,3–0,5 FTE накладных расходов на MLOps, задержка в 2–6 недель на каждый запуск модели — регулярно превышает облачный API. Большинство команд находится между этими крайностями, и ошибка в расчёте стоит в два-три раза дороже, чем они должны платить. Ниже — полная структура TCO. Подставьте свои числа, чтобы найти свою точку безубыточности — а не чужое эмпирическое правило.
Почему «облако дорогое» и «самохостинг бесплатный» — оба заблуждения
Ловушка облачных затрат
При 100 миллионах токенов в день по ценам GPT-4o ваш месячный счёт API достигнет примерно $18,750. Это число выглядит пугающе — но оно предполагает нулевую оптимизацию. На практике большинство команд, работающих в этом масштабе, переплачивают 30–50%, потому что не внедрили многоуровневую маршрутизацию моделей, кэширование промптов или пакетное использование API. Оптимизация облачных расходов — подробно описанная в нашем руководстве по 12 способам оптимизации — обычно стоит меньше месяца резервирования GPU и даёт экономию уже в том же биллинг-цикле. Исчерпайте облачную оптимизацию, прежде чем рассматривать самохостинг.
Ловушка скрытых затрат самохостинга
Два зарезервированных инстанса H100 обходятся примерно в $4,200 в месяц. По сравнению со счётом в $18,750 это выглядит как экономия 78%. Но железо — это около 30–40% реальной стоимости. Добавьте 0,5–1,0 FTE инженера MLOps ($6,000–12,000/мес), риск utilization GPU (70% простоя в провалы трафика = фактически вы платите за compute, который не используете), обслуживание обновлений моделей (2–6 недель на каждый цикл апгрейда) и альтернативную стоимость отсутствия немедленного доступа к новым фронтирным моделям. При менее чем 50 миллионах токенов в день полностью загруженный TCO самохостинга часто превышает затраты на облачный API — иногда значительно.
Фундаментальное понимание
Облачные API берут наценку за токен. Самохостинг несёт фиксированные инфраструктурные и инженерные накладные расходы. Что дешевле — полностью зависит от того, где ваш объём использования попадает на кривую затрат. Облако выигрывает при низком и умеренном объёме и всплесковой нагрузке. Самохостинг выигрывает при высоком стабильном объёме. Гибрид выигрывает почти для всех в промежутке.
Финансовая модель: что реально входит в TCO
Затраты на compute
| GPU | За час (резерв.) | Токены/сек (модель 8B) | Лучше всего для |
|---|---|---|---|
| H100 | ~$2.10 | 2,500+ | Модели 70B+, высокая пропускная способность (цены сверены с Artificial Analysis) |
| A100 | ~$1.20 | 1,500+ | Модели 8–70B, средняя пропускная способность |
| RTX 4090 | ~$0.10 (эквивалент собственного оборудования) | 100+ | Модели 8B, инференс при низком трафике |
Квантование — 4-bit GPTQ или AWQ — сокращает требования к VRAM на 60–75% с торговлей 1–3 пункта качества. Для Qwen3-8B это разница между необходимостью в A100 и комфортной работой на RTX 4090. Протестируйте влияние на качество на своей конкретной нагрузке, прежде чем выбирать уровень квантования.
Инженерный труд
Здесь рушатся большинство моделей TCO. Самохостинг — это не «настроил один раз и работает». Это непрерывный продакшн-конвейер: закупка GPU и управление совместимостью драйверов, выбор фреймворка и обновление версий (vLLM, SGLang или TGI), автоскалинг и управление очередями, мониторинг и он-колл-ротация, циклы обновления моделей с A/B-тестированием, патчи безопасности и снижение рисков цепочки поставок. Инцидент с вредоносным ПО LiteLLM в марте 2026 года — не единичный случай; это новая норма для самостоятельно управляемой инфраструктуры. Закладывайте 0,5–1,0 FTE на любое самохостинговое развёртывание, обрабатывающее продакшн-трафик.
Риск utilization
Ваш трафик падает до 10% от пика с 1 до 5 часов утра. Эти H100 всё ещё работают, всё ещё потребляют энергию, всё ещё стоят $2.10/час каждый. Зарезервированные инстансы гарантируют доступность, но требуют точного прогнозирования ёмкости. Спот-инстансы экономят 60–80%, но могут быть отозваны с уведомлением за 30 секунд — неприемлемо для продакшн-нагрузок. Облачные API берут ноль за время простоя. Самохостинг берёт полную цену 24/7.
Альтернативная стоимость свежести модели
Появляется новая флагманская модель. Пользователи облачных API меняют строку model и деплоят за минуты. Самохостинговые пользователи начинают цикл оценки и миграции на 2–6 недель: скачать веса, сравнить с текущей моделью по бенчмаркам, переоптимизировать промпты, A/B-тест, продакшн-раскатка. Для продуктов, где конкурентная дифференциация зависит от качества модели, эта задержка имеет реальную бизнес-стоимость — потенциально превышающую экономию на инфраструктуре.
Подставьте свои числа в модель выше. Чтобы обосновать анализ реальными ценами, вот как TCO раскладывается в трёх репрезентативных масштабах — покрывающих диапазон, в котором сегодня работает большинство команд.
Анализ безубыточности в трёх масштабах
Малый: 10M токенов/день (~300M/мес)
Облачный API: Смешанная ставка ~$2/M токенов при многоуровневой маршрутизации — ~$600/день, ~$18K/мес.
Самохостинг: 1×H100 зарезервированный ($1,512/мес) + 0,3 FTE MLOps ($3,600/мес) + инфраструктурные накладные расходы ($500/мес) — ~$5,612/мес.
На бумаге самохостинг экономит 69%. Но это предполагает >85% utilization GPU и 0,3 FTE, который реально существует и не является вашим ведущим бэкенд-инженером. При utilization 50% (всплесковый трафик) стоимость самохостинга вырастает до ~$7,500/мес — экономия сжимается до 58%. При utilization 30% (часто для продуктов на ранней стадии) экономия падает ниже 40% — и один инцидент с драйвером GPU стирает месяцы экономии в инженерном времени.
Вердикт: Облако с оптимизацией затрат. Сначала внедрите многоуровневую маршрутизацию и кэширование промптов. Пересмотрите решение на 50M токенов/день.
Средний: 50M токенов/день (~1.5B/мес)
Облачный API: ~$90K/мес смешанная ставка.
Самохостинг: 2×H100 ($3,024) + 0,5 FTE MLOps ($6,000) + выделенная инфраструктура ($1,000) — ~$10,024/мес.
Самохостинг теперь однозначно дешевле — экономия 60–70% — даже с учётом 40% риска utilization и полных инженерных накладных. Это зона перехода, где самохостинг оправдывает свою операционную сложность.
Вердикт: Самохостинг или гибрид. Начните планировать закупку GPU на 30M токенов/день, чтобы быть на ходу к моменту, когда облачные затраты достигнут $75K/мес.
Крупный: 100M+ токенов/день (~3B/мес)
Облачный API: $180K+/мес.
Самохостинг: кластер 4–8×H100 ($6–12K) + 1,0 FTE MLOps ($10K) + выделенная инфраструктура ($2K) — $18–24K/мес.
Преимущество самохостинга расширяется до 80%+. В этом масштабе у вас, скорее всего, уже есть выделенная инфраструктурная команда — в расчёт TCO следует включать амортизацию, пространство дата-центра, пропускную способность сети и резервирование.
Вердикт: Самохостинг — однозначный экономический победитель. Но в этом масштабе вы не выбираете между самохостингом и облаком — вы запускаете гибридную архитектуру, где самохостинг обрабатывает базовую нагрузку, а облако обеспечивает перелив и доступ к фронтирным моделям.
Гибридная строка
70% рутинного трафика — самохостинг или дешёвый API (DeepSeek V3.2 по $0.27/M на входе). 30% сложного трафика — облачные фронтирные модели (Claude Sonnet 4, GPT-5.5). Итого гибрид на 50M токенов/день: ~$32K/мес против чистого облака $90K/мес — экономия 64% с сохранением доступа к лучшим доступным моделям.
Выбор правильной модели для каждого уровня требует актуальных данных о ценах. Наше сравнение цен на LLM API 2026 ранжирует каждую крупную модель по стоимости и возможностям по типу задач — чтобы ваши решения о маршрутизации отражали цены этого месяца, а не прошлого квартала.
Гибридная архитектура: как реально выглядит «лучшее из обоих миров»
В этом разделе даётся архитектурный обзор и обоснование затрат для каждого гибридного паттерна. Полную реализацию на Python с кодом маршрутизации, инфраструктурными связками и архитектурой PII-классификатора смотрите в S10: Гибридная LLM-архитектура — руководство по реализации.
Паттерн 1: многоуровневая маршрутизация моделей
Весь трафик проходит через единый API-шлюз. Лёгкий классификатор определяет сложность. Простые задачи (классификация, извлечение, простые Q&A) направляются на дешёвые модели — Qwen3-8B на самохостинге или DeepSeek V3.2 через API. Средние задачи — на облачные модели среднего уровня. Сложные задачи — многошаговое рассуждение, агентное написание кода, чувствительные клиентские взаимодействия — на фронтирные облачные модели.
Ключевая инфраструктура: один базовый URL, один API-ключ, логика маршрутизации на уровне шлюза. Код приложения не знает и не заботится о том, где в итоге выполняется запрос. Реализацию смотрите в нашем руководстве по мультимодельной архитектуре.
Паттерн 2: Самохостинговый базовый уровень + облачный перелив
Самохостинговый инференс обрабатывает базовую нагрузку — предсказуемый стабильный трафик, за который вы иначе платили бы облачную наценку. Когда спрос превышает ёмкость, перелив автоматически маршрутизируется на облачные API-endpoints. Самохостинговый стек поддерживает высокий utilization. Облако обеспечивает эластичность без избыточного провижнинга. Критическая часть инфраструктуры: мониторинг глубины очереди на шлюзе с триггером автоскалинга, который включает облачную маршрутизацию, когда латентность самохостинга превышает порог.
Паттерн 3: локальные чувствительные данные + облачные общие
PII, PHI или другие регулируемые данные — самохостинговый инференс. Данные никогда не покидают вашу сеть. Чек-лист соответствия остаётся зелёным. Общие запросы, публичные данные, нечувствительные нагрузки — облачный API для доступа к новейшим фронтирным моделям. То же приложение. Та же кодовая база. Тот же формат API. Отличается только правило маршрутизации — PII-классификатор помечает запрос, шлюз маршрутизирует соответственно.
Контраргументы и честные ограничения
«Модели с открытыми весами сокращают разрыв — скоро не будет причин платить за облачные API»
По широким бенчмаркам да: DeepSeek V3.2 отстаёт от GPT-4o менее чем на 5 пунктов на MMLU. По конкретным высокоставочным задачам — сложное многошаговое агентное написание кода (SWE-bench verified), фронтирное рассуждение (GPQA Diamond), мультимодальное понимание видео — проприетарные модели всё ещё лидируют на 8–15 пунктов. Если конкурентная дифференциация вашего продукта зависит от этих фронтирных возможностей, чистый самохостинг пока не жизнеспособен. Кроме того: мультимодальные возможности (видео, аудио) у моделей с открытыми весами остаются значительно слабее. Для параллельного сравнения разрывов в возможностях по категориям задач — а не просто агрегированных бенчмарк-баллов — смотрите каталог моделей TokSpan с текущими ценами и тегами возможностей для каждой поддерживаемой модели.
«vLLM и Ollama делают самохостинг тривиальным»
Они делают тривиальным запуск модели — от дней настройки до минут. Запуск модели — это не запуск продакшн-сервиса. Автоскалинг на нескольких GPU, плавная деградация при обновлении моделей, мультимодельный сервинг с честной очередностью, интеграция наблюдаемости, инфраструктура A/B-тестирования — vLLM и Ollama этого не решают. Вам всё ещё нужны 0,3–0,5 FTE для продакшн-готовности, даже с лучшим тулингом.
«Моей команде нужен суверенитет данных — самохостинг — наш единственный вариант»
Если ваши требования соответствия требуют, чтобы данные никогда не покидали вашу сеть, самохостинговый инференс для чувствительных нагрузок обязателен. Но это не значит 100% самохостинга. Гибридный паттерн 3 — чувствительные данные локально, всё остальное в облаке — сохраняет доступ к фронтирным моделям, удовлетворяя самые строгие требования соответствия.
FAQ
При каком объёме самохостинг становится дешевле?
Точка перехода находится около 50M токенов в день (1.5B/мес) для большинства сценариев. Между 10–50M ответ зависит от уровня utilization, инженерной ёмкости и характеристик нагрузки. Ниже 10M облачный API почти всегда экономичнее. Самый практичный совет: работайте на облаке, инструментируйте всё, соберите три месяца реальных данных об использовании, затем смоделируйте свою конкретную безубыточность. Не делайте самохостинг на основе прогнозируемого объёма — делайте на основе измеренного.
Могу ли я просто использовать более дешёвые модели вместо самохостинга?
DeepSeek V3.2 по $0.27/M входных токенов приближается к предельным затратам на токен самохостинга. Во многих сценариях многоуровневая маршрутизация с дешёвыми облачными моделями достигает большей части снижения затрат самохостинга без операционных накладных. Исчерпайте оптимизацию маршрутизации — использование правильной модели для каждого уровня сложности — прежде чем рассматривать самохостинг. Она даёт снижение затрат на 50–70% с нулевыми изменениями инфраструктуры. Наш регулярно обновляемый рейтинг самых дешёвых провайдеров LLM API отслеживает, какие модели каждый месяц предлагают цену ниже $0.15 за миллион входных токенов — быстрый справочник при назначении моделей на нижние уровни.
Как часто нужно обновлять самохостинговые модели?
Основные семейства моделей с открытыми весами (Llama, Qwen, DeepSeek, Gemma) выпускают значимые новые версии каждые 4–6 месяцев. Каждый апгрейд требует 2–6 недель на оценку, переоптимизацию промптов, A/B-тестирование и продакшн-раскатку. Это не разовое нарушение — это повторяющееся инженерное обязательство, которое следует учитывать при планировании ёмкости команды.
Гибридная архитектура проще или я просто добавляю сложность?
Гибрид вводит логику маршрутизации и управление несколькими средами — реальная дополнительная сложность. Но если использовать единую API-платформу в качестве шлюза, большая часть сложности маршрутизации поглощается на инфраструктурном уровне. Ваш код приложения видит один endpoint. Спаны, излучаемые шлюзом (см. наше руководство по наблюдаемости), показывают все endpoints — самохостинговые и облачные — в одной панели. Операционный выигрыш гибрида в том, что вы не заперты в решение «всё или ничего». Начните только с облака. Добавляйте самохостинговые компоненты для конкретных уровней, когда данные это поддержат.
А что насчёт использования TokSpan или OpenRouter вместо прямого подключения?
Агрегационные API-платформы дают оптовые цены на 15–35% ниже прямых розничных API-ставок — первый и самый лёгкий рычаг затрат для пользователей облачных API. Они также дают многоуровневую маршрутизацию, централизованную наблюдаемость и единый биллинг по всем провайдерам через один endpoint. Если вы рассматриваете самохостинг для снижения затрат, сначала попробуйте цены агрегационных платформ. Экономии может хватить, чтобы остаться на облаке — с нулевыми изменениями инфраструктуры. Логика многоуровневой маршрутизации, приводящая к этим сбережениям, описана в документации по кастомной маршрутизации — маршрутизация на основе правил, семантическая маршрутизация и автоматический фолбэк моделей с одного API-endpoint.
«Самохостинг или облако» — это математическая задача, а не философия. Математика говорит: облако выигрывает ниже 10M токенов/день, гибрид выигрывает от 10 до 100M, а преимущество самохостинга становится решающим выше 100M — но даже тогда гибрид с облачным переливом для доступа к фронтирным моделям — практический победитель для большинства команд.
Начните с облака. Инструментируйте всё. Соберите реальные данные. Смоделируйте свою безубыточность. Резервирование GPU может подождать. Оптимизация затрат — многоуровневая маршрутизация, кэширование промптов, пакетное использование API — нет.
Хотите увидеть, как цены TokSpan сравниваются с прямыми ставками провайдеров и затратами самохостинга в вашем масштабе? Изучите цены TokSpan — унифицированный доступ к API к 200+ моделям с оптовыми ставками на 15–35% ниже прямой розницы.