$0.14. За миллион токенов. Именно столько стоит продакшн-искусственный интеллект прямо сейчас. Это не опечатка. Это не пробный тариф.
Но вы, вероятно, платите $30 за миллион токенов за GPT-5.5. Это три цента за ответ. Тысяча ответов в день: $30. Месяц: $900. Ещё до запуска. До того, как вы заметите, что токены рассуждений незаметно съедают ещё 2–5x вашего счёта.
Остановитесь. Вы не обязаны так жить.
В 2026 году существуют модели, которые стоят 1/40 от цены OpenAI. То же качество для 85% реальных задач. Разрыв не в возможностях — он в осведомлённости.
Эта статья описывает весь ландшафт: 15 самых дешёвых моделей в рейтинге с реальными бенчмарками качества, скрытые комиссии, которые превращают «дешёвые» API в дорогие ошибки, бесплатные тарифы, на которых действительно можно строить продакшн-функции, и путь от нуля до масштаба, не требующий изменения ни одной строки кода.
Самые дешёвые LLM API в 2026 году: рейтинг (по состоянию на июль 2026 года)
«Дешёвый» не имеет смысла без минимального уровня качества. Каждая модель в этом рейтинге имеет подтверждённый сценарий использования, в котором она даёт приемлемое качество. Модели, которые дешевы, но непригодны, в список не включены.
Уровень «Ультра-бюджет» ($0.01–0.15 за миллион токенов)
Это самые дешёвые модели, которые всё ещё выдают связный и полезный результат. Они надёжно справляются с классификацией, извлечением, простыми вопросами и ответами и генерацией шаблонного кода. Для сложных рассуждений они не подходят.
| Модель | Вход $/M | Выход $/M | Контекст | Минимальный уровень качества | Лучшее применение |
|---|---|---|---|---|---|
| GLM-4.7 Flash | Бесплатно | Бесплатно | 128K | ~85% от GPT-4o-mini | Прототипирование, простые чат-боты |
| GLM-4-9B | $0.01 | $0.01 | 32K | Базовые текстовые задачи | Сверхдешёвая классификация |
| Qwen3-8B | $0.01 | $0.01 | 32K | Базовый текст и код | Извлечение с минимальными затратами |
| GPT-4.1 Nano | $0.10 | $0.40 | 1M | Твёрдые рассуждения | Бюджетные задачи с длинным контекстом |
| Llama 4 Scout | $0.11 | $0.34 | 10M | Хорош для своего уровня | Сверхдлинный контекст (10M) |
| DeepSeek V4 Flash | $0.14 | $0.28 | 1M | 92% HumanEval | Генерация текста, классификация, простое программирование |
DeepSeek V4 Flash задаёт эталон для этого уровня. При 92% HumanEval — совпадение с бенчмарком программирования GPT-4o в пределах 0.5 балла — это не просто «хорош за свою цену». Это просто хорош. При входе $0.14 и выходе $0.28 (официальные цены DeepSeek) вы можете обработать 3.5 миллиона выходных токенов за $1. Это примерно 2,600 страниц сгенерированного текста. Попробуйте то же самое с GPT-5.5: тот же объём вывода обойдётся в $105.
GLM-4.7 Flash заслуживает особого упоминания: он полностью бесплатен, с контекстом 128K и OpenAI-совместимым API. Никакой кредитной карты, никакого истечения пробного периода, никаких лимитов использования (в рамках честного использования). Для прототипирования, личных проектов и обучения платить за что-то другое нет причин. Подвох: документация в первую очередь на китайском, API может быть нестабилен в часы работы китайского бизнеса, а политика использования данных неясна. Не отправляйте через него чувствительные данные.
Уровень «Бюджет» ($0.15–0.50 за миллион токенов)
Эти модели обеспечивают качество, близкое к фронтирному, для конкретных задач по ценам, которые превращают подход «использовать GPT-5.5 для всего» в ошибку на $500 в месяц.
| Модель | Вход $/M | Выход $/M | SWE-bench | Лучше всего для |
|---|---|---|---|---|
| DeepSeek V4 Pro | $0.435 | $0.87 | ~85% | Основная модель для кода, общие рассуждения |
| Qwen3-32B | $0.18 | $0.28 | ~75% | Мультиязычность (японский, корейский, арабский) |
| GPT-5.4 Nano | $0.20 | $1.25 | — | Экосистема OpenAI, умеренное качество |
| Llama 3.3 70B | $0.10 | $0.40 | — | Собственный хостинг, конфиденциальность |
DeepSeek V4 Pro — лучшая по соотношению цена/качество модель для программирования из существующих. При выходе $0.87/M и ~85% SWE-bench она стоит 1/29 от того, что стоит Claude Opus 4.8, за качество кода, неотличимое для ~85% реальных задач. Разница проявляется в сложных архитектурных решениях и отладке пограничных случаев — не в «напиши функцию, которая парсит CSV-файлы».
Qwen3-32B за $0.18/$0.28 — лучший выбор для мультиязычных приложений. Он превосходит GPT-5.5 на бенчмарках C-Eval (китайский), японском, корейском и арабском. Если ваша аудитория преимущественно не англоязычная, это, вероятно, ваша лучшая модель независимо от цены.
Уровень «Ценность» ($0.50–1.50 за миллион токенов)
Это модели, близкие к фронтирным, которые прорвались в «клуб SWE-bench 80%+» — порог возможностей, который 18 месяцев назад был доступен только моделям за $15–30/M.
| Модель | Вход $/M | Выход $/M | SWE-bench | Контекст |
|---|---|---|---|---|
| MiniMax M3 | $0.60 | $2.40 | 80.5% | 1M |
| Qwen3.7 Max | $1.25 | $3.75 | 80.4% | 1M |
| Kimi K2.6 | $0.95 | $4.00 | 80.2% | 256K |
| GLM-5 | $1.00 | $3.20 | — | 200K |
| Mistral Large 3 | $0.50 | $1.50 | — | 262K |
MiniMax M3 — самая дешёвая модель в клубе SWE-bench 80%+ — выход $2.40/M — и даёт лучшую ценность программирования на доллар среди всех моделей (0.034 балла SWE-bench на доллар; GPT-5.5 даёт 0.003). Для команд, которым нужно гарантированное качество кода, но которые не могут оправдать выход за $25–50/M, это та самая модель.
Скрытые затраты, которые раздувают ваш счёт
Указанные цены лгут. Вот что не показывает страница с ценами.
Токены рассуждений невидимы и дороги. Когда GPT-5.5 или Claude Opus «думает» перед ответом, эти внутренние токены цепочки рассуждений тарифицируются по ставке выходных токенов. Вы их не видите в ответе — но вы за них платите. Запрос, который даёт 500 видимых выходных токенов, мог потребовать 1,500 токенов рассуждений за кулисами. Ваши эффективные $30/M превращаются в $120/M для этого запроса. OpenAI недавно добавил поле reasoning_tokens для отслеживания этого; следите за ним.
Ползучий рост длины промпта незаметен. Ваш «простой классификатор» начинается с 200 токенов и двух примеров. Через шесть месяцев вы добавили ещё пять примеров, подробную спецификацию формата вывода и преамбулу о том, что «вы полезный ассистент». Теперь промпт составляет 2,500 токенов. Вы платите в 12.5 раз больше за запрос — и не заметили, потому что рост стоимости был постепенным. Проводите аудит длины промптов ежеквартально.
«Ловушка бесплатного тарифа» имеет зубы. Бесплатный тариф Gemini от Google может использовать ваши данные для обучения. Политика конфиденциальности DeepSeek неоднозначна в отношении использования данных. Многие бесплатные тарифы предлагают модели в более низком квантовании (заметно худшее качество, чем у платных). А лимиты скорости бесплатных тарифов (15–30 RPM) сломают ваше продакшн-приложение в самый неподходящий момент. Бесплатные тарифы предназначены для прототипирования. Как только у вас появляются реальные пользователи, переходите на платный тариф.
Потери из-за лимитов скорости добавляют 15–20% накладных расходов. Если ваш клиент повторяет запрос при 429 с фиксированным интервалом в 1 секунду, вы создаёте табун, который гарантирует ещё больше ошибок 429. Решение — экспоненциальная задержка с джиттером — tenacity в Python, llm-retry-kit в Node.js. Но более масштабное решение — предиктивное троттлинг: читайте заголовки x-ratelimit-remaining-* и замедляйтесь до того, как достигнете лимита. Полную реализацию обработки лимитов скорости см. в нашем руководстве по обработке лимитов скорости в продакшне.
Полный перечень из 12 стратегий оптимизации затрат с данными «до и после» — в нашем руководстве по сокращению расходов на API.
Бесплатные LLM API: что можно создать за $0
В 2026 году по-настоящему бесплатных и постоянно доступных LLM API больше, чем когда-либо в истории отрасли. Вот что реально пригодно к использованию — и что может каждая из них.
| Поставщик | Модель | Limit | Лучше всего для | Обучение на данных? |
|---|---|---|---|---|
| Google AI Studio | Gemini 2.5 Flash | 1,500 req/day | Прототипирование, длинный контекст, мультимодальность | Да (бесплатный тариф) |
| Groq | Llama 3.3 70B, Qwen3 32B | 30 RPM / 14,400 RPD | Чат в реальном времени (300–500 tok/s) | Нет |
| Cerebras | Llama 3.3 70B, Qwen3,235B | 30 RPM / 1M tok/day | Пакетная обработка (2,500+ tok/s) | Нет |
| OpenRouter | 35+ бесплатных моделей | 20 RPM / 200 RPD | Эксперименты с моделями | Зависит от модели |
| Z.AI (Zhipu) | GLM-4.7 Flash | ~1,000 RPD | Бесплатный продакшн для простых задач | Неясно |
| GitHub Models | GPT-4o, Claude 3.5 Sonnet, 45+ | 10–15 RPM / 50–150 RPD | Бесплатный доступ к фронтирным моделям | Нет |
GitHub Models прекращает работу 30 июля 2026 года. Если вы им пользуетесь, мигрируйте до этой даты. Бесплатный тариф OpenRouter или недорогая агрегационная платформа — самые простые альтернативы со сравнимым доступом к моделям.
Что реально можно создать: чат-бот поддержки клиентов, обрабатывающий около 200 разговоров в день (бесплатный тариф Gemini Flash). Бот для ревью кода в PR для небольшой команды (бесплатный тариф Groq, Llama 3.3 70B). Личный помощник по написанию текстов (бесплатный тариф Cerebras). Автоматизированный конвейер извлечения данных на ~500 документов в день (GLM-4.7 Flash).
Что нельзя создать: что-либо с SLA. Что-либо, обрабатывающее чувствительные пользовательские данные, где требуется отказ от обучения. Что-либо, что превышает 50 одновременных запросов. Бесплатные тарифы отлично подходят для валидации — «хочет ли кто-то вообще этот продукт?» Для продакшна они не предназначены.
Мост от $0 к платному. Трение при переходе от бесплатного прототипа к платному продакшну обычно связано с созданием новых аккаунтов, добавлением платёжных методов и сменой API-endpoints. Агрегационные платформы устраняют это трение: вы прототипируете на бесплатных моделях, добавляете $5–20 на свой предоплаченный баланс, когда готовы, и сохраняете тот же endpoint, тот же код SDK и те же имена моделей. Нулевая миграция. Это самый быстрый путь от «у меня есть идея» до «у меня есть продакшн-приложение», и стоит это меньше обеда.
Когда дешёвые API подводят: границы качества
У дешёвых моделей есть реальные ограничения. Знать, где они подводят, важнее, чем знать, где они успешны.
Задачи, с которыми дешёвые модели справляются плохо: сложные многошаговые рассуждения, требующие одновременного удержания 3+ ограничений (например, «проанализируйте этот контракт, выявите положения, противоречащие законодательству Калифорнии, и составьте альтернативные формулировки»). Нюансированное творческое письмо с конкретным голосом или тоном. Ревью кода, требующее понимания архитектурных последствий изменения (а не просто «корректна ли эта строка»).
Умная схема эскалации. Направляйте 80% запросов на дешёвую модель (DeepSeek V4 Flash, $0.14/$0.28). Для 15%, которым нужно больше возможностей, повышайте до среднеуровневой модели (DeepSeek V4 Pro, $0.44/$0.87, или Claude Sonnet, $3/$15). Для 5%, которым нужна максимальная глубина, повышайте до фронтирной модели (Claude Opus, $5/$25, или GPT-5.5, $5/$30). Средневзвешенная стоимость: примерно $0.55/M на выход — на 98% дешевле, чем полностью фронтирное решение. Качество: идентично для конечных пользователей, которые не могут определить, какая модель обработала их запрос. Полную реализацию маршрутизации с кодом см. в нашей настройке пользовательской маршрутизации.
Что делает дешёвые модели практичными в масштабе. Модель, которая стоит $0.14/M токенов на бумаге, всё равно требует аккаунт, платёжный метод и панель лимитов скорости. Сложите пять таких моделей — и вы вернётесь к управлению пятью отношениями с провайдерами — накладные расходы на каждого провайдера съедают экономию. Агрегационные платформы решают эту проблему, сводя доступ к единому предоплаченному балансу: внесите $10 один раз и направляйте каждую модель из этой статьи через один и тот же endpoint. Объединение объёмов тысяч пользователей означает, что эффективная ставка за токен оказывается ниже официальной розничной — обычно на 10–20%. Практический результат: вы можете использовать DeepSeek Flash фактически по $0.10/M на вход вместе с Claude Opus по $22/M на выход — из одного аккаунта и с одним счётом. Вот когда «дёшево» становится действительно дешёвым.
FAQ
Действительно ли DeepSeek V4 Flash так же хорош, как GPT-4o?
По бенчмаркам кода: 92% HumanEval против 92.5% (GPT-4o). По общим рассуждениям: 85.5% MMLU против 88.7% (GPT-4o). Для 90% текстовых задач — классификация, извлечение, суммаризация, простое программирование — да, он функционально эквивалентен. Для зрения, мультимодальности и сложных многошаговых рассуждений: нет. Разрыв измерим, но незначителен для большинства продакшн-нагрузок. Детальные данные бенчмарков см. в нашем полном сравнении четырёх провайдеров.
Какой самый дешёвый LLM API без кредитной карты?
GLM-4.7 Flash от Zhipu AI — полностью бесплатный, контекст 128K, OpenAI-совместимый endpoint. Google Gemini Flash — бесплатный тариф, 1,500 запросов в день, без кредитной карты. Из платных: DeepSeek V4 Flash по $0.14/$0.28 за миллион токенов, доступный без кредитной карты через агрегационные платформы, которые принимают альтернативные платежи.
Надёжны ли китайские AI API для продакшна?
DeepSeek и Qwen поддерживают аптайм 99.5%+ на платных тарифах. Основные препятствия для международных разработчиков — документация на китайском, требование китайского номера телефона для прямой регистрации и ограниченная англоязычная поддержка сообщества. Агрегационные платформы решают все три проблемы: документация на английском, отсутствие требования номера телефона и поддержка сообщества на вашем языке. После подключения надёжность API сопоставима с западными провайдерами.
Обучаются ли дешёвые API на моих данных?
Зависит от случая. Бесплатный тариф Google может использовать данные для обучения (они об этом прямо заявляют). Политика DeepSeek неоднозначна — условия неясно указывают, используются ли данные API для обучения. У Zhipu (GLM) аналогично неясная политика. Платные тарифы обычно предлагают отказ от обучения. Корпоративные тарифы имеют договорные гарантии. Если вы работаете с чувствительными данными, используйте провайдера с чёткими условиями использования данных или агрегационную платформу, предоставляющую договорные соглашения об обработке данных.
Как начать с $0 и масштабироваться до продакшна?
Начните с бесплатных тарифов (Google AI Studio, Groq, GLM-4.7 Flash), чтобы создавать и проверять. Когда понадобится большая пропускная способность, добавьте $5 на предоплаченный баланс агрегационной платформы. Ваш код не меняется — тот же endpoint, тот же SDK, те же имена моделей. Вы просто получаете более высокие лимиты скорости, качество платного тарифа (неквантизованные модели) и доступ к премиальным моделям, когда они нужны. Переход от «бесплатного прототипа» к «платному продакшну» занимает 60 секунд и не требует изменений кода. Наше руководство по началу работы проведёт вас через полную настройку.
Вот ваш конкретный следующий шаг. Проведите аудит последних 1,000 вызовов API. Посчитайте, сколько ушло на модели дороже $5 за миллион выходных токенов. Возьмите каждый вызов классификации, извлечения и простого Q&A из этой категории и перенаправьте его на DeepSeek V4 Flash по $0.28 за миллион выходных токенов. Возьмите каждый вызов кода и рассуждений и перенаправьте его на DeepSeek V4 Pro по $0.87. Оставьте фронтирные модели в резерве для тех 5% запросов, которым они действительно нужны, — сложная отладка, юридический анализ, многошаговые агенты. Сделайте перенаправление на этой неделе. Ваш счёт упадёт на 80–90%, пользователи не заметят разницы, и вам больше не придётся читать статьи о ценах.
Смена маршрутизации занимает десять минут. Если хотите сделать её минутной — один endpoint для всех моделей из таблицы цен, без регистрации у каждого провайдера, единый предоплаченный баланс — агрегационный endpoint TokSpan позволяет переключаться между DeepSeek V4 Flash и Claude Opus простой сменой строки модели. Бесплатный тариф покрывает прототипирование. Платные тарифы начинаются от $5.