Вы загрузили в модель весь контракт на 800 страниц. Она ответила — и счёт за этот один вопрос превысил все ваши расходы на API за прошлый месяц. Модель «справилась» с контекстным окном. Ваш бюджет — нет.
Длинный контекст — самая разрекламированная возможность в LLM-стеке, и вокруг хайпа возникли дебаты — «RAG мёртв?» — которые почти полностью построены на неверных предпосылках. Окно на 1M токенов реально: Gemini поставляет окна класса 2M, Claude — 1M, Kimi K3 от Moonshot вышла с 1M в июле 2026 года, DeepSeek V4 Pro несёт 1M контекста с 384K вывода. Но физика не изменилась: токены стоят денег, внимание деградирует с расстоянием, и «могу ли я впихнуть» никогда не было тем же вопросом, что «стоит ли».
Это руководство покрывает ту часть, которую дебаты пропускают: математику затрат (полный контекст против кэширования против RAG), паттерны воркфлоу, которые делают окна на 1M токенов пригодными к использованию (map-reduce, компакция, скользящие окна, многослойный контекст), и фреймворк выбора «длинный контекст против RAG», который завершает спор цифрами, а не ощущениями.
Что дают long-context API в 2026 году
Ключевой вывод: окно на 1M теперь стандарт среди frontier-моделей — и различия — это стоимость, поведение кэша и качество внимания, а не размер окна.
Линейка 2026 года: окна Gemini класса 2M, Claude с общедоступным окном 1M, Kimi K3 с 1M (открытый флагман, который задал новые стандарты и по контексту, и по цене), DeepSeek V4 Pro с контекстом 1M и семейства класса GPT от 400K и выше. Каталог моделей отслеживает актуальные лимиты каждого провайдера через унифицированный endpoint.
Три вещи, о которых размер окна не говорит:
- Стоимость за токен при полном окне. Вход на 1M токенов по frontier-тарифам — это реальные деньги за вопрос; точная цифра зависит от провайдера и уровня, что и есть суть третьего раздела.
- Кэш-цены. Большинство провайдеров дисконтируют кэшированные входные токены примерно до десятой части базовой ставки — конвенция кэширования, задокументированная по всей индустрии — что полностью меняет экономику повторяющихся long-context нагрузок.
- Качество внимания на глубине. «Окно 1M» означает, что модель принимает 1M; это не значит, что она использует 1M равномерно. Деградация на глубине по типу retrieval-эффекта реальна, и именно она — инженерная причина существования паттернов воркфлоу ниже.
Почему «1M токенов» — это не «1M полезных токенов»
Ключевой вывод: размер окна — потолок, а не обещание качества — и кривая затрат линейна, тогда как кривая внимания — нет.
Три реальности за маркетингом:
- Затраты растут линейно и болезненно. Каждый токен в окне оплачивается, участвовал он или нет. Вопрос на 1M токенов по ставке долларового масштаба — это вопрос ценой в доллары: повторяемый, пока не перестанет быть.
- Внимание деградирует с расстоянием. Данные по разным семействам моделей стабильно показывают, что модели лучше используют начало и конец длинных контекстов, чем середину, — «lost in the middle» — это хорошо задокументированный паттерн. Впихнуть — не значит понять.
- Кэш меняет форму. С кэш-ценой ~0.1× второй вопрос с полным окном дёшев — это вознаграждает стабильные, повторяющиеся длинные контексты (один и тот же документ, к которому обращаются многократно) и наказывает разовые полноконтекстные загрузки.
Проектное следствие: длинный контекст лучше всего работает как переиспользуемый актив — стабильный корпус, к которому вы обращаетесь многократно, — и хуже всего как ставка на каждый отдельный вопрос.
Математика затрат: полный контекст против кэша против RAG
Ключевой вывод: для повторяющихся запросов по одному корпусу обычно выигрывает кэш-затем-RAG; для разовых вопросов по целому документу честен полный контекст; для всего остального — считайте.
Сравнение на конкретной форме — корпус на 500K токенов, десять вопросов:
| Подход | Драйвер затрат | Типичная относительная стоимость |
|---|---|---|
| Полный контекст, каждый вопрос | 500K токенов × 10 | 10× цены полного входа |
| Кэш + полный контекст | ~0.1× на кэшированном входе | ~1× цены полного входа |
| RAG (top-k retrieval) | 5K токенов × 10 + индекс | доля одного полного входа |
Структурные выводы: RAG выигрывает по стоимости на порядки для повторяющихся запросов; кэш делает полный контекст конкурентоспособным, когда один и тот же корпус запрашивают часто; полный контекст выигрывает безоговорочно только для разовых глубоких чтений. Качество следует другой кривой — retrieval может промахнуться, полный контекст может «закопать» нужное, — и именно поэтому существует фреймворк выбора.
Цифры зависят от провайдера и корпуса; гайд по кэшированию из этой серии объясняет механику кэша, а проработанный пример ниже — форма, которую нужно заполнить вашими тарифами.
Как строить воркфлоу на 1M токенов
Ключевой вывод: четыре паттерна — map-reduce, компакция, скользящие окна, многослойный контекст — и проектное правило: «никогда не платите за токены, которые вам не нужны».
- Map-reduce. Разбейте корпус, обработайте чанки, объедините результаты. Рабочая лошадка для «ответа по всему документу»: каждый чанк мал, параллелизм естественен, а финальный синтез читает только саммари. Затраты масштабируются с чанками, а не с полным окном.
- Компакция контекста. Сжимайте середину — суммаризируйте, извлекайте ключевые факты, отбрасывайте избыточность — до следующего хода. Компакция — это то, как агенты удерживают многоходовой контекст без квадратичных затрат; это разница между «агент помнит» и «агент таскает весь транскрипт».
- Скользящие окна. Держите последние N токенов, суммаризируйте то, что выпадает. Для диалогов и стримов окно следует за действием — паттерн, который держит интерактивные затраты ограниченными.
- Многослойный контекст. Быстрый путь и полный путь: саммари для рутинных ходов, retrieval полного отрывка по запросу, когда он нужен вопросу, — кастомная маршрутизация делает решение «быстро/полно» механическим. Многослойность — продакшн-паттерн, который превращает «1M контекста» из счёта в возможность.
Общая нить: каждый паттерн — это способ платить за токены, которые имеют значение. Endpoint chat completions отвечает за механику; паттерны решают экономику.
Как выбирать: длинный контекст против RAG против гибрида
Ключевой вывод: вопрос не в том, «мёртв ли RAG», а в том, «каков мой паттерн запросов» — и фреймворк выбора это три вопроса, а не религия.
- Корпус статичен и запрашивается повторно? Кэш-плюс-RAG: проиндексируйте один раз, извлекайте на каждый запрос, кэшируйте стабильные префиксы.
- Вопрос — разовое глубокое чтение большого документа? Полный контекст: честный сценарий, где retrieval промахнулся бы, а стоимость ограничена редкостью вопроса.
- Это долгоиграющий агентный диалог? Многослойный контекст: саммари плюс retrieval плюс ограниченное окно, никогда не полная история.
Связь с гайдом по RAG из этой серии комплементарна, а не конкурентна: тот гайд владеет внутренностями retrieval — чанкингом, гибридным поиском, реранкингом, — а этот — экономикой контекстного окна и паттернами воркфлоу. Оба применимы к большинству продакшн-систем, и гибрид — это норма, а не компромисс.
Частые ошибки
Ключевой вывод: четыре ловушки — три про стоимость, одна про качество — и каждая это хайп «1M окна» в действии.
- Полный контекст по умолчанию. Окно существует, значит, в него впихивают всё — ловушка линейных затрат без дизайна кэша и без retrieval. Бюджетные таблицы в этом руководстве существуют, потому что эта ошибка и есть дефолт.
- Нет компакции в агентных циклах. Каждый ход добавляет полную историю; к двадцатому ходу агент платит за всё, что когда-либо сказал. Для долгоиграющих агентов компакция не опциональна.
- Дрейфующие ключи кэша. Кэш-множитель применяется только когда префикс байт-стабилен: динамические заголовки, таймстампы или переставленные секции обнуляют hit rate, превращая ~0.1× в 1×. В гайде по кэшированию — механика; дисциплина — ваша.
- Бенчмаркинг серединой окна. «Он справился с 1M токенов», протестированное на начале и конце контекста: паттерн lost-in-the-middle выживает, и eval-набор, который не сэмплирует середину, расскажет вам неправильную историю.
FAQ
Может ли контекст на 1M токенов заменить RAG?
Для разовых глубоких чтений большого документа — да, это честный сценарий. Для повторяющихся запросов по корпусу — нет: математика затрат (10× полного входа против retrieval-масштаба) делает ответом RAG, с кэшированием как мостом. Решает фреймворк из трёх вопросов, а не маркетинг.
Сколько реально стоит запрос на 1M токенов?
Полный вход по frontier-тарифам, за каждый запрос; точная цифра зависит от провайдера и уровня. С кэш-попаданиями ~0.1× повторные запросы по одному корпусу обрушивают стоимость. Таблица в этом руководстве — форма; страница вашего провайдера — цифра.
Что такое компакция контекста?
Сжатие диалога или корпуса между ходами — суммаризация, извлечение ключевых фактов, отбрасывание избыточности — чтобы агент нёс смысл вместо полной истории. Это паттерн, который делает долгоиграющих агентов недорогими, и после нескольких ходов он не подлежит обсуждению.
Правда ли кэш-цены ~0.1×?
Индустриальная конвенция — кэш-множитель около десятой части базовой входной цены, задокументированный единообразно у провайдеров. Он применяется только к байт-стабильным префиксам — именно поэтому дисциплина ключей кэша это скрытый рычаг затрат в любом long-context продакшне.
Какие провайдеры предлагают окна на 1M токенов?
Gemini (класс 2M), Claude (1M), Kimi K3 (1M, открытый флагман) и DeepSeek V4 Pro (контекст 1M) среди текущего поколения — а каталог моделей по ссылке выше служит справочником актуальной доступности через один endpoint.
Когда использовать полный контекст вместо retrieval?
Когда вопрос — разовое глубокое чтение, где retrieval промахнулся бы: ревью контракта, анализ одного документа, рассуждение по всему корпусу — и запрос достаточно редок, чтобы стоимость была событием, а не паттерном. Для всего повторяющегося — кэшируйте или извлекайте.
Итоги
Long-context LLM API изменили математику затрат, а не физику: окна на 1M стали стандартом среди frontier-моделей, и теперь различия — это поведение кэша, качество внимания на глубине и паттерны воркфлоу, которые держат счёт в разумных пределах. Map-reduce для вопросов по всему корпусу, компакция для агентов, скользящие окна для стримов, многослойный контекст для продакшна — и фреймворк из трёх вопросов, который заменяет дебаты «RAG мёртв?» цифрами. Окно — это возможность; паттерны делают её бюджетом.
Фреймворк выбора — это задача для электронной таблицы. Получите ключ TokSpan API — $5 бесплатных кредитов, чтобы проверить математику (quickstart), — и оцените все три подхода на собственном корпусе.