На Reddit недавно появился пост с необычным достижением. Автор утверждает, что прогнал через Claude больше миллиарда входных токенов — 1 156 308 524.

История из той же ветки обсуждений болезненнее. Один пользователь настроил в Claude Code команду, которая каждые полчаса проверяла открытые pull request, и забыл её остановить. За 26 часов цикл отработал 46 раз, сессии обошлись примерно в $6000. К сумме стоит относиться осторожно: это рассказ с форума, а не биллинг. Но причина заслуживает внимания: контекст разросся до восьмисот тысяч токенов, и каждая следующая итерация обрабатывала всю эту историю целиком.

В этом суть: для человека запрос «проверь PR ещё раз» — четыре слова. Для модели за ним стоит вся предыдущая переписка, инструкции, куски кода и прошлые решения. Через API отдельно считаются входные токены, которые модель получает, и выходные, которые она генерирует. И вход — не только последняя реплика, а накопленная история разговора.

Контекстное окно — рабочая память модели. У Claude в API оно достигает миллиона токенов, и кажется, что можно загрузить туда всю документацию. Но вместить информацию и хорошо ею воспользоваться — разные вещи.

В 2025 году команда Chroma опубликовала исследование context rot: производительность моделей ухудшалась по мере роста входа, особенно мешали distractors — информация, похожая на нужную, но не содержащая ответа. Модель ничего формально не забывает — просто факт приходится искать среди куда большего материала. Эффект подтвердила и работа июня 2026 года.

Отчасти расходы спасает prompt caching: повторно используемые входные токены при попадании в кэш стоят у Anthropic 0,1 от базовой цены. Но кэш делает повторение дешевле, а не превращает мусор в полезную информацию.

С агентами токены уходят особенно незаметно: задача «почини баг» превращается в десятки самостоятельных действий — прочитать файл, запустить код, получить ошибку, снова прогнать тесты. В агентном режиме появляется и цена всего процесса.

Простые привычки помогают сильнее, чем микроменеджмент промптов. Разделяйте независимые задачи и очищайте историю между ними. Длинные сессии сворачивайте: вместо полной истории оставьте решения и то, что ещё предстоит сделать. И не каждой операции нужна самая тяжёлая модель.

По сути, мы долго учились писать промпты. Теперь придётся учиться выбрасывать лишнее: решать не только, что написать модели, но и что она должна видеть в момент ответа. Иногда лучший способ сделать LLM дешевле и точнее — вовремя дать ей что-нибудь забыть.