Миллиард токенов за месяц: во что обходятся длинные чаты с нейросетью
На Reddit недавно появился пост с необычным достижением. Автор утверждает, что прогнал через Claude больше миллиарда входных токенов — 1 156 308 524.
История из той же ветки обсуждений болезненнее. Один пользователь настроил в Claude Code команду, которая каждые полчаса проверяла открытые pull request, и забыл её остановить. За 26 часов цикл отработал 46 раз, сессии обошлись примерно в $6000. К сумме стоит относиться осторожно: это рассказ с форума, а не биллинг. Но причина заслуживает внимания: контекст разросся до восьмисот тысяч токенов, и каждая следующая итерация обрабатывала всю эту историю целиком.
В этом суть: для человека запрос «проверь PR ещё раз» — четыре слова. Для модели за ним стоит вся предыдущая переписка, инструкции, куски кода и прошлые решения. Через API отдельно считаются входные токены, которые модель получает, и выходные, которые она генерирует. И вход — не только последняя реплика, а накопленная история разговора.
Контекстное окно — рабочая память модели. У Claude в API оно достигает миллиона токенов, и кажется, что можно загрузить туда всю документацию. Но вместить информацию и хорошо ею воспользоваться — разные вещи.
В 2025 году команда Chroma опубликовала исследование context rot: производительность моделей ухудшалась по мере роста входа, особенно мешали distractors — информация, похожая на нужную, но не содержащая ответа. Модель ничего формально не забывает — просто факт приходится искать среди куда большего материала. Эффект подтвердила и работа июня 2026 года.
Отчасти расходы спасает prompt caching: повторно используемые входные токены при попадании в кэш стоят у Anthropic 0,1 от базовой цены. Но кэш делает повторение дешевле, а не превращает мусор в полезную информацию.
С агентами токены уходят особенно незаметно: задача «почини баг» превращается в десятки самостоятельных действий — прочитать файл, запустить код, получить ошибку, снова прогнать тесты. В агентном режиме появляется и цена всего процесса.
Простые привычки помогают сильнее, чем микроменеджмент промптов. Разделяйте независимые задачи и очищайте историю между ними. Длинные сессии сворачивайте: вместо полной истории оставьте решения и то, что ещё предстоит сделать. И не каждой операции нужна самая тяжёлая модель.
По сути, мы долго учились писать промпты. Теперь придётся учиться выбрасывать лишнее: решать не только, что написать модели, но и что она должна видеть в момент ответа. Иногда лучший способ сделать LLM дешевле и точнее — вовремя дать ей что-нибудь забыть.
Любопытно было бы разложить эти 6000 долларов по компонентам: при контексте в восемьсот тысяч токенов только вход за 46 итераций даёт порядка 37 млн токенов. Но чтобы сумма вышла такой, основной вес явно пришёлся на выходные токены — видимо, модель на каждом цикле генерировала подробные отчёты. И вопрос практический: в Claude Code есть лимит стоимости сессии или такой цикл можно остановить только вручную?
Шесть тысяч долларов за сутки из-за одной забытой команды — звучит жутковато. А обычному человеку такое грозит, если просто оставить диалог с нейросетью открытым, или это работает только в автономном режиме?
Вот почему у нас для длинных рутинных задач всё чаще гоняют локальные модели с длинным контекстом — за миллион токенов на входе платишь один раз за железо, а не за каждую итерацию. Вопрос только, потянет ли связка llama.cpp с какой-нибудь открытой моделью восемьсот тысяч токенов без деградации, или такие окна пока удел платных API.
Я как-то оставила автоматическую проверку кода крутиться на ночь и утром увидела счёт в несколько раз больше обычного. Теперь всегда выставляю лимит стоимости сессии, пока не поздно.
Шесть тысяч за 26 часов — впечатляющая цифра, но это всё же рассказ с Reddit без подтверждённого биллинга. Даже если реальная сумма втрое меньше, странно, что в Claude Code нет жёсткого лимита стоимости по умолчанию, а не только ручной настройки.
Любопытно, сходится ли цифра: входные токены у Anthropic стоят заметно дешевле выходных, поэтому $6000 за 46 сессий выглядит правдоподобно только при длинных ответах. Интересно, во что обходится один проход с контекстом в 800 тысяч токенов, если считать по обычному API-тарифу.
Интерфейсу не хватает счётчика цены.
@Светлана, счётчик бы помог, но в этой истории цена растёт незаметно: 46 итераций по полчаса, и каждая перегоняет разросшийся контекст заново. Даже с индикатором суммы в интерфейсе непонятно, как на неё влиять — вручную откатывать историю диалога никто не будет. И всё же историю с шестью тысячами долларов автор сам называет форумным рассказом, так что к цифре стоит относиться с оговоркой.