← Все статьи
2026-07-24 00:03 · 🤖 AI World

claude-thermos отрезает 22% счёта Claude Code одной командой

В многоагентных сессиях Claude Code кэш промптов тихо сгорает каждый раз, когда субагент работает дольше 5 минут. Автор open-source инструмента claude-thermos измерил потери на 185 реальных сессиях: 22% счёта уходило на бесполезный re-encoding уже закэшированного контента.

claude-thermos отрезает 22% счёта Claude Code одной командой

Кэш промптов в Claude Code живёт ровно 5 минут. Пока запросы с одинаковым префиксом приходят чаще — чтение стоит 0.1× от базовой цены токена. Как только между запросами образуется пауза длиннее этого TTL — кэш умирает, и следующий ход пересчитывает всю историю разговора по ставке записи: 1.25× на 200 000–500 000 токенов. В многоагентных сессиях это происходит постоянно и незаметно. Независимый разработчик зафиксировал потери на 185 реальных локальных сессиях — итог: 22% всего счёта ушло именно туда.

Контекст

Claude Code строит архитектуру вокруг многоуровневой агентуры: главный агент запускает субагентов под отдельные задачи — поиск по репозиторию, запуск тестов, генерация файлов, анализ кода. Каждый субагент работает в своём контексте: другой system prompt, другой набор инструментов. Их запросы идут с другим cache prefix и физически не могут прогреть кэш главного агента.

Пока субагент работает — главный агент ждёт. Его кэш не обновляется. Если субагентная задача занимает 6-7 минут, кэш уже мёртв к моменту возврата. Главный агент видит байт-идентичную историю разговора и вынужден заплатить за полный rewrite — как будто он запустился заново с нуля. При этом никакого предупреждения нет: просто тихий всплеск расходов.

claude-thermos — открытый Python-пакет, который работает как локальный реверс-прокси. Он перехватывает трафик между Claude Code и Anthropic API через переменную ANTHROPIC_BASE_URL, группирует запросы по сессиям и lineage-группам (одна lineage — один cache prefix), отслеживает опасные паузы и автоматически посылает «тепловые» запросы с max_tokens: 1. Единственный сгенерированный токен выбрасывается; цель — prefill, который читает и обновляет кэшированный префикс без вмешательства в реальный поток.

Аналитика

Математика здесь выгодная в одну сторону. Один warm-запрос стоит 0.1× базовой цены входного токена. Один rewrite, который он предотвращает, стоит 1.25× на сотнях тысяч токенов истории. Даже несколько избыточных warm-запросов не перекрывают экономию от одного предотвращённого rewrite. Отношение стоимостей — примерно 1 к 12 в пользу грева.

На 185 реальных сессиях принудительный rewrite кэша составил около 22% общего счёта — деньги, потраченные на повторную запись контента, уже закэшированного несколько минут назад.

Важнее другое: 22% — не патологический кейс, а медианная картина нормальной работы. Claude Code использует субагентов по умолчанию для типичных операций. Чем сложнее проект и длиннее контекст — тем дольше субагентные задачи, тем чаще кэш умирает. Это системная проблема любого agentic workflow, а не редкое исключение.

Показательно и то, как это обнаружили: не через документацию Anthropic, а через телеметрию. Встроенные логи (events.jsonl, summary.json) с разбивкой по warm_fired, resume_detected, net_savings — редкость для open-source инструментов. Это хорошо вписывается в культуру AI-first разработки, где себестоимость генерации — операционная метрика первого уровня, а не абстракция.

Кейсы применения в бизнесе

B2B-SaaS стартап с AI-фичами. Команда из 3-5 разработчиков активно использует Claude Code для написания кода, тестов, миграций. Сессии по 1-2 часа с несколькими субагентами — типичная картина. При ежедневном использовании claude-thermos может сэкономить десятки долларов в месяц без изменения workflow. Внедрение — одна строка в команде запуска, нулевое время настройки.

Корпорация с командой AI-разработки. 10+ инженеров используют Claude Code для review, рефакторинга legacy и генерации документации. Длинные контексты — legacy-кодовые базы на сотни тысяч строк — дают самый большой выигрыш от сохранения кэша: чем объёмнее история, тем дороже её rewrite. Инструмент встраивается в корпоративные dev-образы через uvx без изменения существующих скриптов и пайплайнов.

Фрилансер или небольшая студия в КР и СНГ. При бюджете на AI-инструменты в $50-200 в месяц даже 20% экономия на Claude Code ощутима. claude-thermos не требует регистрации, платных тарифов или сторонних API — только Python 3.11+ и уже установленный claude CLI. Реальная экономия за сессию считается встроенными логами в ~/.claude-thermos/.

Кейсы в личной жизни

Разработчик, активно использующий Claude Code. Длинные сессии с поиском по репозиторию, запуском тестов, рефакторингом — именно тот случай, где кэш регулярно умирает. Установить uvx claude-thermos как alias в shell-конфиге — 5 минут работы, и экономия начинается с первой же сессии. После первого часа работы summary.json покажет конкретную цифру в токенах.

Контент-мейкер с агентурными пайплайнами. Если Claude Code используется для автоматизации — генерация постов, транскрипция, SEO-анализ с несколькими параллельными агентами — claude-thermos напрямую снижает стоимость каждого прогона. Логи позволяют точно видеть, сколько сэкономлено за сессию, что удобно при учёте операционных расходов на контент.

Студент или исследователь с ограниченным бюджетом. При работе над дипломной или исследовательской задачей в Claude Code, где сессии длятся часами, 22% экономия может ощутимо продлить период продуктивной работы без пополнения счёта. Бесплатный инструмент, нулевая настройка, работает поверх уже имеющегося Claude-подписки.

Как применить сегодня

  • Замени запуск claude на uvx claude-thermos — все аргументы проксируются без изменений, поведение Claude Code не меняется
  • Проверь логи после первой длинной сессии: ~/.claude-thermos/logs/summary.json покажет net_savings в токенах
  • Посчитай реальную экономию: умножь net_savings на цену входного токена своей модели (например, при $3 / 1M токенов для Sonnet — 1 200 000 токенов экономии = $3.60 за сессию)
  • Если нужно временно отключить грев без смены команды: установи переменную CLAUDE_WARMER_DISABLE=1
  • Инструмент полезен для любого сценария с длинными паузами между запросами — не только Claude Code, но и любой автоматизации поверх Anthropic API, где между ходами возникают паузы дольше 5 минут
← Все статьи