3 июля 2026 года на arXiv появился препринт с практически применимой идеей: авторы из нескольких исследовательских групп представили MiniCache — фреймворк кеширования на уровне программ для агентных LLM-систем. Вместо того чтобы каждый раз гнать похожий запрос через дорогую большую модель, система находит структурно идентичную программу в кеше и поручает малой модели лишь подставить новые переменные. На датасетах WebShop, Formula и CodeTAT-QA результат: до 3,1× меньше задержки и 2,8× выше пропускная способность при параллельном обслуживании.
Контекст
LLM-инференс дорог — особенно в агентных пайплайнах, где одна пользовательская задача порождает цепочку из нескольких вызовов модели. Один шаг program-aided reasoning с дорогой frontier-моделью стоит центы; тысячи пользователей в продакшне превращают это в значимую операционную статью. Именно поэтому оптимизация инференса стала одним из самых горячих направлений в AI-инфраструктуре: KV-кеш, speculative decoding, квантизация, дистилляция — всё это попытки сделать большие модели дешевле без жертвы качеством.
MiniCache атакует конкретный паттерн — Program-of-Thought (PoT) reasoning: когда LLM сначала пишет программу (код, структурированный план, шаги вычисления), а потом выполняет её. Это стандарт для агентных систем, RAG-пайплайнов с инструментами, автоматизированного Q&A. Ключевое наблюдение: структурно похожие пользовательские запросы порождают структурно похожие программы. Если программа уже есть в кеше — достаточно извлечь изменившиеся параметры и подставить их, не вызывая большую модель заново.
Авторы препринта — Jingquan Chen, Jinghua Piao, Jie Feng, Shaogang Hu, Yong Li. Работа находится на стадии препринта arXiv (arXiv:2607.20507) и ещё не прошла peer-review, что важно учитывать при оценке заявленных цифр.
Аналитика
Архитектура MiniCache строится на двух ролях малой модели. Первая — извлечение семантических переменных при cache-hit: малая модель разбирает новый запрос и вытаскивает параметры, которые нужно подставить в кешированную программу. Вторая — speculative drafting во время генерации target-LLM: малая модель формирует черновик, большая только проверяет и корректирует. Это архитектурно близко к speculative decoding, но работает на уровне программных объектов, а не отдельных токенов.
Авторы формулируют вывод явно: малые модели наиболее эффективны не как замена большим, а как лёгкий интерфейсный слой. Это то, что опытные практики знают интуитивно — Haiku или компактный open-source LLM на роутинге и классификации, большая модель на сложной генерации. MiniCache формализует этот паттерн в воспроизводимый фреймворк с чёткими точками интеграции.
Для рынка это означает продолжение тренда на гибридные multi-model пайплайны. Провайдеры вроде Fireworks AI, Together AI и Modal уже конкурируют на latency и стоимости токена. Если идеи MiniCache войдут в mainstream-фреймворки — LangChain, LlamaIndex, DSPy — стоимость агентных приложений может упасть кратно без потери функциональности. Крупные игроки (Anthropic, OpenAI, Google) уже встраивают prompt caching на уровне платформы; MiniCache предлагает аналог на уровне приложения.
Кейсы применения в бизнесе
B2B-SaaS стартап с агентными функциями. Если продукт генерирует SQL, Python-код или структурированные запросы по шаблонным задачам пользователей — подход MiniCache применим напрямую. Запрос «посчитай выручку за прошлый месяц по регионам» структурно идентичен запросу «за позапрошлый квартал по категориям». Кешируй PoT-программу однократно, малой моделью извлекай только изменившиеся переменные (период, срез), большую модель вызывай только на cache-miss или нестандартные кейсы. При большом объёме экономия на токенах — кратная.
Корпорация с повторяющимися structured-задачами. Финансовые отчёты, compliance-проверки, юридические резюме — структурно однотипные запросы с разными данными. Архитектура «кеш программы + малая модель для переменных» снижает нагрузку на дорогие enterprise-контракты. Важно: это не требует переписывать систему целиком — достаточно добавить слой перехвата и кеширования перед вызовом target-LLM.
SMB в КР или СНГ с ограниченным AI-бюджетом. Если вы платите за API пропорционально запросам, а пользователи задают похожие вопросы — кеширование программ критично. Определите топ-20 типовых запросов, напишите для них параметрические шаблоны, используйте малую и дешёвую модель для заполнения переменных. Концепция достаточно понятна из препринта, чтобы реализовать её вручную без готовой библиотеки.
Кейсы в личной жизни
Разработчик с агентным ассистентом. Если вы используете Claude Code или аналог для повторяющихся задач — генерации тестов, рефакторинга по паттерну, документации — введите собственный «мягкий кеш»: сохраняйте удачные промпты-программы как шаблоны с явными параметрами. Вместо того чтобы каждый раз объяснять контекст заново — подставляйте переменные в проверенный шаблон. Это ручной MiniCache, работает уже сегодня.
Контент-мейкер с повторяющимися форматами. Скрипты роликов, посты, разборы новостей — у каждого жанра есть структурный скелет. Зафиксируйте его как параметрический шаблон с явными переменными (тема, ключевые факты, тон, аудитория) и меняйте только их. Скорость работы с LLM растёт, качество остаётся стабильным, а расход токенов падает.
Студент или исследователь с задачами анализа данных. Jupyter-нотбуки с LLM-генерацией кода часто повторяют одну и ту же структуру: загрузи → почисти → визуализируй → резюмируй. Параметризуй эту структуру, используй локальный Qwen или Llama для адаптации шаблона к новому датасету. Дорогую frontier-модель вызывай только на финальную интерпретацию результата.
Как применить сегодня
- Прочитай препринт MiniCache (arXiv:2607.20507) — авторы описывают архитектуру достаточно подробно для самостоятельной реализации за несколько дней.
- Аудитируй свои LLM-вызовы: какие запросы структурно повторяются? Это кандидаты на кеш программ.
- Внедри prompt templating с явными переменными: замени «напиши отчёт о продажах за июль» на шаблон с
{{период}},{{срез}},{{метрики}}. - Поставь малую модель на маршрутизацию: Haiku или open-source модель до 7B для классификации запроса и извлечения переменных; большую модель — только на cache-miss и сложные случаи.
- Отслеживай hit rate кеша и стоимость токенов до и после — это ваша метрика ROI.