← Все статьи
2026-07-25 00:02 · 🤖 AI World

MiniCache: как малая модель режет задержку LLM в три раза

Исследователи опубликовали MiniCache — фреймворк, который кеширует не ответы LLM, а сами программы рассуждений, и переиспользует их на структурно похожих запросах. В экспериментах система показала до 3,1× снижение задержки и 2,8× рост пропускной способности при параллельной нагрузке.

MiniCache: как малая модель режет задержку LLM в три раза

3 июля 2026 года на arXiv появился препринт с практически применимой идеей: авторы из нескольких исследовательских групп представили MiniCache — фреймворк кеширования на уровне программ для агентных LLM-систем. Вместо того чтобы каждый раз гнать похожий запрос через дорогую большую модель, система находит структурно идентичную программу в кеше и поручает малой модели лишь подставить новые переменные. На датасетах WebShop, Formula и CodeTAT-QA результат: до 3,1× меньше задержки и 2,8× выше пропускная способность при параллельном обслуживании.

Контекст

LLM-инференс дорог — особенно в агентных пайплайнах, где одна пользовательская задача порождает цепочку из нескольких вызовов модели. Один шаг program-aided reasoning с дорогой frontier-моделью стоит центы; тысячи пользователей в продакшне превращают это в значимую операционную статью. Именно поэтому оптимизация инференса стала одним из самых горячих направлений в AI-инфраструктуре: KV-кеш, speculative decoding, квантизация, дистилляция — всё это попытки сделать большие модели дешевле без жертвы качеством.

MiniCache атакует конкретный паттерн — Program-of-Thought (PoT) reasoning: когда LLM сначала пишет программу (код, структурированный план, шаги вычисления), а потом выполняет её. Это стандарт для агентных систем, RAG-пайплайнов с инструментами, автоматизированного Q&A. Ключевое наблюдение: структурно похожие пользовательские запросы порождают структурно похожие программы. Если программа уже есть в кеше — достаточно извлечь изменившиеся параметры и подставить их, не вызывая большую модель заново.

Авторы препринта — Jingquan Chen, Jinghua Piao, Jie Feng, Shaogang Hu, Yong Li. Работа находится на стадии препринта arXiv (arXiv:2607.20507) и ещё не прошла peer-review, что важно учитывать при оценке заявленных цифр.

Аналитика

Архитектура MiniCache строится на двух ролях малой модели. Первая — извлечение семантических переменных при cache-hit: малая модель разбирает новый запрос и вытаскивает параметры, которые нужно подставить в кешированную программу. Вторая — speculative drafting во время генерации target-LLM: малая модель формирует черновик, большая только проверяет и корректирует. Это архитектурно близко к speculative decoding, но работает на уровне программных объектов, а не отдельных токенов.

Авторы формулируют вывод явно: малые модели наиболее эффективны не как замена большим, а как лёгкий интерфейсный слой. Это то, что опытные практики знают интуитивно — Haiku или компактный open-source LLM на роутинге и классификации, большая модель на сложной генерации. MiniCache формализует этот паттерн в воспроизводимый фреймворк с чёткими точками интеграции.

Для рынка это означает продолжение тренда на гибридные multi-model пайплайны. Провайдеры вроде Fireworks AI, Together AI и Modal уже конкурируют на latency и стоимости токена. Если идеи MiniCache войдут в mainstream-фреймворки — LangChain, LlamaIndex, DSPy — стоимость агентных приложений может упасть кратно без потери функциональности. Крупные игроки (Anthropic, OpenAI, Google) уже встраивают prompt caching на уровне платформы; MiniCache предлагает аналог на уровне приложения.

Кейсы применения в бизнесе

B2B-SaaS стартап с агентными функциями. Если продукт генерирует SQL, Python-код или структурированные запросы по шаблонным задачам пользователей — подход MiniCache применим напрямую. Запрос «посчитай выручку за прошлый месяц по регионам» структурно идентичен запросу «за позапрошлый квартал по категориям». Кешируй PoT-программу однократно, малой моделью извлекай только изменившиеся переменные (период, срез), большую модель вызывай только на cache-miss или нестандартные кейсы. При большом объёме экономия на токенах — кратная.

Корпорация с повторяющимися structured-задачами. Финансовые отчёты, compliance-проверки, юридические резюме — структурно однотипные запросы с разными данными. Архитектура «кеш программы + малая модель для переменных» снижает нагрузку на дорогие enterprise-контракты. Важно: это не требует переписывать систему целиком — достаточно добавить слой перехвата и кеширования перед вызовом target-LLM.

SMB в КР или СНГ с ограниченным AI-бюджетом. Если вы платите за API пропорционально запросам, а пользователи задают похожие вопросы — кеширование программ критично. Определите топ-20 типовых запросов, напишите для них параметрические шаблоны, используйте малую и дешёвую модель для заполнения переменных. Концепция достаточно понятна из препринта, чтобы реализовать её вручную без готовой библиотеки.

Кейсы в личной жизни

Разработчик с агентным ассистентом. Если вы используете Claude Code или аналог для повторяющихся задач — генерации тестов, рефакторинга по паттерну, документации — введите собственный «мягкий кеш»: сохраняйте удачные промпты-программы как шаблоны с явными параметрами. Вместо того чтобы каждый раз объяснять контекст заново — подставляйте переменные в проверенный шаблон. Это ручной MiniCache, работает уже сегодня.

Контент-мейкер с повторяющимися форматами. Скрипты роликов, посты, разборы новостей — у каждого жанра есть структурный скелет. Зафиксируйте его как параметрический шаблон с явными переменными (тема, ключевые факты, тон, аудитория) и меняйте только их. Скорость работы с LLM растёт, качество остаётся стабильным, а расход токенов падает.

Студент или исследователь с задачами анализа данных. Jupyter-нотбуки с LLM-генерацией кода часто повторяют одну и ту же структуру: загрузи → почисти → визуализируй → резюмируй. Параметризуй эту структуру, используй локальный Qwen или Llama для адаптации шаблона к новому датасету. Дорогую frontier-модель вызывай только на финальную интерпретацию результата.

Как применить сегодня

  • Прочитай препринт MiniCache (arXiv:2607.20507) — авторы описывают архитектуру достаточно подробно для самостоятельной реализации за несколько дней.
  • Аудитируй свои LLM-вызовы: какие запросы структурно повторяются? Это кандидаты на кеш программ.
  • Внедри prompt templating с явными переменными: замени «напиши отчёт о продажах за июль» на шаблон с {{период}}, {{срез}}, {{метрики}}.
  • Поставь малую модель на маршрутизацию: Haiku или open-source модель до 7B для классификации запроса и извлечения переменных; большую модель — только на cache-miss и сложные случаи.
  • Отслеживай hit rate кеша и стоимость токенов до и после — это ваша метрика ROI.
← Все статьи