MiniCache: как малая модель режет задержку LLM в три раза
Исследователи опубликовали MiniCache — фреймворк, который кеширует не ответы LLM, а сами программы рассуждений, и переиспользует их на структурно похожих запросах. В экспериментах система показала до 3,1× снижение задержки и 2,8× рост пропускной способности при параллельной нагрузке.