#мульти-агенты

Публикаций: 9

Мульти-агентный QA: шесть ИИ вместо тест-менеджера — 340% ROI за 9 месяцев

Исследовательская группа представила AINTMA — архитектуру из шести специализированных AI-агентов, которые автономно закрывают весь цикл тест-менеджмента. На 12 реальных проектах за 18 месяцев: дефект-рейт упал с 8.3% до 2.1%, цикл тестов сократился на 43%, ROI — 340% за девять месяцев.

Мульти-агентный дебат в юриспруденции: больше раундов — хуже

Шесть исследователей протестировали multi-agent debate в юридических задачах и обнаружили парадокс: пул из нескольких агентов бьёт одиночного на 8%, но при увеличении числа раундов агенты начинают подкреплять ошибки друг друга. Работа получила Outstanding Paper на AI4Law Workshop в рамках ICML 2026.

Как мульти-агентная рефлексия штурмует барьер ARC-AGI-2

ARCANA — фреймворк из arXiv (10 июля 2026), где четыре специализированных агента совместно решают задачи ARC-AGI-2, учась на собственных провалах через общую «доску» и мета-контроллер. Это прямая атака на бенчмарк, который давно считается барьером между паттерн-матчингом и настоящим абстрактным мышлением.

GATS: агентное планирование без LLM-вызовов при 100% надёжности

GATS — фреймворк, который убирает вызовы LLM из цикла планирования агента целиком. На стресс-тесте из 12 сценариев — 100% успех против 23,9% у ReAct и 88,9% у LATS, при нулевом inference-cost в runtime.

GPT-5.6 Sol Ultra закрыл математическую гипотезу за час вместо 50 лет

GPT-5.6 Sol Ultra — новая модель OpenAI — за час построил доказательство Гипотезы о двойном цикловом покрытии, которая оставалась открытой 50 лет. Параллельно работали 64 субагента — и главный вопрос уже не в математике, а в том, что это значит для будущего AI-рассуждений.

Datasette 1.0: Claude — план, GPT — код, результат — за день

Simon Willison выпустил Datasette 1.0a33 — ключевой шаг к стабильному релизу. И показал на практике: кастомный API-инструмент можно собрать силами двух моделей за несколько часов, разделив между ними планирование и реализацию.

Claude Opus 4.8 обходит GPT-5.5 и запускает сотни агентов параллельно

Anthropic выпустила Claude Opus 4.8 — флагман, который по большинству бенчмарков опережает GPT-5.5 и Gemini 3.1 Pro. Вместе с моделью пришли dynamic workflows: механизм параллельного запуска сотен суб-агентов для задач вроде миграции целых кодовых баз.

AiHub: как компания из Бишкека отдала операционку агентам и закрыла 4 контракта за месяц

Обзор AI-first проекта из Кыргызстана, где мульти-агентная система закрывает маркетинг, поддержку, контент и клиентские разработки. Интересно не то, что используют ИИ — а то, в каких кратностях эта ставка окупается.

Мульти-агенты ИИ отсекают ложные тревоги в мониторинге пациентов

Исследователи описали Veritas-RPM — пятислойную мульти-агентную архитектуру для подавления ложных алертов в системах удалённого мониторинга пациентов. 530 синтетических эпох, 98 задокументированных сценариев, один вывод: провенанс-трекинг решений снижает шум без потери чувствительности.

← Все статьи