#агентные системы

Публикаций: 3

Агенты без отделов: что показал benchmark 45 биотех-кейсов

Исследователь Yinan Wang опубликовал на arXiv работу с неудобным вопросом: если AI-нативная компания строится из агентов — зачем ей копировать человеческий оргчарт? Benchmark из 45 ретроспективных биотех-кейсов показывает: архитектура с общей моделью «актив → ценность» обходит имитацию отделов — с важными оговорками.

Как мульти-агентная рефлексия штурмует барьер ARC-AGI-2

ARCANA — фреймворк из arXiv (10 июля 2026), где четыре специализированных агента совместно решают задачи ARC-AGI-2, учась на собственных провалах через общую «доску» и мета-контроллер. Это прямая атака на бенчмарк, который давно считается барьером между паттерн-матчингом и настоящим абстрактным мышлением.

6000 попыток взломать AI-ассистент — никто не прошёл

Разработчик открыл публичный вызов: взломайте AI-агента через обычную почту и заставьте слить секреты. 2000+ участников, 6000 попыток, $500 токенов — ни одной утечки.

← Все статьи