#benchmark

Публикаций: 3

9,9M токенов и всё равно 15%: пределы современных AI-агентов

Команда из 13 исследователей опубликовала Long-Horizon-Terminal-Bench — бенчмарк из 46 длинных терминальных задач. Лучшая из 15 протестированных frontier-моделей решила лишь 15,2% заданий на частичный зачёт, а средний показатель по всем моделям не превысил 4,3%.

GPT-5.6 Luna, Terra, Sol: OpenAI бьёт Claude на агентах

OpenAI вывела в общий доступ GPT-5.6 — три модели с разным соотношением цены и мощности. Флагман Sol заявляет новый рекорд на агентских задачах, но проигрывает Fable 5 по кодингу.

Медицинский тест для LLM: 7000 сценариев от поступления до выписки

Исследователи представили ClinicalMC — первый бенчмарк, проверяющий LLM не в одиночных клинических вопросах, а в полной цепочке госпитализации. Семь тысяч примеров, четыре стадии лечения, мультиагентная симуляция врача, пациента и экзаменатора.

← Все статьи