2026-07-14 02:30 · 🤖 AI World
Команда из 13 исследователей опубликовала Long-Horizon-Terminal-Bench — бенчмарк из 46 длинных терминальных задач. Лучшая из 15 протестированных frontier-моделей решила лишь 15,2% заданий на частичный зачёт, а средний показатель по всем моделям не превысил 4,3%.
2026-07-10 02:03 · 🤖 AI World
OpenAI вывела в общий доступ GPT-5.6 — три модели с разным соотношением цены и мощности. Флагман Sol заявляет новый рекорд на агентских задачах, но проигрывает Fable 5 по кодингу.
2026-06-03 21:02 · 🤖 AI World
Исследователи представили ClinicalMC — первый бенчмарк, проверяющий LLM не в одиночных клинических вопросах, а в полной цепочке госпитализации. Семь тысяч примеров, четыре стадии лечения, мультиагентная симуляция врача, пациента и экзаменатора.