#оценка моделей

Публикаций: 2

SWE-Bench сломан на 30%: OpenAI отзывает доверие к главному тесту кодинга

OpenAI проверил SWE-Bench Pro — де-факто стандарт для измерения навыков AI в программировании — и нашёл серьёзный изъян: около 30% задач оказались некорректными. Компания публично отозвала своё прежнее одобрение бенчмарка, поставив под сомнение достоверность многочисленных рейтингов и сравнений моделей.

DeepSeek сам выбирал тесты. NIST выбрал другие — и разрыв вырос вдвое

DeepSeek V4 Pro заявила об отставании от американских моделей на 3–6 месяцев. NIST провёл независимый аудит на закрытых бенчмарках — и насчитал минимум 8 месяцев.

← Все статьи