← Все статьи
2026-09-04 17:30 · 🤖 AI World

GPT-6 Astra обогнал людей на ARC-AGI-3: Chollet сдвигает прогноз AGI

GPT-6 Astra от OpenAI получает противоречивые оценки от разных провайдеров бенчмарков — но одна цифра перекрывает всё: модель впервые в истории показала эффективность выше среднего человека на ARC-AGI-3. Создатель теста Франсуа Шолле не называет это AGI, зато сдвигает свой прогноз вперёд.

GPT-6 Astra обогнал людей на ARC-AGI-3: Chollet сдвигает прогноз AGI

GPT-6 Astra от OpenAI рисует два совершенно разных портрета в зависимости от того, кто смотрит. Epoch AI ставит модель на первое место с результатом 169 баллов. Artificial Analysis не видит прогресса относительно предшественника и располагает Astra ниже Claude Fable 5.1 от Anthropic. Но вся эта полемика блекнет на фоне одного факта: на тесте ARC-AGI-3 языковая модель впервые оказалась эффективнее среднего человека — и это сдвинуло горизонт AGI для самого скептичного наблюдателя в индустрии.

Контекст

ARC-AGI (Abstraction and Reasoning Corpus) — тест, который Франсуа Шолле создавал с одной целью: сломать логику языковых моделей, которые берут бенчмарки не интеллектом, а масштабом обучающей выборки. Задача строится так: показать несколько примеров паттерна, вывести правило, применить к новому случаю. Люди делают это интуитивно. Модели до последнего времени — нет, или справлялись медленнее и с большими ресурсами. ARC-AGI-3 — следующая, принципиально более трудная итерация.

ARC Prize — это не просто конкурс с денежным призом. Это публичная ставка Шолле на то, что нынешние архитектуры упрутся в потолок именно здесь. Именно поэтому его слова имеют вес: он не комментатор со стороны, а человек, который проектировал барьер. Когда он говорит, что прогресс идёт быстрее ожидаемого — это признание, что барьер ломается.

Расхождение Epoch AI и Artificial Analysis в оценке Astra — отдельная история. Оба игрока уважаемы в пространстве независимых оценок LLM, и оба правы в своих рамках. Один агрегирует широкий набор задач, другой фокусируется на определённых профилях нагрузки. Противоречие указывает на фундаментальный сдвиг: моделей, которые «лучше на всём», больше нет. Есть модели с профилями — и правильный выбор зависит от конкретной задачи.

Аналитика

Главное в этой новости — не рейтинг. Главное, что ARC-AGI-3 — один из немногих тестов, специально разработанных против насыщенного обучения. Преодолеть его за счёт одного лишь масштаба данных нельзя. Если модель обгоняет человека по эффективности именно здесь, речь идёт о качественно другом типе прогресса, чем очередной MMLU или HumanEval.

Шолле видит прогресс «вдвое быстрее» ожидаемого — и сдвигает свой AGI-прогноз вперёд. При этом явно оговаривается: эффективность выше человеческой на одном тесте — не доказательство AGI.

Это разграничение важно. Шолле не объявляет победу — он обновляет калибровку. Для индустрии это означает: компании, строившие стратегию на «AGI ещё далеко», получают новые данные для пересчёта горизонтов планирования. Окно для неспешных экспериментов сужается — не потому что AGI завтра, а потому что прогресс инструментов идёт быстрее, чем большинство закладывало в дорожные карты.

Параллельно расхождение бенчмарков даёт практический сигнал для разработчиков продуктов: выбор модели по «общему первому месту» — устаревший подход. Нужен model-router, который выбирает инструмент по профилю задачи: агентный цикл, генерация кода, классификация, рассуждение — везде оптимальная модель своя.

Кейсы применения в бизнесе

B2B-SaaS стартап, строящий агентный продукт: расхождение Epoch AI и Artificial Analysis — прямой повод запустить внутреннее A/B-тестирование на реальных задачах продукта. Не «кто первый в рейтинге», а «какая модель лучше на нашем конкретном рабочем цикле» — с реальными пользователями и реальными ошибками. Внедрить model-router: переключение между GPT-6 Astra, Claude Fable 5.1 и более лёгкими моделями в зависимости от типа запроса. Это снижает стоимость и повышает качество одновременно.

Корпорация с legacy-инфраструктурой: прогресс на ARC-AGI-3 и сдвиг прогноза Шолле — аргумент для внутреннего разговора об ускорении AI-пилотов. Компании, которые не начали автоматизацию реальных процессов сейчас, через год будут догонять. Конкретный шаг: взять один процесс с высокой долей ручного рассуждения (анализ договоров, классификация обращений, подготовка отчётов) и запустить пилот с измеримым KPI за 4 недели.

SMB и локальный бизнес в КР/СНГ: из этой новости следует одно практическое правило — не ждать «финальной» модели. Инструменты уже достаточно мощные для автоматизации реальных задач: обработка входящих запросов, черновики документов, базовая аналитика. Начинать нужно не с выбора «лучшей модели», а с выбора первого процесса — и запустить его за неделю.

Кейсы в личной жизни

Разработчик: бенчмарки расходятся — значит, пришло время провести личный тест. Взять три реальные задачи из рабочей недели (debugging, код-ревью, генерация тестов), прогнать через GPT-6 Astra и Claude Fable 5.1 с одинаковым промптом, зафиксировать разницу в качестве и скорости. Персональный бенчмарк надёжнее любого публичного рейтинга.

Контент-мейкер и студент: тема ARC-AGI-3 — готовый крючок для материала. Объяснить аудитории, что такое AGI-тест и почему он отличается от обычных бенчмарков — это контент, который будет актуален минимум год. Студентам — изучить описание ARC Prize и разобраться, как строятся задачи; это прокачивает понимание того, как AI думает (и где не думает).

Фрилансер: прогресс на задачах абстрактного рассуждения означает, что AI уже сейчас справляется с анализом ТЗ, выявлением противоречий в требованиях, структурированием предложений клиентам. Делегировать эти части проекта модели — не риск, а рычаг: освобождённое время идёт на то, что AI ещё не умеет — переговоры, доверие, контекст отношений.

Как применить сегодня

  • Найти страницу ARC Prize и самостоятельно попробовать несколько задач ARC-AGI — чтобы понять, что именно измеряется и почему прогресс здесь важнее MMLU.
  • При выборе модели для продукта — сверять сразу два источника (Epoch AI и Artificial Analysis), искать расхождения и понять, какой профиль ближе к вашей задаче.
  • Запустить личный мини-тест: 5 реальных задач из рабочей недели, одинаковый промпт, несколько моделей. Зафиксировать, где разница ощутима.
  • Если в продукте ещё нет model-router — это хороший момент его проектировать. Выбор модели «по умолчанию» стоит денег и качества одновременно.
  • Следить за публичными высказываниями Шолле по ARC-AGI — он ведёт последовательный публичный дневник ожиданий по AGI, и это один из лучших ориентиров для калибровки горизонтов в индустрии.
← Все статьи