← Все статьи
2026-07-23 06:06 · 🤖 AI World

Читерят ли AI-лабы с бенчмарками: тест на пеликане

Исследователь Дилан Кастильо провёл масштабный эксперимент, чтобы выяснить, не натренированы ли топовые AI-модели специально рисовать пеликана на велосипеде лучше всего остального. Вопрос кажется абсурдным — до тех пор, пока не понимаешь, что стоит за ним.

Читерят ли AI-лабы с бенчмарками: тест на пеликане

У Саймона Уиллисона есть неформальный бенчмарк: попросить модель нарисовать пеликана на велосипеде. Несерьёзно звучит. Но вопрос, который вырастает из этого мема, — вполне серьёзный. Не стали ли AI-лабы целенаправленно оптимизировать модели именно под этот промпт, зная, что Уиллисон его использует? Дилан Кастильо решил проверить это методично, а не на глаз.

Контекст

Саймон Уиллисон — один из самых уважаемых независимых исследователей в AI-сообществе. Несколько лет назад он начал использовать промпт «нарисуй пеликана на велосипеде» как быстрый неформальный тест при выходе новой модели: оценить качество генерации, стиль, способность модели работать с необычной комбинацией объектов. Неожиданно это превратилось в культурный мем внутри AI-сообщества.

Феномен benchmaxxing — намеренная оптимизация моделей под конкретные тесты — давно обсуждается как системная проблема индустрии. Стандартные бенчмарки MMLU, HumanEval и им подобные уже под подозрением: если лаба знает, какие задания используются при оценке, соблазн натренировать под них высок. Pelicanmaxxing — буквальный частный случай: не сделали ли так с пеликаном на велосипеде?

Для проверки Кастильо выстроил матрицу: 8 животных × 6 транспортных средств = 48 промптов, каждый прогнан трижды через 7 моделей — GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 и DeepSeek V4 Pro. Для оценки результатов привлёк GPT-5.6 Luna и Gemini 3.1 Flash-Lite. Это уже не эксперимент на коленке — это воспроизводимое исследование с чётким протоколом.

Аналитика

Результат однозначный: никаких признаков pelicanmaxxing. Пеликаны нарисованы не лучше других животных. Велосипеды — не лучше других транспортных средств. Комбинация «пеликан + велосипед» не показывает аномально высокое качество относительно того, что предсказывает общее мастерство модели с каждым элементом по отдельности. Единственный нюанс — GLM-5.2 показал самый заметный относительный буст именно в ячейке «пеликан-велосипед», но эффект незначительный и не воспроизводится стабильно.

Почему это важно за рамками шутки? Потому что если бы читерство обнаружилось — это было бы косвенным свидетельством системной проблемы с доверием ко всем остальным публичным бенчмаркам. Пеликан был удобной «канарейкой в шахте»: нет официального протокола, нет leaderboard, нет стимула оптимизировать — кроме как если лаба действительно мониторит контент конкретного исследователя. Чистый результат здесь не снимает вопросы к другим тестам, но показывает: хотя бы в этом случае лабы не играли грязно.

Более широкий урок: сообщество, которое самостоятельно проводит строгие независимые эксперименты, ценнее любой маркетинговой цифры от самих лаб. Такие работы создают реальную подотчётность — не через регуляторов, а через публичную воспроизводимую проверку. Это именно та культура, которая должна масштабироваться.

Кейсы применения в бизнесе

B2B-SaaS стартап: Если выбираете модель для генерации изображений в продукте — не доверяйте только официальным бенчмаркам. Создайте собственную матрицу из реальных промптов вашего юзкейса: 15-20 вариаций × 3-4 модели × 2-3 прогона. Методика Кастильо — готовый шаблон. Займёт день, сэкономит месяцы неправильного выбора инфраструктуры.

Корпорация с legacy: При тендере на AI-инструменты в компаниях часто выбирают «наиболее высокооцененную по публичным бенчмаркам» модель. Практичнее: составить внутренний набор из 20-30 реальных задач компании и прогнать всех кандидатов через него независимо. Это единственный способ получить честный ответ применительно к вашим данным.

SMB и локальный бизнес в КР/СНГ: Когда подрядчик или агентство предлагает «лучшую AI-модель» — спросите, по каким тестам и кто их проводил. Независимые исследования вроде этого показывают: маркетинговые заявления и реальные результаты на конкретных задачах расходятся. Попросите демо на ваших реальных документах или визуальных материалах — не на «пеликанах».

Кейсы в личной жизни

Разработчик: Методика эксперимента — отличный шаблон для собственных оценок при выборе модели: матрица вариаций × несколько моделей × несколько прогонов, автоматическая оценка через отдельную модель-судью. Можно применять к любому AI-инструменту, который интегрируешь в рабочий стек.

Контент-мейкер: Если используешь AI для генерации визуального контента, тест пеликана показывает: качество модели на отдельных элементах хорошо предсказывает качество их комбинации. Перед сменой инструмента прогони 5-10 промптов с реальными комбинациями объектов из своих задач — и сравни.

Студент или исследователь: Работа Кастильо — пример правильно сформулированной гипотезы и её воспроизводимой проверки: чёткий вопрос, контролируемая матрица, независимая оценка. Хороший образец того, как оформлять собственные AI-эксперименты в формат, на который можно ссылаться.

Как применить сегодня

  • Перед выбором AI-модели для своего кейса: составь матрицу из 10-20 реальных промптов × 3-5 моделей, прогони каждый 2-3 раза — используй другую модель как судью для оценки результатов.
  • Не полагайся только на бенчмарки от самих лабов — ищи независимые тесты на реальных задачах. Блог Саймона Уиллисона — один из самых полезных ресурсов такого рода.
  • Внедри «канарейковые» промпты в свой процесс: специфические запросы, не засвеченные в публичных тестах, и тестируй на них модели при каждом обновлении.
  • Если используешь несколько AI-моделей — применяй их для взаимной оценки (паттерн из исследования: GPT оценивает результаты Gemini и наоборот).
  • Скептицизм к бенчмаркам — правильная стратегия. Отсутствие читерства в одном тесте не означает отсутствия проблем с другими. Собственный тест на реальных задачах всегда честнее чужого.
← Все статьи