TryAI запустили drawing arena: четыре модели — GPT-5.6 Sol, Claude Fable 5, Grok 4.5 и Gemini 3.6 Flash — получили одинаковый инструментарий цветного карандаша (цвет, ширина кисти, давление, штрихи, размытие, ластик) и задание нарисовать с нуля Мону Лизу и «Звёздную ночь» Ван Гога. Всего 28 рисунков: два целевых — с объективной оценкой по метрике SSIM — и пять по открытым текстовым промптам на каждую модель. Один победитель, один полный провал, разрыв в цене — в 20 раз.
Контекст
TryAI регулярно запускают задачи с намеренно нечёткими условиями — без единственно правильного ответа. Прошлый тест был про создание музыкальных видео. Этот — про рисование. Авторы прямо говорят: не проверка художественных способностей, а способ увидеть, как модели ведут себя в открытых многошаговых задачах, где бенчмарк ничего не покажет.
Каждая модель получила семь рисунков: два по целевым изображениям (SSIM — метрика структурного сходства, от 0 до 1) и пять по промптам без эталона: пожилой рыбак в закатном свете, закат над океаном, красная роза в стеклянной вазе, спящий кот на подоконнике, уютная каюта с камином. Инструментарий одинаков: plan (скрэтчпад), view_target, view_canvas, draw, smudge, erase, set_color / set_brush / set_pressure.
Полный agentic loop без ручного вмешательства: нарисовал → посмотрел на холст → переоценил → скорректировал → нарисовал снова. Каждый вызов view_canvas пересчитывал SSIM, то есть модель видела свой прогресс в реальном времени. Харнесс open source.
Аналитика
Главный вывод — не рейтинг качества, а то, как модели по-разному обращаются с одним инструментарием. GPT-5.6 Sol ни разу не вызвал set_color, set_brush или set_pressure отдельно — встраивал параметры прямо в каждый вызов draw. Компактно, без лишних ходов. Итог: $7.74 за семь рисунков, лучший результат по качеству в большинстве категорий, авторы назвали его «runaway leader».
Claude Fable 5 сделал 123 вызова smudge, постоянно просматривал холст — и всё равно проиграл GPT-5.6 при стоимости $160. Авторы сразу оговариваются: Fable бил GPT-5.6 в других тестах, включая задачу с музыкальными видео. Но на этом конкретном сценарии соотношение цена/результат катастрофическое. Grok 4.5 направил 65% из 1349 вызовов на смену параметров — менял цвет и кисть чаще, чем рисовал. Итог: почти ни один рисунок не вышел пригодным. Прямая цитата авторов: «basically garbage here».
Gemini 3.6 Flash оказался лучше Grok при стоимости $12.87 и показал наивысший SSIM по Моне Лизе во всём батче — пик 0.449. Но к финалу откатился до 0.337. Это подводит к ключевому паттерну, проявившемуся у всех четырёх: модели перередактировали свои лучшие работы. Пик достигается примерно на пятом просмотре, потом модель продолжает вносить правки — и ухудшает итог. GPT-5.6 Sol на Моне Лизе: пик SSIM 0.352, финал 0.325. Gemini Flash: пик 0.449, финал 0.337. Больше просмотров не равно лучший результат. У нынешних моделей нет надёжного внутреннего stopping criterion.
Кейсы применения в бизнесе
B2B-SaaS стартап с дизайн-потребностями. GPT-5.6 Sol и Gemini Flash уже сейчас можно подключить как агентов для генерации черновых иллюстраций, иконок или UI-скетчей прямо внутри пайплайна разработки. Стоимость одной сессии — единицы долларов. Это не замена дизайнеру, но быстрый способ получить визуальный черновик для согласования с командой без открытия Figma.
Корпорация с бюджетным контролем на AI-инструменты. Разница $7.74 против $160 становится критичной, когда задача требует сотен итераций — например, автоматическая генерация иллюстраций для отчётов или презентаций. Оптимальная стратегия: GPT-5.6 или Gemini Flash для итеративных визуальных задач; Fable 5 — только там, где нужна глубина рассуждений на единичных запросах, где стоимость шага некритична.
SMB и локальный бизнес (КР/СНГ). Для иллюстраций к соцсетям, рекламным материалам или оформлению продукта agentic-рисование через GPT-5.6 Sol — рабочий инструмент при ограниченном бюджете на дизайн. Сценарий: дать промпт с описанием стиля и фирменными цветами, запустить 10–15 итераций, выбрать лучший кадр до того, как модель начнёт регрессировать.
Кейсы в личной жизни
Разработчик. Разверни canvas-arena локально и запусти тест на своей модели или API. Это практичный способ измерить реальное agentic-поведение: сколько вызовов, какие паттерны использования инструментов, где модель уходит в петлю. Бенчмарк ничего этого не покажет.
Контент-мейкер или YouTuber на AI-тематике. Запусти GPT-5.6 Sol на простой промпт, запиши процесс и покажи progress-timelapse — как модель строит изображение шаг за шагом, ошибается, корректирует. Аудитории это заходит лучше, чем очередной скриншот из чата: видно живое agentic-поведение.
Студент или исследователь. Паттерн plateau + regression — открытый вопрос. Почему модели не останавливаются в точке пика? Это артефакт промпта, отсутствие stopping criterion или системная особенность обучения? Готовый open-source харнесс даёт хорошую экспериментальную базу для проверки гипотез без написания инфраструктуры с нуля.
Как применить сегодня
- Для визуальных agentic-задач стартуй с GPT-5.6 Sol — лучший результат при минимальной стоимости ($7.74 за семь рисунков по тесту).
- При выборе модели для итеративного пайплайна смотри на cost-per-step, а не только на качество одного ответа. Claude Fable 5 в ~20 раз дороже — на визуальных итеративных задачах это не оправдано.
- Добавляй early-stop в любой agentic-цикл с обратной связью: все четыре модели ухудшали финальный результат после достижения пика. Ограничь число итераций или задай порог метрики качества.
- Grok 4.5 — пока не для визуальных agentic-задач с инструментами: слишком много overhead на смену параметров, слишком мало реального рисования.
- Gemini 3.6 Flash — хорошая альтернатива при чуть большем бюджете ($12.87), особенно по скорости вывода токенов. Но учитывай regression: финальный результат стабильно ниже пика.