← Все статьи
2026-09-05 08:10 · 🤖 AI World

GPT-6 Astra бьёт весь Sol на минимальном reasoning — и дешевле в пересчёте

Simon Willison получил доступ к GPT-6 Astra и сравнил её с семейством GPT-5.6 через неожиданный тест — SVG-рисунок пеликана на велосипеде. Данные оказались интереснее самих картинок.

GPT-6 Astra бьёт весь Sol на минимальном reasoning — и дешевле в пересчёте

Симон Уиллисон получил ранний доступ к GPT-6 Astra и использовал его по-своему: заставил модель нарисовать SVG с пеликаном на велосипеде на пяти уровнях reasoning — low, medium, high, xhigh и max. Astra не поддерживает режим reasoning=none, так что low — это уже «думающий» режим. Рядом поставил результаты GPT-5.6 Sol, Terra и Luna. Получилась сравнительная таблица, в которой количественные данные оказались интереснее самих картинок.

Контекст

OpenAI в 2026 году разворачивает разветвлённый зоопарк моделей с разным позиционированием. GPT-5.6 Sol — основная рабочая лошадь, Terra и Luna — вариации. GPT-6 Astra — следующая ступень с ограниченным доступом. По прайсу Astra выглядит вдвое дороже: $10 за миллион входящих токенов и $50 за исходящие, против $5 и $30 у Sol. Именно это «вдвое» — первое, что отпугивает разработчиков.

Тест с пеликаном — не академический бенчмарк. Генерация SVG вручную требует пространственного мышления: модель должна удерживать когерентную структуру объекта — тело, ноги, велосипед, педали — на протяжении всего вывода в виде координат и path-атрибутов. Это честный прокси для задач layout-генерации, визуальных схем и диаграмм.

Важный фон: уровни reasoning у Astra влияют не только на качество, но и на количество потраченных токенов. Чем выше уровень — тем больше «внутренних шагов» модель делает перед ответом. Это напрямую влияет на реальную стоимость запроса.

Аналитика

Главный вывод теста формулируется так:

Astra low даёт лучший результат, чем любая конфигурация GPT-5.6 Sol на любом уровне reasoning — и стоит 9.55 цента за запрос.

Это разрушает интуицию «дорогая модель — дорогой запрос». Astra тратит существенно меньше токенов на каждом уровне reasoning, что компенсирует разницу в цене за миллион. Реальный cost-gap между моделями оказывается уже, чем следует из ценников. Лучший пеликан Sol (уровень xhigh) по-прежнему выглядит как «набор абстрактных форм» — Astra на любом уровне, включая low, смотрится лучше. Это не итерационный прогресс, а качественный скачок в пространственном понимании.

Есть ещё одна деталь: Astra и Luna использовали по 16 входящих токенов на одинаковый промпт, тогда как Sol и Terra — по 26. Разница стабильная. Это может указывать на схожий токенизатор или близкую архитектуру — то есть Astra и Luna могут быть ближе родственниками, чем следует из официального позиционирования. Если гипотеза верна, Luna — потенциально более доступный прокси для части задач, где не нужен полный GPT-6.

Ограничение, которое стоит держать в уме: даже Astra ниже уровня max нестабильно рисует ноги пеликана с обеих сторон кадра. Max — лучший результат в тесте, но и самый дорогой. Для продакшн-применений вопрос «low или max» остаётся задачей оптимизации под конкретную задачу.

Кейсы применения в бизнесе

B2B-SaaS с автогенерацией визуального контента (диаграммы, SVG-иллюстрации, схемы интерфейсов): переход с Sol xhigh на Astra low даст лучшее качество при сопоставимой или меньшей стоимости на запрос. Конкретная экономия зависит от объёма, но сам принцип — тестировать на реальном трафике, а не на теоретическом прайсе.

Корпорация с устоявшимся стеком на Sol: не переключаться полностью, а провести A/B тест на 5–10% трафика. Особенно там, где качество вывода имеет значение — визуальные отчёты, автоматически генерируемые схемы, презентационные материалы. Данные на собственном трафике убедительнее любого внешнего бенчмарка.

SMB и локальный бизнес в КР/СНГ с ограниченным AI-бюджетом: 9.55 цента за запрос к Astra low — приемлемо для большинства задач малого объёма. Если один качественный запрос заменяет два-три итерационных к Sol с постпроцессингом, выгода очевидна. Доступ через API, тест — вопрос нескольких часов.

Кейсы в личной жизни

Разработчик, работающий с SVG, CSS-анимациями или canvas: тест с пеликаном — прокси для пространственного программирования. Если пишешь инструменты с генерацией визуального кода, Astra low — первый кандидат на быстрый личный тест. Воспроизвести просто: один промпт, два API-вызова.

Контент-мейкер, использующий AI для иллюстраций: SVG — масштабируемый формат без зависимости от image-генераторов. Простые иллюстрации для статей, постов или презентаций через текстовый API — способ получить готовый векторный файл без рендеринга и без отдельного сервиса.

Студент или исследователь, изучающий LLM: наблюдение про 16 vs 26 токенов у разных моделей — пример того, как простой практический тест вскрывает архитектурные детали, которых нет в официальной документации. Воспроизводимые эксперименты такого рода — честный способ понять, как модели реально работают, а не как их описывают в пресс-релизах.

Как применить сегодня

  • Получи доступ к Astra через developer program OpenAI и запусти тот же запрос, что уже идёт к Sol — сравни качество на своей задаче, не на чужом тесте.
  • Посчитай реальный cost/запрос: Astra дороже по прайсу, но тратит меньше токенов. Возьми исторические данные по объёму токенов в своих запросах и пересчитай при новом тарифе.
  • Для задач с пространственным мышлением (SVG, схемы, координаты, layout) — тестируй именно Astra low, не max. По данным теста, низкий уровень reasoning уже даёт значимый прирост качества.
  • Следи за Luna: если гипотеза о близкой архитектуре с Astra верна, это может оказаться более доступным путём к части возможностей GPT-6 — стоит проверить на своих задачах.
  • SVG-тест воспроизводим без сложного окружения: попроси модель нарисовать любой конкретный объект в SVG — быстрый личный бенчмарк на пять минут.
← Все статьи