← Все статьи
2026-09-02 08:05 · 🤖 AI World

Claude Fable 5.1: reasoning на max стоит $3.30 — и это того стоит

1 сентября 2026 года Anthropic выпустила Claude Fable 5.1 с пятью уровнями reasoning и двукратным преимуществом над GPT-5.6 Sol на научном бенчмарке. Инженер Саймон Уиллисон немедленно прогнал её через свой воспроизводимый SVG-тест и обнаружил: зависимость качества от уровня рассуждения не линейна — она скачкообразна.

Claude Fable 5.1: reasoning на max стоит $3.30 — и это того стоит

1 сентября 2026 года Anthropic выпустила Claude Fable 5.1, анонсировав её как новый стандарт для кодинга, научного мышления и сложных долгосрочных задач. Саймон Уиллисон — один из самых внимательных независимых тестировщиков языковых моделей — немедленно прогнал её через свой воспроизводимый SVG-тест: нарисовать пеликана на велосипеде при пяти разных уровнях reasoning. Разница оказалась разительной — и по качеству, и по цене.

Контекст

Fable 5.1 — часть линейки расширенного reasoning от Anthropic. Пять уровней effort: low, medium, high, xhigh, max. Полностью отключить thinking нельзя — в отличие от более ранних версий семейства. На свежем бенчмарке Terminal-Bench-Science 0.1 (анонсирован 27 августа 2026) модель набирает 52.6%. Для сравнения: предыдущий Fable 5 — 24.7%, Opus 5 — 29.0%, GPT-5.6 Sol — 22.4%. Двукратное преимущество над прямыми конкурентами в научном мышлении — цифра, которая говорит сама за себя.

«Пеликановый тест» — неформальный, но воспроизводимый бенчмарк Уиллисона: один промт («Generate an SVG of a pelican riding a bicycle»), одна модель, разные параметры. Автор признаёт, что с 2025 года тест хуже коррелирует с общим качеством моделей, — но сравнения внутри одной семьи по уровням reasoning по-прежнему информативны.

Неожиданная находка: на уровнях low и medium модель, судя по трейсу, не запустила видимого рассуждения вовсе. Low — 1998 токенов, 23.8 секунды, около 10 центов. Medium — 1977 токенов, 23 секунды, около 9.9 цента. Меньше токенов, чем на low, практически идентичный результат. Reasoning как будто решил, что задача не стоит усилий.

Аналитика

Зависимость качества от уровня reasoning — скачкообразная, а не линейная. Между low и high разница почти не ощущается визуально: модель немного больше «думает», результат почти тот же. Между high и xhigh — качественный скачок. xhigh: 36 767 токенов, почти 8 минут, $1.83. max: 65 927 токенов, почти 14 минут, $3.30. Пеликан на max получил голубую шляпку, правильно расставленные ноги на педалях, корзинку с рыбой — лучший результат от Anthropic по этому тесту.

«I'll accept the slight thickness as charming rather than overengineering it» — из reasoning trace на xhigh: модель буквально рассуждает об эстетических компромиссах в SVG-рисунке.

Это поднимает инженерный вопрос: где именно для конкретной задачи находится «точка перехода» — уровень, после которого дополнительные токены дают реальную ценность? Для SVG-генерации она лежит между high и xhigh. Для другой задачи может быть иной или не существовать вовсе. Найти эту точку — уже отдельная компетенция.

Сравнение с Gemini 3.7 Flash неожиданное: Уиллисон честно признаёт, что Gemini выдаёт более стильные SVG. Fable 5.1 на max — технически аккуратный, детализированный, инструктируемый результат. Но не «яркий». Разные оптимизации: одна модель натренирована на точность, другая — на визуальный эффект. Зависит от задачи.

Кейсы применения в бизнесе

B2B SaaS-стартап: если продукт генерирует технические схемы, архитектурные диаграммы или UI-прототипы, Fable 5.1 на уровнях high/xhigh может закрыть целый класс задач. Сценарий — пользователь описывает бизнес-процесс текстом, модель рендерит SVG-диаграмму без участия дизайнера. Цикл «описал → увидел» сокращается с часов до секунд при разумной стоимости на xhigh.

Корпорация с legacy: Terminal-Bench-Science — это про научное и аналитическое мышление. Нефтегаз, фармацевтика, инженерные компании могут применять max-режим для разбора сложных технических отчётов, синтеза данных из нескольких источников, структурирования выводов из многостраничных документов. Разовая задача за $3–5 оправдана, если заменяет несколько часов работы аналитика.

SMB в КР/СНГ: low и medium — доступная автоматизация за копейки. Генерация описаний товаров, простые иллюстрации, ответы на типовые клиентские запросы. Max — для стратегических разовых задач: структурировать бизнес-план, разобрать юридический договор, подготовить тендерную документацию. Разовые $3 при регулярном возврате ROI оправданы даже для малого бизнеса.

Кейсы в личной жизни

Разработчик: подход Уиллисона — готовая методология. Запускаешь одну задачу на разных уровнях, смотришь на разницу в качестве и цене. Для рутинного кода — low. Для сложного рефакторинга, дебага неочевидного бага, генерации нетривиальных тестов — high или xhigh. Выбор уровня reasoning становится такой же компетенцией, как выбор алгоритма.

Контент-мейкер и дизайнер: SVG и анимации — уже не только для специалистов с Figma. Промт на max может дать анимированную иконку, иллюстрацию для поста или баннер для лендинга. Для ежедневного использования дорого, но для ключевых материалов — нормальная инвестиция.

Студент и исследователь: заявленная сила Fable 5.1 — именно scientific reasoning. Разбор академических статей, формулировка гипотез, структурирование литературного обзора — уровень high уже даёт хороший результат без необходимости уходить в max с его 14-минутным ожиданием.

Как применить сегодня

  • Запустите одну реальную задачу на low, затем на xhigh — сравните качество и цену. Это ваш личный калибровочный тест для поиска точки перехода.
  • Для научного и технического анализа тестируйте именно xhigh — по данным теста, именно здесь начинается качественный скачок при разумной стоимости относительно max.
  • Используйте pipe-подход: сначала статичный результат на max, затем передайте его в high с промтом на трансформацию (анимация, переработка, дополнение). Так Уиллисон получил анимированный SVG за $1.37 вместо повторного $3.30-прогона.
  • Стройте свой бенчмарк для своей предметной области: один воспроизводимый промт, несколько уровней reasoning — это даст понимание оптимума стоимость/качество именно для ваших задач.
  • Для задач, где thinking явно не нужен (шаблонные тексты, простая классификация, форматирование), low даёт идентичный результат за долю цены — используйте это.
← Все статьи