Короткий выбор выглядит так:
- Claude Fable 5 стоит проверять первым на самых трудных и длительных задачах, где один неверный результат обходится дороже токенов.
- GPT-5.6 Sol — практичная отправная точка, когда нужна почти предельная способность модели, но важна экономика каждого запуска.
- Gemini 3.6 Flash — первый кандидат для высокой пропускной способности, мультимодальных данных и массовой обработки.
Это не пьедестал. Побеждает модель, которая на ваших входных данных стабильно проходит заранее заданный порог качества при приемлемой стоимости и времени.
Сначала сравните условия, а не рекламные баллы
На 6 августа 2026 года у всех трёх моделей контекстное окно около миллиона токенов, но различаются тарифы, максимальный ответ, типы входа и поведение API.
| Параметр | GPT-5.6 Sol | Claude Fable 5 | Gemini 3.6 Flash |
|---|---|---|---|
| Официальный ID | gpt-5.6-sol; gpt-5.6 — alias | claude-fable-5 | gemini-3.6-flash |
| Ввод / вывод за 1 млн токенов | $5 / $30 | $10 / $50 | $1,50 / $7,50 |
| Контекст | 1 050 000 | 1 000 000 | 1 048 576 |
| Максимальный вывод | 128 000 | 128 000 | 65 536 |
| Основные входы | текст, изображения | текст, изображения, документы | текст, изображения, видео, аудио, PDF |
| Рассуждение | настраиваемый effort | adaptive thinking всегда включён | thinking поддерживается, default — medium |
| Важная ветка обработки | длинный ввод может стоить дороже | refusal может прийти с HTTP 200 | thinking входит в output billing; инструменты могут тарифицироваться отдельно |
Характеристики проверены по странице Sol у OpenAI, руководству Anthropic по Fable 5 и карточке Gemini 3.6 Flash. Это базовые цены официальных API в долларах США, а не стоимость подписок. Налоги, marketplace, priority, batch, cache и инструменты меняют итог.
Большое окно не гарантирует хорошую работу со всем объёмом. Важны структура контекста, позиция инструкции, история инструментов и резерв вывода. Миллион нерелевантных токенов может сделать задачу дороже и менее точной.

Где каждая модель оправдывает свою цену
Fable 5 — когда запас качества важнее тарифа
Anthropic рекомендует Fable 5 для самых сложных продолжительных задач в программировании и интеллектуальной работе. Контекст 1M, вывод до 128k и постоянно включённое адаптивное рассуждение подходят для крупных миграций, многоэтапного исследования, анализа массивов документов и агентов, которые должны долго планировать и перепроверять работу.
Тариф $10/$50 — самый высокий в тройке. Переплата оправдана, если пропущенное требование, неправильная архитектура или повторная ручная проверка дороже разницы в счёте API.
Интеграция обязана распознавать отказ. У Fable классификатор может вернуть HTTP 200 и stop_reason: "refusal". Это не готовый результат и не транспортная ошибка. Нужна отдельная ветка: безопасно сузить запрос, отправить человеку или вызвать разрешённую резервную модель.
Sol — баланс frontier-уровня и затрат
GPT-5.6 Sol стоит $5/$30. Модель принимает текст и изображения, а через Responses API поддерживает поиск, работу с файлами, code interpreter, hosted shell, computer use, MCP и другие инструменты. Их фактическая доступность зависит от endpoint, аккаунта и политики.
Sol логично начинать с трудных coding-agent задач, профессионального анализа и длинных инструментальных процессов, которые нужно масштабировать. Базовый тариф заметно ниже Fable, а независимый комплексный индекс ставит их рядом. Это делает Sol сильным default-кандидатом, но не гарантирует победу на конкретном репозитории.
Для ввода больше 272k токенов OpenAI указывает повышающий коэффициент. До смены модели удалите лишние файлы, настройте поиск и сократите историю инструментов: это часто полезнее, чем оплачивать весь архив в каждом запросе.
Gemini 3.6 Flash — скорость, разные форматы и массовые операции
Стандартный платный Gemini API оценивает Flash в $1,50/$7,50. На вход можно передавать текст, изображения, видео, аудио и PDF; на выходе — текст. Поддерживаются function calling, code execution, file search, URL context, Search/Maps grounding, structured output и computer use в preview.
Эта комбинация подходит для обработки медиа, извлечения из документов, классификации, быстрых агентных циклов и маршрута «дешёвая модель обрабатывает всё, сложные случаи уходят наверх». Максимальный ответ 65 536 токенов — ниже 128k у Sol и Fable; для очень длинного единого документа это реальное ограничение.
Flash необязательно должен выиграть общий рейтинг. Достаточно пройти ваш порог качества быстрее и дешевле.
Посчитайте стоимость принятого результата
Предположим, одна попытка использует 100 000 входных и 20 000 выходных токенов. Без cache, tools, повторов и специальных режимов:
textстоимость попытки = вход / 1 000 000 × тариф входа + выход / 1 000 000 × тариф выхода
| Модель | Расчёт | Базовая попытка |
|---|---|---|
| GPT-5.6 Sol | 0,1 × $5 + 0,02 × $30 | $1,10 |
| Claude Fable 5 | 0,1 × $10 + 0,02 × $50 | $2,00 |
| Gemini 3.6 Flash | 0,1 × $1,50 + 0,02 × $7,50 | $0,30 |
Равный объём токенов — только начало. В производстве учитывайте рассуждение и фактический вывод, запись и чтение cache, платные инструменты, длинный контекст, timeout, отказ, невалидный JSON, повтор и ручную проверку.
textстоимость успешной задачи = (все попытки + инструменты + проверка человеком) / принятые результаты
Если Gemini проходит критерии с четвёртой попытки, а Sol — с первой, разница $0,30 против $1,10 почти исчезает. Если обе модели с первого раза правильно извлекают одинаковую структуру, преимущество Flash действительно.

Что показывают независимые измерения
Artificial Analysis в текущем Intelligence Index v4.1 показывает 60 для Claude Fable 5, 59 для GPT-5.6 Sol и 50 для Gemini 3.6 Flash. Но конфигурации различаются: Fable — adaptive reasoning с максимальным effort и fallback на Opus 4.8; Sol — max; Gemini — high. Это подтверждает близость Fable и Sol в верхнем сегменте и другую позицию Flash по цене/скорости, но не отвечает за ваш код.
Там же наблюдалась скорость вывода примерно 73,5 tokens/s для Fable, 65,9 для Sol и 200,5 для Gemini. Это пропускная способность после начала генерации, а не время до первого токена и не полная длительность задачи с tools и reasoning.
В эксперименте Quesma с Baba Is You Fable и Sol решили по 13 из 14 уровней на позднем этапе: Fable был быстрее, Sol — дешевле. Gemini 3.6 Flash там не тестировали, а harness на позднем этапе различался. Вывод узкий, но полезный: оценивать нужно связку «модель + инструменты + число попыток + стоимость успеха».
Проведите честный мини-тест
- Возьмите 6–12 реальных обезличенных задач: типовые, одну длинную и несколько прежних провалов.
- До запуска запишите критерии: тесты проходят, лишние файлы не меняются, ссылки открываются, JSON соответствует schema.
- Зафиксируйте одинаковые материалы, инструменты, срок и бюджет. Сохраните ID модели и effort.
- Повторите каждую задачу минимум три раза, чтобы увидеть разброс, а не лучший demo-run.
- Раздельно логируйте качество, вход, выход, reasoning, cache, tools, refusal, timeout, retries, время до первого токена и полное время.
- Сначала исключите модели ниже порога качества. Среди оставшихся сравните стоимость успешной задачи и понятность отказов.
Стоп-правило: дешёвая модель не проходит в production, если её first-pass success ниже минимума на рискованных задачах. Если качество двух вариантов практически одинаково, выбирайте более дешёвый успешный результат и управляемый сценарий сбоя.
Для медицины, права, финансов и безопасности такой набор — только пилот. Нужны расширенная выборка и профильный человек.
Итоговая схема выбора
| Главный фактор | Проверить первой | Переключиться, если |
|---|---|---|
| Сложнейший код, длинный агент, дорогая ошибка | Claude Fable 5 | отказ, цена или срок выше лимита |
| Сложная профессиональная работа в масштабе | GPT-5.6 Sol | рутинный объём дешевле проходит на Flash; самые трудные случаи требуют Fable |
| Видео, аудио, PDF, быстрые циклы | Gemini 3.6 Flash | сложные примеры не проходят rubric |
| Массовое извлечение и классификация | Gemini 3.6 Flash | повторы съедают экономию |
| Чувствительные к политике сценарии | зависит от ваших контролей | нет явной ветки refusal/fallback и ручной проверки |
Для начального теста через единый OpenAI-compatible интерфейс можно посмотреть каталог LaoZhang API: в нём перечислены все три ID. Документация требует проверить в live console группу токена, регион, цену и доступность. Это не полная замена официальных API; для новейших native tools и обязательств провайдера используйте прямой доступ.
На практике устойчивое решение часто состоит из двух уровней: обычные задачи получает самая дешёвая модель, проходящая порог, а неуспешные и рискованные случаи автоматически повышаются до более сильной. Такая схема переживёт следующий апдейт рейтинга лучше, чем статичный «победитель».
