Миллион выходных токенов у GPT-6 Luna стоит 50 центов, а у Claude Opus 5.5 — 20 долларов. Если платить за токены в сорок раз больше, хочется видеть пользу в выполненной работе.
Сравните две задачи: достать номер заказа из письма и найти ошибку в незнакомом репозитории. В первом случае ответ можно сверить с несколькими строками текста. Во втором ещё предстоит понять, что вообще проверять. Выбирать для обеих задач одну модель только из-за её места в рейтинге было бы странно.
Opus впереди. Но зачем на графике Luna?
В срезе Artificial Analysis Intelligence Index на 22 сентября 2026 года у Opus 5.5 — 58 баллов. У Fable 5.1 и GPT-6 Astra — по 53, у GPT-6 Sol — 48, у Luna — 37. Это баллы индекса, а не процент обращений, которые модель сможет закрыть без ошибок.
На графике девять разных моделей с наибольшими баллами и GPT-6 Luna. Это не мировой топ-10: Luna добавлена, чтобы все три модели из статьи можно было сравнить на одной картинке. Для каждой взят её лучший опубликованный результат.
Обратите внимание на подписи под столбцами. Результаты Opus 5.5 и Fable 5.1 получены с максимальным уровнем рассуждений и включённым fallback. Остальные конфигурации тоже указаны на графике. Стоимость и время ответа между ними не уравнивались, поэтому самый высокий столбец не обещает ни самого быстрого ответа, ни самого маленького счёта.
Три модели, разные поводы их попробовать
Anthropic описывает Opus 5.5 как близкую к Fable 5.1 на большинстве задач, с улучшениями в программировании, работе с интерфейсом компьютера и работе с информацией. При этом сама компания предупреждает: разница в бенчмарках стала хуже отражать разницу в повседневном использовании. Даже продавец модели предлагает смотреть дальше места в рейтинге.
GPT-6 Sol рассчитана на сложные задачи программирования и агентные сценарии. Её тоже стоит включить в сравнение для задачи с репозиторием. Только зафиксируйте уровень рассуждений: два запуска Sol могут использовать разные настройки.
GPT-6 Luna предназначена для большого объёма узких задач. Попробуйте её на извлечении данных или классификации. Правильно ли она нашла номер заказа, проще проверить по самому письму, чем пытаться угадать по 37 баллам общего индекса.
В прайс-листе нет строки «переделать за моделью»
Стандартные тарифы на текстовые токены из официальной документации, проверенные 22 сентября 2026 года. Все суммы в долларах США за миллион токенов:
- Opus 5.5: 4 за вход, 20 за выход; 0,20 за чтение из кеша.
- GPT-6 Sol: 2 за вход, 10 за выход; 0,20 за кешированный вход.
- GPT-6 Luna: 0,10 за вход, 0,50 за выход; 0,01 за кешированный вход.
У OpenAI есть дополнительные ценовые условия для длинных запросов, режимов обработки и обработки в определённых регионах. А сороккратная разница в тарифах ещё не означает такую же разницу в цене готового результата: расход токенов и повторные попытки меняют расчёт.
У Anthropic это хорошо видно в собственных цифрах. В анонсе цены входных и выходных токенов Opus 5.5 на 20 % ниже, чем у Opus 5. Для типовых задач при настройках по умолчанию компания, по результатам своих тестов, оценивает снижение затрат уже в 40 %. Первая цифра описывает тариф, вторая — ожидаемый счёт за выполненную работу.
Если сотруднику приходится переписывать ответ, счёт от API показывает не все расходы. Добавьте к нему время на исправления, повторные попытки и вызовы инструментов. Более полный расчёт есть в разборе стоимости AI-ассистента.
Простая замена модели может сломать агента
В заметках о миграции на Opus 5.5 есть менее эффектная, чем бенчмарки, деталь: режим рассуждений всегда включён, а принудительный вызов инструментов возвращает ошибки. Если ваш агент рассчитывает на такой вызов, проблема может возникнуть ещё до оценки качества ответа.
Начните с действия, которое можно отменить: модель предлагает очередь для обращения, а сотрудник подтверждает выбор; агент меняет код, но изменения ещё должны пройти тесты и ревью. Оставьте текущую модель для сравнения и дайте кандидатам одинаковые инструкции, инструменты и права. Проверьте неудобные запросы и отказы сервисов, а не только аккуратные примеры. Запишите время ответа и ручные исправления, не расширяя доступ агента.
За какую работу стоит доплатить
Если номер заказа уже есть в вашей системе, его можно получить запросом к базе. Для извлечения из письма может подойти и фиксированное правило. Перед подключением модели стоит проверить вариант автоматизации без ИИ.
С ошибкой в репозитории расчёт другой. Более дорогие токены могут окупиться, если до правильного результата удаётся дойти с меньшими усилиями. Сравнивать нужно стоимость выполненной задачи, включая человеческое время.
Если вы выбираете модель для рабочего процесса, обсудим его в LindenTech. Начать стоит с задачи, на которую команда уже тратит время. Менять текущую модель имеет смысл, когда замена оправдывает свои затраты.