AIFreeAPI Logo

GPT-6 Astra или Claude Fable 5.1: сколько стоит API

A
8 min readСравнение AI-моделей

При коротком запросе базовые ставки совпадают, но кэш и длинный контекст меняют итог. Разбираем тарифы и считаем стоимость на своей нагрузке.

Сводная таблица цен GPT-6 Astra и Claude Fable 5.1 с кэшем, порогом 272 000 токенов и пакетной обработкой

При стандартной обработке и входе не более 272 000 токенов GPT-6 Astra и Claude Fable 5.1 стоят одинаково по двум главным строкам: $10 за 1 млн обычных входных токенов и $50 за 1 млн выходных. Разница появляется в кэше и на длинных запросах. Чтение кэша у Fable 5.1 стоит $0,25 за 1 млн токенов против $1 у Astra, а после превышения 272 000 входных токенов Astra переводит весь запрос на повышенный тариф. У Fable 5.1 стандартные ставки сохраняются в пределах контекстного окна 1 млн токенов.

Это сравнение опубликованных цен прямых API, проверенных 5 сентября 2026 года. Оно не определяет стоимость готовой задачи без данных о фактических токенах, кэше, режиме обработки, инструментах и повторах.

Базовые ставки: где цены совпадают, а где расходятся

Все суммы ниже указаны в долларах США за 1 млн токенов при стандартной обработке.

Строка тарифаGPT-6 Astra, вход до 272KGPT-6 Astra, вход свыше 272KClaude Fable 5.1
Обычный вход$10$20$10
Чтение кэша$1$2$0,25
Запись в кэш$12,50$25$12,50 на 5 минут; $20 на 1 час
Вывод$50$75$50

Прайс-лист OpenAI и страница модели GPT-6 Astra задают отдельные ставки для короткого и длинного входа. Страница Claude Fable 5.1 и тарифы Anthropic сохраняют стандартную цену Fable 5.1 во всём заявленном контекстном окне 1 млн токенов.

Из таблицы следуют три практических вывода.

  • Без кэша при коротком запросе модели имеют одинаковую цену за одинаковое число входных и выходных токенов.
  • При многократном использовании одного префикса Fable 5.1 дешевле читает уже созданный кэш, но стоимость первой записи зависит от выбранного срока хранения.
  • При входе свыше 272K Astra становится дороже по каждой токенной строке, включая вывод. Поэтому порог нельзя оценивать только по добавочной части контекста.

Порог Astra меняет стоимость всего запроса

Для Astra значение 272 000 включительно относится к короткому тарифу. Как только вход становится больше, повышенные ставки применяются ко всему запросу: $20 за 1 млн обычных входных токенов, $2 за чтение кэша, $25 за запись и $75 за вывод. Это не прогрессивная шкала, где дороже оплачивается лишь хвост после 272K.

Пусть кэша и инструментов нет, а модель возвращает 20 000 выходных токенов:

ВходРасчёт для AstraСтоимость
272 0000,272 × $10 + 0,020 × $50$3,72
273 0000,273 × $20 + 0,020 × $75$6,96

У Fable 5.1 те же два запроса при стандартном тарифе стоили бы соответственно $3,72 и $3,73. Разрыв возникает не из-за одной тысячи дополнительных токенов как таковой, а из-за смены тарифа Astra для всего запроса.

Перед отправкой большого контекста полезно считать не размер файлов, а входные токены именно того запроса, который уйдёт в API. Если значение близко к порогу, удаление старых логов, дубликатов и нерелевантных файлов может дать больший эффект, чем небольшая экономия в другой строке тарифа.

Кэш выгоден только при достаточном повторном использовании

У Astra кэшируемый префикс должен содержать не менее 1 024 токенов. Запись стоит в 1,25 раза дороже обычного входа, чтение — в десять раз дешевле; поддерживается срок 30 минут, а успешное повторное чтение обновляет его без новой платы за запись. Фактическое попадание в кэш зависит от стабильности префикса и того, истёк ли срок хранения. Эти условия описаны в руководстве OpenAI по кэшированию запросов.

У Fable 5.1 запись на 5 минут стоит $12,50 за 1 млн токенов, на 1 час — $20, а чтение или обновление кэша — $0,25. Часовой вариант дороже при создании, поэтому он окупается только тогда, когда более долгий срок действительно сохраняет повторные чтения.

Условный пример показывает масштаб разницы. Представим десять коротких запросов с одним и тем же кэшируемым префиксом на 100 000 токенов: один раз он записывается, затем девять раз читается; каждый запрос создаёт 10 000 выходных токенов. Другого входа, инструментов и повторов нет.

Модель и срок кэшаЗаписьДевять чтений100K выводаИтого
GPT-6 Astra, 30 минут$1,25$0,90$5,00$7,15
Claude Fable 5.1, 5 минут$1,25$0,225$5,00$6,475
Claude Fable 5.1, 1 час$2,00$0,225$5,00$7,225

Это не прогноз счёта, а расчёт по явно заданной структуре. Если хотя бы часть префикса не попадает в кэш, между запросами проходит слишком много времени или меняется объём вывода, результат будет другим. Особенно важно брать значения cache read и cache write из ответа API, а не считать попадание по длине похожего текста.

Что меняет пакетная обработка

Если ответ не нужен сразу, пакетный режим снижает входную и выходную стоимость на 50% у обоих поставщиков.

РежимВходЧтение кэшаЗапись в кэшВывод
Astra Batch или Flex, до 272K$5$0,50$6,25$25
Astra Batch или Flex, свыше 272K$10$1$12,50$37,50
Fable 5.1 Message Batches$5по отдельной ставке чтенияпо ставке выбранного срока$25

У OpenAI Batch и Flex имеют одинаковое указанное снижение цены, но это разные режимы обработки со своими условиями задержки. У Anthropic Message Batches — асинхронный режим; официальная документация разрешает сочетать его с кэшированием, после чего итог зависит от записей, чтений и других модификаторов.

Не стоит автоматически делить любой будущий счёт пополам. Сначала нужно подтвердить, что конкретная нагрузка допускает отложенное выполнение, затем отдельно учесть кэш, географический режим, инструменты и запросы, ушедшие в обычную обработку.

Формула для своего бюджета

Для одной модели и одного тарифного режима токенную часть можно считать так:

Стоимость токенов = (обычный вход × его ставка + чтение кэша × его ставка + запись в кэш × её ставка + вывод × его ставка) / 1 000 000.

Категории следует брать из данных об использовании, которые возвращает поставщик, и не складывать один и тот же токен дважды. Затем к результату добавляются отдельные платные инструменты, хранение или контейнеры, региональный коэффициент, повторы, налоги и наценки выбранной платформы.

В Responses обычный вход — это input_tokens минус input_tokens_details.cached_tokens и input_tokens_details.cache_write_tokens. В Claude Messages поле input_tokens уже исключает чтение и запись кэша. Не учитывайте их дважды.

Для рабочего расчёта достаточно собрать по каждому типу задачи такие поля:

Что записатьЗачем это нужно
Идентификатор модели и поставщикНе переносить цену другой модели или облачного посредника
Обычный вход, чтение и запись кэшаУвидеть реальное повторное использование префикса
Выход и токены рассужденийНе оценивать расход только по видимому ответу
Стандартный, Batch, Flex или иной режимПрименить правильную строку тарифа
Число повторов и вызовов инструментовПолучить стоимость задачи, а не одной попытки
Регион обработки и платформаУчесть коэффициенты и отдельный облачный счёт
Шесть шагов расчёта стоимости API по данным об использовании, режиму обработки, ставкам и дополнительным коэффициентам
Шесть шагов расчёта стоимости API по данным об использовании, режиму обработки, ставкам и дополнительным коэффициентам

У Astra невидимые токены рассуждений входят в контекст и оплачиваются как выходные. У Fable 5.1 применяется новый токенизатор: Anthropic сообщает примерно о 30% большем числе токенов для того же текста по сравнению с Claude Sonnet 4.6 и более ранними моделями, но этот процент зависит от содержимого и не является коэффициентом пересчёта между Fable и Astra. Для честного сравнения нужны фактические счётчики обеих моделей на одной задаче с одинаковым критерием завершения.

Схемы клиентских инструментов также попадают во вход. Серверные инструменты могут иметь отдельную цену. Поэтому запрос с одинаковым пользовательским текстом не обязательно имеет одинаковый оплачиваемый вход, а стоимость видимого ответа не показывает полную стоимость запуска.

Режим и место обработки могут изменить публичную ставку

У OpenAI режим Fast тарифицируется по удвоенной применимой ставке. Для моделей, отвечающих условиям региональной обработки и выпущенных 5 марта 2026 года или позднее, действует надбавка 10%; у Astra режим Fast недоступен вместе с хранением данных в ЕС. У Claude 4.6 и более новых моделей значение inference_geo: "us" умножает вход, вывод, запись и чтение кэша на 1,1, тогда как global использует стандартную ставку.

Эти коэффициенты относятся к прямым предложениям поставщиков и указанным режимам. Amazon Bedrock, Google Cloud, Microsoft Foundry и другие партнёрские площадки выставляют счёт по собственным правилам; публичную цену прямого API нельзя подставлять вместо их прайс-листа или частного корпоративного договора.

Подписки ChatGPT, Claude и агентских приложений тоже не являются токенными тарифами API. Месячная плата, лимиты плана и кредиты приложения не переводятся в доллары за миллион токенов без отдельной документации продукта.

Цена в документации ещё не означает доступ в аккаунте

Журнал изменений OpenAI датирует выпуск GPT-6 Astra 3 сентября 2026 года. Доступ открывается поэтапно: наличие страницы модели и прайс-листа не доказывает, что gpt-6-astra уже разрешена конкретной организации, проекту, региону или уровню обслуживания.

Claude Fable 5.1 выпущена 1 сентября 2026 года; в официальном описании модели она указана как активная модель с идентификатором claude-fable-5-1. Фактическая доступность всё равно зависит от аккаунта, региона и выбранной платформы.

До переноса нагрузки нужно проверить обе модели реальным запросом из нужной организации и среды. Ошибка доступа — не ценовой результат, а отсутствие возможности применить этот тариф в текущей конфигурации.

Пример расчёта токенной стоимости и схема выбора тарифа с учётом порога Astra, кэша, режима обработки и региона
Пример расчёта токенной стоимости и схема выбора тарифа с учётом порога Astra, кэша, режима обработки и региона

Как принять решение без ложного «победителя»

Сначала возьмите несколько типичных задач и сохраните usage по каждой принятой попытке. Затем:

  1. Разделите обычный вход, чтение кэша, запись в кэш и вывод.
  2. Для Astra отдельно отметьте запросы с входом свыше 272K.
  3. Разведите синхронную и пакетную обработку.
  4. Добавьте инструменты, региональные коэффициенты, повторы и платформенные наценки.
  5. Сравните медиану и дорогие выбросы по завершённой задаче, а не по одному запросу.

Если нагрузка короткая, обходится без кэша и использует стандартную обработку, базовая токенная цена совпадает. При частом чтении стабильного префикса Fable 5.1 получает преимущество по цене чтения кэша. При входе свыше 272K Astra переходит на более дорогую ставку для всего запроса, тогда как Fable сохраняет стандартный тариф в пределах 1 млн токенов. Для отложенной обработки обе модели дают 50-процентную скидку, но окончательный счёт всё равно определяется реальным распределением токенов и режимов.

Перед бюджетным решением ещё раз откройте прайс-лист OpenAI и тарифы Anthropic: цены, доступ и условия обработки меняются быстрее, чем архитектура приложения.