Перейти к содержанию

Claude Haiku 5.5 vs GPT-6 Luna: цена API до и после 100K токенов

Короткие запросы у обеих моделей стоят одинаково. Промпт свыше 100 000 токенов, растущая история агента и длинные рассуждения делают Haiku 5.5 дороже GPT-6 Luna.

A
AI Free API Team
••14 мин чтения•Сравнение AI-моделей
На подставке две стопки плиток: высокая розовая Haiku 5.5 с ценой $0,080 и низкая синяя GPT-6 Luna с ценой $0,016 за запрос с промптом 150 000 токенов

По состоянию на 8 октября 2026 года Claude Haiku 5.5 и GPT-6 Luna берут одинаковые деньги за токен, но только пока промпт не длиннее 100 000 токенов: $0,10 за 1 млн входных, $0,50 за 1 млн выходных и $0,01 за 1 млн токенов, прочитанных из кеша (прайс Anthropic, прайс OpenAI). Как только промпт Haiku 5.5 переваливает за 100 000 токенов, все ставки этого запроса, включая выход, вырастают в 5 раз. Luna держит базовый тариф до 272 000 входных токенов, а дальше дорожает вдвое на входе и в 1,5 раза на выходе.

Практическое правило такое. Короткие запросы — классификация, извлечение данных, маршрутизация, ответы поддержки — по ставкам стоят одинаково, и счёт решает, сколько токенов модель тратит на задачу. По сторонним замерам Artificial Analysis Haiku на том же уровне effort пишет в 2,75–8,5 раза больше выходных токенов, зато и набирает более высокий индекс; при сопоставимом качестве стоимость задачи почти сходится. Промпты длиной от 100 000 до 272 000 токенов на Luna ровно в 5 раз дешевле за те же токены. Многоходовый агент с растущей историей на Haiku обходится дороже, если не удерживать контекст ниже порога.

И отдельное условие, которое стоит проверить до любых расчётов: ни Anthropic, ни OpenAI не включают Россию в списки стран, где работает их API (подробнее — в разделе о доступе ниже).

Что дешевле для вашего трафика: Haiku 5.5 или Luna

Ваша нагрузкаГде дешевле счётЧто может изменить вывод
Короткие запросы: классификация, извлечение, маршрутизация, промпт заметно меньше 100 000 токеновСтавки одинаковые; по замерам Artificial Analysis на одинаковом уровне effort Luna тратит меньше выходных токеновHaiku на уровне low проходит вашу планку качества — тогда стоимость задачи сопоставима
RAG и работа с документами, промпт 100 000–272 000 токеновLuna, в 5 раз за те же токеныВы можете обрезать контекст Haiku до 100 000 токенов без потери качества
Промпт длиннее 272 000 токеновLuna, в 2,5 раза на примере нижеОбе модели в повышенном тарифе; выгоднее сокращать контекст у любой из них
Многоходовый агент, история растёт с каждым ходомLuna, как только контекст Haiku переходит 100 000Сжатие истории до порога почти выравнивает счёт
Асинхронная обработка через BatchСоотношение то же, обе модели вдвое дешевле—
Нужен быстрый первый токен при сопоставимом качествеHaiku: у пары Haiku high и Luna max по замерам Artificial Analysis — 28 против 111 секундВаши собственные замеры задержки

Для большинства нагрузок вывод звучит так: Luna дешевле или не дороже, если только Haiku на пониженном effort не решает ваши задачи так же хорошо, как Luna на своём уровне по умолчанию, — тогда стоимость задачи выравнивается. Какой случай ваш, покажут два числа: длина промпта в токенах Haiku и выходные токены на задачу у обеих моделей.

Цены Claude Haiku 5.5 и GPT-6 Luna за 1 млн токенов

Ставки Standard в прямых API Anthropic и OpenAI, USD за 1 млн токенов, по состоянию на 8 октября 2026 года:

Категория токеновHaiku 5.5, промпт до 100 000Haiku 5.5, промпт свыше 100 000Luna, вход до 272 000Luna, вход свыше 272 000
Вход$0,10$0,50$0,10$0,20
Запись в кеш$0,125 (5 минут), $0,20 (1 час)$0,625 (5 минут), $1,00 (1 час)$0,125$0,25
Чтение из кеша$0,01$0,05$0,01$0,02
Выход$0,50$2,50$0,50$0,75

Источники: прайс Anthropic и обзор Haiku 5.5; прайс OpenAI и страница GPT-6 Luna.

Пороги у моделей устроены по-разному, и это главное, что отличает их счета:

  • Haiku 5.5 считает длину промпта. В промпт входят системные инструкции, все сообщения (в том числе результаты инструментов, изображения и документы) и определения инструментов (документация по окну контекста). Ровно 100 000 токенов — ещё нижний тариф, 100 001 — уже верхний. В таблице Anthropic строки выхода и кеша тоже разделены по длине промпта, поэтому длинный промпт делает дороже и ответ на него.
  • Luna считает входные токены. Если их больше 272 000, OpenAI берёт удвоенную ставку за вход и кеш и полуторную за выход для всего запроса.
  • Учитываются ли кешированные токены в порогах, ни одна компания не пишет. Окно контекста Haiku кеш точно включает, а про ценовой порог в документации ничего нет. В расчётах ниже кеш входит в порог: это осторожное допущение, а не правило.
Ступенчатые графики ставок за вход и выход: до 100 000 токенов линии Haiku 5.5 и GPT-6 Luna совпадают, затем Haiku растёт в 5 раз, а Luna дорожает только после 272 000 токенов

Скидки и надбавки. Batch вдвое дешевле у обеих: у Haiku $0,05 и $0,25 за вход и выход при промпте до 100 000 токенов и $0,25 и $1,25 свыше. У Luna режим Flex стоит столько же, сколько Batch, а режим Fast — вдвое дороже Standard. У Haiku 5.5 нет режима Fast и не поддерживается Priority Tier; вывод только в США (inference_geo: "us") добавляет к любым ставкам множитель 1,1. Кешировать у Haiku можно промпт от 512 токенов (документация по кешированию).

Haiku 5.5 также доступна через Amazon Bedrock, Google Cloud и Microsoft Foundry. Там свои прайсы, и всё сравнение ниже относится только к прямым API.

Сколько стоит один запрос: одинаково до 100 000 токенов, затем в 5 раз дороже

Формула для запроса без кеша:

стоимость = (входные токены × ставка входа + выходные токены × ставка выхода) / 1 000 000

Ставку выбирает длина конкретного запроса, а не ваш месячный объём. Расчёт для одинакового числа токенов на обеих моделях, Standard, без кеша:

Промпт + ответ, токеновHaiku 5.5GPT-6 LunaРазница
2 000 + 200$0,0003$0,0003нет
20 000 + 1 000$0,0025$0,0025нет
100 000 + 2 000$0,011$0,011нет
100 001 + 2 000$0,055$0,011в 5 раз
150 000 + 2 000$0,080$0,016в 5 раз
272 000 + 2 000$0,141$0,0282в 5 раз
300 000 + 5 000$0,1625$0,06375в 2,55 раза

Миллион запросов классификации по 2 000 входных и 200 выходных токенов обойдётся в $300 на любой из моделей. А 10 000 запросов в день к базе документов с промптом 150 000 токенов и ответом 2 000 — это $800 в день на Haiku против $160 на Luna. На участке от 100 001 до 272 000 токенов разница всегда ровно пятикратная: оба тарифа Haiku отличаются ровно в 5 раз во всех категориях, а Luna всё ещё на базовой ставке. За порогом 272 000 Luna тоже дорожает, и разрыв сокращается.

Batch не меняет соотношения: тот же запрос на 150 000 + 2 000 токенов стоит $0,040 на Haiku и $0,008 на Luna.

Агент на 20 ходов: Haiku 5.5 дороже в 2,2–2,6 раза из-за пяти ходов

Пороги сильнее всего бьют по агентам, у которых история растёт с каждым ходом. Модельный пример с такими параметрами:

  • 20 ходов, первый промпт — 12 000 токенов, каждый следующий длиннее на 6 000 (на 20-м ходу — 126 000);
  • 1 500 выходных токенов на каждом ходу;
  • ходы 16–20 переходят порог 100 000 токенов;
  • в варианте с кешем каждый ход читает предыдущий промпт из кеша и записывает новые 6 000 токенов по ставке 5-минутного кеша, а кешированные токены считаются в порог.
ВариантHaiku 5.5GPT-6 LunaРазница
Без кеша$0,396$0,153в 2,59 раза
С кешем$0,0949$0,0433в 2,19 раза
С кешем, контекст Haiku сжат до 40 000 токенов перед 16-м ходом$0,0441$0,0433почти нет
Столбцы длины промпта по 20 ходам агента: ходы 16–20 выше порога 100 000 токенов; справа итоги без кеша и с кешем для Haiku 5.5 и GPT-6 Luna и доля 68% этих ходов в счёте Haiku

В варианте с кешем пять ходов за порогом дают $0,0645 из $0,0949, то есть 68% счёта Haiku. Если удержать историю ниже 100 000 токенов, Haiku возвращается к тем же ставкам, что и у Luna. В строке со сжатием не учтена стоимость самого сжатия (например, запроса на пересказ истории), так что реальная разница будет чуть больше.

Это модель, а не реальный счёт. В настоящем агенте контекст Haiku растёт быстрее: по умолчанию Haiku 5.5 сохраняет в истории прежние блоки рассуждений, и они оплачиваются как входные токены на следующих ходах (об этом — ниже). Кроме того, модели тратят разное число токенов на один и тот же ход.

Стоимость задачи по замерам Artificial Analysis: Haiku 5.5 тратит больше токенов

Равные ставки не означают равную стоимость задачи. Artificial Analysis прогнала обе модели через свой Intelligence Index v4.3.2 (10 тестов) на четырёх уровнях effort, на следующий день после выхода Haiku 5.5:

Уровень effortИндекс: Haiku / LunaВыходных токенов на задачу: Haiku / LunaСтоимость задачи: Haiku / Luna
Low29 / 2217 тыс. / 2 тыс.$0,02 / $0,0045
Medium (по умолчанию у обеих)34 / 3033 тыс. / 11 тыс.$0,05 / $0,02
High38 / 3355 тыс. / 20 тыс.$0,08 / $0,03
Max43 / 38—$0,21 / $0,07

Источники: сравнения Low, Medium, High и Max на сайте Artificial Analysis. Строка Max взята со страницы сравнения по умолчанию: это наименее надёжные цифры в таблице, и их могут пересмотреть.

На одинаковом названии уровня Haiku в 2,5–3 раза дороже за задачу (на Low — в 4,4 раза), потому что пишет заметно больше: из 33 тыс. выходных токенов на Medium 20 тыс. приходится на рассуждения (у Luna — 6 тыс. из 11 тыс.). Но и результат у неё выше на каждом уровне.

Если сравнивать по близкому индексу, а не по названию уровня, картина другая:

  • Haiku Low (индекс 29) и Luna Medium (30) — по $0,02 за задачу;
  • Haiku Medium (34) и Luna High (33) — $0,05 против $0,03;
  • Haiku High (38) и Luna Max (38) — $0,08 против $0,07, при этом время до первого токена у Haiku 28 секунд против 111 у Luna.

Названия уровней effort у Anthropic и OpenAI означают разный объём работы, поэтому medium против medium — не сравнение при равном качестве. Ограничения у этих цифр серьёзные: один набор тестов одной организации, замер в первый день, значения могут пересматриваться. Цены задач Haiku помечены звёздочкой, расшифровка которой в данных не приводится; среди тестов есть и проверка на длинном контексте (AA-LCR), и неизвестно, переходили ли какие-то запросы Haiku порог 100 000 токенов.

Собственные графики Anthropic показывают отрыв Haiku 5.5 сильнее: например, GDPval-AA 1620 против 1437 у Luna и Terminal-Bench 4.0 39,2% против 16,4% (значения Luna приводят Unite.AI и японская PC Watch). Это результаты производителя, а не независимая проверка.

Вывод для выбора: индекс — не ваша задача. Он подсказывает, какие пары уровней сравнивать на своём наборе данных: Haiku low против Luna medium и Haiku high против Luna max — разумные стартовые пары.

Токенизатор и сохранённые рассуждения: скрытые части счёта Haiku 5.5

Токенизатор. Haiku 5.5 использует токенизатор моделей Claude 4.7 и новее: тот же текст даёт примерно на 30% больше токенов, чем у Haiku 4.5, точная цифра зависит от содержимого (что нового в Haiku 5.5). Саймон Уиллисон на своём промпте насчитал около 1,25 раза. Сколько токенов тот же текст занимает у Haiku 5.5 по сравнению с Luna, не публикует никто. Одинаковые ставки за токен не гарантируют одинаковый счёт за один и тот же текст, а порог 100 000 нужно мерить в токенах именно Haiku 5.5. Перепроверьте длину промптов через подсчёт токенов в API Anthropic с model: "claude-haiku-5-5", а у Luna возьмите input_tokens из поля usage ответа.

Рассуждения оплачиваются как выход. У Haiku 5.5 по умолчанию включено адаптивное мышление (adaptive thinking) с effort medium. Токены рассуждений считаются выходными, оплачиваются по ставке выхода и входят в max_tokens (руководство по миграции). Поэтому output_tokens в счёте бывает намного больше видимого ответа. Как эти токены отражаются в usage у разных провайдеров, разобрано в статье «Токены рассуждений в OpenAI, Claude и Gemini: оплата и контроль».

Прежние рассуждения остаются в контексте. Haiku 5.5 по умолчанию сохраняет в истории блоки рассуждений с прошлых ходов; на следующих запросах они становятся частью входа и оплачиваются как входные токены (документация по окну контекста). Haiku 4.5 такие блоки отбрасывала. В многоходовом диалоге это значит, что промпт растёт быстрее и порог 100 000 наступает раньше, чем вы привыкли.

Как посчитать свою нагрузку: формула и калькулятор на Python

Общая формула для одного запроса с кешем:

стоимость = (новый вход × ставка входа + запись в кеш × ставка записи + чтение кеша × ставка чтения + выход × ставка выхода) / 1 000 000

Правила выбора ставки:

  1. Тариф определяется для каждого запроса отдельно: у Haiku — по длине всего промпта (больше 100 000 — верхний), у Luna — по входным токенам (больше 272 000 — верхний).
  2. Выходные токены — это ответ вместе с рассуждениями.
  3. Если не знаете, входит ли кеш в порог, считайте, что входит: так оценка не окажется заниженной.

Калькулятор ниже повторяет эти правила. Он считает 5-минутную запись в кеш; для часового кеша у Haiku подставьте $0,20 и $1,00.

python
# Ставки Standard, USD за 1 млн токенов, по состоянию на 8 октября 2026 года
RATES = {
    "haiku": {"limit": 100_000,
              "low":  {"in": 0.10, "write": 0.125, "read": 0.01, "out": 0.50},
              "high": {"in": 0.50, "write": 0.625, "read": 0.05, "out": 2.50}},
    "luna":  {"limit": 272_000,
              "low":  {"in": 0.10, "write": 0.125, "read": 0.01, "out": 0.50},
              "high": {"in": 0.20, "write": 0.25,  "read": 0.02, "out": 0.75}},
}

def request_cost(model, fresh, cache_write=0, cache_read=0, output=0):
    """Стоимость одного запроса в долларах.
    fresh - входные токены без кеша; output - выход вместе с токенами рассуждений.
    Допущение: кешированные токены тоже считаются в порог."""
    m = RATES[model]
    prompt = fresh + cache_write + cache_read
    r = m["high"] if prompt > m["limit"] else m["low"]
    return (fresh * r["in"] + cache_write * r["write"]
            + cache_read * r["read"] + output * r["out"]) / 1_000_000

for model in ("haiku", "luna"):
    print(model,
          round(request_cost(model, 100_000, output=2_000), 6),
          round(request_cost(model, 100_001, output=2_000), 6),
          round(request_cost(model, 150_000, output=2_000), 6))
# haiku 0.011 0.055001 0.08
# luna 0.011 0.011 0.016

Чтобы получить месячный счёт, прогоните через функцию реальные записи из логов (длину промпта, кеш и выход каждого запроса) и сложите результаты. Средняя длина промпта здесь обманывает: если 10% запросов переходят порог 100 000, именно они могут дать большую часть счёта Haiku.

Что измерить на своих данных перед переключением

  1. Распределение длины промптов в токенах Haiku 5.5: медиана, 95-й перцентиль, максимум и доля запросов длиннее 100 000. Если доля нулевая, порог вас не касается.
  2. Выходные токены на задачу у обеих моделей на выбранных уровнях effort, вместе с рассуждениями. Берите output_tokens из usage, а не длину видимого ответа.
  3. Долю принятых ответов на одном и том же наборе ваших задач. Делите счёт на число годных результатов: дешёвый ответ, который приходится переделывать, обходится дороже.
  4. Для агентов — длину промпта на каждом ходу и номер хода, на котором Haiku переходит 100 000 токенов, с учётом сохранённых блоков рассуждений.
  5. Долю чтений из кеша. Ставка чтения в 10 раз ниже ставки входа, и кешируемый общий префикс сильно меняет итог на обеих моделях.

Тест, который чаще всего меняет вывод, — пара Haiku low против Luna medium на ваших задачах. Если по качеству они равны, равна и стоимость задачи, и решать будут задержка и длина промптов.

Настройки, которые снижают счёт: effort, thinking и длина контекста

У Haiku 5.5:

  • Понизьте effort. Anthropic советует там, где Haiku 4.5 работала без рассуждений или с маленьким бюджетом, выбирать более низкий уровень: модель рассуждает меньше, а на простых запросах может не рассуждать вовсе.
  • Отключите рассуждения, если они не нужны: thinking: {"type": "disabled"} работает при effort high и ниже.
  • Держите промпт не длиннее 100 000 токенов. Сокращайте фрагменты в RAG, сжимайте историю агента до порога, делите большие документы на части.
  • Используйте Batch для асинхронных задач и кеш для повторяющегося префикса.

У Luna параметр reasoning effort принимает значения none, low, medium (по умолчанию), high, xhigh и max; none — режим без рассуждений, ближайший аналог отключённого thinking у Haiku.

Если вы переводите код с Haiku 4.5, учтите изменения, из-за которых запросы падают: значение temperature, top_p или top_k, отличное от значения по умолчанию, и предзаполнение ответа (prefill) возвращают ошибку 400. Классификаторы безопасности могут вернуть stop_reason: "refusal", и автоматического переключения на другую модель на стороне сервера нет (руководство по миграции).

Переход с Haiku 4.5: сколько вы сэкономите на самом деле

Anthropic называет Haiku 5.5 на 90% дешевле Haiku 4.5 для запросов до 100 000 токенов и на 50% — для более длинных, а с учётом нового токенизатора в среднем на 75% дешевле (анонс Haiku 5.5). «В среднем 75%» — это средняя по трафику Anthropic, а не гарантия для вашего.

Расчёт на одном запросе: промпт, который у Haiku 4.5 занимал 10 000 токенов, у Haiku 5.5 займёт около 13 000. С ответом 500 токенов это $0,0125 на Haiku 4.5 ($1 и $5 за 1 млн) против $0,00155 на Haiku 5.5, то есть примерно на 88% меньше. Порог 100 000 токенов Haiku 5.5 соответствует примерно 76 900 токенам в старом подсчёте Haiku 4.5, так что промпты, которые раньше казались далёкими от предела, могут оказаться за ним. Длина ответа тоже может измениться: у Haiku 5.5 рассуждения включены по умолчанию.

По состоянию на 8 октября 2026 года Haiku 4.5 ещё активна: отключение — не раньше 15 октября 2026 года, уведомления о выводе из эксплуатации пока нет (график вывода моделей).

Доступ к API Anthropic и OpenAI из России

Россия не входит ни в список стран Anthropic, ни в список стран OpenAI по состоянию на 8 октября 2026 года. OpenAI прямо предупреждает, что доступ к сервисам или их перепродажа за пределами списка могут привести к блокировке или приостановке аккаунта. Для компании, работающей из России, сравнение цен выше ничего не меняет: напрямую официально недоступен ни один из двух API.

Если ваша компания и пользователи находятся в стране из этих списков, цены и расчёты выше относятся к вам напрямую, на каком бы языке вы ни работали. Как получить собственный ключ и не попасть на перепродажу чужого доступа, разобрано в статье «Как получить Claude API-ключ и не купить чужой доступ».

Когда не подходит ни Haiku 5.5, ни Luna

Если обе небольшие модели не дотягивают по качеству, следующий шаг вверх у каждой компании свой. У OpenAI это Sol: когда переход окупается, разобрано в материале «GPT-6 Luna или Sol: сколько стоят и когда Sol окупается». У Anthropic — Opus 5.5: «Claude Opus 5.5: сколько стоит API и что проверить при переходе с Opus 5». Флагманы друг с другом сравниваются в статье «GPT-6.1 Sol или Claude Opus 5.5: сравнение цен и стоимости задачи».

Частые вопросы о цене Haiku 5.5 и GPT-6 Luna

Что дешевле на коротких запросах — Claude Haiku 5.5 или GPT-6 Luna?

За одинаковое число токенов — одинаково: $0,10 за 1 млн входных и $0,50 за 1 млн выходных, пока промпт не длиннее 100 000 токенов. Разница появляется из-за длины ответа: по замерам Artificial Analysis на одинаковом уровне effort Haiku выдаёт больше выходных токенов и стоит за задачу в 2,5–4,4 раза дороже, но и качество у неё выше. При сопоставимом качестве (Haiku low против Luna medium) стоимость задачи одинаковая — $0,02.

Что будет с ценой Haiku 5.5 после 100 000 токенов?

Все ставки запроса — вход, запись и чтение кеша, выход — умножаются на 5: $0,50 за вход и $2,50 за выход за 1 млн токенов. Порог считается по длине промпта конкретного запроса; ровно 100 000 токенов — ещё нижний тариф.

Считаются ли кешированные токены в порог 100 000 у Haiku и 272 000 у Luna?

Ни Anthropic, ни OpenAI этого не пишут. Известно только, что в окно контекста Haiku кешированные токены входят. Безопаснее планировать так, будто они входят и в ценовой порог, и проверять по фактическим счетам.

Правда ли, что Haiku 5.5 в 12 раз дороже Luna?

Такую цифру привёл пользователь Reddit для одной своей многоходовой задачи; условия запуска не раскрыты, и типичной её считать нельзя. Механизм, на который указывают в обсуждении, реален: на ходах с промптом длиннее 100 000 токенов Haiku в 5 раз дороже, а если она к тому же пишет больше токенов, разница складывается. В модельном агенте на 20 ходов выше разрыв составил 2,2–2,6 раза.