# Claude Haiku 5.5 对比 GPT-6 Luna API 价格：同价只到 10 万 token

> Claude Haiku 5.5 与 GPT-6 Luna 标价同为每百万 token 输入 $0.10、输出 $0.50，但 Haiku 提示词过 10 万后全部单价乘 5，Luna 到 27.2 万才涨。

- Source: https://www.aifreeapi.com/zh/posts/claude-haiku-5-5-vs-gpt-6-luna
- Language: zh
- Published: 2026-10-08
- Updated: 2026-10-08
- Publisher: AI Free API (https://www.aifreeapi.com)

截至 2026 年 10 月 8 日，Claude Haiku 5.5（`claude-haiku-5-5`）和 GPT-6 Luna（`gpt-6-luna`）的官方标价确实一样：每百万 token 输入 $0.10、缓存命中 $0.01、输出 $0.50。但这个"一样"只持续到 Haiku 的提示词达到 10 万 token。从第 100,001 个 token 开始，Haiku 这一次请求的输入、缓存和输出全部按 5 倍计价；Luna 要到输入超过 27.2 万 token 才涨，而且只涨到 1.5 到 2 倍。

按请求大小，价格结论分三段：

- **提示词不超过 10 万 token**：token 数相同，两边账单完全相同。差别只来自各自实际用掉多少 token。
- **10 万到 27.2 万之间**：同样大小的请求，Haiku 正好是 Luna 的 5 倍。
- **超过 27.2 万**：两边都在高档，Haiku 是 Luna 的 2.5 到 3.3 倍。

单价相同也不等于每个任务花一样多。Artificial Analysis 在 Haiku 5.5 发布次日的评测里，两个模型都用 medium 档时，Haiku 每个任务约产出 33k 输出 token，Luna 约 11k，每任务成本 $0.05 对 $0.02；不过 Haiku 同档的综合分也更高（34 对 30），把分数拉到相近再比，差距缩小到 1 到 1.7 倍。

可以这样起步：分类、抽取、路由这类提示词远低于 10 万的短请求，价格分不出胜负，拿真实样本比质量和每条请求的输出 token；单次输入经常越过 10 万的长文档任务，以及上下文一路变长的多轮 Agent，默认先用 Luna，除非你能把 Haiku 的每次请求压在 10 万以内。另外，两家官方 API 的支持地区都不包括中国大陆和香港，具体见后文。

## Haiku 5.5 和 GPT-6 Luna 的标价：10 万 token 以内完全相同

下表是两家官方定价页上的标准价，单位为美元 / 百万 token，截至 2026 年 10 月 8 日（[Anthropic 定价页](https://platform.claude.com/docs/en/about-claude/pricing)、[OpenAI 定价页](https://developers.openai.com/api/docs/pricing)）。

| 计费项 | Haiku 5.5 提示词 ≤ 100,000 | Haiku 5.5 提示词 > 100,000 | Luna 输入 ≤ 272K | Luna 输入 > 272K |
| --- | --- | --- | --- | --- |
| 输入 | $0.10 | $0.50 | $0.10 | $0.20 |
| 缓存写入（Haiku 为 5 分钟缓存） | $0.125 | $0.625 | $0.125 | $0.25 |
| 1 小时缓存写入 | $0.20 | $1.00 | 无此项 | 无此项 |
| 缓存命中 | $0.01 | $0.05 | $0.01 | $0.02 |
| 输出 | $0.50 | $2.50 | $0.50 | $0.75 |
| Batch | 上述价格的一半 | 上述价格的一半 | 一半（Flex 同价） | 一半（Flex 同价） |

几处容易看错的细节：

- **两家的门槛口径不同。** Anthropic 写的是"提示词长度超过 100,000 token 的请求付更高的价格"，正好 100,000 仍算低档；系统提示词、对话消息、工具结果、图片、文档和工具定义都算进提示词。OpenAI 写的是输入 token 超过 272K 时，[整次请求的输入和缓存按 2 倍、输出按 1.5 倍计价](https://developers.openai.com/api/docs/models/gpt-6-luna)。Luna 这条规则和 GPT-6 Sol 一样，两者的对比见[《GPT-6 Luna 与 Sol 价格对比：API 和 Codex 分别怎么算》](/zh/posts/gpt-6-luna-vs-sol-price)。
- **Haiku 的高档也管输出。** 定价表按提示词长度给输出单独列了 $2.50 一行，所以长提示词那一次请求的输出也是 5 倍价。
- **缓存 token 算不算进门槛，两家都没写。** Anthropic 的上下文窗口文档说缓存读取、缓存写入和普通输入都计入上下文窗口，但定价页、缓存文档都没说它们是否计入 100,000 的计价门槛；OpenAI 对 272K 也没有说明。下文的算例都按"计入"处理，做预算时这样更稳妥。
- **其他加价和不支持的选项。** Haiku 5.5 用 `inference_geo: "us"` 指定仅在美国推理时，所有计费项乘 1.1；它不支持 Priority Tier，也没有 fast mode。Luna 的 Fast 档是标准价的 2 倍。

规格上两者也很接近：Haiku 5.5 上下文 1M、最大输出 128K，默认 effort 为 `medium`（[Haiku 5.5 概览](https://platform.claude.com/docs/en/models/haiku-5-5/overview)）；Luna 上下文 1,050,000、最大输入 922,000、最大输出 128,000，默认 reasoning effort 也是 `medium`。所以选择通常不卡在规格上，而是卡在请求有多长、每次输出多少。

## 按请求大小算账：提示词过 10 万后 Haiku 是 Luna 的 5 倍

单次请求的费用这样算，两边公式相同，只是单价按各自的档位取：

```text
单次费用 = (未缓存输入 × 输入单价 + 缓存写入 × 写入单价
           + 缓存命中 × 命中单价 + 输出 × 输出单价) ÷ 1,000,000
```

下面假设两边 token 数相同、不用缓存和工具、按标准价：

| 每次请求（输入 + 输出 token） | Haiku 5.5 | GPT-6 Luna | Haiku ÷ Luna |
| --- | --- | --- | --- |
| 2,000 + 200（短分类） | $0.0003 | $0.0003 | 1 倍 |
| 20,000 + 1,000 | $0.0025 | $0.0025 | 1 倍 |
| 100,000 + 2,000 | $0.011 | $0.011 | 1 倍 |
| 100,001 + 2,000 | $0.0550 | $0.0110 | 5 倍 |
| 150,000 + 2,000 | $0.080 | $0.016 | 5 倍 |
| 272,000 + 2,000 | $0.141 | $0.0282 | 5 倍 |
| 300,000 + 5,000 | $0.1625 | $0.06375 | 2.55 倍 |

拿第一行验算：Haiku 是 2,000 × $0.10 + 200 × $0.50 = $300 / 百万次请求，Luna 一样，100 万次这样的分类请求两边都是 $300。再看第四行：只多 1 个 token，Haiku 那次请求就从 $0.011 跳到 $0.055，因为 100,001 × $0.50 + 2,000 × $2.50 已经全部按高档算。

这张表能读出三条规则：

1. **10 万以内，单价不会造成任何差额。** 账单差多少，完全由两边实际计出的 token 数决定（下一节会讲为什么它们往往不相等）。
2. **10 万到 27.2 万之间，倍数恒为 5。** Haiku 高档每一项都是低档的 5 倍，而 Luna 还在低档，所以不管输入输出怎么配比，结果都是 5 倍。
3. **超过 27.2 万，倍数落在 2.5 到 3.3 之间。** 输入、缓存这几项的比例是 $0.50 ÷ $0.20 = 2.5，输出是 $2.50 ÷ $0.75 ≈ 3.3，输出占比越高越接近 3.3。

![按提示词长度分三段的 Haiku 5.5 与 Luna 单次费用之比：10 万以内 1 倍，10 万到 27.2 万 5 倍，超过 27.2 万 2.5 到 3.3 倍，各附一个算例](https://www.aifreeapi.com/posts/zh/claude-haiku-5-5-vs-gpt-6-luna/img/price-tiers.webp)

Batch 不会改变这个比例，两边都是半价：150,000 + 2,000 的请求走 Batch，Haiku $0.040，Luna $0.008。

因为门槛按单次请求判断，估算时要看提示词长度的分布，尤其是 P95 和最大值，平均值会掩盖问题。平均 3 万 token 的业务，只要一小部分请求越过 10 万，Haiku 的账单就可能被这一小部分拉高，后面"混合流量"一节有具体算例。

## 多轮 Agent 账单：上下文过 10 万后 Haiku 是 Luna 的 2 倍多

Agent、子代理和长对话的麻烦在于提示词会一轮轮变长，前面的请求都在低档，后面几轮悄悄越过 10 万。下面是一个可以复算的示例，不是实际账单：

- 一次会话 20 轮，第 1 轮提示词 12,000 token，之后每轮增加 6,000（工具结果、历史消息），第 20 轮为 126,000；
- 每轮输出 1,500 token；
- 第 16 到 20 轮的提示词超过 10 万；
- 两边 token 数相同，标准价；使用缓存时，每轮从缓存读取上一轮的提示词，新增的 6,000 token 按 5 分钟缓存写入计价，并假设缓存 token 计入 10 万门槛。

| 一次 20 轮会话 | Haiku 5.5 | GPT-6 Luna | Haiku ÷ Luna |
| --- | --- | --- | --- |
| 不用缓存 | $0.396 | $0.153 | 2.59 倍 |
| 使用缓存 | $0.0949 | $0.0433 | 2.19 倍 |
| 使用缓存，第 16 轮前把上下文压缩到 4 万 token（不含压缩本身的费用） | $0.0441 | $0.0433 | 约 1 倍 |

![20 轮 Agent 示例：左侧每轮提示词长度柱状图，第 16 到 20 轮越过 10 万门槛；右侧一次会话费用，Haiku 5.5 $0.0949、GPT-6 Luna $0.0433、Haiku 压缩上下文后 $0.0441](https://www.aifreeapi.com/posts/zh/claude-haiku-5-5-vs-gpt-6-luna/img/agent-loop-cost.webp)

换成每 1,000 次会话，不用缓存是 $396 对 $153，用缓存是 $94.9 对 $43.3。用缓存时，Haiku 那 $0.0949 里有 $0.0645（68%）来自最后 5 轮；前 15 轮两边都是 $0.0304，一分不差。也就是说，多轮任务里 Haiku 贵出来的部分几乎全部来自越线的那几轮。

这个示例有两处会让真实情况对 Haiku 更不利：

- **Haiku 5.5 默认保留之前的思考块。** 这些思考块留在上下文里，后续请求按输入计费，所以 Haiku 的上下文会比示例里涨得更快，越过 10 万也会更早（[上下文窗口文档](https://platform.claude.com/docs/en/build-with-claude/context-windows)）。
- **两边的 token 数并不相同。** Haiku 同档位下输出更多（见后文），输出又会进入下一轮的上下文。

反过来，如果缓存读取其实不计入门槛，Haiku 的账单会比表中低。在官方写清楚之前，按计入做预算更稳妥。

想让 Haiku 在长会话里保持和 Luna 同价，办法只有一个：让每次请求的提示词留在 10 万以内，比如定期总结、压缩历史，清理旧的思考块，或者把一个长任务拆成几个上下文更短的子代理。

## 单价相同账单不同的原因：输出 token、思考块和分词器

10 万以内两边的单价一模一样，同一件事的账单仍可能不同，原因在 token 数上：

**1. 思考 token 按输出计费，而且 Haiku 同档写得更多。** Haiku 5.5 的思考 token 按输出价收费，也计入 `max_tokens`；Artificial Analysis 统计的每任务输出 token 也包含了两边的推理部分。它的数据里，同为 medium 档，Haiku 每任务输出约 33k（其中推理约 20k），Luna 约 11k（推理约 6k）；只算输出这一项，就是 33,000 × $0.50 ÷ 1,000,000 = $0.0165 对 $0.0055。low 档差得更远：17k 对 2k。思考 token 在用量和账单里怎么对上，可以看[《推理 Token 到底怎么计费？Gemini、OpenAI、Claude 的去重对账方法》](/zh/posts/reasoning-token-billing)。

**2. Haiku 保留的思考块会变成后续请求的输入。** 这是 Haiku 5.5 的默认行为，单轮请求不受影响，多轮对话的每一轮都会多出一截输入。

**3. 分词器不同，同一段文字的 token 数不同。** Haiku 5.5 用的是 Claude 4.7 之后的新分词器，Anthropic 说同样的文字比 Haiku 4.5 多出约 30% 的 token，具体取决于内容（[Haiku 5.5 新特性](https://platform.claude.com/docs/en/models/haiku-5-5/whats-new-haiku-5-5)）。Haiku 5.5 和 Luna 对同一段中文或代码各计多少 token，目前没有公开的对比数据，只能用你自己的样本测。

把这些差异换算成钱，可以用一个简单的敏感度：在低档，每次请求多 100 个输出 token，100 万次请求就多 100,000,000 × $0.50 ÷ 1,000,000 = $50；一个 2,000 token 的提示词如果在某一边多计 10%（200 token），100 万次请求多 $20。短请求里，输出长度比分词器差异更值得盯。

## 每任务成本：同一 effort 档 Luna 便宜，分数对齐后接近

下面的数字来自 [Artificial Analysis](https://artificialanalysis.ai/models/comparisons/claude-haiku-5-5-medium-vs-gpt-6-luna-medium) 的 Intelligence Index v4.3.2（10 项评测），在 Haiku 5.5 发布次日公布，同一档位名称两两对比：

| 档位（两边相同） | 综合指数 Haiku / Luna | 每任务成本 Haiku / Luna | 每任务输出 token Haiku / Luna | 首 token 延迟 Haiku / Luna |
| --- | --- | --- | --- | --- |
| Low | 29 / 22 | $0.02 / $0.0045 | 17k / 2k | 9.93 秒 / 3.05 秒 |
| Medium（两边默认） | 34 / 30 | $0.05 / $0.02 | 33k / 11k | 13.40 秒 / 未显示 |
| High | 38 / 33 | $0.08 / $0.03 | 55k / 20k | 28.01 秒 / 21.08 秒 |
| Max | 43 / 38 | $0.21 / $0.07 | — | 432 秒 / 111 秒 |

同一个档位名，Haiku 分数更高，也花得更多。但两家的 effort 档位各自定义，名字相同不代表做同样多的工作。按分数把两边对齐，结论就变了：

| 分数接近的组合 | 综合指数 | 每任务成本 |
| --- | --- | --- |
| Haiku Low 对 Luna Medium | 29 对 30 | $0.02 对 $0.02 |
| Haiku Medium 对 Luna High | 34 对 33 | $0.05 对 $0.03 |
| Haiku High 对 Luna Max | 38 对 38 | $0.08 对 $0.07 |

在相近的分数上，Haiku 的每任务成本是 Luna 的 1 到约 1.7 倍；最高这一组 Haiku High 的首 token 延迟是 28 秒，Luna Max 是 111 秒。

用这些数字时要记住几个边界：这是一家机构的一套测试框架，发布第二天的数据，之后可能修订；Max 档的数字取自 [Max 对 Max 的默认对比页](https://artificialanalysis.ai/models/comparisons/claude-haiku-5-5-vs-gpt-6-luna)；Haiku 的每任务成本在页面上带星号，对比页没有给出说明；评测里有长上下文项目（AA-LCR），其中是否有请求越过了 Haiku 的 10 万门槛不得而知。最重要的是，综合指数不等于你的任务。它的用处是告诉你该怎么设计测试：别只拿两边的默认档比，要拿"Haiku 低一档"对"Luna 默认档"也比一次。

旗舰模型之间也有同样的"标价差和任务成本差不是一回事"，见[《GPT-6.1 Sol 对比 Opus 5.5：标价差 2 倍，任务成本差 6 倍》](/zh/posts/gpt-6-1-sol-vs-claude-opus-5-5)。

## 按自己的流量估算：混合请求的算法与判断规则

月账单可以按提示词长度分档估算：

```text
月账单 ≈ Σ（该档请求数 × 该档单次费用）
单次费用 = 按上文公式，用实测的平均输入、缓存和输出 token 代入
```

一个混合流量的示例（假设两边 token 数相同）：每月 100 万次请求，95% 是 2,000 + 200 的短请求，5% 是 150,000 + 2,000 的长文档请求。

- Haiku 5.5：950,000 × $0.0003 + 50,000 × $0.080 = $285 + $4,000 = $4,285
- GPT-6 Luna：950,000 × $0.0003 + 50,000 × $0.016 = $285 + $800 = $1,085

短请求部分两边都是 $285，差额全部来自那 5% 的长请求。这就是为什么要先看提示词长度分布，再看单价。

据此可以得出几条判断规则：

- **几乎所有请求都在 10 万以内（按 Haiku 5.5 的实际计数）**：单价打平，比的是"每个合格结果用多少 token"。两边都用默认档时 Luna 通常更省；如果 Haiku 用 `low` 或关闭思考就能通过你的验收，而 Luna 要 `medium` 才行，两者成本接近，这时按质量、延迟和你已有的 SDK 选。
- **有一部分请求落在 10 万到 27.2 万之间**：Luna 更便宜，除非你能把这部分请求裁剪或拆分到 10 万以内，或者 Haiku 在这类任务上的质量提升值得多付的钱。也可以把长请求单独路由给 Luna，短请求按质量选。
- **经常超过 27.2 万**：Haiku 是 Luna 的 2.5 到 3.3 倍，选 Luna。
- **上下文持续变长的多轮 Agent**：默认 Luna；如果坚持用 Haiku，压缩和清理要保证每轮都不越过 10 万。

可以用这句话检验自己的结论："按我的流量，X 更便宜，除非……"。对大多数短请求业务，"除非"后面是 Haiku 在更低档位上的合格率；对长上下文业务，"除非"后面是能不能把 Haiku 的每次请求压在 10 万以内。

## 切换前先测的 5 项数据和要调的参数

不用大规模压测，拿一两百条有代表性的真实请求，两边各跑一遍，记下这些数：

1. **用 Haiku 5.5 重新计数的提示词长度。** Anthropic 的[迁移指南](https://platform.claude.com/docs/en/models/haiku-5-5/migration-guide)明确要求用 `model` 设为 `claude-haiku-5-5` 重新计数，不要沿用 Haiku 4.5 的数字。记下 P50、P95 和最大值，看离 10 万有多远。Luna 一侧读响应 `usage` 里的输入和缓存 token。
2. **每个任务的输出 token，含思考或推理部分。** 这是 10 万以内唯一会让两边账单拉开的变量。
3. **多轮任务每一轮的提示词增长。** 重点看 Haiku 保留思考块后每轮多出多少，以及第几轮越过 10 万。
4. **各档位的合格率。** 至少测 Haiku 的 `low`、关闭思考、`medium`，以及 Luna 的 `none`、`low`、`medium`，用同一套验收标准打分，再按"每个合格结果的成本"比。
5. **一次带缓存、总长超过 10 万的请求实际按哪一档计费。** 构造一条未缓存部分不到 10 万、加上缓存读取超过 10 万的请求，在用量或账单页面看它按哪一档收费，就能确认缓存是否计入门槛。

调参时用得上的开关：

- **Haiku 5.5**：`effort` 默认 `medium`，可以往下调；在 `high` 及以下可以用 `thinking: {"type": "disabled"}` 关闭思考，但 Anthropic 更建议用调低 effort 来换速度和成本。从 Haiku 4.5 迁移时，`temperature`、`top_p`、`top_k` 传非默认值和 assistant 预填都会返回 400；安全分类器可能返回 `stop_reason: "refusal"`，没有服务端降级，代码里要处理。最小可缓存提示词为 512 token。
- **GPT-6 Luna**：reasoning effort 有 `none`、`low`、`medium`（默认）、`high`、`xhigh`、`max`；不急的任务走 Batch 或 Flex 半价，Fast 档按 2 倍计价。

如果小模型在你的任务上怎么调都过不了验收，往上一级看会比继续压参数更省时间，Claude 这边见[《Claude Opus 5.5 已发布：API 价格、能力与从 Opus 5 迁移的检查项》](/zh/posts/claude-opus-5-5)。

## 从 Haiku 4.5 升级："降九成"按同一段文字算约少 87%

Anthropic 的说法是，10 万 token 以内的请求比 Haiku 4.5 低 90%，超过 10 万低 50%，按它自己的流量平均约低 75%（[发布公告](https://www.anthropic.com/claude-haiku-5-5)）。这里的 90% 和 50% 是每 token 单价的比较，同一段文字在新分词器下会多计约 30%：

- **10 万以内**：同一段文字的费用约为原来的 1.3 × 0.1 = 0.13，少约 87%。例如 Haiku 4.5 上 10,000 token 的提示词加 500 token 输出，费用 $0.0125；同样内容在 Haiku 5.5 上约 13,000 token，费用 $0.00155。
- **超过 10 万**：约为原来的 1.3 × 0.5 = 0.65，少约 35%，没有"降九成"那么多。
- **门槛提前了。** Haiku 5.5 的 100,000 token 约相当于 Haiku 4.5 计数下的 76,900 token（100,000 ÷ 1.3）。原来 8 万多 token 的请求，换过来可能已经进了高档。

1.3 只是平均值，以重新计数为准。另外 Haiku 5.5 默认开启思考，输出长度也可能和 4.5 不同。截至 2026 年 10 月 8 日，Haiku 4.5 仍是 Active 状态，退役时间"不早于 2026 年 10 月 15 日"，还没有发出弃用通知。这个日期只是下限，之后随时可能公布弃用安排，规划迁移前到 [模型弃用页面](https://platform.claude.com/docs/en/about-claude/model-deprecations) 再看一次。

## 中国大陆能不能直接调用 Claude 和 OpenAI 的官方 API

不能。Anthropic 和 OpenAI 公布的 API 支持地区名单都不包括中国大陆和香港（[Anthropic 支持地区](https://www.anthropic.com/supported-countries)、[OpenAI 支持地区](https://developers.openai.com/api/docs/supported-countries)）。OpenAI 还写明，在名单以外的地区访问或提供访问，可能导致账号被封禁或暂停。

如果你的公司主体和使用地在支持地区内，开通 Claude API 的步骤见[《Claude API Key 怎么获取：先买额度，再创建自己的密钥》](/zh/posts/claude-api-purchasing-guide)。

另一条路是第三方 API 平台。以 [laozhang.ai](https://docs.laozhang.ai/models) 为例，截至 2026 年 10 月 7 日的模型列表里有 `gpt-6-luna`，标价每百万 token 输入 $0.1、输出 $0.5、缓存读取 $0.01，与 OpenAI 标准价相同；列表里目前没有任何 Claude 模型，FAQ 说明 Claude 系列因资源原因暂时下线，所以它现在不能用来调用 Haiku 5.5。缓存写入价、27.2 万以上的长上下文价格和 Batch 在该列表里都没有写明，用于长请求前先向平台确认。

## Haiku 5.5 与 Luna 价格的几个短问题

### 缓存命中的 token 算不算进 Haiku 5.5 的 10 万门槛？

公开文档没有写。上下文窗口文档只说缓存读取、缓存写入和普通输入都计入上下文窗口，没说是否计入计价门槛；Luna 的 272K 也一样。预算时按计入处理，再用上文第 5 项测试确认。

### 走 Batch 能缩小 Haiku 5.5 和 Luna 在 10 万以上的差距吗？

不能。两边的 Batch 都是标准价的一半，比例不变：150,000 + 2,000 的请求走 Batch，Haiku $0.040，Luna $0.008，仍是 5 倍。

### Claude Haiku 5.5 和 GPT-6 Luna 哪个更强？

在 Artificial Analysis 的综合指数里，同一档位名下 Haiku 都高 4 到 7 分，但它为此用的 token 也多得多；单项上并不全赢，比如 medium 档的 AutomationBench-AA，Luna 是 40%，Haiku 是 29%。Anthropic 自己发布的图表里，Haiku 5.5 在 GDPval-AA v2.1 上得 1620，据媒体转述 Luna 为 1437，这属于厂商自报，不是独立评测。对你的业务来说，哪个更强要看上文第 4 项测试的合格率。

### Haiku 5.5 的 10 万门槛按输入算还是按整个请求算？

按提示词长度判断，提示词包括系统提示词、消息、工具结果、图片、文档和工具定义；输出不计入门槛，但一旦提示词超过 10 万，这次请求的输出也按 $2.50 / 百万 token 计价。
