跳到正文

Claude Haiku 5.5 对比 GPT-6 Luna API 价格:同价只到 10 万 token

10 万 token 内两者同价,账单看谁的输出和思考 token 少;10 万到 27.2 万之间,同样的请求 Haiku 是 Luna 的 5 倍。长文档和多轮 Agent 默认先用 Luna。

A
AI Free API Team
••23 分钟阅读•AI 模型对比
白色底座上两摞叠片:一次 15 万 + 2,000 token 的请求,GPT-6 Luna 3 片标 $0.016,Claude Haiku 5.5 15 片标 $0.080,旁边写着同价只到 10 万

截至 2026 年 10 月 8 日,Claude Haiku 5.5(claude-haiku-5-5)和 GPT-6 Luna(gpt-6-luna)的官方标价确实一样:每百万 token 输入 $0.10、缓存命中 $0.01、输出 $0.50。但这个"一样"只持续到 Haiku 的提示词达到 10 万 token。从第 100,001 个 token 开始,Haiku 这一次请求的输入、缓存和输出全部按 5 倍计价;Luna 要到输入超过 27.2 万 token 才涨,而且只涨到 1.5 到 2 倍。

按请求大小,价格结论分三段:

  • 提示词不超过 10 万 token:token 数相同,两边账单完全相同。差别只来自各自实际用掉多少 token。
  • 10 万到 27.2 万之间:同样大小的请求,Haiku 正好是 Luna 的 5 倍。
  • 超过 27.2 万:两边都在高档,Haiku 是 Luna 的 2.5 到 3.3 倍。

单价相同也不等于每个任务花一样多。Artificial Analysis 在 Haiku 5.5 发布次日的评测里,两个模型都用 medium 档时,Haiku 每个任务约产出 33k 输出 token,Luna 约 11k,每任务成本 $0.05 对 $0.02;不过 Haiku 同档的综合分也更高(34 对 30),把分数拉到相近再比,差距缩小到 1 到 1.7 倍。

可以这样起步:分类、抽取、路由这类提示词远低于 10 万的短请求,价格分不出胜负,拿真实样本比质量和每条请求的输出 token;单次输入经常越过 10 万的长文档任务,以及上下文一路变长的多轮 Agent,默认先用 Luna,除非你能把 Haiku 的每次请求压在 10 万以内。另外,两家官方 API 的支持地区都不包括中国大陆和香港,具体见后文。

Haiku 5.5 和 GPT-6 Luna 的标价:10 万 token 以内完全相同

下表是两家官方定价页上的标准价,单位为美元 / 百万 token,截至 2026 年 10 月 8 日(Anthropic 定价页、OpenAI 定价页)。

计费项Haiku 5.5 提示词 ≤ 100,000Haiku 5.5 提示词 > 100,000Luna 输入 ≤ 272KLuna 输入 > 272K
输入$0.10$0.50$0.10$0.20
缓存写入(Haiku 为 5 分钟缓存)$0.125$0.625$0.125$0.25
1 小时缓存写入$0.20$1.00无此项无此项
缓存命中$0.01$0.05$0.01$0.02
输出$0.50$2.50$0.50$0.75
Batch上述价格的一半上述价格的一半一半(Flex 同价)一半(Flex 同价)

几处容易看错的细节:

  • 两家的门槛口径不同。 Anthropic 写的是"提示词长度超过 100,000 token 的请求付更高的价格",正好 100,000 仍算低档;系统提示词、对话消息、工具结果、图片、文档和工具定义都算进提示词。OpenAI 写的是输入 token 超过 272K 时,整次请求的输入和缓存按 2 倍、输出按 1.5 倍计价。Luna 这条规则和 GPT-6 Sol 一样,两者的对比见《GPT-6 Luna 与 Sol 价格对比:API 和 Codex 分别怎么算》。
  • Haiku 的高档也管输出。 定价表按提示词长度给输出单独列了 $2.50 一行,所以长提示词那一次请求的输出也是 5 倍价。
  • 缓存 token 算不算进门槛,两家都没写。 Anthropic 的上下文窗口文档说缓存读取、缓存写入和普通输入都计入上下文窗口,但定价页、缓存文档都没说它们是否计入 100,000 的计价门槛;OpenAI 对 272K 也没有说明。下文的算例都按"计入"处理,做预算时这样更稳妥。
  • 其他加价和不支持的选项。 Haiku 5.5 用 inference_geo: "us" 指定仅在美国推理时,所有计费项乘 1.1;它不支持 Priority Tier,也没有 fast mode。Luna 的 Fast 档是标准价的 2 倍。

规格上两者也很接近:Haiku 5.5 上下文 1M、最大输出 128K,默认 effort 为 medium(Haiku 5.5 概览);Luna 上下文 1,050,000、最大输入 922,000、最大输出 128,000,默认 reasoning effort 也是 medium。所以选择通常不卡在规格上,而是卡在请求有多长、每次输出多少。

按请求大小算账:提示词过 10 万后 Haiku 是 Luna 的 5 倍

单次请求的费用这样算,两边公式相同,只是单价按各自的档位取:

text
单次费用 = (未缓存输入 × 输入单价 + 缓存写入 × 写入单价
           + 缓存命中 × 命中单价 + 输出 × 输出单价) ÷ 1,000,000

下面假设两边 token 数相同、不用缓存和工具、按标准价:

每次请求(输入 + 输出 token)Haiku 5.5GPT-6 LunaHaiku ÷ Luna
2,000 + 200(短分类)$0.0003$0.00031 倍
20,000 + 1,000$0.0025$0.00251 倍
100,000 + 2,000$0.011$0.0111 倍
100,001 + 2,000$0.0550$0.01105 倍
150,000 + 2,000$0.080$0.0165 倍
272,000 + 2,000$0.141$0.02825 倍
300,000 + 5,000$0.1625$0.063752.55 倍

拿第一行验算:Haiku 是 2,000 × $0.10 + 200 × $0.50 = $300 / 百万次请求,Luna 一样,100 万次这样的分类请求两边都是 $300。再看第四行:只多 1 个 token,Haiku 那次请求就从 $0.011 跳到 $0.055,因为 100,001 × $0.50 + 2,000 × $2.50 已经全部按高档算。

这张表能读出三条规则:

  1. 10 万以内,单价不会造成任何差额。 账单差多少,完全由两边实际计出的 token 数决定(下一节会讲为什么它们往往不相等)。
  2. 10 万到 27.2 万之间,倍数恒为 5。 Haiku 高档每一项都是低档的 5 倍,而 Luna 还在低档,所以不管输入输出怎么配比,结果都是 5 倍。
  3. 超过 27.2 万,倍数落在 2.5 到 3.3 之间。 输入、缓存这几项的比例是 $0.50 ÷ $0.20 = 2.5,输出是 $2.50 ÷ $0.75 ≈ 3.3,输出占比越高越接近 3.3。
按提示词长度分三段的 Haiku 5.5 与 Luna 单次费用之比:10 万以内 1 倍,10 万到 27.2 万 5 倍,超过 27.2 万 2.5 到 3.3 倍,各附一个算例

Batch 不会改变这个比例,两边都是半价:150,000 + 2,000 的请求走 Batch,Haiku $0.040,Luna $0.008。

因为门槛按单次请求判断,估算时要看提示词长度的分布,尤其是 P95 和最大值,平均值会掩盖问题。平均 3 万 token 的业务,只要一小部分请求越过 10 万,Haiku 的账单就可能被这一小部分拉高,后面"混合流量"一节有具体算例。

多轮 Agent 账单:上下文过 10 万后 Haiku 是 Luna 的 2 倍多

Agent、子代理和长对话的麻烦在于提示词会一轮轮变长,前面的请求都在低档,后面几轮悄悄越过 10 万。下面是一个可以复算的示例,不是实际账单:

  • 一次会话 20 轮,第 1 轮提示词 12,000 token,之后每轮增加 6,000(工具结果、历史消息),第 20 轮为 126,000;
  • 每轮输出 1,500 token;
  • 第 16 到 20 轮的提示词超过 10 万;
  • 两边 token 数相同,标准价;使用缓存时,每轮从缓存读取上一轮的提示词,新增的 6,000 token 按 5 分钟缓存写入计价,并假设缓存 token 计入 10 万门槛。
一次 20 轮会话Haiku 5.5GPT-6 LunaHaiku ÷ Luna
不用缓存$0.396$0.1532.59 倍
使用缓存$0.0949$0.04332.19 倍
使用缓存,第 16 轮前把上下文压缩到 4 万 token(不含压缩本身的费用)$0.0441$0.0433约 1 倍
20 轮 Agent 示例:左侧每轮提示词长度柱状图,第 16 到 20 轮越过 10 万门槛;右侧一次会话费用,Haiku 5.5 $0.0949、GPT-6 Luna $0.0433、Haiku 压缩上下文后 $0.0441

换成每 1,000 次会话,不用缓存是 $396 对 $153,用缓存是 $94.9 对 $43.3。用缓存时,Haiku 那 $0.0949 里有 $0.0645(68%)来自最后 5 轮;前 15 轮两边都是 $0.0304,一分不差。也就是说,多轮任务里 Haiku 贵出来的部分几乎全部来自越线的那几轮。

这个示例有两处会让真实情况对 Haiku 更不利:

  • Haiku 5.5 默认保留之前的思考块。 这些思考块留在上下文里,后续请求按输入计费,所以 Haiku 的上下文会比示例里涨得更快,越过 10 万也会更早(上下文窗口文档)。
  • 两边的 token 数并不相同。 Haiku 同档位下输出更多(见后文),输出又会进入下一轮的上下文。

反过来,如果缓存读取其实不计入门槛,Haiku 的账单会比表中低。在官方写清楚之前,按计入做预算更稳妥。

想让 Haiku 在长会话里保持和 Luna 同价,办法只有一个:让每次请求的提示词留在 10 万以内,比如定期总结、压缩历史,清理旧的思考块,或者把一个长任务拆成几个上下文更短的子代理。

单价相同账单不同的原因:输出 token、思考块和分词器

10 万以内两边的单价一模一样,同一件事的账单仍可能不同,原因在 token 数上:

1. 思考 token 按输出计费,而且 Haiku 同档写得更多。 Haiku 5.5 的思考 token 按输出价收费,也计入 max_tokens;Artificial Analysis 统计的每任务输出 token 也包含了两边的推理部分。它的数据里,同为 medium 档,Haiku 每任务输出约 33k(其中推理约 20k),Luna 约 11k(推理约 6k);只算输出这一项,就是 33,000 × $0.50 ÷ 1,000,000 = $0.0165 对 $0.0055。low 档差得更远:17k 对 2k。思考 token 在用量和账单里怎么对上,可以看《推理 Token 到底怎么计费?Gemini、OpenAI、Claude 的去重对账方法》。

2. Haiku 保留的思考块会变成后续请求的输入。 这是 Haiku 5.5 的默认行为,单轮请求不受影响,多轮对话的每一轮都会多出一截输入。

3. 分词器不同,同一段文字的 token 数不同。 Haiku 5.5 用的是 Claude 4.7 之后的新分词器,Anthropic 说同样的文字比 Haiku 4.5 多出约 30% 的 token,具体取决于内容(Haiku 5.5 新特性)。Haiku 5.5 和 Luna 对同一段中文或代码各计多少 token,目前没有公开的对比数据,只能用你自己的样本测。

把这些差异换算成钱,可以用一个简单的敏感度:在低档,每次请求多 100 个输出 token,100 万次请求就多 100,000,000 × $0.50 ÷ 1,000,000 = $50;一个 2,000 token 的提示词如果在某一边多计 10%(200 token),100 万次请求多 $20。短请求里,输出长度比分词器差异更值得盯。

每任务成本:同一 effort 档 Luna 便宜,分数对齐后接近

下面的数字来自 Artificial Analysis 的 Intelligence Index v4.3.2(10 项评测),在 Haiku 5.5 发布次日公布,同一档位名称两两对比:

档位(两边相同)综合指数 Haiku / Luna每任务成本 Haiku / Luna每任务输出 token Haiku / Luna首 token 延迟 Haiku / Luna
Low29 / 22$0.02 / $0.004517k / 2k9.93 秒 / 3.05 秒
Medium(两边默认)34 / 30$0.05 / $0.0233k / 11k13.40 秒 / 未显示
High38 / 33$0.08 / $0.0355k / 20k28.01 秒 / 21.08 秒
Max43 / 38$0.21 / $0.07—432 秒 / 111 秒

同一个档位名,Haiku 分数更高,也花得更多。但两家的 effort 档位各自定义,名字相同不代表做同样多的工作。按分数把两边对齐,结论就变了:

分数接近的组合综合指数每任务成本
Haiku Low 对 Luna Medium29 对 30$0.02 对 $0.02
Haiku Medium 对 Luna High34 对 33$0.05 对 $0.03
Haiku High 对 Luna Max38 对 38$0.08 对 $0.07

在相近的分数上,Haiku 的每任务成本是 Luna 的 1 到约 1.7 倍;最高这一组 Haiku High 的首 token 延迟是 28 秒,Luna Max 是 111 秒。

用这些数字时要记住几个边界:这是一家机构的一套测试框架,发布第二天的数据,之后可能修订;Max 档的数字取自 Max 对 Max 的默认对比页;Haiku 的每任务成本在页面上带星号,对比页没有给出说明;评测里有长上下文项目(AA-LCR),其中是否有请求越过了 Haiku 的 10 万门槛不得而知。最重要的是,综合指数不等于你的任务。它的用处是告诉你该怎么设计测试:别只拿两边的默认档比,要拿"Haiku 低一档"对"Luna 默认档"也比一次。

旗舰模型之间也有同样的"标价差和任务成本差不是一回事",见《GPT-6.1 Sol 对比 Opus 5.5:标价差 2 倍,任务成本差 6 倍》。

按自己的流量估算:混合请求的算法与判断规则

月账单可以按提示词长度分档估算:

text
月账单 ≈ Σ(该档请求数 × 该档单次费用)
单次费用 = 按上文公式,用实测的平均输入、缓存和输出 token 代入

一个混合流量的示例(假设两边 token 数相同):每月 100 万次请求,95% 是 2,000 + 200 的短请求,5% 是 150,000 + 2,000 的长文档请求。

  • Haiku 5.5:950,000 × $0.0003 + 50,000 × $0.080 = $285 + $4,000 = $4,285
  • GPT-6 Luna:950,000 × $0.0003 + 50,000 × $0.016 = $285 + $800 = $1,085

短请求部分两边都是 $285,差额全部来自那 5% 的长请求。这就是为什么要先看提示词长度分布,再看单价。

据此可以得出几条判断规则:

  • 几乎所有请求都在 10 万以内(按 Haiku 5.5 的实际计数):单价打平,比的是"每个合格结果用多少 token"。两边都用默认档时 Luna 通常更省;如果 Haiku 用 low 或关闭思考就能通过你的验收,而 Luna 要 medium 才行,两者成本接近,这时按质量、延迟和你已有的 SDK 选。
  • 有一部分请求落在 10 万到 27.2 万之间:Luna 更便宜,除非你能把这部分请求裁剪或拆分到 10 万以内,或者 Haiku 在这类任务上的质量提升值得多付的钱。也可以把长请求单独路由给 Luna,短请求按质量选。
  • 经常超过 27.2 万:Haiku 是 Luna 的 2.5 到 3.3 倍,选 Luna。
  • 上下文持续变长的多轮 Agent:默认 Luna;如果坚持用 Haiku,压缩和清理要保证每轮都不越过 10 万。

可以用这句话检验自己的结论:"按我的流量,X 更便宜,除非……"。对大多数短请求业务,"除非"后面是 Haiku 在更低档位上的合格率;对长上下文业务,"除非"后面是能不能把 Haiku 的每次请求压在 10 万以内。

切换前先测的 5 项数据和要调的参数

不用大规模压测,拿一两百条有代表性的真实请求,两边各跑一遍,记下这些数:

  1. 用 Haiku 5.5 重新计数的提示词长度。 Anthropic 的迁移指南明确要求用 model 设为 claude-haiku-5-5 重新计数,不要沿用 Haiku 4.5 的数字。记下 P50、P95 和最大值,看离 10 万有多远。Luna 一侧读响应 usage 里的输入和缓存 token。
  2. 每个任务的输出 token,含思考或推理部分。 这是 10 万以内唯一会让两边账单拉开的变量。
  3. 多轮任务每一轮的提示词增长。 重点看 Haiku 保留思考块后每轮多出多少,以及第几轮越过 10 万。
  4. 各档位的合格率。 至少测 Haiku 的 low、关闭思考、medium,以及 Luna 的 none、low、medium,用同一套验收标准打分,再按"每个合格结果的成本"比。
  5. 一次带缓存、总长超过 10 万的请求实际按哪一档计费。 构造一条未缓存部分不到 10 万、加上缓存读取超过 10 万的请求,在用量或账单页面看它按哪一档收费,就能确认缓存是否计入门槛。

调参时用得上的开关:

  • Haiku 5.5:effort 默认 medium,可以往下调;在 high 及以下可以用 thinking: {"type": "disabled"} 关闭思考,但 Anthropic 更建议用调低 effort 来换速度和成本。从 Haiku 4.5 迁移时,temperature、top_p、top_k 传非默认值和 assistant 预填都会返回 400;安全分类器可能返回 stop_reason: "refusal",没有服务端降级,代码里要处理。最小可缓存提示词为 512 token。
  • GPT-6 Luna:reasoning effort 有 none、low、medium(默认)、high、xhigh、max;不急的任务走 Batch 或 Flex 半价,Fast 档按 2 倍计价。

如果小模型在你的任务上怎么调都过不了验收,往上一级看会比继续压参数更省时间,Claude 这边见《Claude Opus 5.5 已发布:API 价格、能力与从 Opus 5 迁移的检查项》。

从 Haiku 4.5 升级:"降九成"按同一段文字算约少 87%

Anthropic 的说法是,10 万 token 以内的请求比 Haiku 4.5 低 90%,超过 10 万低 50%,按它自己的流量平均约低 75%(发布公告)。这里的 90% 和 50% 是每 token 单价的比较,同一段文字在新分词器下会多计约 30%:

  • 10 万以内:同一段文字的费用约为原来的 1.3 × 0.1 = 0.13,少约 87%。例如 Haiku 4.5 上 10,000 token 的提示词加 500 token 输出,费用 $0.0125;同样内容在 Haiku 5.5 上约 13,000 token,费用 $0.00155。
  • 超过 10 万:约为原来的 1.3 × 0.5 = 0.65,少约 35%,没有"降九成"那么多。
  • 门槛提前了。 Haiku 5.5 的 100,000 token 约相当于 Haiku 4.5 计数下的 76,900 token(100,000 ÷ 1.3)。原来 8 万多 token 的请求,换过来可能已经进了高档。

1.3 只是平均值,以重新计数为准。另外 Haiku 5.5 默认开启思考,输出长度也可能和 4.5 不同。截至 2026 年 10 月 8 日,Haiku 4.5 仍是 Active 状态,退役时间"不早于 2026 年 10 月 15 日",还没有发出弃用通知。这个日期只是下限,之后随时可能公布弃用安排,规划迁移前到 模型弃用页面 再看一次。

中国大陆能不能直接调用 Claude 和 OpenAI 的官方 API

不能。Anthropic 和 OpenAI 公布的 API 支持地区名单都不包括中国大陆和香港(Anthropic 支持地区、OpenAI 支持地区)。OpenAI 还写明,在名单以外的地区访问或提供访问,可能导致账号被封禁或暂停。

如果你的公司主体和使用地在支持地区内,开通 Claude API 的步骤见《Claude API Key 怎么获取:先买额度,再创建自己的密钥》。

另一条路是第三方 API 平台。以 laozhang.ai 为例,截至 2026 年 10 月 7 日的模型列表里有 gpt-6-luna,标价每百万 token 输入 $0.1、输出 $0.5、缓存读取 $0.01,与 OpenAI 标准价相同;列表里目前没有任何 Claude 模型,FAQ 说明 Claude 系列因资源原因暂时下线,所以它现在不能用来调用 Haiku 5.5。缓存写入价、27.2 万以上的长上下文价格和 Batch 在该列表里都没有写明,用于长请求前先向平台确认。

Haiku 5.5 与 Luna 价格的几个短问题

缓存命中的 token 算不算进 Haiku 5.5 的 10 万门槛?

公开文档没有写。上下文窗口文档只说缓存读取、缓存写入和普通输入都计入上下文窗口,没说是否计入计价门槛;Luna 的 272K 也一样。预算时按计入处理,再用上文第 5 项测试确认。

走 Batch 能缩小 Haiku 5.5 和 Luna 在 10 万以上的差距吗?

不能。两边的 Batch 都是标准价的一半,比例不变:150,000 + 2,000 的请求走 Batch,Haiku $0.040,Luna $0.008,仍是 5 倍。

Claude Haiku 5.5 和 GPT-6 Luna 哪个更强?

在 Artificial Analysis 的综合指数里,同一档位名下 Haiku 都高 4 到 7 分,但它为此用的 token 也多得多;单项上并不全赢,比如 medium 档的 AutomationBench-AA,Luna 是 40%,Haiku 是 29%。Anthropic 自己发布的图表里,Haiku 5.5 在 GDPval-AA v2.1 上得 1620,据媒体转述 Luna 为 1437,这属于厂商自报,不是独立评测。对你的业务来说,哪个更强要看上文第 4 项测试的合格率。

Haiku 5.5 的 10 万门槛按输入算还是按整个请求算?

按提示词长度判断,提示词包括系统提示词、消息、工具结果、图片、文档和工具定义;输出不计入门槛,但一旦提示词超过 10 万,这次请求的输出也按 $2.50 / 百万 token 计价。