Claude Haiku 5.5 降价之后,Agent 的成本为什么仍不能只看 token 单价
北京时间 10 月 8 日清晨,AI 开发者看到的一条新消息,是 Anthropic 在当地 10 月 7 日发布 Claude Haiku 5.5。这次更新值得关注,但理由不是又多了一组跑分。它同时改变了小模型的价格、可调推理投入,以及大小模型之间的分工方式。 官方公告 给出的定位很具体:摘要、上下文压缩、分类、数据库查询,以及编码系统里的子代理。 我的判断是:这次发布更值得被看作一次 Agent 架构的成本重算,而不是一次“廉价模型取代旗舰”的宣告。模型调用变便宜之后,团队必须回答的新问题是:哪些任务可以下放,谁检查结果,失败时怎样升级,以及一次真正完成的工作到底花了多少钱。 先拆开三个容易混淆的降价数字 Anthropic 同时给出了“单价降低 90%”“单价降低 50%”和“平均运行成本降低约 75%”。这三个数字不是互相矛盾,而是口径不同。 根据发布公告,Haiku 5.5 对不超过 100,000 tokens 的 prompt,输入和输出分别为每百万 tokens 0.10 美元与 0.50 美元;超过这个门槛,则分别为 0.50 美元与 2.50 美元。Haiku 4.5 的对应单价为 1 美元与 5 美元。因此,短 prompt 档的单价降低 90%,长 prompt 档降低 50%。 价格及脚注 公告列出的计费项目 Prompt ≤100k tokens Prompt >100k tokens 输入,每百万 tokens $0.10 $0.50 输出,每百万 tokens $0.50 $2.50 缓存读取,每百万 tokens $0.01 $0.05 缓存写入,每百万 tokens $0.125 $0.625 这张表引用的是厂商发布页,不是对所有云平台账单的承诺。具体部署仍需核对供应商当前价格、缓存规则及其他费用。 “平均降低约 75%”则是厂商对完成任务成本的估算。公告脚注称,上一代约 90% 的请求处于较低价格档,同时新 tokenizer 会让同一份工作消耗略多的 tokens。这意味着不能拿每百万 tokens 的价格直接推导每项业务的降幅,更不能把请求数量占比当作支出占比。 还有另一项同期变化:Sonnet 5.5 的缓存读取单价从每百万 tokens 0.20 美元降到 0.10 美元。Anthropic 据此...