本页是基于外部帮助文章的整理笔记,不是原文全文转载。
抓取整理时间:2026-06-22。
一句话结论:Claude Fable 5 在输入、输出、缓存写入、缓存读取等计费维度上,价格基本都是 Opus 4.8 的 2 倍,选型和迁移预算可以先按这个倍数做粗估。
核心结论
原文的核心判断是:Claude Fable 5 在输入、输出、缓存写入、缓存读取等计费维度上,相对 Opus 4.8 基本是等比例翻倍。
这意味着迁移评估可以先用一个简单办法粗估:如果你已经有 Opus 4.8 的真实成本数据,把同样流量迁到 Fable 5,大致可以按 2 倍预算做第一轮评估。
价格对比整理
| 计费维度 | Claude Fable 5 | Opus 4.8 | 相对关系 |
|---|---|---|---|
| 输入 | 10 美元 / 百万 token | 5 美元 / 百万 token | 2 倍 |
| 输出 | 50 美元 / 百万 token | 25 美元 / 百万 token | 2 倍 |
| 缓存写入 | 12.50 美元 / 百万 token | 6.25 美元 / 百万 token | 2 倍 |
| 缓存读取 | 1 美元 / 百万 token | 0.50 美元 / 百万 token | 2 倍 |
注意:这张表是对原文内容的整理,具体价格应以实际调用平台和官方最新价格为准。如果还不清楚输入、输出、缓存写入、缓存读取这些计费维度具体是怎么算的,可以先看 AI API 计费公式与 Token 机制。
Prompt caching 的意义
对长 system prompt、文档问答、客服知识库、Agent 工作流来说,Prompt caching 往往比单纯比较模型单价更重要。
如果大量上下文会重复出现,第一次写入缓存后,后续命中可以显著降低输入侧成本。反过来,如果每次上下文都完全不同,缓存写入费可能无法摊薄,就不一定划算。
怎么选 Fable 5 还是 Opus 4.8
可以按四个维度判断:
| 维度 | 更倾向 Fable 5 | 更倾向 Opus 4.8 |
|---|---|---|
| 任务难度 | 长链路、高难、多步自我修正 | 常规编码、问答、草稿 |
| 调用频率 | 低频但高价值 | 高频批量任务 |
| 出错代价 | 失败成本很高 | 可接受重试 |
| 预算敏感度 | 价值优先 | 成本优先 |
最稳的方式不是固定只用一个模型,而是做分层路由:关键节点用强模型,高频普通任务用更经济的模型,重复上下文场景配合缓存。如果你的场景还在纠结自建模型还是走云端 API,也可以参考 Qwen 3 8B/27B 模型选型 中类似的四维判断框架。
工程落地建议
- 先用真实流量采样,不要只按单价表拍脑袋。
- 对每类任务记录输入、输出、缓存命中和总费用。
- 把“任务价值”和“模型成本”一起纳入路由策略。
- 对长上下文 Agent 默认评估 Prompt caching。
- 预算敏感场景优先做模型降级、批处理和上下文裁剪。
归根结底,Fable 5 和 Opus 4.8 之间的价格差本身不是问题,缺少分层路由和成本治理的调用方式才是问题——像 LoopRouter 这类分层路由方案,本质上就是把“贵模型只用在刀刃上”的判断自动化。
