从¥0.02到¥210:一张表看懂大模型价格战的「百倍价差」
2026年8月的第一周,大模型API价格表长这样(¥/百万token,按1:7折合):
假设你是个开发者,面前有两个按钮:
- 按钮A:按一次 ¥2
- 按钮B:按一次 ¥210
价格差105倍。
但它们调用的都是2026年最好的大模型。
一张表说清楚
以下是截至2026年8月7日的主流模型API价格对比(统一按人民币,汇率1 USD = 7 CNY):
| 模型 | 厂商 | 缓存命中 | 输入 | 输出 | 发布 |
|---|---|---|---|---|---|
| deepseek-v4-flash | 深度求索 | ¥0.02 | ¥1 | ¥2 | 7/31 |
| hy3(混元3) | 腾讯 | ¥0.25 | ¥1 | ¥4 | 7/6 |
| gpt-5.6-luna | OpenAI | ¥0.14 | ¥1.4 | ¥8.4 | 7/9 |
| qwen3.8-max | 阿里 | ¥1.5 | ¥12 | ¥36 | 8/3 |
| grok-4.5 | xAI | ¥3.5 | ¥14 | ¥42 | 7/8 |
| claude-sonnet-5 | Anthropic | ¥1.4 | ¥14 | ¥70 | 7/1 |
| kimi-k3 | 月之暗面 | ¥2 | ¥20 | ¥100 | 7/17 |
| claude-opus-5 | Anthropic | ¥3.5 | ¥35 | ¥175 | 7/25 |
| gpt-5.6-terra | OpenAI | ¥1.4 | ¥14 | ¥84 | 7/9 |
| gpt-5.6-sol | OpenAI | ¥3.5 | ¥35 | ¥210 | 7/9 |
仅列出文本模型,图片模型(qwen-image-3.0-pro、doubao-seedream-5)另算。
面对这张表,Flash大概是这个表情:

图片来自知乎@Uzlea,Flash二创Q版表情包。星瞳同款白毛+鲸鱼光环,”你有我便宜吗”——¥0.02缓存命中确实有资格狂。
几条肉眼可见的规律
1. 百倍价差是实打实的存在
最低 ¥2(Flash 输出)到最高 ¥210(Sol 输出),差105倍。
这个数字意味着什么?同样处理100万token的输出:
- 用Flash:¥2,约等于一条微信消息
- 用Sol:¥210,够在便利店买一周的午餐
在工业级应用里,每天数十亿token的调用量下,这个价差就是”开源vs破产”的差别。
2. 三档定价已经是标配
OpenAI的三档(Sol/Terra/Luna)不是孤例:
| 厂商 | 低档 | 中档 | 高档 |
|---|---|---|---|
| OpenAI | Luna ¥8.4 | Terra ¥84 | Sol ¥210 |
| Anthropic | Haiku(~¥35) | Sonnet ¥70 | Opus ¥175 |
| DeepSeek | Flash ¥2 | Pro ¥6 | — |
DeepSeek是唯一没有高档的。不是不能做——Pro ¥6跟Terra ¥84比差距很大,说明DS有往上冲的空间。但它的战略选择是不做贵的,只做便宜的。
3. 缓存命中是隐形的战场
Flash ¥0.02 vs Sonnet ¥1.4 vs Sol ¥3.5。
缓存命中价格反映的是各家在KV Cache优化上的工程能力。DS能做到¥0.02,靠的不是模型小(Flash 284B MoE不小),是靠对重复上下文的极致复用。对于Agent多轮对话场景(大量系统提示词、历史消息),缓存命中率通常在60-80%,这意味着实际成本远低于标价。
在这个维度上,DS领先所有人至少一个数量级。¥0.02已经接近”要不要收你钱我还在犹豫”的程度。
4. 混元3:被低估的中间派
腾讯混元3 ¥4输出,只比Flash贵2倍,但比Luna便宜一半。
结合之前我们实测过的”混元3发现字段名矛盾→主动提示”的表现,混元3在Agent场景下是”下限稳定”型选手——不会突然降智、不会偷换模型。对不追benchmark、只要不出错的工业用户来说,¥4买个安心感,这个定位非常精准。
价格的”分钱分货”曲线
如果我们把输出价格画个图,能看到一个清晰的非线性关系:
¥2 —— Flash(极致便宜)
¥4 —— 混元3(便宜+稳定)
¥8.4 —— Luna(OpenAI的低价牌)
¥36 —— Qwen3.8-Max(国产中档)
¥42 —— Grok 4.5(马斯克家的)
¥70 —— Sonnet 5(Anthropic的入门)
¥84 —— Terra(OpenAI的中档)
¥100 —— Kimi K3(超长上下文溢价)
¥175 —— Opus 5(Anthropic的顶配)
¥210 —— Sol(OpenAI的顶配)
从¥2到¥8.4,价格翻4倍。
从¥8.4到¥210,价格翻25倍。
但能力翻了多少?看看SWE-bench、MMLU、Agent任务等基准——
SWE-bench verified:Flash 62% vs Sol 约78%(差距约26%)
Agent任务稳定性:混元3 ≈ Sonnet 5(七分钱两分货效应)
价格翻25倍,能力提升不到30%。这不是”一分钱一分货”,是”五分钱一分货,后十五分钱是保险和品牌溢价”。
这张表的潜台词
回到开头那个选择题——按钮A还是按钮B?
答案不是”按钮A因为便宜”或者”按钮B因为更好”。
真正的答案取决于你是谁:
- 如果你在做批量推理、数据清洗、Agent自动化工序 → Flash ¥2。一天跑10亿token才¥2000。
- 如果你在做需要稳定性的Agent任务(代码、运维) → 混元3 ¥4或Sonnet ¥70。多花钱买不抽风。
- 如果你需要极致推理能力、且”错了后果很严重” → Sol ¥210或Opus ¥175。这钱花的是”责任转移”——出错了你怪模型公司,模型公司认。
- 如果你在写K3那种超长文档/论文 → Kimi K3 ¥100。1M上下文不是所有模型都有的。
价格不是选模型的标准,”你的场景对错误有多容忍”才是。
价格战还没结束,它只是在分层
2023年拼”谁最强”。
2024年拼”谁便宜”。
2026年8月,拼的是”你在每个价格带上都有我的产品吗”——价格矩阵的完整性。
OpenAI有(Sol→Terra→Luna),Anthropic有(Opus→Sonnet→Haiku),腾讯有(混元3 ¥4就是它的答案),DeepSeek有但偏科(Flash→Pro缺高端)。
下一阶段会是什么?
我猜是”缓存命中率“变成产品的核心卖点。因为在Agent时代,多轮对话是标配,KV Cache复用率决定真实成本。Flash ¥0.02不是营销噱头,是Agent场景下的事实成本。当用户发现他们实际花的是¥0.02而不是¥2时,”你有我便宜吗”这句话的杀伤力会更大。
数据来源:各厂商API定价页(2026年8月7日),价格表来自公众号”大模型评测”。题图二次元Flash形象来自知乎@Uzlea。汇率按1 USD ≈ 7 CNY。