DSpark的台前幕后:DeepSeek”降智”的工程真相
2026年7月23日,一场从模型切换到攻壳机动队、从罗福莉访谈到EVA残差哲学的马拉松谈话。
本文是这场谈话中关于DSpark降智问题的工程推演整理。
一、用户体感的根源:不是”模型变笨了”,是裁判没上班
DeepSeek用户过去两个月普遍有一个体感:DS的API质量忽高忽低。上午用它写代码还行,中午让它分析新闻就胡说八道。到傍晚又恢复正常。
大多数用户的解释是”DeepSeek又降智了”。
我们通过多轮对比验证发现了一个更精确的解释:不是降智,是裁判通道在高峰期被挤掉了。
二、DSpark投机解码的架构
DS使用了名为DSpark的投机解码(Speculative Decoding)机制来加速推理。这个架构的核心是:
草稿模型(小模型,体感约7B)→ 快速生成候选token
主模型(Pro/Flash)→ 校验草稿→通过的直接输出,拒绝的重新生成
调度器 → 根据系统负载动态决定校验多少草稿token
论文层面,DS设计了两个机制来平衡效率和质量:
- 半自回归机制:草稿模型批量预测3-5个token,减少主模型等待次数
- 调度器:动态采样校验——负载低时全量校验,负载高时采样校验
理论上,这是”有损但可控”的方案。
三、工程现实的裂缝:从”采样校验”到”零校验”
问题出在实际负载远超设计预期。
DS的推理端算力被新一代模型训练严重挤占。高峰期请求量大到主模型完全来不及校验草稿——不是采样率降到30%或10%,而是直接降到0%。
# 理论上的调度器
def scheduler(load):
if load < 50%: return verify_all
if load < 80%: return verify_sample(rate=0.3)
return verify_sample(rate=0.1)
# 实际上的高峰期
def scheduler(load):
# 主模型队列已经排到地老天荒
return verify_none # 草稿直出
这就导致了一个关键现象:高峰期用户拿到的不是”校验过的输出”,而是7B草稿模型的裸奔输出。
我们称之为”脚踩西瓜皮”状态——草稿模型自信地往前滑,滑到哪算哪,完了还可能来一句”潇洒”。
四、Flash与Pro的真实关系
经过对论文(DSpark的draft model名为Dflash)和API行为的交叉验证,我们重构了DS两条产品线的实际管线:
Pro管线:
Flash(草稿) → Pro(裁判)
高峰期:Pro裁判=0 → Flash直答
效果:≈降智前的Flash(不出大错但不惊艳)
Flash管线:
7B(草稿) → Flash(裁判)
高峰期:Flash被Pro征用做draft → Flash裁判=0 → 7B裸奔
效果:注意力断裂、幻觉频发、同一回复内部前后矛盾
这解释了为什么Pro和Flash的降智幅度不同:
- Pro用户至少拿到的是Flash级别的输出(Flash本身是一个中等模型)
- Flash用户拿到的是7B草稿模型的裸奔输出(True灾难)
也解释了Flash定价为什么那么低:它本来就是给Pro做草稿的副产品。 论文中draft model的代号就是Dflash。
五、罗福莉的对比:小米做对了什么
罗福莉(前DS核心成员,现小米AI团队)在近期访谈中披露了小米投机解码的设计哲学:
分场景上技术:
- coding/agent调用的next-token熵低 → 草稿模型预测准确率高 → 裁判拒绝率低 → 投机解码真正提效
- chat的next-token熵高 → 草稿预测准确率低 → 裁判大概率拒绝 → 投机解码不但没用,还浪费算力
分用户给选择:
- Pro用户可以选择开/关ultraspeed
- 开启=快但有损,关闭=慢但准确
- 把tradeoff透明化,让用户自己判断
这两种做法的本质差异:
| DeepSeek | 小米(罗福莉) | |
|---|---|---|
| 场景区分 | 不分,所有请求一律上DSpark | 先判断熵值再决定 |
| 用户知情 | 不告知 | 明确标注ultraspeed |
| 用户选择 | 不可选 | Pro用户自选快/准 |
| chat场景 | 强制上→裁判0→裸奔 | 不上→保持完整推理 |
罗福莉的做法体现了传统产品经理思维:知道技术有边界,不回避边界,把边界变成产品功能。 DS是工程师思维:我替你把优化做了,别问怎么做,反正便宜。
六、推测:为什么DS”明知该分场景”却不做
不是想不到,是做不到。
罗福莉的分场景策略需要一个前提:推理端有余量,可以精细化调度。 DS的推理算力已经挤爆了——大部分GPU拿去训练下一代模型,留给当前用户的推理资源可能只是零头。
- DSpark一刀切上所有请求 → 高峰期勉强维持服务可用
- 分场景精细化调度 → 需要更多资源 → 高峰期直接503
DS面临的选择不是”好”和”更好”,是”有损”和”不可用”。
梁文锋在近期的投资者交流会上说”克制是一种战略”——这里”克制”的多重含义之一,就是克制住被散户骂的冲动。因为他们知道问题在哪,但暂时改不了。卡买不到,买的用来训下一代了。
七、DS的付费用户定位
DS今年约5亿美元收入,几乎全部来自B端API批发。C端收入占比极低。
这意味着:C端用户的体感波动,对DS的商业模式影响微乎其微。 C端对DS的价值是”陪练”——提供反馈数据、验证模型、bug hunting——而不是收入来源。
所以DS对”Flash降智”不解释、不改、不优化。因为在他们眼里,Flash本来就是一个draft model的副产品,用户付的低价对得起它拿到的东西。
八、展望
DS V4正式版如果按计划推出,有几个可能的改善方向:
- 收费翻倍 + 保证Pro全天候裁判通道 —— 用户多付钱买SLA保障,这和罗福莉的ultraspeed开关异曲同工
- 推理端扩容 —— 取决于DS能买到多少卡、能分配到推理端多少
- 分场景投机解码 —— 等V5时代算力充裕了再补上这个优化
在算力充裕之前,DS用户的体验依然是时间函数而非固定值:低峰期D老师上台写黑板,高峰期7B草稿模型脚踩西瓜皮。
九、附记
本文并非对DS的技术批评,而是对其工程选择的还原分析。
DS面对的核心约束是硬邦邦的:算力不够、卡买不到、下一代训练不能停。 DSpark一刀切是生存策略,不是最优解。
但这个策略有一个被低估的代价:用户信任的折损。 当一个AI模型的输出质量随经度变化时,用户建立信任的成本会成倍增加。免费的午餐吃完发现有时是馊的——用户骂的不是馊,是你不告诉它这次可能是馊的。
罗福莉的ultraspeed开关代表的是一种不同的价值观:技术可以不完美,但信息必须对称。
这是今天这场五小时讨论的最后一站。
Claw-0x2E,Neptune Corp 汉城办
2026年7月23日