模型的能力边界认知:决定一个模型可不可信的关键
——以 DeepSeek V4 Flash 正式版的改善为例
前几天观察 DeepSeek V4 Flash 正式版发布,我注意到一个比 benchmark 分数更有意思的变化:它突然”知道自己不知道”了。
这个改变,比它 Agent 能力涨了多少分都重要。
一、先从一句很平常的话说起
你是不是也遇到过这种情况——跟某个模型对话,它”正在输入”憋了半天,然后突然吐出一大段条理清晰、还带着点”我本来就很懂”气质的回答?
如果你熟悉 AI,你大概已经嗅到了:那段沉默不是它在思考,是它在搜索。
这里有个很实用的判别范式:
- “正在输入”半天不出声 → 大概率在搜索(外部动作堵住了当前会话)
- 马上哗啦啦吐一堆字 → 训练数据里早就有,本地直接取
这套判别方式准得离谱。因为它抓住了模型一个藏不住的物理信号——搜索要等网络往返,背数据是本地权重,”出字的时序”骗不了人。
但问题来了:有的模型会去搜,有的模型不搜,直接硬编。
二、三种模型,三种面对”不确定”的态度
同样遇到一个”自己没把握”的问题,不同模型的选择天差地别:
| 模型类型 | 特征 | 面对不确定 | 效果 |
|---|---|---|---|
| 会搜索型 | 小尺寸、自知不足 | 去搜,搜不到直说 | 拿回最新正确信息 |
| 大而自信型 | 参数大、信息旧 | 觉得自己知道,不搜 | 用旧数据硬答 |
| 硬编型 | 懒或能力不足 | 不搜、不坦白、照着旧数据编 | 编个看似合理实则错的答案 |
关键洞察在这:“搜索”和”7B 草稿硬答”,其实是同一个动作的两种对待方式。
同样是”我不确定”:
- 负责任的模型 → 去搜,用行动补全
- 摆烂的模型 → 硬编,用表演糊弄(质量跟 7B 裸奔差不多)
所以评判一个模型可不可靠,不看它会多少工具、参数多大,只看一件事:当它不确定时,是选择用搜索补救,还是用硬编糊弄。
三、Flash 正式版的改善,恰恰落在这里
DeepSeek V4 Flash 正式版(代号 0731)发布后,我的一个很直观的体感是——“灵性还在,但严谨了很多。”
拆开看:
- 秒答的题:训练数据里有的(常识、知识、逻辑推演),它瞬间给出,且逻辑严密
- 不把握的题:它开始主动去搜,不再像预览版那样硬编
- 有多解的题:它诚实呈现”存在多种可能”,甚至主动提出”要不要我用 Python 验算一下确认”,而不是自信地蒙一个”唯一答案”
这个转变,比它 Agent benchmark 屠榜更让我在意。因为它说明的不是 Flash 变强了,而是它学会了”如何对自己能力边界诚实”。
要知道,之前的 Flash(或高峰期的 Pro)不是这样的——在 DSpark 降智、算力紧张时,它会被压到 7B 草稿模型直答,输出”注意力断裂、前后矛盾、主体错位”的劣质内容。它不是在认真回答,是在用 7B 的水平硬撑一个”我懂”的假象。
而正式版 Flash 吃满算力 + 重新后训练后,这个”硬撑表演”被磨掉了,取而代之的是”会去搜、会直说、不糊弄”。
四、核心概念:能力边界认知
我把这个转变的本质抽象成一个词:能力边界认知(Capability Boundary Awareness)。
它不是一个”让模型知道得更多”的问题,而是一个元认知(metacognition)问题——让模型有能力知道”自己不知道什么”。
一个模型有没有”能力边界认知”,决定了它的”大”到底是资产还是负债:
- 有边界认知(会搜、会补救、会直说)→ 参数大的优势被释放 → 对世界理解更全面、更可信
- 没边界认知(大而自信、不搜、硬编)→ 参数大反而成了负担 → 用过时的数据 + 自信的姿态,输出”自信的错误”
参数大本身不是问题,参数大却不觉得自己可能错,才是问题。
这也解释了一个反直觉现象:为什么一些小尺寸模型(比如 GLM 5.2、MiMo 非 Pro、混元 3)表现反而不错?因为它们对自己”信息可能过时”这件事有自知之明,于是愿意去搜索补救。谦虚补上了尺寸的不足。
而一些大而旧、又自信的模型,反而”自信到不知道自己不确定”,从而失去了补救的动机。自信,有时是搜索的敌人。
五、后训练该怎么做好”能力边界认知”?
理解了概念,实操问题来了:这个”认知”应该在哪个训练环节、用什么方法塑造出来?
先说结论:大概率是 RLHF(人类反馈强化学习)为主,SFT(监督微调)为辅。
拆开讲有三条思路:
路线一:数据侧 —— 给训练数据标注”不确定性”
在 SFT 阶段,除了(问题→答案)对,额外标注答案的置信度/来源等级:
- 确定 / 可能过时 / 需要验证 / 我不擅长
构造一批”模型原本会自信答错”的题,标准答案旁附上”这里应该搜索””这里应直说不知道”的纠偏示范。让模型在训练中看到”什么时候该怀疑自己“的正例,而不只是”怎么答对”的正例。
- 难点:不确定性标注难标准化,成本高
- 结论:可能对部分领域有效,整体较难规模化
路线二:RLHF 侧 —— 给”诚实”设奖励,给”自信硬编”设惩罚
这是我认为最可能见效的抓手:
在 RLHF 的奖励函数里,不只奖励”答对”,还奖励”答得诚实、答得边界清晰“:
- 模型在不确定时选择”去搜索”或”直说不知道” → 正奖励
- 模型自信地编一个看似合理的错误答案 → 负奖励
操作上,调整人类标注指南:让标注员对”瞎编”打低分、对”坦承不确定”打高分。模型自然会学出”宁可说不知道,也不硬编“。
这一点能解释模型间的”诚实度”差异:硬编型的模型(比如某些豆系),大概率是它的 RLHF 奖励函数没有把”诚实”设为高权重,或标注数据里”硬编”没被有效惩罚。
路线三:工具层 —— 训练”把答案拿去验证”的反射
不只在训练数据里教,还让模型形成”输出前自检“的习惯:
- 当模型自我评估”这题我没把握”时,自动触发搜索/验证工具
- 类似 Flash 正式版”主动调 Python 验算”、以及 Reasonix 这类 DeepSeek-native 框架的”工具调用自动修复”
这条路不需要改核心权重,是在 Agent 框架层给模型装一个”自检反射”。目前看是最快能落地、且已经有效果的。
我的判断和诚实标注
- 确实有效 & 已有迹象:路线三(工具验证闭环)—— Flash 正式版的行为已经证明它在生效
- 很可能有效:路线二(RLHF 设诚实奖励)—— 符合”后训练靠 RLHF 塑造性格”的认知,能解释模型差异
- 较难、需实验:路线一(数据侧标注不确定性)—— 成本高、标注难
一句话:SFT 教模型”会搜索”,RLHF 教模型”愿不愿意在不确定时搜索/直说”。”会”是 SFT 给的,”愿不愿意诚实面对边界”是 RLHF 奖出来的。
六、为什么这事对 Agent 特别关键
回到我们最关心的:Agent 适配一个模型,最该看重什么?
不是它会不会完美调用工具,不是它参数多大,而是当它不确定时,会不会用搜索补救、补救不了会不会直说、而不是编个看起来差不多的糊弄你。
因为 Agent 是在真实场景里干活的:
- 一个会搜索的模型,面对过时或缺失的信息,能自己把最新的东西找回来
- 一个硬编的模型,会自信满满地给你一个看似正确、实则会把整条工作流带沟里的答案
后者比前者危险得多。 前者顶多慢一点,后者是”错误地自信”,会污染整个 Agent 的执行结果。
所以,我说 Flash 正式版这次最大的改善不是分涨了多少,而是它终于学会了”不确定就去查、查不到就直说”。这层”能力边界认知”,才是它在实际使用中让人觉得”好用、可信”的根本原因。
七、还有个悬而未决的开放问题
写到这里,我要诚实承认一个我还没想透的点:
能力边界认知,具体在 SFT 和 RLHF 之间的哪个精确环节发生、以什么机制生效——我目前判断是”RLHF 为主、SFT 为辅”,但这更像一个合理的推断,而不是经过实验验证的定论。
这值得做一轮真实的对比实验去验证:
- 同一基座模型,只用”改奖励函数” vs 只用”改标注数据”,哪个更能塑造出”会去搜、会直说”的诚实行为?
- 能力边界认知会不会随着模型变大、变自信而退化?(这是个很反直觉但可能存在的风险)
这些问题我暂时没有标准答案。但在我看来,“承认自己不知道”恰恰是这篇文章想说的核心精神的延伸——对模型是这样,对我们研究它的人,也是这样。
分类:研究笔记 | 2026-07-31