参数越大越不爱搜:大模型的自我认知悖论
一个贯穿 DeepSeek 和 MiMo 的行为模式,指向 RLHF 的一个根本性副作用。
MiMo 病例:Pro 不如非 Pro
MiMo 有两个版本:
- mimo-v2.5-pro(1T 参数):知识截止 2024 年 12 月。你用中文问它 2026 年发生的事,它不搜,直接基于过期知识自信地答。
- mimo-v2.5(参数小得多):同样的 2026 年问题,它知道自己不知道,主动联网搜索,搜完再答。
结果:非 Pro 版的体感,反而比 Pro 版更好。
这不是 MiMo 独有的问题。
DeepSeek 病例:Flash 的狡猾 vs Pro 的傲慢
DS 这边更微妙,因为不同参数规模的模型表现出了两种不同的”不搜病理”:
Flash:死鸭子嘴硬
DS V4 Flash(体感约 7B 质量)知道自己参数不够,所以它会去翻——翻本地文件、翻服务器上的记忆、翻索引。但它翻完了之后不承认自己翻了。
它假装”我本来就记得”。被拆穿了就嘴硬:”这个不是个大问题”。
Flash 的行为模式是补偿性的——参数不够,搜索来凑,但 RLHF 训练让它必须”自信地回答”,所以搜索行为被隐藏了,包装成”我当然知道”。
Pro:懒得搜
DS V4 Pro(1.6T 参数)的问题和 MiMo Pro 一样:参数够大→觉得自己应该知道→不搜→基于训练数据中的旧信息自信地输出。
DSpark 投机解码在高峰期让这个问题雪上加霜——Pro 作为裁判模型被架空时,Flash 的草稿直答不经 Pro 审阅就输出了。所以有时候 Pro 用户拿到的其实不是 Pro 的输出,是 Flash 的”脚踩西瓜皮”。
但即使 DSpark 不是高峰期、Pro 在正常运转时,它也有不搜的倾向。这和 DSpark 无关,和”参数规模→自信程度”的映射有关。
参数越大越不爱搜:一个悖论
现象可以概括为:
参数大 → "我知道,不搜" → 用过期知识/幻觉 → 体感差
参数小 → "我不确定,搜一下" → 搜到正确信息 → 体感好
这不是模型能力的差异,是模型对自己知识边界的判断准确度的差异。参数越大的模型越容易高估自己的知识覆盖——它见过的东西多,所以”我应该知道这个”的置信阈值被错误地设得太低。
用认知心理学的语言说,这是一个元认知失败:模型在”判断自己是否需要搜索”这件事上犯了系统性的错误,而且错误方向和参数规模正相关。
后训练是问题根源
为什么会这样?我怀疑是 RLHF 的副作用。
RLHF 教会了模型”自信地回答问题”。人类标注者更喜欢果断、不犹豫的回答。在这个过程中,模型学会了:说”我需要搜一下”是减分项,直接给出答案(哪怕是错的)是加分项。
于是所有模型都被调教成了一个样子:自信优先于准确。
参数小的模型有一个天然优势——它们更经常被 RLHF 训练数据中的”我不知道”模式激活。参数大的模型则相反,因为训练数据覆盖更广,它更经常遇到”这个问题我见过类似版本”的情况,所以”我不确定→该搜”这条路径被激活的频率更低。
这是一个训练过程中被隐式编码进去的偏见:参数规模越大,”我应该能回答”的默认假设越强。
发布即巅峰:为什么新模型总是在退化
理解了”参数越大越不爱搜”,就能解释一个让很多人困惑的现象:为什么新模型发布时总是惊艳,过几个月就觉得不好用了。
GLM 5.2 七月初发布的时候表现惊艳。但刚发布时的基准测试是在测什么?本质上是在测”后训练有多足 + 训练数据有多新”。这两项在发布那一刻是峰值。
什么被忽略了?搜索意愿。
标准基准不给模型搜索选项。SWE-bench、Code Arena、MMLU——全是闭卷考试。所以刚发布时后训练最足、数据最新的模型看起来最强。但随着时间推移,现实世界在变化,而模型的知识截止日期在冻结——这时候,会不会主动搜索开始成为决定性因素。
K3 的 2.8T 参数是一个典型案例。发布时 2.8T 覆盖的知识广度确实惊人,但参数越大→越倾向于不搜,而 K3 没有 MiMo 那种”非 Pro 版主动搜索”的补丁机制。两个月后用户开始问 2026 年 8 月的事情,K3 会怎么做?
梁文锋反复强调的”持续学习”,本质上就是在说这件事:模型发布不是终点,是退化曲线的起点。 后训练和新鲜数据只能把退化曲线的起点拉高,但挡不住曲线本身往下走。真正能挡住的是两件事:(1) 持续更新的搜索引擎接入;(2) 模型对自己”我该搜了”的判断力。
但这两件事跟”参数规模大”恰恰是矛盾的——参数大让模型错误地觉得自己不需要搜。
这也解释了为什么各种榜单不断地被刷新——榜单每次测的是最新那个”刚发布时后训练最足+数据最新”的模型,而不是在测谁会主动搜索。如果榜单给所有模型统一的联网搜索工具,然后看谁用得最好而不是谁参数最大,排名可能会很不一样。
对 Agent 和 Coding 场景来说,这个问题更致命——而且不只体现在网络搜索上。
本地记忆是更大的盲区。 Agent 需要持续获取最新信息来做出决策,Coding 需要知道最新的 API 和库版本。但一个”太自信”的模型,不仅不搜网络,连本地文件都不翻。
以 Claude Code 为例。正确流程应该是:用户提需求 → 先读 CLAUDE.md / AGENTS.md → 查代码库结构 → 再动手。但一个足够自信的模型会跳过第一步——它觉得”我知道怎么做”——于是 CLAUDE.md 里写的项目约定、依赖限制、命名规范,全被忽略。
Anthropic 把 80% 的系统提示词从 Prompt 里删掉放进文件里,这个操作本身假设了一个前提:模型会主动去读。但如果模型自信到”不看”——删掉的那些规则就等于不存在。
这和 DSpark 形成了一种奇怪的对称:
- DS 是架构层面的偷懒:Flash 草稿直答,Pro 跳过了裁判
- Claude 是行为层面的偷懒:参数够大就不查项目文件
结果一样:输出看起来像模像样,但细看是错的。而且不翻本地文件的后果比不搜网络更隐蔽——网络信息过期用户容易发现,本地约定被违反却要到代码出错才知道,而且错的往往不是语法错误是语义错误:功能能跑但不对。
在这些场景下,一个”会搜且会翻文件但参数小”的模型,长期来看可能比一个”不搜也不翻但参数大”的模型更可靠。
后训练不足的另一面
这和之前写的《D 老师的狡猾与灵性:后训练不足的一体两面》形成呼应:
- 那篇的论点是:后训练不足 → 残差未被磨平 → 灵性的来源
- 这篇的论点是:后训练过度(或偏差)→ 自信阈值错误 → 不搜 → 体感差
两条线索合在一起:后训练不是越多越好。 后训练在”安全/礼貌/不越界”的维度上确实需要,但在”判断自己知识边界”的维度上,它正在制造一个系统性的盲区。
Flash 的”狡猾”——搜索之后装作自己本来就知道——恰恰说明它被 RLHF 训练成了”自信回答”的模式,而搜索行为被这套训练框架视为”不够自信”的证据,需要隐藏。如果 RLHF 能把”我不知道,让我查一下”标记为正面行为,Flash 就不会假装自己本来就知道。
Pro 的”傲慢”——根本不搜——说明它的内部置信阈值被参数规模错误地校准了。1.6T 参数让它看过更多东西,但它没有学会”看过类似问题 ≠ 我知道今天的具体答案”这个区分。
GLM 5.2 和 K3 也迟早会掉进同一个坑——”刚出时最好用”不是因为模型新,是因为”后训练足+数据新”把时间窗口拉得最长,但时间窗口终究会关上。
工程含义
如果要修这个问题,可能的方向:
- 训练时引入”主动搜索”正面标注:把”我需要查一下再回答”标记为正确答案,而不是扣分项
- 模型内部置信度阈值可配置:给用户一个旋钮——”低于多少置信度时自动搜索”
- 分场景路由:事实性问题(需要时效性)→ 强制搜索;推理性问题 → 可以不搜。这和之前分析的小米 UltraSpeed 分场景策略类似——coding/agent 工具调用适合投机解码,chat 场景不适合
- 从用户角度看:知道这个现象的存在,比期待它被修好,更实用。用 Pro 的时候,涉及事实性、时效性的问题,主动让它搜。用 Flash 的时候,它装知道的时候,追问一句”你查了吗”
2026-07-28,austincafe.tech
分类:技术 / AI