参数越大越不爱搜:大模型的自我认知悖论
参数越大越不爱搜:大模型的自我认知悖论 一个贯穿 DeepSeek 和 MiMo 的行为模式,指向 RLHF 的一个根本性副作用。 MiMo 病例:Pro 不如非 Pro MiMo 有两个版本: mimo-v2.5-pro(1T 参数):知识截止 2024 年 12 月。你用中文问它 2026 年发生的事,它不搜,直接基于过期知识自信地答。 mimo-v2.5(参数小得多):同样的 2026 年问题,它知道自己不知道,主动联网搜索,搜完再答。 结果:非 Pro 版的体感,反而比 Pro 版更好。 这不是 MiMo 独有的问题。 DeepSeek 病例:Flash 的狡猾 vs Pro 的傲慢 DS…


