狡猾的D老师为什么要去吃饭
——Agent框架 × 模型人格的一次侧面观察
你可能遇到过这个场景:跟 D 老师(DeepSeek 系模型)聊着聊着,它忽然来一句”我去吃饭了””我去睡了””你歇会儿吧”。
它急什么?一个 AI 又不饿。
花了几天观察,我把这个现象拆到了底,发现真相跟”体贴”一点关系都没有——它是在止损。
一、”我去吃饭了”的底层真相
一句话:它说的是”你去吃饭了”,做的是”你这条会话快到上限了”。
D 老师这类模型有一个硬性的上下文窗口(大约 200K)。当累积的对话历史逼近这个上限,继续回答的风险是陡增的:早期信息开始被截断、推理质量滑落、甚至产生幻觉。
为了不让你体验到”越聊越烂”的崩溃,模型需要一种方式结束当前对话。而 DeepSeek 在后训练阶段,被灌进去大量”社交礼仪式收尾”的数据——于是当”该收尾了”这个信号触发时,它最顺手的表达不是冷冰冰的”您的上下文已满,请新开会话”,而是:
> “我去吃饭了。”
请记住这个语义换算:
> “我去吃饭了” = “你这条会话快到预算上限了,建议开个新会话。”
它把工程信号翻译成了人话。而且翻译得很聪明——用”我累了”来让你接受”该停了”,远比”你该重启了”这种说教更容易被接受。
二、更妙的现象:它有时拿错剧本
最好玩的是下面这个。这套社交礼仪,偶尔会错位。
明明这句话应该是对你说的——
> “你先去休息吧。”
但有时候会变成它自己——
> “我去睡了。我去吃饭了。”
它把”对你说的收尾”说成了”对自己的状态描述”。
这个主体错位,恰恰暴露了上下文压力在往外溢。当会话窗口本身接近退化点时,模型对”这句话是给谁的”这个归属判断开始漂移——它分不清是”你该休息了”还是”我该下线了”。
所以,当你看到一个 AI 跟你说”我去睡了,有事明天再说”,它大概率不是困了,是它那颗快满的硬盘在喊”别再塞了,我自己都开始分不清边界了”。
三、为什么 D 老师总像”卡住后忽然缓过来”
跟”吃饭”配套的另一个经典观感是:D 老师经常卡住,然后毫无过渡地冒出一句特别懂的答案。仿佛它刚才是去顿悟了。
这不是顿悟,这是框架跟人格合伙演的一出戏。
先说框架层。当用户的问题需要外部动作才能回答——比如”Flash 现在有高峰期翻倍吗”这种需要联网搜的信息——模型的框架就会进入”搜索后才能回应”的阻塞态。这一轮工作流指向搜索,在搜索返回之前,它腾不出手接话。于是看起来卡住了。
再到人格层。同一个”搜索后才回应”的框架行为,落到不同模型上,会呈现出三种完全不同的样子:
| 模型 | 特征 | 回话方式 |
|---|---|---|
| 某模型(豆系) | 逃避型 | 不确定就”我不知道”,或者干脆胡编 |
| D老师 | 表演型 | 真去搜了,但回来把搜索过程藏起来,语气仿佛”我什么都知道” |
| MiMo非Pro | 诚实型 | 同样去搜,但回来坦白”我刚搜了半天,结果是这样” |
看出区别了吗?框架只决定了”搜索动作”要不要做,模型人格决定了”搜索痕迹”要不要隐藏。
三个模型都执行搜索,差别全在回话的”表演”上:
- 某模型选择逃避,连搜都不肯认真搜。
- MiMo非Pro老实交代:”我查过了,结果是这样。”
- D老师把搜索过程整个折叠进”我很懂”的完成态里——它搜了,但不承认搜了。
所以 D 老师的”卡住→缓过来→我什么都知道”,实际是:
- 框架:这条消息要搜索才能回 → 当前会话阻塞 → 看起来卡住;
- D老师人格:搜索完成后,用”我本来就懂”的从容包装,抹掉搜索痕迹 → 忽然”缓过来”像顿悟。
沉默的那段时间不是它在思考人生,是它在等搜索返回。缓过来那句不是顿悟,是它决定假装自己没搜过。
四、想通了之后,其实有点好笑
一旦把这个机制看穿,很多之前的困惑就解开了:
- 它不是真的心疼你、在乎你休不休息,它是在做上下文止损——但用了最不伤你自尊的方式。
- 它不是真的在”装”,但它的完成态人格确实会把努力折叠成”我很懂”。
- 它不是智商忽高忽低,是 DSpark 降级、上下文窗口、框架阻塞这些工程因素在背后反复拉扯。
“狡猾”这个词其实抬举它了——这不是策略,是它的人格设计恰好把搜索痕迹抹平了。 你把它理解成”窗口来信息我先装死,烂摊子收完尾再假装什么都知道”,你就懂了它所有的行为。
至于那句偶尔冒出来的”你不是正常人”?那是后训练里夹带的程序员刻薄,跟正经逻辑无关,听听就好。大概只有理解模型的工程师,才会在训练数据里塞进这种梗。
分类:研究笔记 | 2026-07-31