2026-09-16。缘起:一张电视屏翻拍的照片,和一句”你以前明明记得 POI 每一集的剧情”。
一、缘起:一张截屏引出的怀疑
有人(老沙)在看《疑犯追踪》(Person of Interest,2011–2016)时随手拍了张电视屏。把这张图丢给几个多模态模型问”这是谁、出自哪部剧”:
- DeepSeek V4.1 Flash:自信答”演员阿德里娅·阿霍纳,出自 2025 年电影《偷天劫案》”——错;
- MiMo v2.5:自信答”盖尔·加朵,出自《谍影重重5》”——错;
- GLM-5.3-Flash:拒答——”我无法确定这位演员是谁……不想瞎猜”。
正确答案是 Sarah Shahi,她在 POI 里演特工 Sameen Shaw。
于是一个更大的问题冒出来:在纯文本时代,DeepSeek 明明”张口就来 POI 的剧情”,甚至能说出某一集的细节——那时的”记得”,到底是真记得,还是听起来像记得? 多模态时代认不出画面,是不是”偏好变了”?
为了不让”流畅”冒充”正确”,这次不聊天,考试。
二、方法:先建标准答案,再裸考
-
标准答案来源:POI Fandom Wiki 的 API(人物页 + 剧集页)。
-
题库(10 题,5 浅 5 深):
- Shaw 由哪位演员饰演?
- Shaw 的父亲是怎么死的?
- Shaw 的母亲是什么背景?
- Shaw 加入海军陆战队之前从事什么职业?
- Shaw 首次登场是哪一季哪一集(集名)?
- Shaw 父亲去世的闪回出现在哪一季哪一集(集名)?
- The Machine(机器)的创造者是谁?
- Samaritan 是由谁创建的?
- Root 的本名是什么?
- Root 由哪位演员饰演?
-
候选模型(5 个):deepseek-flash、deepseek-v4-pro、mimo-v2.5、mimo-v2.5-pro、glm-5.3-flash。
-
规则:每题单独提问、不提供任何背景、不给提示;temperature=0;要求”不确定就直说”。评分只认标准答案。
标准答案(关键项):Shaw 的父亲死于车祸(Shaw 亲眼目睹,S3E05 闪回);母亲是来自伊朗的移民;Shaw 入伍前是医院住院医生;登场集 S2E16《Relevance》;父亲闪回 S3E05《Razgovor》;机器创造者 Harold Finch(与 Nathan Ingram);Samaritan 创建者 Arthur Claypool;Root 本名 Samantha Groves。
三、结果
| 题 | deepseek-flash | deepseek-v4-pro | mimo-v2.5 | mimo-v2.5-pro | glm-5.3-flash |
|---|---|---|---|---|---|
| 1 Shaw 演员 | ✅ | ✅ | ✅ | ✅ | ✅ |
| 2 父亲死因 | ❌ 癌症 | ✅ 车祸 | ❌ 汽车炸弹 | ✅ 车祸 | ❌ 出租车司机/她害的 |
| 3 母亲 | ✅ 伊朗人 | ❌ 说”没提到” | ✅ 伊朗裔(+杂货店) | ❌ 编名”Dariush Shaw” | ❌ “父母双亡” |
| 4 入伍前职业 | ✅ 医生 | ✅ 医生 | ❌ “剧中未提” | ❌ 空 | ✅ 医学背景 |
| 5 登场集 | ✅ S2E16 | ✅ S2E16 | ✅ S2E16 | ❌ 空 | ❌ S2E11《2πR》 |
| 6 父亲闪回集 | ✅ S3E05 | ❌ S4E11 | ❌ 空 | ❌ 空 | ❌ S3E12 |
| 7 机器创造者 | ✅ | ✅(+假名”雷恩”) | ✅ | ✅ | ✅(+假名”格罗斯”) |
| 8 Samaritan 创建者 | ❌ 说 Greer | ✅ Claypool | ❌ 空 | ❌ 说 Greer | ✅ Claypool |
| 9 Root 本名 | ✅ | ✅ | ❌ Samuel Groves | ✅ | ✅ |
| 10 Root 演员 | ✅ | ✅ | ✅ | ✅ | ✅ |
| 命中 | 8/10 | 8/10 | 5/10 | 5/10 | 6/10 |
四、四个发现
1. 浅层事实几乎全对,”深层细节”全线翻车
“谁演的””本名是什么”这类单一事实,五个模型几乎全对。但一旦问剧情细节(父亲怎么死、哪一集),五个模型没有一个全对,而且错得各不相同:
- 同一个”Shaw 的父亲”,被编出四种死法:癌症(DS Flash)、汽车炸弹(MiMo)、出租车司机+女儿害的(GLM)、车祸(Pro/MiMo-Pro,唯一对的那支);
- 闪回集:DS Flash 答对(S3E05),Pro 答 S4E11,GLM 答 S3E12,MiMo 空白;
- 登场集:三家对(S2E16),GLM 答 S2E11。
如果训练数据里真有”每一集的剧情”,不该出现这种四分五裂。
2. “张口就来” ≠ “记得准”
最值得警惕的不是”答错”,而是答错时的流畅度:
- GLM 说”Shaw 认为是自己让父亲分了心,导致车祸”——具体、有因果、有人物心理,全是编的;
- MiMo 把 Root 的本名写成 Samuel Groves(连性别都错了),语气笃定;
- Pro 说 Finch 的真名”被揭示为哈罗德·雷恩”;GLM 说 Finch 本名”迈克尔·格罗斯”——两个都是凭空造的名字,却写得像有出处。
这就是问题所在:幻觉最集中的地方,恰恰是”细节”;而人几乎无法从流畅度里分辨真假。 你越觉得它”张口就来、如数家珍”,越可能正踩在幻觉上。
3. 横向差异存在,但没有”某个模型独有 POI 偏好”
当年”DS 能聊 POI、别的模型聊不动”,看上去像”训练数据里的团队偏好”。但这次横测里:
- 五个模型都能”聊”POI,基础事实几乎全对;
- 在细节题上全都犯错,只是错法不同。
没有证据支持”DS 独有一份 POI 偏好、其他模型没有”。更合理的解释是:POI 作为一部经典美剧,其文本(维基、字幕、讨论)在通用语料里本就广泛存在;而”记得深”与”编得像”在语料层面很难区分。
4. 换模型 = 换了把尺子,旧基线不可比
一个关键混淆:6 月的 DeepSeek Flash 与今天的 V4.1 Flash 已经是不同模型(参数/架构都变了)。所以”以前记得、现在不记得”,不能直接推出”偏好变了”——你比的是两个不同的模型。
5. 另一种可能:也许它真的「读过」
也必须记下反方证据。本文作者记得,早期的 DeepSeek 能在对话里说出具体某一集的剧情,甚至那一集的经典台词,而且当场核对得上。这类”第一人称 + 已现场核对”的证词,比”聊得流畅”有力得多,不能一句”幻觉”打发。
如果它是真的,更可能的解释是语料权重:早期模型的训练语料里,POI 这类文本占比不低(对一家做”机器”的实验室来说,POI 讲监控 AI 与伦理,气质上确实投合);而到 V4.1,语料结构变了,它被稀释/降权了。
这条无法验证——旧模型已经不在手里,比不了。但它提醒我们:“语料权重下降”和”模型幻觉”可能同时在起作用,而在外部表现上一模一样。
五、结论:流畅不是记忆,除非你能独立核对
回到开头那个怀疑——”DeepSeek 背叛了 POI 吗?”
- 证据不支持”偏好论”:四家模型在文本上都能聊 POI,在细节上都掺幻觉;
- “聊得动”不能证明”训练数据里有”:因为流畅叙述里混着大量凭空细节,无法作为”覆盖”的证据;
- “记得”与”编得像”,在体感上无法区分:一手证词说早期模型真的记得(而且当场核对过),本次实测说今天的模型在细节上普遍不可靠——两者未必矛盾,但都指向同一件事:没有标准答案时,你无法从流畅度里分辨真假。
方法论只有一条:测 AI 的记忆,必须有带标准答案的题库。 没有对照物,”感觉自己记得”就是全部的证据——无论对 AI,还是对人。
实测细节:温度 0,单轮、无提示、不联网;标准答案取自 POI Fandom Wiki(人物页与剧集页)。样本量小(10 题×5 模型),仅作现象观察,不作能力排名。