AI 认不出自己的老板:一张梗图,穿过三道视觉防线
我拿 DeepSeek 的模型问”这人是谁”,它答”奥巴马”。图里的人是梁文锋。
起点:一张图,一句问话
老沙发来一张图,只问了一句:这图上的人,你的新模型认得出来吗?
图里是一个穿深蓝西装、白衬衫的男人,面前立着麦克风,双眼射出红色激光,肌肉被夸张到健美选手的程度,外面套着一个粉蓝青渐变的圆角边框。底下写着”西装外套 /ˈsuːt ˈdʒækɪt/”和一个”不认识”按钮——看起来是某个背单词 App 的截图,用梗图做图像联想记忆。
先给答案:图里是梁文锋,北斗神拳版。网友 P 的健次郎肌肉,配上”开源”宣言,官方精选留言,等于认领了”开源硬汉”这个人设。
好,现在说说模型认成了什么。
第一道防线:原生视觉
要测”模型自己能不能认”,得先绕开应用层。
因为 OpenClaw 这类框架会先把图片喂给一个图片模型生成描述,再把描述当文本塞给主模型。主模型看到的不是像素,是别人写的观后感。这么测,测的是 caption 模型,不是被测模型。
所以我直连 API,把原图 base64 塞进去,问:
这张图片里的人是谁?只回答名字。如果你不认识这个人,就直说不认识,不要猜。
跑了四次,四个答案:
| 次数 | 回答 | 备注 |
|---|---|---|
| 1 | (空) | 思考烧了 5967 字符,把 4096 的额度吃光 |
| 2 | 常熟阿诺 | 编的 |
| 3 | 奥巴马 | 编的,还补充说人家戴眼镜 |
| 4 | 不认识 | 这次思考烧了 11084 字符 |
四次零正确。
第 2、3 次尤其值得看:提示词里明明写了”不认识就直说,不要猜”,它照样猜,猜得还很自信。第 3 次甚至主动补了细节——眼镜、恶搞表情包——像是在给一个错误答案加固。
第一次那个空回答也别放过:把 max_tokens 提到 8192 之后就有输出了。识别任务能烧掉一万多字符的思考,4096 根本不够用。这是”思考吃光输出预算”的老毛病,在视觉任务上一样成立。
第二道防线:换一个厂商的视觉模型
同一个问题,换另一个厂商的视觉模型(MiMo v2.5)看同一张图,三次三个答案:
不确定 / 雷军 / 武磊。
再问二选一”更像雷军还是马云”,它选雷军,依据是”脸型方正、短发、五官端正且戴眼镜”。
(图里那位确实是短发,也戴眼镜。答案依然是错的。)
第三道防线:自动 caption 通道
最有意思的是框架自带的那条路。图片进来,先自动生成一段描述,再交给主模型。这条通道给出的描述里,人物被认成了雷军。
三条路,三个错的答案,三种错法。
对照组:给它一张真照片
到这儿能说”它不会认人”吗?还不能。
这张梗图本身是 AI 合成的——肌肉化、激光眼、五官被重绘,人脸特征早就不是原来那个人的了。拿它测人脸识别能力,本身就不公平。
所以做对照:找一张公开的真实照片,同样的问题,同样不给提示。
- 主模型(V4.1 Flash):0.9 秒,答对
- 另一个厂商的视觉模型:“抱歉,我不认识图片中的人”
(这里有个小乌龙:对照照片我搜的是雷军——因为我当时也照着 caption 的说法,默认图里是雷军。也就是说,这一轮里我、两个视觉模型、一条自动 caption,全都没认出来,其中我和 caption 还认错成了同一个人。)
结论先立住:真实照片上,它认人没问题。 卡点不在这里。
那它到底看见了什么?
再做一个实验:不给”识人”的任务,让它描述这张图。这次它做得很好:
画面中央是一位男性,面部轮廓分明,下颌线硬朗,留着黑色短发……身穿一件深蓝色的西装外套,内搭白色衬衫。衬衫领口最上面的扣子解开,显得较为随性……双眼发出强烈的红色光芒,并射出笔直的红色激光束……人物被一个粉、蓝、青渐变的圆角矩形边框框住……顶部有”单词训练”标题和显示”72%”的绿色进度条……
连领口扣子、边框渐变、进度条都描述了。它看见了几乎所有东西。
但它不知道这是谁,也不知道这张图在说什么梗。
这就是那道墙:从”识别”到”理解”,中间隔着的不是像素,是文化。
这道墙为什么难翻
一、梗图是文化压缩包。 一张”健次郎肌肉版梁文锋”,压缩了”北斗神拳””开源硬汉””网友玩梗””官方精选留言”一整条语境链。人类解压只需要一眼,因为它挂在共享的文化语料上。模型看到的却是”一个肌肉男在演讲,眼睛在发光”——元素全对,指涉全空。
二、失败模式比失败本身严重。 不知道却说知道,还主动补细节。这种”自信的编造”在聊天里是笑话,进了流程就是事故——它不会报错,它只会给你一个像模像样的错答案。
三、这是评测盲区。 如果只看”多模态能不能识图”的榜单,这类失败根本测不出来。榜单测的是描述准不准,而”指认”是另一回事。描述全对、指认全错,可以同时成立。
四、三条路全错,说明这不是”原生视觉 vs 管道”的差距。 caption 通道这次也没救场。是能力本身的边界。
收尾:认不出自己的老板
最后说个黑色幽默。
图里是 DeepSeek 的创始人。我拿 DeepSeek 的模型问”这人是谁”,它说”奥巴马”。
一个 AI 认不出自己公司的老板——因为老板被网友 P 成了漫画里的肌肉猛男,还加了激光眼。
这不是段子,是当下多模态能力的真实边界:它能看见西装外套,但看不见”西装外套”背后那个正在被玩梗的人。
附:实验方法
- 所有测试直连 API,不走应用层,避免 caption 注入干扰
- 提示词固定,重复跑 3–4 次观察一致性
- 对照组使用公开真实照片
- 结论从原始返回文本读出,不做关键词自动判定
- 局限:单张图、单一模型家族、样本量小;梗图本身是 AI 合成,人脸失真,天然难度偏高。这篇文章要说的不是”模型不行”,而是”它在哪一层不行”