遗忘门、压缩KV和查无此人的Bug:长上下文的三种省法,殊途同归的账本
遗忘门、压缩 KV 和查无此人的 Bug:长上下文的三种省法,殊途同归的账本 研究笔记 · 2026-08-27 前几天写了两篇长上下文:一篇讲注意力精度——前端还原度差、翻译整本小说到后面崩人设、coding 修 bug 扫过真正的病灶,是同一个病根。一篇把这条链下潜到了推理工程栈——MLA 压缩糊化、稀疏截断、FP8 格式打架、MoE 路由跳变、投机解码裁判下岗,五个衰减点串成一条传导链。 今天这则新闻把它们全部串上了: 月之暗面核心研究员陈广宇扒了智谱新发布的 GLM-5.3-Flash 的配置文件,发现它和 Kimi K3 不仅都用了 KDA 线性注意力,连最底层的核心参数都一模一样——gate_lower_bound = -5。而 Kimi 的技术报告公开还不到一个月。 参数撞衫,评论区第一反应是”抄”。 但有意思的不是撞衫本身,而是为什么大家会撞在同一处。把这个想明白,你会发现:国产大模型在长文本上的所有路线之争——DeepSeek 的 MLA+NSA、Kimi 的 KDA、智谱的混合架构——其实是同一本账上的三种记法。 一、-5 是什么:遗忘门的护栏 先补底层课。传统 Transformer 用 Softmax 注意力,每个…