Forwarded from 动察Beating AI News
Claude防蒸馏可能白防了:小模型能直接套出大模型思维链

大模型厂商为了防止能力被蒸馏,会隐藏完整思维链,只给用户一份摘要。但最新研究发现,这层保护可能没有想象中牢固:把 Opus 的加密思维链交给同厂更弱的 Haiku,再越狱 Haiku,就能让它直接复述 Opus 的原始推理。研究者在 Claude、GPT 和 Gemini 上都跑通了。

这件事其实已经铺垫了几个月。5 月,密码学家 Matthew Green 发现这些加密思维链可以跨会话、跨账号重放,但当时还没找到稳定读取内容的方法。新论文把最后一步补上了:不用破解加密算法,直接让厂商自己的模型帮你「解密」。

更早的 3 月,现 Engram 联合创始人兼研究负责人 John X. Morris 等人还证明了另一条路:即使完全拿不到原始思维链,只看答案和推理摘要,也能反推出一套详细的合成推理,再用于训练小模型。

这也让此前流传的「国内 AI 公司早已找到办法获取 Claude、Codex 原始推理,再拿去训练模型」的说法,在技术上更说得通了。但这仍只能证明方法可行,不能证明任何国内 AI 实验室实际这么做过。

论文还发现一个反常现象:部分 Claude、GPT 的原始推理片段,在 Kimi K3 中被复现出来的概率,最高比其他模型高约 100 万倍。给 K3 几个 Opus 推理开头,它后面的思路也会明显更像 Opus。但作者强调,这些结果不足以证明 K3 做过蒸馏。

论文