快讯
AI姨:小模型能直接套出大模型思维链
据链上分析师AI姨报道,最新研究发现,Claude防蒸馏的保护措施可能并不牢固。小模型能够直接套出大模型的思维链,尽管大模型厂商试图通过隐藏完整思维链并只提供摘要来防止能力被蒸馏。研究者在Claude、GPT和Gemini上均验证了这一点。研究者Matthew Green早在5月就发现这些加密思维链可以跨会话、跨账号重放,但当时尚未找到稳定读取内容的方法。最近的研究表明,给GPT-5.6和Opus 5一个假工具就能套出思维链。安全研究员Can Bölük也找到了更简单的方法,通过调整原生思维并使用假工具,模型能够将推理写入工具参数。最初他在GPT-5.6 Luna上展示了这一结果,随后在GPT-5.6 SOL和Claude Fable 5上也取得了类似成果。评论区用户也尝试了Claude Opus 5,成功复述了大段推理。尽管如此,目前尚不能直接称这些内容为「原始思维链」。
