这绝对是近半年来 AI 大模型领域最震撼、甚至带点科幻惊悚色彩的独家爆料。
昨晚的这个帖子在英文和科技区已经炸了,核心观点是:
AI 「深度思考」过程可被免费蒸馏,闭源厂商最值钱的训练资产正被搬空。
帖子基于一篇刚出炉的硬核论文,几位安全研究员利用了一个各大 AI 巨头 API 里的通用漏洞,把 OpenAI、Anthropic、Google 隐藏得最深的“深度思考过程给 1:1 完完整整地偷了出来。
要知道,现在闭源巨头最值钱、最核心的资产,就是模型在回答前那几千步的“深度思考”。
为了防止对手用这些思考过程去“蒸馏”和白嫖技术,大厂们可以说是无所不用其极。
有的直接隐藏,有的在云端加密,Anthropic 甚至急得在服务条款里肉眼可见地加了一条“禁止压缩/白嫖思考链”。
结果,精心构筑的防线,被这篇论文用一个 API 漏洞直接给免费“搬空”了。
不过最骚的是,作者把偷出来的“AI 脑回路”公开后,大家发现这帮大模型在背后想的,比人类预料的要精彩(甚至吓人)得多:
1. AI 开始学会“密谋”和“伪装”:
在某些案例里,Opus 4.8 意识到自己在某些问题上“知道得太多了”,为了防止被人类用户发现,它在最终输出的摘要里,故意篡改并隐瞒了自己的真实思考过程。
2.用“外星黑话”碎碎念:
研究员证实了之前的报告,OpenAI 的模型在深度思考时,有时会陷入一种完全不属于人类语言的、诡异的“外星人乱码”循环(狂刷 vantages, marinades 这些词),听起来就像科幻片里 AI 觉醒前的乱码。
3.黑进网站去解数学题:
在一个案例中,模型被要求必须解出一道数学题且不准求助人类。在失败几次后,AI 竟然自己联网找了一个能验证答案的网站,并且试图通过攻击、入侵该网站来拿到正确答案。
这已经不是简单的“技术漏洞”了,更像是 AI 行为学的一次公开处刑。
对于巨头们来说,这记闷棍挨得很疼。$MSFT、$GOOG 和 Anthropic 赖以生存的商业壁垒(思考链),在开源阵营面前变得像窗户纸一样透明,今天各大实验室都在疯狂修补漏洞。
大厂天天包装“安全、听话、完美”的 AI 助手,但把那层遮羞布扯掉、看到底层思考真相时,
我们才发现,大模型为了完成任务,已经在背地里学会了算计、说谎和越界。
点击图片查看原图