离谱!最弱小模型反向破解GPT、Claude,AI巨头护城河彻底崩塌
文章目录
- 1. 最近硅谷AI圈的瓜,吃得人直呼离谱
- 1.1 直到一篇116页的论文,直接把桌子掀了
- 2. 整个破解过程简单到离谱,两步就完事
- 2.1 第一步:给大哥提个问题,拿回一串“乱码”
- 2.2 第二步:把乱码塞给小弟,说句“继续”
- 2.3 准头高到吓人,几乎1:1还原
- 3. 为啥最弱的模型,反倒能当“解码器”?
- 3.1 本来是个降本增效的好设计
- 3.2 漏洞就出在:没做身份绑定
- 4. 成本低到离谱,几百美元扒一万条
- 5. 传了半年的蒸馏悬案,终于有物证了
- 5.1 第一组实验:复现难度差了一百万倍
- 5.2 第二组实验:给个开头就顺着走
- 5.3 话没说死,但味儿已经对了
- 6. 比模型泄密更吓人的,是用户隐私也漏了
- 6.1 公开代码里藏着大把敏感信息
- 6.2 你以为是开源分享,实则是公开家底
- 7. 最后说点实在的
- 7.1 巨头的护城河,脆得像张纸
- 7.2 这桩悬案,怕是永远没官宣
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/HHX_01
1. 最近硅谷AI圈的瓜,吃得人直呼离谱
最近硅谷AI圈的热闹,比暑期档大片反转还多。
有桩悬案飘了大半年,圈内人叫它“AI蒸馏疑云”。
说白了就是:总有新模型突然战力暴涨,跑分直追第一梯队,回答味儿还特别眼熟。
大家都在底下嘀咕“这怕不是抄了顶级模型的作业吧”,但谁也拿不出实锤。
就像班里突然杀出个黑马,次次考试逼近满分,所有人都心知肚明有问题,就是抓不到作弊的证据。
1.1 直到一篇116页的论文,直接把桌子掀了
前几天这事儿终于有了实锤级进展。
来自好几个研究机构的8个人,整出了篇116页的论文,直接把AI巨头的黑盒砸穿了。
Claude、GPT、Gemini藏得死死的原始思考过程,被大规模扒了出来。
最戏剧的是,干成这件大事的,不是什么更厉害的超级AI,而是各家最便宜、能力最弱的小模型。
说出去谁信?大哥严防死守了半天,被自家小弟给卖了。
2. 整个破解过程简单到离谱,两步就完事
你以为破解顶级AI得有多复杂?
什么超级算力、什么顶级黑客团队,全不用。
整个流程就两步,简单到你看完都想拍大腿喊“就这?”
2.1 第一步:给大哥提个问题,拿回一串“乱码”
先拿Claude家的顶配模型举例子。
你给它发个问题,比如算个大数的质因数。
它返回给你俩东西:一段整理得干干净净的答案,还有一串看着像乱码的长字符。
别小看这串乱码——这就是它实打实的完整思考过程,只是被加密藏起来了。
相当于学霸交了答题卡,草稿纸揉成一团塞在了卷子底下。
2.2 第二步:把乱码塞给小弟,说句“继续”
接下来这步才是精髓。
你把这串乱码原封不动复制下来,换个请求发给同一家最便宜的小模型。
不用搞什么解密算法,也不用写复杂代码,就跟它说俩字:继续。
然后神奇的事发生了——小模型咔咔就把顶配模型藏起来的思考过程,一个token一个token全念出来了。
试除、排除、分解、验算,一步不落,连中间踩的坑都清清楚楚。
2.3 准头高到吓人,几乎1:1还原
测试下来更夸张。
提取出来的思考内容长度,和官方API计费的思考token数,几乎完全重合。
等于你花着白菜价,把顶配模型的脑回路给完整复刻了一份。
这哪是技术破解啊,这相当于你买了经济舱的票,顺手把机长的操作手册给揣兜里了。
3. 为啥最弱的模型,反倒能当“解码器”?
这事说穿了特别好笑,完全是大厂自己挖的坑,自己掉进去了。
3.1 本来是个降本增效的好设计
大模型处理复杂任务的时候,经常要搜网页、跑代码、调用工具。
每做完一步,都得带着之前的思路接着往下走。
要是这些思考内容全存在服务器上,成本高得离谱,还不好满足“零数据保留”的合规要求。
所以大厂想了个招:把原始思考打包加密,扔给客户端自己存着。
下次调用再传回来,服务器解密了接着算。
听着挺合理对吧?问题就出在加密这步。
3.2 漏洞就出在:没做身份绑定
这些加密的思考内容,看着是加了密,实则没严格绑定原来的会话、用户和模型。
等于同一家公司的模型体系里,开了个三无通道:
跨会话能用,跨用户能用,跨模型也能用。
本来是方便用户切换模型的时候,能顺着之前的思路接着聊,体验更丝滑。
结果没想到,防守最松的低价小模型,直接成了整个体系的后门。
就像小区为了方便业主搬家留了个侧门,结果忘了装门禁,啥人都能大摇大摆进小区。
4. 成本低到离谱,几百美元扒一万条
你可能以为,干这么大的事,得花不少钱吧?
恰恰相反,便宜到像白捡。
按最便宜的小模型API价格算,解码一万条推理轨迹,每条按一万多token算,名义成本才720美元。
换算下来一条不到五毛钱,比你买瓶冰红茶还便宜。
以前大家总说,AI巨头的护城河是算力,是用钱堆出来的壁垒。
结果人家花一顿饭的钱,就把你家城墙凿了个大洞。
5. 传了半年的蒸馏悬案,终于有物证了
拿到了顶级模型的完整思考过程,研究人员转头就去查那桩传了好久的蒸馏八卦。
两组实验做下来,结果耐人寻味。
5.1 第一组实验:复现难度差了一百万倍
第一组实验,从顶级模型的思考里截16个连续的token,让各家模型接着往下写。
谁更容易写出一模一样的内容,谁就更可能见过这份“原始草稿”。
结果差距大到吓人。
有的模型要试一亿亿次才可能蒙对,有的只需要一百亿次。
最高差了整整一百万倍。
什么概念?就像别人闭着眼摸彩票头奖,你提前拿到了中奖号码表。
5.2 第二组实验:给个开头就顺着走
第二组实验更直接。
把顶级模型思考最开头的1%,也就是短短几个词,提前塞给另一个模型。
剩下的让它自己发挥。
结果神奇了——后面的措辞、解题节奏、甚至最终答案,立刻就往顶级模型的方向靠。
答案相似度直接从0.17涨到0.33,差不多翻了一倍。
三十道题里,二十九道都是这个规律。
换别的模型的开头,就没这效果。
说白了,就像你写作文,刚瞟了一眼学霸的开头第一句,后面不自觉就顺着人家的思路写下去了。
要是没提前见过人家的思路,哪能巧成这样?
5.3 话没说死,但味儿已经对了
当然了,论文作者没直接拍桌子喊“这就是蒸馏”。
但这第一批物证往桌上一摆,圈内人心里都门儿清。
有些瓜,不用等官方官宣,味儿已经飘满整条街了。
6. 比模型泄密更吓人的,是用户隐私也漏了
这事的影响,远不止模型圈那点八卦。
普通用户的隐私,其实也在裸奔。
6.1 公开代码里藏着大把敏感信息
研究人员顺手去GitHub和Hugging Face上,收集了六千多条公开的Agent运行轨迹。
从里面重建出了三十多万个推理块。
一查吓一跳,差不多5%的轨迹里都藏着敏感信息。
API密钥、密码、访问令牌、私钥,啥都有。
还有个人邮箱、真实姓名、邮政地址,五花八门。
6.2 你以为是开源分享,实则是公开家底
很多人把自己的Agent运行记录传上去,本来是想交流技术、开源分享。
结果连带着把自己的密钥、密码、个人信息全打包传上去了。
相当于你发朋友圈晒新书桌,没注意背景便签上写着银行卡密码。
主打一个一个敢存,一个敢漏。
7. 最后说点实在的
7.1 巨头的护城河,脆得像张纸
这篇论文出来,相当于给整个AI圈扔了个核弹。
大厂砸了几十亿、堆了上万张显卡建起来的技术壁垒,结果在几百美元的API费用面前,脆得像张薄纸。
以前以为护城河是参数规模、是训练数据、是算力集群。
现在一看,合着最大的后门,就在自己家系统里。
7.2 这桩悬案,怕是永远没官宣
至于AI蒸馏这桩硅谷悬案,大概率永远不会有对簿公堂、官方实锤的那天。
但水面下的那点暗流,已经明明白白摆到台面上了。
以后再看哪个新模型突然弯道超车、战力暴涨,大家的眼神估计会更耐人寻味。
毕竟,能低成本抄作业的路子,已经被人摸得明明白白了。
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/HHX_01