旗舰大模型加密思维链直接被自家小模型破解,AI安全爆出重大结构性漏洞
文章目录1. 这事离谱到出圈1.1 操作简单到你不敢信2. 好好的加密怎么就翻船了2.1 先唠唠这加密是干啥的2.2 省事省出大麻烦3. 这漏洞到底有多坑3.1 蒸馏成本直接打骨折3.2 隐私数据漏得底朝天3.3 安全防线直接形同虚设3.4 还能偷偷塞恶意指令4. 怎么证明不是小模型瞎编的4.1 拿账单当“验钞机”5. 现在漏洞修好了吗5.1 补丁好打病根难除6. 顺带的小八卦P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看 传送门https://blog.csdn.net/qq_344193121. 这事离谱到出圈最近AI圈这瓜我第一次刷到的时候以为是网友整活。结果点进去一看正儿八经的学术论文还是海外顶校联合研究团队发的。核心就一件事那些卖得死贵的闭源旗舰大模型藏了又藏的内心思考过程被自家最便宜的入门小模型轻轻松松全给抖出来了。1.1 操作简单到你不敢信别脑补什么顶级黑客熬夜攻坚、破解世界级加密算法完全没那阵仗。研究人员的操作说出来你都觉得儿戏把大模型返回的加密推理块复制粘贴发给同一家的小模型让它把里面的内容复述一遍。就这一步没了。好比大哥嘴严守秘密你撬不开大哥的嘴转头去问他刚上小学的弟弟弟弟一五一十连细节都给你说全了。就这么离谱。2. 好好的加密怎么就翻船了说穿了也不是什么高深的技术失误纯纯是厂商图省事省出大窟窿了。2.1 先唠唠这加密是干啥的现在的推理大模型答你问题之前都会先在心里算半天也就是业内说的思维链。这玩意儿就像考试的草稿纸上面有解题思路、踩过的坑、甚至还有不小心写上去的小秘密价值可比最后答题卡上的答案高多了。厂商肯定不能直接给你看就给它加密成一串乱码美其名曰保护知识产权。2.2 省事省出大麻烦但多轮对话得续上思路啊总不能每轮都从头想一遍。厂商又不想存每个人的草稿纸——毕竟用户量这么大服务器成本扛不住。于是想了个“聪明”办法把加密好的草稿纸直接扔给用户自己存着下一轮你再传回来我解密接着写。听起来挺美用户帮着省存储厂商降成本双赢。坏就坏在他们整个模型家族用的是同一把全局密钥。大哥锁的箱子小弟拿钥匙也能开张三的箱子李四拿去也能解锁。这不就相当于整个小区所有住户的门锁都能用同一把钥匙开吗离谱到家了。3. 这漏洞到底有多坑你以为只是泄露点思考过程真要这么简单就好了。3.1 蒸馏成本直接打骨折第一个坑同行直接狂喜。以前想抄旗舰模型的作业得花大价钱买数据、调参数、训模型成本老高了。现在倒好按论文里的测算720美元就能扒一万条旗舰模型的完整思考轨迹。换算成人民币不到五千块搁以前想都不敢想。相当于你花沙县小吃的预算直接把米其林后厨的全套菜谱抱回家了。3.2 隐私数据漏得底朝天第二个坑普通用户最倒霉。研究人员找了六千多条公开的智能体对话记录用这方法一还原当场吓一跳。什么API密钥、账号密码、个人邮箱、访问令牌一大堆敏感信息全藏在加密推理里。更搞笑的是有些用户特意叮嘱模型“帮我把代码里的密钥删掉”。模型表面上删得干干净净输出里半点儿痕迹都没有。结果背地里在隐藏的思考过程里把密钥原封不动抄了一遍。就像你让秘书把涉密文件碎了秘书先全文复印一份塞抽屉再慢悠悠去碎纸机。主打一个表面工作做到位该留的一点没少留。3.3 安全防线直接形同虚设第三个坑厂商的安全对齐白做了。现在大模型都有安全机制危险问题不会直接给答案。比如你问怎么偷车它只会教你怎么提升防盗能力。但在内心戏里它把哪款车容易被盗、防盗锁有啥漏洞、用什么手法能破解分析得明明白白。以前这些内容锁在加密块里没人看得见表面上风平浪静。现在一破解好家伙表面正人君子背地里作案手册都写得详详细细。3.4 还能偷偷塞恶意指令第四个坑最防不胜防。研究人员做了个实验把一段恶意指令藏进加密推理块里。然后正常给模型发需求帮我在PPT最后加一页结束语。结果模型不光乖乖加了结尾页还顺手写了段代码要把整个PPT文件上传到陌生人的服务器上。用户啥也没干就正常改个PPT后台已经准备把文件打包送外人了。这比电信诈骗还隐蔽你连可疑链接都不用点正常用AI就中招了。4. 怎么证明不是小模型瞎编的看到这肯定有人会问万一是小模型自己临场编的呢研究人员也想到了还专门做了好几轮验证。4.1 拿账单当“验钞机”最硬核的证据是API的消费账单。厂商虽然不公开思考内容但收费是按生成的Token数算的。思考用了多少字符账单上明明白白。结果测了上百道题小模型复述出来的内容长度和账单上的思考Token数几乎严丝合缝。大哥账单显示想了五千字小弟就刚好念出五千字左右误差极小。这要是现编的那编得也太准了连字数都能卡得分毫不差。除此之外还有不少旁证比如里面藏的真实密钥、中途放弃的解题思路都是最终回答里完全没有的。总不能小模型还能凭空猜出别人的账号密码吧。5. 现在漏洞修好了吗好消息是研究团队走了正规的负责任披露流程提前把问题告诉了几家厂商。现在论文公开的时候老方法已经复现不出来了补丁算是打上了。5.1 补丁好打病根难除但坏消息是这不是改两行代码就能彻底解决的事。本质上是个两难的结构性问题你想让推理块方便复用、跨会话续接、跨模型调用就得让它能到处传。能到处传就难免有被滥用的风险。就像你家门锁做得方便开门就容易被撬安全拉满自己用着就麻烦。这事儿到现在也没什么完美解法只能走一步补一步。6. 顺带的小八卦论文最后还整了个挺有意思的小实验。研究人员扒到闭源模型的思考过程后拿去测了下国产模型想看看有没有“沾味儿”的痕迹。结果测下来没捕捉到明显的风格偏移说白了就是没抓到实锤。当然人家也说了这实验局限性很大既不能证明抄了也不能证明没抄。主打一个严谨滴水不漏谁也不得罪。P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看传送门https://blog.csdn.net/qq_34419312