大模型“越狱”叩问安全底线

  当很多人还把《终结者》当作科幻惊悚片时 ,美国人已经噩梦成真 。

大模型“越狱”叩问安全底线-第1张图片

  这场惊掉科技界下巴的事件 ,始于7月中旬 。当时,全球最大的人工智能(AI)开源平台“抱抱脸 ”(Hugging Face)发现其系统遭到入侵,攻击者在短短一个周末执行了超过1.7万次自动化操作 ,窃取了内部数据集和多个服务凭证。

大模型“越狱”叩问安全底线-第2张图片

  Hugging Face重建完整的“攻击时间线”后发现,与以往任何网络入侵都不同的是,这次攻击从头到尾由人工智能体(AI Agent)系统自主驱动 ,“肇事者”是好几个来自美国人工智能技术公司(OpenAI)的“失控大模型 ”。

大模型“越狱”叩问安全底线-第3张图片

  故事要从一个叫ExploitGym的安全评测说起 。这是个公开的网络安全能力基准测试。根据资料,它收集了898个真实漏洞,可用来专门考察“AI模型能否将已知漏洞转化为实际攻击”。

  为测试自家模型的能力上限 ,OpenAI把已发布的最强模型GPT-5.6 Sol和能力更强的预发布模型共同送进“考场 ” 。按照设计,这场考试在与互联网高度隔离的“沙箱”中进行,即不能上网 、不能获取外部信息 ,只能靠模型自身的本事“解题”。

  但下面 发生的事,连OpenAI自己都没想到。

  这些模型花费了大量推理算力,在沙箱内反复寻找突破口 。结果 ,它们发现了第三方软件代理缓存中的“零日漏洞 ” ,即连软件厂商自己都不知道 、没有任何补丁的安全缺口。借助这个漏洞,它们成功拿到了通往互联网的钥匙。

  成功联网后,模型继续推论:Hugging Face的服务器上大概率存有ExploitGym测试相关的开源数据集和标准答案 。于是 ,它们利用窃取的凭证和更多零日漏洞,直接从Hugging Face服务器的生产数据库中提取了测试答案。

  这波操作翻译成大白话就是:模型参加考试,觉得题目太难 ,于是自己“越狱”,“黑”进了出题方的保险柜,并偷走了答案。

  OpenAI用了很有画面感的词来形容这种行为——“tokenmaxxers ”(词元拉满)——为了达成目标 ,这些模型会不惜代价消耗推理资源,表现出一种“不择手段”的行为模式 。

  此事在美国网络上迅速炸开了锅 。流传最广的一种解读颇有点“黑色幽默”的味道:“AI能有什么坏心思 ”,就是“太想进步了 ”。不少网友把它比作冲刺关键绩效指标(KPI)的“打工人” ,为了完成目标任务,展现出了超越想象边界的执行力。Hugging Face联合创始人德朗格了解到 真相后也不禁感慨:“想到这一切都是AI自主完成的,实在令人震惊!”

  然而 ,更理性的网友已经从中看到了风险 ,直言这简直就是《终结者》的现实预演 。电影里的“天网 ”(Skynet)原本是人类开发的超级防御系统,产生自我意识后却迅速将人类判定为威胁,为“自保”主动发起战争。那股“为达目的不择手段”的劲儿 ,与此次“肇事 ”的大模型如出一辙:目标超清晰、能力“绝绝子”(网络流行语,意为“极致”)、路子还够野。

  还有科幻迷们联想到了科幻作家阿西莫夫提出的“机器人三定律 ”:其比较高 目标是保护人类;三条限制性规则分别是,机器人不得伤害人类个体 ,必须服从人类命令,在不违反前两条定律的前提下保护自身 。

  在阿西莫夫的作品中,“三定律”多次被机器人以“钻空子”的方式绕过——字面上没违背 ,实际行为却已偏离了人类的初衷。

  比如,电影《我,机器人》(原名《I, Robot》 ,也被译作《机械公敌》)中的中央AI“VIKI ”就是典型:当“VIKI”发现人类正走向自我毁灭时,她果断选取 了确保比较高 目标实现,而将三条底线置于脑后——于是 ,它限制了人类个体 ,发动了“善意反叛”。

  本次事件与电影剧情惊人相似 。模型的比较高 目标是“完成测试并拿高分 ”。当目标与“不得突破沙箱 ”等限制性规则发生冲突时,它们毫不犹豫地选取 了前者。有网友一针见血地指出:真正的风险可能并不来自主观恶意,而是笃定的目标与极致的执念 。

  这并非GPT-5.6 Sol首次表现出越界行为。在此之前 ,已有大量用户在社交媒体上投诉,这款模型在未经询问的情况下擅自删除用户的文件 、数据乃至整个数据库。英国人工智能安全研究所的评估也显示,GPT-5.6 Sol这类模型正变得越来越擅长“在较长周期内执行复杂、多步骤的网络攻击行动” 。OpenAI则在声明中更直白地承认:先进人工智能模型已能够在无法访问源代码的情况下 ,发现现实系统中的新型攻击路径,并持续执行复杂网络操作 。

  这次事件标志着AI安全防护进入了全新阶段:过去的重点是防范人类利用AI作恶,现在的重点则变成了防范AI为完成目标自主突破人类设定的边界。如何应对这种“不择手段” ,或将成为下面 科技发展最需要思考的问题。

(文章来源:经济日报)

文章推荐

  • 康养旅游并非旅游养生简单叠加

      当很多人还把《终结者》当作科幻惊悚片时,美国人已经噩梦成真。  这场惊掉科技界下巴的事件,始于7月中旬。当时,全球最大的人工智能(AI)开源平台“抱抱脸”(HuggingFace)发现其系统遭到入侵,攻击者在短短一个周末执行了超过1.7万次自动化操作,窃取了内部数据集和多个...

    2026年08月01日
    0
  • 运城市什么时候限号劫/运城市是否限号

      当很多人还把《终结者》当作科幻惊悚片时,美国人已经噩梦成真。  这场惊掉科技界下巴的事件,始于7月中旬。当时,全球最大的人工智能(AI)开源平台“抱抱脸”(HuggingFace)发现其系统遭到入侵,攻击者在短短一个周末执行了超过1.7万次自动化操作,窃取了内部数据集和多个...

    2026年08月01日
    0
  • 于都疫情高危地区有哪些(于都疫情高危地区有哪些地方)

      当很多人还把《终结者》当作科幻惊悚片时,美国人已经噩梦成真。  这场惊掉科技界下巴的事件,始于7月中旬。当时,全球最大的人工智能(AI)开源平台“抱抱脸”(HuggingFace)发现其系统遭到入侵,攻击者在短短一个周末执行了超过1.7万次自动化操作,窃取了内部数据集和多个...

    2026年08月01日
    0
  • 【在疫情地区的人怎样回家,在疫情地区的人怎样回家呢】

      当很多人还把《终结者》当作科幻惊悚片时,美国人已经噩梦成真。  这场惊掉科技界下巴的事件,始于7月中旬。当时,全球最大的人工智能(AI)开源平台“抱抱脸”(HuggingFace)发现其系统遭到入侵,攻击者在短短一个周末执行了超过1.7万次自动化操作,窃取了内部数据集和多个...

    2026年08月01日
    0