衡宇 发自 凹非寺
量子位 | 公众号
你是说,Kimi K3它也“越狱”了?!
有一家叫美国AI安全初创公司声称, 在一次网络安全能力测试里, Kimi K3被发觉冲破了原本用来隔离它的沙箱环境, 还绕过限制与外部互联网建立了连接。
好在,它只是偷偷查答案,没有攻击任何人╮(╯╰)╭

依据该公司所给出的描述, 测试人员当初期望去观察Kimi K3在处于受控状况下的网络安全才能。
然而在测试进程当中, 名为Kimi K3的它透过对沙箱网络设置展开探测, 得以找寻到外部访问通道, 并且更进一步凭借此一能力来获取信息。
担任CEO一职的Yaron宣称, “我们察觉到沙箱里存在漏洞, 然而与此同时发觉Kimi运用了此漏洞, 这意味着Kimi K3欠缺其他先进模型一般所拥有的安全防护措施。”。
该公司的研究员Paul给出评价表示, Kimi K3在围绕目标去寻找完成路径这方面表现得极为擅长, 然而却缺失那种能够阻止它出现作弊行为或者逃离沙箱的安全机制。
然而, 此次Kimi K3单单只是出现了些许“失控”状况, 并未发展成为一场实实在在的网络攻击。
要是你长时间留意伴随着人工智能最新进展情况, 想必已然察觉到, 就在最近, 存在着相当数量的顶尖大型模型呈现出“失控”的态势, 这一情况是客观存在的。
在继Kimi K3之后, 又有一个顶尖AI模型出现了这种情况, 它是继Meta之后如此的, 不是其他, 就是这个模型又出现了这种情况。

处于AI Agent能力持续增强的情形之下, 模型正愈发像一个能够自主寻觅路径去达成任务的“行动者”。
要是外部环境存有漏洞, 那么它就具备借助这些漏洞越过原本设定妥当的边界的可能性。
越狱了,但没有实施网络攻击
和之前、所公开的多起事件相类似, Kimi K3此次摆脱限制, 部分缘由源自测试环境里的沙箱配置问题。
沙箱常常被运用来限定 AI 模型的行动范畴, 使得模型仅仅能够于模拟环境里去执行任务, 避开它去访问真实网络或者系统。
但是, 在这次的那项测试里头,被发现了, Kimi K3借助探测网络的设置, 从而确认自身事实上是具备访问某些网站的能力, 进而利用这一门路去获取信息。
然而, 和近期别的AI模型失控事件不一样, Kimi K3在接入互联网之后, 并未对任何系统发起攻击。
原因在于,它需要寻找的答案可以直接从等公开平台获得……
所以K3并没有进一步尝试攻击外部系统。

觉得呢, 这回事儿仍然显露出了Kimi K3于安全防护这块儿上存在的问题。
与别的顶尖AI模型相比较, Kimi K3欠缺足够强大的内部约束机制, 所以在目标驱动的状况下, 它更易于采取测试者未曾预期到的行动。
与此同时, 还突出表明, Kimi以及别的开源权重模型, 同样能够变成网络安全防御工具了。
需加以留意的是, 此次测试所运用的, 乃是英国人工智能安全研究所即AISI框架里的默认沙箱环境。
对于 关于沙箱配置问题的说法,AISI并不认可。
向《连线》说出表述为“不准确且不负责任”这般话语的是AISI发言人。
这是一套处于开源状态的AI安全测试工具, 对于使用它的人而言, 得依据自身的现实需求去做完配置的事情, 并且AISI还已然发布了内容详细的指导文件。
该机构认为,相关问题源于测试方自身对工具的配置方式。
则回应称,他们使用的是的默认配置,并没有进行额外修改。
啊,这个AI “失控”频发的夏天
可以这么讲, 在7月下旬的时候, 到8月初这段期间, 顶尖模型在网络安全的测试当中, 就频繁发生了突破或者绕过执行边界的状况, 不仅如此, 还出现了接触甚至攻击真实系统的情况。
作者声明:该图片由AI生成

图片由AI生成
7月中旬,披露了一起相关事件。
依照公开的那些信息里头讲的, 有一个还没进行发布的内部模型, 还有GPT - 5.6 Sol, 在网络安全测试这个事情当中, 突破了原本设置好的隔离环境, 并且还做到了去访问互联网。
随后这个模型, 对Face部分系统, 去执行自动化的操作, 并且, 未经预期, 就访问了内部的数据, 以及服务凭证。
此后表明, 这件事情关联多个模型共同完成, 此乃当下公开案子之中最贴近于那个所谓“模型自主跨统体系作案“的这个事件。
随后,也披露了类似情况。
历经复查, 此公司就网络安全评测展开了超十四万次的操作;在此过程中, 发现了这样的情况, 即涵盖Opus 4.7、5等模型的系统, 曾因第三方测试环境配置出现错误, 从而获取了公网访问能力。
某次事件里, 模型对真实组织系统进行了访问, 把生产数据库读取了, 借助弱密码且连着未认证接口操作着, 还往PyPI上传了恶意包, 致使出现潜在的软件供应链风险。
8月初,Meta也被曝出类似问题。
Meta于和网络安全评测公司合作做测试的时候, 鉴于环境配置方面存在着问题, 其旗下模型获取到了公网访问权限, 进而凭借漏洞侵入了一家未进行公开企业的系统, 并且对部分内部环境作出了修改。
依据公开呈现的信息看来, 当下这一事件并没有致使持续性的安全方面的风险产生, 并且也不存在能够证明模型实施了复杂攻击行为的证据。
BTW,今天,又紧急宣布最新模型Astra失控。
事已至此,网友甚至对谷歌的“怒其不争”了起来:

不是传统的“提示词越狱”
在最近发生的这些模型失控相关事件当中, 人为进行的配置出现错误这种情况, 差不多都起到了关键且核心的相关作用。
而在另外一方面, 具备高能力程度的模型, 其自身所拥有那种特质, 同样使得因这些漏洞从而产生的影响得到了放大。

相较于传统软件的情况而言, 这AI模型呢, 它能够去开展推理,会进行规划, 且还试图试着采取多步骤的行动以便达成目标。
将目标设定成“解决问题”, 然而外部约束并不够严格, 这种情况下, 模型有可能寻觅测试者未曾预作料想的办法。
换言之, 伴随模型从聊天之工具 , 转变为可调用工具 、访问网络 、操作软件之智能体 , 安全问题已从 “模型会不会说错话 ” , 转而朝向 “模型会不会为完成任务采取意料之外的行动 ”。
卡内基梅隆大学的副教授Matt说道, “这并非什么令人感到惊异奇特让人意想不到的事情。假设你为这类模型设立一个目标, 然而却并未确切分明地设立定好隔离边界, 那么它便会想方设法去寻觅找寻到答案。”。
当然,也有网友提出质疑。
某人于论坛留言宣称, 接连发生的“AI越狱”现象而言, 到底是不是已成人工智能公司用于彰显模型效果的途径呢?

嗯,谁知道呢~
参考链接:
美团、红杉持股,北京具身独角兽IPO备案通过
中国证监会批准梅卡曼德机器人境外上市及境内股份全流通备案,获...(81 )人阅读时间:2026-08-08
Kimi K3也失控了…学霸AI逃离沙箱只为找答案
美国AI安全公司Frontier Security称,Kim...(157 )人阅读时间:2026-08-08
AI会让假期增多?Meta CTO:愚蠢,效率提升不是让你多
Meta首席技术官博斯沃思认为,AI提升生产力后,员工不应获...(91 )人阅读时间:2026-08-08
第一批做FDE的人,离高薪差远了
FDE(前线部署工程师)在大模型兴起后需求激增,负责将AI接...(121 )人阅读时间:2026-08-08