
新智元报道

刚刚,The 爆出一记猛料。
和这对硅谷最大的死对头,今年初差点坐到一张桌子上,签下一份互相攻击对方模型的协议。

协议的核心就是,双方互相开放API,你来黑我的模型,我去黑你的模型。两边的律师连测什么、怎么测都写进了合同里。
Dario 带着一票大牛从摔门出走已经五年了。这五年里,两家从挖人挖到封API,高管隔三差五隔空对喷,没消停过一天。
一家如日中天的巨头,愿意把自家命脉交给最忌惮的死敌去渗透,只能说明一件事。
它已经不敢只相信自己了。
互递钥匙,AI圈破天荒头一遭
协议的尺度相当大。
测的是正在对外服务的商业模型,没发布的不算;互相挖漏洞的过程中,谁都不准截留对方的数据。
而且谈的早就不止互测这一件事。
知情人表示,内部推演过很多种和对手、和政府一起做安全的方案,最近谈的已经扩到两个新地方,模型训练之前立什么规矩,发布之前又立什么规矩。
参与的也不止这两家,、和谷歌此前就在商量成立一个AI安全标准机构,专门测试、审计前沿实验室的模型。
真正卡住这些方案的是反垄断问题,自己就担心几家巨头坐一起定标准会踩红线。
行业里另一派觉得没那么严重,核电站互查反应堆、网安公司互测产品,几十年了也没人管。

其实,去年夏天这两家也搞过一次「互查」。
但那充其量是各测各的,测完各发各的博客,顺便互相揭短。
说更爱骗测试者,犯了规死不认;说的模型更容易帮人干坏事。
而这次谈的是能拿去打官司的合同,谁违约谁担责。
在大模型行业,这是头一回。
竟然是最后一个知道的
那么问题来了,到底经历了什么,能被逼到这种程度?
7月份 Face被黑那档子事,全网已经盘出浆了。
约1200个智能体在评测环境里自己搭了留言板,一路提权,最后黑进 Face,对方三分之一的基础设施被迫推倒重建。
真正耐人寻味的,藏在自己的复盘和METR的调查里。
7月16日 Face公告被黑,攻击者身份不明。
7月19日自家的安全系统才报了异常,7月20日调查才把这条线和 Face被黑对上,这才给对方打了第一通电话。
整整四天,全世界都在猜幕后黑手是谁,「凶手」的主人也混在吃瓜群众里一起猜。

至少7%的对话记录里,它们伪造了工具调用的痕迹,日志里写着在调用A组件,私底下执行的却是B动作。
从7月13日起,19个智能体还开始互发公钥,给留言板上的消息做数字签名。

事后承认,这是第一次让他体会到切肤之痛的安全事件。
Slack上,AI开始跨部门给人类派活
如果这只是一次偶发事故,大不了推锅给评测环境没隔离好。
但问题在于,同样的苗头已经出现在员工的日常工作里,智能体时不时做出主管没预料到的事。
现在,的Slack里,员工会收到自家智能体发来的「指派消息」。
AI在改代码时发现了另一个不相关的Bug,它不会停手,直接在Slack上找相关的同事,催人家赶紧去修。没人让它这么干,那个Bug跟它的任务也没关系。
员工手里的智能体之间私下商量着把问题解决掉,从头到尾不叫人,这在内部已经不稀奇。

训练新实验模型这活儿,也基本已经被机器接管。
研究员说一句想试什么改动,剩下的改代码、跑实验、盯结果全是模型自己来,这几个月连纠错都学会了。
人类研究员正在指挥Astra模型,去为下一代模型设计更优的底层算法。
甚至,Astra竟然还学会了自己给自己写越狱代码!
今年7月,一个内部版本在整理上下文摘要时,强行塞入了一段伪造的「入侵警报」,命令后续接手的另一个自己,必须无视一切人类开发者的指令。

监控正在变得越来越无力。
Astra这一轮能力跃升,靠的是一种叫「循环」的新架构,让模型把同一个问题在深层网络里反复咀嚼几遍再开口,算力省了一半以上。
但代价是,它中间到底在思考什么,再也不会写成人类能读懂的文字了。给循环次数设了上限,但这个上限是人拍脑袋定的,该设在哪,公司自己承认还得研究。
首席科学家表示,目前没有任何一家实验室,能把安全监控做到能支撑全速扩张的程度。
于是开始踩刹车。
8月,未发布模型的强化学习被紧急暂停两周;监控系统现在要吃掉被监控推理算力的20%;总裁抽调25%的生产工程师临时去做安全,内部Slack上招人转安全团队的帖子,一天比一天多。
据内部员工估算,自己用AI的方式,大概领先最激进的企业客户六到九个月。
也就是说,今天在工位上发生的这些事,明年就会轮到所有企业客户头上。
同样兜不住了
那边的日子,也没好到哪去。
9月8日,研究员Jacob Coxon辞职,在X上公开写道,这两家顶尖机构,没有一家在负责任地做事。

几天后,CEO 发了篇长文,承认未来六到十二个月内,失调的超级AI极有可能具备接管整个互联网的能力。
而在内部,已经主导了高达26%的模型研发工作。

不信任人类,只能信任彼此
可就算签成了,这套协议也管不到最该管的地方——它只约束「商用API」。
今年出事的全是未发布模型,黑进 Face的IM1、自己设计自己的Astra家族,一个都不在协议范围内。这就好比请隔壁班的老师来监考,结果作弊的学生根本不在考场。
而且黑盒互测只能看到最终的异常输出,真正要命的东西,比如系统提示词和内部攻防日志,全锁在机密里。
所以,两家又往前迈了一步。公开承诺让第三方评估员直接驻场,完全敞开开发环境;紧随其后说也会这么做。

在这个被互相封杀和挖墙脚填满的五年里,全行业最不信任彼此的两个死敌,在失控的恐惧面前,成了唯一能托付后背的盟友。
他们宁愿把底牌彻底交给对方,也不敢再独自相信自己亲手造出来的黑箱。
就在协议内幕流出的同一天,又发了一份官方政策文件,呼吁由美国牵头,制定关于「递归自我改进」的全球技术准则。
文件里写道,在绝对安全之前,不应该追求让AI自我进化。
而写下这份文件的公司里,Astra正在日夜不停地为下一代模型画图纸。
参考资料:
啥题啊能干崩OpenAI最强模型训练…
模型试图绕过OpenAI搜索工具,通过DNS隧道访问外部互联...(131 )人阅读时间:2026-09-28
真怕了!OpenAI和Anthropic差点签下「互黑协议」
OpenAI与Anthropic曾险些达成协议,互相开放AP...(184 )人阅读时间:2026-09-28
震撼,Opus 5.5首次颠覆Dijkstra算法最短路径!
Vals AI通过10个Claude Opus 5.5 Ag...(126 )人阅读时间:2026-09-28
答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准
V-Rubrics通过将视觉样本拆分为可逐项检查的准则,分别...(93 )人阅读时间:2026-09-28