文婷 发自 凹非寺
量子位 | 公众号
发生了什么状况呢? 在科研领域占据几十年统治地位的PDF格式, 竟然都要因为AI的缘故而面临“退休”的情况了…
因为以后论文的第一读者不是人,而是AI??

近日, IEEE着重留意了一项全新研究, 即ARA(Agent-), 它不但能够使AI领会研究成果, 而且还能够重现实验, 灵活地避开失败路径并接着推进研究, 从而让AI从辅助工具转变为科研协作者。
据电气和电子工程师协会报道, ARA团队在一篇名为《最后的人类论文: 智能体》的论文里, 提出请科学家们不再继续采用PDF来撰写传统种类的论文, 并且还表明:
AI需要一种不同的内容格式,而AI的需求,理应被置于首位。
论文的第一作者刘嘉晨核心论点是:
在AI把人类专家之中各个方面的数据全部用尽之后, 它便一点都不需要来自人类的任何输入了, 自此之后, AI将会开始自行朝着更高阶段变化发展。
此刻, 这些仅仅提升AI科学家能力, 然而却不改变科研知识共享方式之举, 恰似于泥泞道路上驾驶F1赛车, 难以去复现以及接续前人所开展的工作。
而PDF就是过去科研知识共享的最核心代表。
是时候了,ARA当立。
为什么PDF该死?
PDF所代表的是传统论文的最终结果, 它是科研最后成果的最终呈现, 然而就是这种呈现, 却“有问题”。
ARA团队持有这样的看法, 那就是, 实际的科研并非是那种从问题直接通向答案的笔直路线, 研究者常常需要提出十几个假设, 还要尝试几十种方案, 并且要调整无数次参数, 在历经大量失败以后, 才能够摸索出一条可行的路径来。
然而, 当那些探索被撰写成论文时, 那棵有着横生枝杈的“探索树”, 通常会被修剪成一条干净的、连贯的成功路径。
ARA团队把这种损失称作“叙事税”, 为了让研究变成一个有始有终、逻辑连贯且成功的故事, 大量探索过程被主动抛弃, 后来者只能被闪耀的新突破晃瞎眼, 、, 却看不到前人踩过的坑、遭受过的罪。

除了“叙事税”,传统论文还存在着“工程税”。
一篇论文只要能让审稿人信服,便算完成了使命。
但“说服审稿人”与“让AI完整复现”完全是两套标准。
模型版本, 运行环境, 超参数, 预处理方式, 训练技巧等这些成为决定实验成败的关键细节, 常常分散于正文、附录以及代码仓库里, 并且有些压根就未曾被记录下来, 是这样的情况。

在研究团队所统计的, 当中的8921项专家复现要求里, 发现仅仅是以45.4%的比例, 在论文PDF之中得到了完整的说明。
对于咱们而言,实验信息变得少了, 我们能够依据以往的经历, 向导师寻求帮助, 或者通过持续不断地尝试错误来进行补充。
可对于AI来讲, 论文之中未曾书写, 这便意味着仅能够凭借猜测(抑或是胡乱编造), 它同样十分无奈。

因此,ARA选择彻底换一种思路:
不再把线性叙事的论文当作科研成果自身, 换成把研究重新建成一个机器能够直接开展操作的知识包。
这个知识包包含四个层次:
简单来讲, 论文最终借助PDF展现的情形, 仅仅是“我们最终达成了怎样的成果”。
然而要是借助ARA, 所呈现的还有“为何要如此去做”, 还有“具体该如何去做”, 还有“哪些办法已然失败”, 还有“原始的证据处在何方”, 所追求的是知识胜过叙事。
更形而上来说,PDF只有结果,ARA还包括了整个过程。
嗯, 好像道理确实是这么回事儿, 不过, “一切存在皆合理”, 你瞧, PDF 已经作为人类科研论文最终呈现形式存在这么多年了, 那它肯定必定是有着内在的、自身蕴含的那种合理依据的。
ARA要取而代之,需要的就不光是理念了。
ARA真的比PDF好用吗?
为了让ARA真正跑起来,研究团队设计了三套配套机制:
1、Live负责在研究进程当中一直不间断地记录实验相关情况, 诸如决策过程、转变方向的状况, 以及出现的失败路径等。
2、ARA , 承担着把现有的PDF予以转换的职责, 还要将代码仓库转变为ARA格式。
3、ARA原生审稿系统, 它的职责是, 让机器率先去完成结构检查, 以及复现验证, 然后呢, 把关于创新性、重要性, 还有研究品位等方面的判断, 留给人类审稿人。
研究团队进行了测试, 其目的在于体现ARA真的比PDF好用, 测试是分别从理解、复现以及延伸这三个维度展开的。

在理解测试里, 研究人员设定了450个问题这般数量, 要求AI从ARA那里, 或者从传统PDF加代码仓库之中, 去寻觅答案。
使用ARA的AI准确率达到了93.7%, 结果显示了这一情况, 而传统材料组的准确率仅仅为72.4%, 二者之间相差了21.3%。
最具差距的是“复盘失败”, 在问题关联失败方案、替代路线以及实验教训之际, ARA组准确率达81.4%, 传统材料组仅15.7%。其原因极为简单, 传统论文中根本不存在这些信息。

在复现测试期间, 团队挑选出了15篇带有仓库的机器学习方面的论文, 并且设定了150项复现任务。
其中, ARA组的难度加权成功率是64.4%, 传统组的是57.4%。并且任务越是困难, ARA的优势就愈发显著:。
在简单任务里, ARA领先4.9%, 在中等任务中, ARA领先着5.6%, 于困难任务中, ARA领先8.5%。
但ARA的表现并非一路开挂。
于极具挑战性这一特性的研究延伸关联部分, ARA组成功获取了3项RE - Bench开放任务的胜利, 然而另外2项却被传统论文组实现了反超。

不过,也有可取之处。
ARA组于全部5项任务里头, 均率先触碰到那至关重要、极有价值的首个实验操作步数: 借助失败记录快速避开已然被证实为无效的研究方向, 节省大量重复探索。
这同样呼应了论文里的另外一组数据, 在对24008次AI Agent运行情况展开论文分析的时候, 90.2%的资金成本全被消耗在失败探索方面, 可是传统论文基本上不会留存这些失败记录。
对刘嘉晨而言,这正是ARA最重要的价值。

于她所构想的人机科研关联当中, AI不再单纯是用于润色论文、找寻资料或者生成代码的辅助性工具, 而是能够切实成为参与阅读、进行复现以及实现延伸研究的科研方面的主体。
对于科研人员而言, 能够更专注于那些AI没法替代的工作, 比如判断问题是不是重要, 判断工作是不是真的新颖,判断某条路线是不是值得投入, 也就是判断、创新和品味方面的工作。
ARA也并非完美
然而, 即便ARA的成绩单显得极为夺目, 可是它当下更似一名野心十足、天赋聪慧然而基础尚薄弱的高一新生, 才刚踏入学校就妄图在高考里考入北大。
它离成为“PDF终结者”还有很长的一段道路要走。

篇幅有限,简单说三点。
ARA存在首要之缺陷, 此缺陷即是当下其实验范畴较为狭窄, 其具备之普适程度较弱, 专门涵盖之领域仅为天然适配代码复现之机器学习这一领域, 至于是否运用在湿实验或者理论学科之上, 至今尚未获得证实之物存在其。
第二个问题,就是隐私和数据安全问题。
当前, ARA不仅尚未达成细粒度的访问控制, 而且缺少沙箱执行以及内容异常检测, 并且相关的规则和标准也并未完善妥当。
倘若就这般随随便便地将机密数据给予它, 可要留意紧接着的那一秒便被你那般的竞争对手夺去啊。

第三个是不可避免的AI幻觉和路径依赖问题。
在针对十五篇论文所开展的复现实验里, 传统材料组出现了两次结果编造的情况, ARA组同样出现了一次结果编造的情况。
因此, 当下它理应既无法确保AI始终不会编造结果, 又难以保证它不会憨朴单纯毫无心机地轻信前人的论断。

当然,这种思考和理念,依然有其创新性和价值。
若你有更详尽知晓的需求, 提议你径直去往文末所附的论文处, 以及开源地址处。
或者更进一步与ARA的研究团队、提出者交流。
ARA提出者
该ARA研究, 是由来自斯坦福大学的研究者, 以及来自密歇根大学的研究者, 还有来自卡内基梅隆大学的研究者, 和来自MIT的研究者, 共计37名研究者, 共同完成的。
其中第一作者是刘嘉晨。
她乃是密歇根大学的计算机科学博士, 其在机器学习系统那个领域, 以及大模型基础设施这个领域, 有着较深的钻研。

刘嘉晨,来源IEEE
她曾参与大模型服务的研究, 她曾参与训练系统的研究, 她还曾参与RL系统的研究, 她也曾在Meta从事大模型预训练相关工作, 她也曾在Meta从事大模型后训练基础设施相关工作。
刘嘉晨的个人主页所呈现的内容, 以及密歇根大学官网所展示的信息表明, 她在2023年的时候, 有过入选and Stars荣誉榜单这样的情况。

图源密歇根大学官网
今年5月的时候, 刘嘉晨于帕洛阿尔托创立了Agent- Lab, 已然实现了产学研的联动以此来推进ARA科研生态建设。当下, 其公开呈现出的成果主要涵盖了ARA协议和论文、与之配套的代码、关于研究生态的构想, 还有面向2026的AI驱动科研生态研讨会。
事实上, 这般Agent - 的观念, 于AI急剧发展的这几年间, 实实在在正给无数行业带来模式革新趋势发展走向变化。
始于PDF, 进展至ARA, 一方面存有AI能力的涌现, 这能够使得整个科研过程的价值被再度发觉以及予以重视, 并非是仅仅展现出一个最终的结果。
以往我们生成了PDF, 缘由在于全部论文皆是以人类作为阅读之人、使用之人、核心之对象。
可是当下, 伴随着AI能力的增添辅助 , Agent能力实现了突破 , 人类没办法全部顾及的科研过程 , Agent能够进行查看 , 人类不容易达到并行状态的科研复现 , Agent能够予以复现。
先前是人类, 与PDF有关涉及人类, 往后或许是人类, 关联Agent, 再到ARA, 又关联Agent, 最终还是人类。
这种变革也不局限于科研领域,在更早之前,一脉源流的已经有:
GUI已死,CLI当立…
已死,HTML当立…
已死,Loop当立…
……
“PDF已死,ARA当立”
只是这种趋势下的一种因循结果罢了。
更本质而言, 其于一种AI观、价值观方面呈现出的哲理体现, 你至今所秉持支持的状况是, 究竟为“人是万物的尺度” , 还是AI才是更为终极的尺度呢。
你是碳基生命守护者,还是完全拥抱硅基时代降临…
这并非关乎对与错, 仅仅是一种选择, 当做出选择的人数量增多, 那么在某一个特定节点就会区分出何为对何为错。
而ARA的提出者,显然选择的是AI为中心、Agent 。
当然, 截至目前, ARA的这一份研究及其论文, 依旧是以PDF的形式进行提交以及呈现的。
以下是改写: 参考链接, 其为: :///abs/2604.24658, 再补充有: :////two-cse-phd--named---and---stars, 还有着: ://the--of--..io/。
PDF当死,ARA该立!论文是时候Agent原生了
统治科研圈的PDF格式可能因AI技术革新而“退休”。新研究A...(199 )人阅读时间:2026-08-11
想要杀死一个原创软件,有多简单?
AI 技术兴起,导致许多 App 被免费或低价的 AI 工具...(150 )人阅读时间:2026-08-11
投资、研发、生产美国化!一文读懂“光模块禁令”政策脉络
FCC主席Brendan Carr在记者会上回应了对将外国无...(182 )人阅读时间:2026-08-11
熊孩子用AI做了个浏览器狂刷短视频,父母是该哭还是该笑?
Runway CEO陈思齐11岁女儿为绕过YouTube屏幕...(69 )人阅读时间:2026-08-11