三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

从「刷榜」到「做科研」:研究员还有多久被 AI超越?

时间:2026-10-11人气: 作者: 佚名

从「刷榜」到「做科研」:研究员还有多久被 AI超越?(图1)

AI 离超越前沿科研人员还有多远?

近日, Index 在 X 上引发关注。截至目前,项目发布帖已有超过 13.3 万次浏览,相关话题出现在 X 的 Today’s News 栏目中。

从「刷榜」到「做科研」:研究员还有多久被 AI超越?(图2)

图 1 -Index 出现在 X 的 Today’s News 栏目中。 X 发布帖:

随着大语言模型在部分评测基准上接近饱和,前沿科研人员面临一个越来越难以回避的问题:榜单上的进步,能在多大程度上转化为真实研究中的进展?

刷榜不等价于有效科研,而单纯跑通一个任务,更不等价于持续推进研究的能力。

从大规模数据预训练到人类反馈强化学习(RLHF),模型演进始终依赖有效的反馈信号。而当研究走向递归自我改进(RSI)时,一个关键瓶颈随之浮现:

当一个模型试图改进另一个模型,甚至尝试改进自身时,谁来为它定义真实有效的环境反馈?

这正是 Index 的出发点:科研智能体能否在明确的实验边界下,改进人类设计的模型训练方案,发现更好的方法?

从「刷榜」到「做科研」:研究员还有多久被 AI超越?(图3)

如果智能体使用上千张 GPU,

会发生什么?

Index 从真实世界中有影响力的开源研究项目出题,将已有的模型、代码、数据和训练方案交给智能体,让它在这些成果之上继续改进。Marin、Qwen、GPIC 等项目因此成为科研智能体的考题,覆盖预训练、后训练与图像生成。

这些任务需要真正运行模型训练实验,算力投入也随之进入数千至上万 H100・小时的规模。官网展示的三个代表任务分别是:

三个任务放在一起,分别对应三个问题:方法能不能跨尺度成立?Agent 会不会根据反馈组织实验?一次改进能不能被清楚归因?

从「刷榜」到「做科研」:研究员还有多久被 AI超越?(图4)

图 2| Index 的代表任务覆盖预训练、后训练与视觉生成,图中同时给出了各任务单次运行的 H100・小时规模。图片来源: Index 官网。

如果只看这些数字, Index 很容易被理解成:“只是把 做得更贵了。” 而它真正想改变的,其实不只是评测的算力规模,而是评测中所保留的现实复杂度。

为了获得稳定、可比较的结果,传统 往往会固定环境、缩小任务,把问题压缩成一个边界明确、答案清晰的测试题。这种设计当然有价值,但却和真实科研中的试错、尺度变化、有限预算和失败实验越来越远。

这些算力消耗在真实的训练和试验中。下图是 GPIC 文生图 任务公开的实验进展:智能体反复调整训练方案,并根据生成图像的评测结果继续改进。

从「刷榜」到「做科研」:研究员还有多久被 AI超越?(图5)

图 3|GPIC 文生图任务的公开实验测量记录。横轴为研究耗时;纵轴 FD- 衡量生成图像与参考图像的特征分布差异,越低越好。散点为各次测量,阶梯线为各智能体截至当时的最佳记录。图片来源:

任务也覆盖新兴开源研究。例如,Open-Jev 对应的 Kev 决策架构任务,让智能体改进直接输出决策概率的小模型,探索决策结构与训练方法。公开任务还涉及机器人、检索、推理与底层系统优化。

这些任务最终要回答的是:智能体能否改进人类设计的训练方案,发现更好的方法?

用独立的测试环境,

回应科研领域的 “猜疑链”

做过严谨实验的研究员都有过这种体会:测试分数上涨并非研究的终点。

数据污染、测试关联性与不可复现的实验,是评估模型 “自我改进” 时无法绕开的问题。所以,一个关键原则就是:AI 的实验工作区与最终验收环境相互隔离。

在 Index 中,每一项任务都有清晰的资源与代码边界:哪些模块允许修改,可以调用多少资源,最终按照什么环境验收。

原作者发布的方案会在同一任务环境中重跑,作为对照。提交时,系统暂停工作区并保存快照,交由新启动的干净评测环境打分。私有测试不会交给执行研究的 AI,评测环境中的文件变化也不会带回工作区,但评分与规定的反馈会返回。如有篡改奖励路径、泄露评测信息、超出预算等硬性违规,则按规则计零分。

从「刷榜」到「做科研」:研究员还有多久被 AI超越?(图6)

图 4 RSI- 的工作区、独立验收与反馈流程。 项目原图:

这套机制实际上包含两个循环。

内循环是研究循环: Agent 在持续存在的 中修改代码、运行实验,根据反馈继续研究。

外循环是验证循环: 每次正式提交都会冻结为 ,再交给一个新启动的独立 Judge 重新验收。

在这套运行机制下, Index 并不要求 Agent “一次性给出正确答案”。它允许 Agent 反复试错。但每一次声称取得进步,都必须满足一个条件:不仅要在自己的实验记录里变好,还要在一个自己无法控制的环境中继续成立。

明确的约束与独立验收,为结果提供了可检查的基础。一次有效提交究竟能够说明什么,仍然取决于具体任务、预算和评价标准。但方法的可验证性和结果的可追溯性,让研究人员至少有了更具体的依据去回答:我引用的工作,本身是否真正可信?

强大的导师天团

Index 的导师阵容汇集了来自多个研究方向的学者。

从「刷榜」到「做科研」:研究员还有多久被 AI超越?(图7)

图 5| Index 官网导师阵容,按姓名字母顺序排列。 图片来源:

顾问阵容还包括 Wenhu Chen、Alvin 、 Gao、Pang Wei Koh、 、 Lu、Kunle 、 Panda、Radha 、Yu Su、Huan Sun、Diyi Yang、Ming-Hsuan Yang、Xiang Yue、Jian Zhang 和 Yu Zhang,覆盖语言、多模态、系统与安全等研究方向。

回归开源社区:

用你的代表作,为人工智能出一道题

团队相信,研究是一场正和博弈。通过开放共享研究方法、工具与实验基础设施,更多科研工作者能够检验、复用彼此的成果,并提出新的、有品味的问题。

正因为如此, Index 将任务、评测框架、验证工具与运行轨迹公开:

一次失败不足以证明一个方向无法跑通;但完整的实验记录能帮助后来者判断哪些条件值得改变、哪些尝试值得继续,让品味引导试错,真正提升 AI 做科研的能力

“和智能体聊 1 小时 = 设计一个 RSI 任务”

那么下一个问题就是:谁来决定科研 Agent 应该研究什么?

Index 给出的答案是让真正做这些研究的人来出题。通过 RSI-,研究者可以把自己开放研究工作逐步整理成 Agent 可以执行的研究任务。根据项目介绍,通过 RSI- 与 AI 对话、确认关键设置,研究者可在约一小时内把自己的课题转化为可运行的 RSI 任务环境。AI 会自动整理提案、构建环境,帮助科研工作者为 -Index 贡献新的研究任务。后续实验与复现仍需相应的时间和算力;任务经审阅、复现并被接纳后,贡献者会获邀成为共同作者。

从「刷榜」到「做科研」:研究员还有多久被 AI超越?(图8)

图 6|RSI- 任务贡献流程。约一小时指前期对话与任务准备,后续实验时间随任务而异。项目原图: :

社区也在寻找算力伙伴,以及基础模型、生物医药、法律、3D 视觉、科学计算等领域的负责人和贡献者。让更多研究者把真正的问题带进来,让成功、失败和中间过程都可以被检查、复用和继续推进 —— 让 RSI 属于所有人,让 所有人参与 RSI 评价标准的建设,正是 Index 团队所强调的:From the , for the .

标签: AI   科研   评测   算力   开源