
新智元报道

全世界拿AI搞科研的姿势,可能从一开始就用错了!
哈佛物理学家、量子场论教材作者 找到的正确姿势,恰恰是别把当科学家。
他把够不着的深层问题留给自己,只挑它最擅长的题交给它。
结果,他熬了好几周、逐行写代码才完成的计算,只跑了20分钟就复现了,连他自己都没想到。
他又多追问了一句,在接下来几周里算出15个费曼积分,这些积分此前从来没有人算出来过。
三个月后,手里多了36篇论文初稿,从对撞机里的粒子做到了巴拿马雨林里的树,横跨18个学科。

10月1日,把他的长文发上了官方科学博客,标题叫「形状的科学」。
他在文中给出的理由是,今天的大模型很擅长做科学,但还算不上科学家。硬把它当成人类科学家去使唤,它的本事反而发挥不出来。
想让AI变强,有两条路。一条是等巨头在实验室里堆出下一代模型,另一条就是拿到模型的人,自己找到对的用法。
哈佛教授挖出了最强的一面
去年12月,让 Opus 4.5给自己当科研助手。用他的话说,像一个能干的研究生,干活快20倍,论文最后写出来了,过程却很磨人。
很多科学家都有类似的体会。新闻里AI一会儿解开数学难题,一会儿刷新纪录,自己上手一用,却总觉得隔着一层。
这种落差,在他看来有迹可循。AI科研的新闻头条大多出在数学里,那是唯一能把问题完整写下来、答案能被绝对验证的学科,可大部分科学并不长这样。
他借了物理学里的一个词,叫「阻抗不匹配」,两个系统各自运转良好,接在一起却配不上。放到AI科研上,一头是科学家想要的,另一头是AI最擅长的。
于是他按实际的样子来用它。眼下帮不了他想深层的概念问题,可它几乎什么领域都懂,写代码是强项,读论文和数据也是机器的速度。
他要做的,就是专挑正好落在这些长处上的题。这类题,他叫作「形状的问题」。

科学家想做的事和AI能做的事只在两小块地方重叠,那里就是「形状的问题」
追问一句,算出15个新积分
第一个形状的问题,他从老本行里挑,叫散射振幅。
物理学家要靠它从对撞机的碎片里认出新粒子。可它的核心是费曼图背后的多维积分,难一点的,算出一个就够写一篇博士论文。
为了绕开这些难算的积分,过去20年,物理学家发展出一条捷径,叫S矩阵。它不硬算积分,靠物理约束一层层排除。
比如,知道振幅在哪些地方会变成无穷大,候选就缩到2万个,再加一个对称性,剩下500个,就这样一步步缩到1个。约束不够用的时候,再在几个点上把振幅算到极高的精度,把剩下的系数钉死。

在看来,这道题天生适合AI。一来,它要的数学、物理和计算机知识没人能全部掌握;二来,答案能被验证,跑两个脚本就能对到任意位数,想糊弄也糊弄不了。
他交给 Fable 5的第一件事,是把散落在各种代码和论文里的方法搬进同一个框架。结果,很快复现了他的旧结果,还指出他有个算法写慢了。
突破出在后面。他让去找还没人算过的振幅,发现它一直把自己限制在最简单的对数函数里,于是追问了一句,更难的椭圆函数能不能也这么做。

这一问问到了难处。人类完整算出的椭圆费曼积分只有寥寥几个,还没有一个完全靠算出来,因为所需的知识散在许多人身上,从来没人试过。
却没有这个障碍,它把整套工具扩展到了椭圆函数上,大部分新软件由它自己写,剩下的借自数学界。
几周后,30个积分被从头到尾算完,一半是复现已知结果,另外15个此前从来没人算出来过。
回头看这几周,Fable 5的能力是底子,决定结果的是两次选题,一次是挑中这道能验证、知识又分散的题,一次是看出在给自己设限,追问了一句。
其中第二次更关键,那批前人从没算出来的积分,全出在追问之后。
这套越用越全的工具,起名叫。它是套在大模型外面的一层工具和流程,已经开源,换哪家的模型都能驱动。
其中两个积分引擎的算法,出自北京大学马滟青团队。

门槛有多低,我们自己试了一下。在一台Mac上装好后,我们只用一句话给 Code交代任务。
它自己翻文档、找工具,20分钟出头、花了约1.5美元,就把官网上一个新算出的积分系数重算了一遍,还找出了闭式,和数值对上157位。
一套积分,打穿18个学科
本来,打算就这批积分写篇文章收工。可科学里有个巧合,同样的方程总会在不同学科里反复出现,这批工具的用处远不止物理。
告诉他,这些积分还能对应到群体遗传学里的贝叶斯证据积分。
系统发育学用DNA给物种排家谱树时要算的积分,和当初为费曼图打造的积分也是同一类。

为费曼图造的积分工具,在物种家谱、群体遗传和生态学里都能用
为了让工具箱越用越全,他给立了条规矩,老工具要用,新工具也要造。
这样一来,每个项目哪怕失败,都会留下新工具,越用越能干,用他的话说,就像《黑客帝国》里刚灌完功夫的尼奥。
也就是说,模型能做成多少事,不只取决于权重,也取决于手边的工具箱。下一代模型要等实验室发布,工具箱却每天都在扩充,和模型打交道的人自己就能改进它。
工具箱带进别的学科后,生态学最先出了成果。中性理论认为,森林里物种的兴衰也许全凭运气。
可这个理论的方程写出来20年,一直没人能在大尺度上解开。认出这是形状的题,把它解了。
拿巴拿马运河巴罗科罗拉多岛的普查数据一对,树种组成的变化速度比中性理论允许的快了4.5倍,光靠运气解释不了。
于是,他和植物生物学家James O'Dwyer用搭出新模型,把物种之间寿命、生长和繁殖的差异加了回来,正往全球的森林样地推广。

其他学科也陆续出了结果。群体遗传学里,他们在57亿对相邻突变中找到了基因转换的证据。
经济学五大顶刊4452篇论文的复现包,被搬进开源代码逐个核对,语言学家也拿到了覆盖6072种语言的重音数据库。
数学家在1939年开启的格点积分系列,最后一道难题也被解开了。

这些成果加起来,就是那36篇论文稿。它们是从约400个候选问题里筛出来做成的,目前都还没正式发表。
在文末披露,项目期间他在担任访问研究员,由资助,由他本人拥有和维护。
撑起这个产量的工作台并不复杂。每个项目一个 Code会话,一个总控会话负责协调和验收,计算交给后台子Agent。
还有一个会话专门扮演挑刺的审稿人,把结果翻来覆去地核查。

一个总控会话管着一群项目会话,计算交给后台子Agent,另有会话专门挑刺
做成的这些题有一个共同点,答案都能被核对。
正因为算错了瞒不住,才敢放手让它去跑。所以说,能被验证的地方,AI就能放开手往前推。
通往ASI的另一条路,谁都能走
这三个月,回答的是一个更大的问题,智能到底靠什么扩张。
外界衡量AI有多强,看的几乎全是模型本身,参数多了没有,跑分高了没有,下一代什么时候发。
看的却是另一件事,模型的上限由实验室决定,最后能发挥出多少,取决于挑题、搭工具、定验收标准的那个人。
至于AI该去哪儿,他用了一个数学概念来比喻,叫凸包,也就是把一个形状所有尖角连起来后,围出的最小凸形状。
人类知识就是这样一个参差不齐的形状,生物学往一个方向突出去,数学往另一个方向突出去。
一个实验室可能花20年,用一种方法把一组基因研究透,旁边的基因和别的方法却一直荒着。
那些人类够得着、但还没有哪个人去过的中间地带,最适合交给AI。
做的,就是在这些尖刺之间连线,把凸包一点点填满。

人类知识像一颗参差不齐的星形,的工具包在尖刺之间连线,填补中间的空白
AI去填这些空白,人在科研里的位置也跟着变了。
局面变得太快,几乎没法提前规划。反问,一个AI可能一夜之间就算完的问题,为什么还要申请三年的经费去算。
连该怎么带研究生,他也说自己至今还没想清楚。
不过在他看来,只要找对问题,大部分技术活都能自动化,离不开人的是概念那一部分。
放到通往ASI这件事上,也是两条路。一条是等实验室训出更强的模型,另一条是把人类散落在几十个学科里的工具拼成一个工具箱,交给一个什么都懂一点的模型,再由人来挑题、追问、验收。
前一条路握在少数几家公司手里,后一条路不用等下一代模型,每个会用AI的人现在就能走。
参考资料:
刚刚,Claude夺舍Codex!GPT-6.1 Sol极速
OpenAI高管Tibo征集Codex产品需求时,用户在评论...(99 )人阅读时间:2026-10-06
哈佛教授90天横扫18个学科,Claude神助攻!连开36篇
哈佛物理学家Matthew Schwartz发现,正确使用A...(176 )人阅读时间:2026-10-06
从一道光到千万道光,华为Mate 90系列如何续写Mate精
华为Mate 90系列发布会以“光”为主题,通过《Dream...(62 )人阅读时间:2026-10-06
放养AI练棋,Claude暴涨250分!GPT-6越练越菜
Claude Opus 5.5和GPT-6 Astra被放养...(178 )人阅读时间:2026-10-06