三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > 科技

给AI智能体做优化时,你真的需要每次都做全套题吗?

时间:2026-09-02人气: 作者: 佚名

给AI智能体做优化时,你真的需要每次都做全套题吗?(图1)

假如你是一位家教老师,手上有一套100道题的题库,用来检验学生每一次学习方法调整后的效果。

每次学生换了新的学习方法,你就让他把这100道题全部重做一遍,然后根据成绩决定这个新方法好不好用。听起来很严谨,对吧?

但你有没有想过一个问题:如果学生已经把简单的20道题都做对了很多次,你还有必要每次都让他重做这20道题吗?如果有30道题是超纲的,无论换什么方法他都不会做,这30道题的存在除了浪费时间还有什么用?

这就是一群来自东京大学的研究者在优化AI智能体时撞上的真实困境,而他们的解法,或许比你想象的更聪明。

AI智能体的"外壳"比"大脑"更重要?

先说一个可能颠覆你认知的事实。

你可能以为,AI智能体表现好不好,主要看背后用的大模型强不强。GPT用得越新、参数越大,效果就该越好。

但2026年的一项研究发现,围绕同一个大模型,仅仅改变外围的控制代码,也就是决定模型该存什么、该取什么、该看到什么信息的那套逻辑,性能差异可以达到6倍之多。

这套控制代码有个专门的名字。

(哈奈斯,直译为"挽具"):指包裹在大模型外部、决定模型如何存储信息、检索信息、组织提示词的控制代码,可以理解为大模型的"操作手册"或者"工作流程"。

这意味着,同一匹马,套上不同的挽具,拉车的效率能差出6倍。这不是夸张的说法,是论文里实打实的数据。于是问题就变成了:既然挽具这么关键,那怎么把它设计好?

自动进化的挽具,代价却越来越贵

传统上,工程师们是手工打磨这套挽具的,靠经验、靠试错。但挽具的设计空间太大了,手工调整费时费力还未必调得好。

于是最近出现了一个新方向,叫做自动化挽具优化。简单说,就是让一个更聪明的"元智能体"(meta-agent)来当教练,不断修改挽具的代码,然后拿去考试(也就是在验证任务上跑一遍),看效果好不好,好就保留,不好就换个方向再试。

这个思路的代表作叫Meta-,出自2026年的一篇论文。它的做法很直接:每一轮迭代生成几个候选挽具,然后把它们放到全部验证任务上跑一遍,取平均分,分数最高的留下来当下一轮的起点,如此循环几十轮。

问题就出在"每一轮都要跑全部验证任务"这句话上。

如果验证集有100个任务,跑一次全套评估就要执行100次任务。而如果每个任务都像终端智能体那样,需要在沙盒环境里跑上几十分钟才能出结果,那这个评估成本就直接爆炸了。论文里提到的-Bench 2.1基准测试,就是这样一个又贵又慢的评估场。

更麻烦的是,这套全量评估还是静态的。

打个比方,你带着学生复习了一整个学期,一开始有些题他完全不会做,有些题他一看就会。但随着复习深入,原来不会的题他慢慢会了,原来会的题他还是会。这时候,那些"一直都会"和"一直都不会"的题,对你判断"这次的学习方法有没有用"已经没什么参考价值了,可你还在让他每次都做一遍,浪费的全是无效时间。

这正是论文里指出的核心矛盾:随着挽具不断进化,哪些任务能真正区分出"这个挽具比那个挽具强",这个答案是在不断变化的。而全量评估死守着一份固定的验证集,完全没有跟上这种变化。

Task-:让考题跟着学生一起进化

面对这个问题,研究者们提出了一个叫Task-的方法。

Task-(任务协同进化):一种让验证任务集合随着挽具一起动态调整的优化框架,核心思路是每轮只评估一小部分"信息量大"的任务,而不是全部任务。

这个名字里的""(协同进化)其实点出了整个方法的精髓:挽具在进化,考题也要跟着一起变。

这套方法要解决两个具体问题。第一,怎么挑出真正有信息量的任务来考。第二,只考了一部分题,怎么估算出如果考全部题目大概会是什么分数,好让不同轮次之间能公平比较。

我们一个一个来看。

### 挑题的逻辑:分歧越大,信息量越大

研究者们观察到一个朴素但很有说服力的现象:如果一道题,不同挽具的表现差异很大,有的挽具做对了、有的做错了,那这道题就特别能反映出挽具之间的优劣差距。反过来,如果一道题所有挽具都做对,或者所有挽具都做错,这道题基本就是"废题",考不考都一样,反正区分不出高下。

这个道理用统计学的语言来说,就是伯努利方差。

伯努利方差:衡量一个只有"成功/失败"两种结果的事件的波动程度,当成功率恰好是50%时方差最大,当成功率是0%或100%(永远失败或永远成功)时方差为零。

论文给出的具体计算公式是,每个任务的采样权重等于它历史成功率的伯努利方差,再加上一个鼓励探索新任务的小奖励项(针对观测次数少的任务),另外对那些"从来没被解决过的任务"设了一个小的保底权重,因为说不定哪天挽具进化到能解决它了。

这里必须停下来做一个类比,因为它揭示的不只是装饰性的比喻,而是这个设计决策真正的代价和收益所在。

想象你是一个体育老师,要给20个学生分组打篮球,看谁分组分得好。如果你选的两组人,一组是身高两米的篮球队主力,一组是从没摸过球的初一新生,那比赛结果毫无悬念,你根本看不出这个分组方式好不好用。但如果你选的两组人实力接近,一场球赛下来比分咬得很紧,这场比赛才真正能告诉你分组策略是否合理。如果你继续按老办法,每次都拉着全班48个人打全场,你会发现大部分时间都浪费在那些"注定赢"和"注定输"的对局上,真正有价值的信息其实来自那几场势均力敌的较量。Task-做的,就是主动把评估资源集中投向那些"势均力敌"的任务,而不是继续在早已见分晓的比赛上耗费时间。

不这么做的后果论文里也有实打实的数据支撑:他们统计了任务池里各类任务的分布,发现在文本分类的实验中,一直没人能做出来的任务和几乎所有候选都能做出来的任务,加起来始终占了超过70%的任务池。也就是说,如果继续均匀地随机抽样,你抽到的题目里,至少七成是"废题",真正有区分度的题目只占一小部分,还常常被稀释掉了。

### 打分的逻辑:只考了一部分题,怎么估算全套成绩

选出信息量大的题目只是第一步。第二步更麻烦:既然每一轮考的题目都不一样,那不同轮次的分数怎么放在同一把尺子上比较?

这里就要引入一个概念。

-估计:一种统计学方法,通过给每个被抽中的样本乘以"1除以它被抽中的概率"这个权重,来无偏地估计整体的平均水平,即便抽样本身不是均匀的。

说得直白一点,如果某道题因为太容易或太难,被抽中的概率特别低(比如只有5%),那一旦它真的被抽到了,这次抽样结果就要按比例放大来"补偿",因为它代表的不只是它自己,而是背后那一大堆类似的、没被抽到的同类题目。

论文里给出了两种具体的估计方式。当任务的成功率普遍集中在接近0或接近100这两个极端时,用一种叫Hájek估计的公式,直接对抽中的每个结果按抽样概率的倒数加权平均。而当任务成功率普遍集中在中间地带(比如接近50%)时,Hájek估计会出问题,因为一道几乎每次都解决的题如果被极小概率抽中,它的权重会被放得极大,直接主导整个估算结果,把分数带偏。这时候要改用另一种叫锚定差值估计的方式,不直接对结果加权,而是对"这次结果和历史平均水平的差值"加权,用历史平均值当一个稳定的锚点。

论文里举了一个真实案例:在-Bench 2.1的一次实验中,如果错误地用了Hájek估计,某个候选挽具在三道题里只做对一道,原始得分是33.3%,但估算出来的全套分数却是85.9%,明显是被极小概率抽中的某道"简单题"的权重给拉爆了。换成锚定差值估计后,这种失真就消失了。

这背后其实藏着一个更普遍的道理:统计方法从来不是万能公式,选哪种估计方式,取决于你的数据长什么样子。这也是为什么论文特意做了一节对照实验,专门验证"用错了估计器会怎样",结果显示用错方法后,文本分类的准确率会掉3到3.6个百分点,这不是一个可以忽略的误差。

具体效果:省了80%的评估量,成绩不掉反升

说了这么多设计原理,实际效果到底怎么样?

论文在两个场景下做了验证。第一个是在线文本分类任务,包含法律条文预测、疾病症状诊断、化学反应物预测三个数据集,用GPT-OSS-120B做分类器, Opus 4.6当"教练"来优化挽具。第二个是更硬核的-Bench 2.1,一个专门考验AI智能体能不能在命令行里完成复杂长任务的基准测试。

先看文本分类的结果。

| 方法 | 评估预算 | 评估总次数 | 平均准确率 |

| 全量搜索(Meta-) | 100% | 7,800 | 48.6% |

| 固定子集(Naive) | 7% | 480 | 45.2% |

| 随机重采样 | 7% | 480 | 47.0% |

| **Task-** | 7% | 480 | **47.6%** |

| 固定子集(Naive) | 20% | 1,560 | 47.2% |

| 随机重采样 | 20% | 1,560 | 48.2% |

| **Task-** | 20% | 1,560 | **49.3%** |

这个表格里最让人意外的一行,是最后一行。用20%的评估预算,Task-居然反过来超过了动用全部验证集的全量搜索,49.3%对48.6%,高出0.7个百分点。评估量只用了原来的五分之一,结果反而更好。

这个反直觉的结果,论文给出了一个合理的解释:一直在同一份固定的验证集上反复打磨,反而容易让挽具过拟合到这份验证集本身,就像一个学生刷题刷太多同一套卷子,做出来的答案越来越贴合这套卷子的出题套路,一旦换成新的题目就露馅了。而Task-每轮都在换考题,反而无意中避免了这种"应试化"的倾向。

再看-Bench 2.1的结果。

| 方法 | 评估预算 | GPT-5.6 Luna | Qwen3.6-35B-A3B |

| 全量搜索 | 100% | 62.9% | 42.7% |

| 固定子集 | 20% | 55.1% | 39.3% |

| 随机重采样 | 20% | 59.6% | 37.1% |

| **Task-** | 20% | **61.8%** | **41.6%** |

这里的差距只有约1个百分点,换算成任务数,89个任务里差1个任务而已。考虑到全量搜索本来就享有"每轮都能看全部答案"的天然优势,能用五分之一的评估量追到这么近,已经很说明问题了。

而真正让人眼前一亮的,是评估成本的实际节省数字。用GPT-5.6 Luna跑-Bench 2.1,全量搜索需要处理2,888M个输入token,耗时22.2小时;换成Task-后降到579M个token,11.5小时,成本从117美元降到30美元,节省了80%。换成Qwen3.6-35B-A3B,搜索时间从38小时降到20.5小时。

这里有个细节值得多说两句。同样是20%的评估预算,随机重采样反而只用了124M个token,比Task-的579M还要少得多。这不是说随机重采样更省钱、更划算,恰恰相反,这说明随机重采样把预算大量花在了那些"运行几分钟就结束"的简单任务上,而Task-刻意把预算投向了那些运行时间长、多轮交互、真正能分出胜负的困难任务。省下来的钱背后,是评估质量的差异,不是同一份质量下的价格便宜。这也解释了为什么在同样20%的预算下,随机重采样的最终得分比Task-低了3.3个百分点。

挑出来的挽具到底长什么样

光看数字有点抽象,论文里也具体展示了Task-最终挑出来的挽具做了哪些改动,这部分特别有意思,能看出"进化"出来的方案有多聪明。

在文本分类任务里,被选中的挽具做了一个巧妙的融合。原本的方案只用一种文本切分方式(比如按单词切)去检索历史上相似的例子作为参考,但研究发现这在不同数据集上表现不一致,法律案例描述里,一个词组往往能指示出具体的罪名,用按词切分的方式效果好;而化学分子式和症状描述这类文本,更适合按字符片段切分。于是进化出来的挽具同时用两种切分方式各自排一次序,再用一种叫倒数排名融合( rank )的方法把两个排序结果合并起来,谁排名靠前谁就更可能被选进提示词里。这样一来,挽具不需要提前知道这道题来自哪个数据集,也能自动用上最合适的检索方式。

在-Bench 2.1里,被选中的挽具改动了一个更实际的细节:智能体在终端里敲完一条命令后,该等多久再检查结果。原来的方案是固定睡眠一段时间,不管命令是不是已经跑完了。进化出来的挽具改成了智能体主动轮询,一旦发现命令提示符已经回来了(说明命令执行完了),就立刻结束等待,不再傻等。论文提到,元智能体在提出这个改动之前,专门分析了搜索日志,发现固定的等待时间占用了任务总预算的四分之一到三分之一,而且大约五分之一的失败案例根本不是因为答案错了,而是因为超时了。

这个案例特别打动人的地方在于,它说明自动优化不只是碰运气地随机改代码,而是真的能从历史数据里"读出"问题所在,然后对症下药。

局限与留白

论文也很坦诚地指出了一个尚未解决的问题:目前Task-在评估一个候选挽具之前,就已经固定好了这一轮要考多少道题,考完才能看结果。这意味着它没法做到"这个候选一看就明显不行,提前中止评估节省时间",也没法做到"两个候选难分高下,那就多考几道题看看"。这种动态调整评估数量的能力,作者留给了未来的工作。

另外论文里还提到一个有意思的补充实验:他们试着用更强的模型-V4-Flash跑同样的搜索流程,结果发现进化了十轮,最好的候选挽具和最初的起点分数完全一样,都是70.8%,一点提升都没有。这不是Task-的问题,而是说明当底层模型已经足够强,本身就不需要太多外部脚手架时,挽具优化能腾挪的空间自然也就变小了。这提醒我们,任何优化方法都是在一个特定的"改进空间"里工作的,空间不存在,方法再好也无从发挥。

写在后面

读完这篇论文,最触动我的其实不是那些具体的百分比数字,而是它揭示的一个更普遍的道理:在很多需要反复评估、反复迭代的系统里,我们默认"全面检查"是最安全、最公平的做法,但全面检查本身也是有代价的,而且这个代价会随着时间推移变得越来越不划算,因为随着系统进步,原来有区分度的检查项会逐渐失去区分度。

这让我联想到软件工程里的回归测试。一个成熟的代码库往往积累了成千上万条测试用例,每次代码改动都要全部跑一遍,随着代码库越来越大,这个成本也越来越高。有没有可能借鉴类似Task-的思路,动态识别出哪些测试用例对当前这次改动最有区分度,优先跑这些?这不是这篇论文讨论的范围,但方法论上是相通的。

论文里那个"20%预算反而超过全量搜索"的结果,我读的时候愣了一下。仔细想想会发现,这其实是在提醒我们:更多的数据、更全面的评估,不总是等于更好的结果。有时候,杂乱无章地看太多信息,反而会让决策系统被那些没有信息量的噪声干扰,学会了"讨好评估集"而不是真正变强。这个道理放在教育、放在管理、放在很多需要反复打分排序的场景里,可能都值得琢磨琢磨。

Q&A

Q1:Task-是什么?

A:Task-是东京大学研究者提出的一种AI智能体挽具优化方法,核心思路是让验证任务集合随着挽具一起动态调整,每轮只评估一小部分信息量大的任务,而不是像传统方法那样每次都跑全部验证集,从而在保持效果的同时大幅降低评估成本。

Q2:Task-能节省多少评估成本?

A:在-Bench 2.1基准测试上,Task-能将搜索成本降低67%到80%,同时性能只比使用全部验证集的方法低约1个百分点。在在线文本分类任务上,用20%的评估预算甚至能超过使用全部验证集的方法,比使用全量搜索还要多出0.7个百分点。

Q3:挽具()为什么对AI智能体这么重要?

A:挽具是包裹在大模型外部、决定模型如何存储和检索信息、如何组织提示词的控制代码。研究发现,同一个大模型仅仅改变外围的挽具设计,性能差异可以达到6倍之多,这说明挽具设计的重要性不亚于模型本身的能力。