三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

蒸馏被妖魔化了,但过度的蒸馏也有代价

时间:2026-08-09人气: 作者: 佚名

蒸馏被妖魔化了,但过度的蒸馏也有代价(图1)

被舆论关注焦点再一次聚焦的词汇是“蒸馏” , 这一回, 处于众人瞩目的聚光灯之下的并非是多次对国产模型蒸馏予以严厉指控的强硬派 , 反而是长时间都没有在公众面前公开现身露面的张一鸣。

在最近, 字节全员会上, 张一鸣进行了发话, 这发话的情况比较罕见。那发言中提到, 字节存在一种倾向, 宁愿去忍受模型处于落后状态这样的情况, 也不期望凭借蒸馏这种方式去让智能在短时间内实现爬坡。

当字节的Seed模型被视作处于落后状态, 蒸馏已然成为模型公司竞赛时常用的手段之际, 张一鸣的表达, 使得字节的技术身位显得极为独特。在媒体的报道里面, 自Seed成立之后, 内部曾有过三次大规模的蒸馏想法, 但均被集团予以掐断了。

究竟一个模型的优劣情况, 关系到架构、数据、infra、评估这四方面内容关联紧密;那些具备高层次质量的数据几乎变成决定模型质量好坏的核心要点所在;今年5月份的时候, 梁文锋于与投资人进行交流沟通的过程当中同样讲到了这一点, 差不多有半数的研究员, 都正在从事标注数据这项工作;高质量的数据所耗费的成本极为高昂。

这致使蒸馏出能够成为极度具有吸引力的便捷途径的SOTA模型数据, 被一位基础模型方面的研究员告知我们, 现今在模型能力里最容易被短期内加以改进的变量便为数据, 借助更强的模型来生成高质量数据导致技术风险显著低于推翻原本所采用的既有结构、再次开展大规模专项训练工作, 并且成本也要远远少得多。

为何明明蒸馏存在诸多益处, 却仍有人极为坚决地予以反对, 那蒸馏所会付出的代价究竟是什么?

蒸馏自身是个处于中性状态的技术, 主要是针对一个有着庞大参数且性能更为强大的模型, 借助其输出的概率分布的情况, 去训练得到一个呈现轻量级特点的模型 , 达成在维持高性能的状况下, 极大程度地削减参数规模以及推理所需成本的目的。举例来说 , 是以GPT - 4o 、 o1等当作教师模型 , 来训练GPT - 4o mini等学生模型。

然而, 在过去的这两年期间, 当别的模型, 在获取许可的情况下, 大幅度地对SOTA模型的数据展开蒸馏训练之时, 蒸馏所呈现出的情感色彩, 变得更为复杂多样了。、、等众多模型公司, 都清晰明确地表达了对这种未经许可的蒸馏行为的反对态度, 甚至还直接将矛头指向了一些来自中国的模型公司。

这背后自然而然存在着他们基于商业方面的考虑, 已然耗用了数十亿美元去打造模型, 竞争对手能够用极低的成本, 避开自身数十亿美元的研发投入, 迅速去复制模型能力, 极有可能打破它们原先设定的定价体系连同商业策略。

本质上看,蒸馏真正触碰到的,是基础模型公司的投资回报逻辑。

把采用压缩别的SOTA模型这种方式, 去使得复制竞争对手能力得以实现, 在国外引发了很大争议。今年5月的时候, 马斯克表明, AI公司通常是会对别的模型进行蒸馏操作的, xAI就有部分是通过蒸馏来开展训练的。

然而, 就在同一个月, Meta却在团队内部清晰地界定了使用外部模型工具的范围界限, 规定工程师在设计编程测试题目时必须依靠自身独立完成构思思路呈现方式借助所属专业技术技能水平规划步骤, 并且严厉禁止直接采纳由AI生成的创意想法思路。为了避免防止模型所生成的内容流入到Meta自身的训练数据之中, 部分团队竟被要求暂停相关的调用操作行为。

这表明, 蒸馏并非是那种, 单纯由中国公司去做, 而遭到美国公司反对这般的简单故事。

从长时间的角度去看, 在SOTA模型的防守能力得以增强的情况下, 过度地依赖蒸馏这种行为会对模型公司自身的自研能力形成制约。不过, 有不少的公司依旧是采用调用API的方式来开展蒸馏工作, 在某种程度上, 这甚至如同开源那样变成了一种趋势。

在具体实践中,蒸馏的代价或许还在于边界的模糊和人的惰性。

提到蒸馏会“上瘾”的研发人员数量不少, 对于好些面临竞赛压力的研究员而言, 诱惑是十分现实的, 因为相较于他们自己从零开始去寻觅高质量数据, 还要设计复杂的训练方案, SOTA 模型蒸馏得到的高质量数据, 无疑是更加高效、成本更为便宜的一条路径。

问题同样处在这儿, 蒸馏最为巨大的诱惑在于, 能让人暂且避开那些特别困难的事。一旦模型竞赛的方向出现了改变, 或者模型公司形成了依赖, 它所丧失的不单单是数据的原创性, 并且还有自身发现数据、训练模型以及解决问题的能力。

这或许得算是张一鸣甘愿接纳Seed暂且处于落后态势的实际缘由之所在, 模型呢, 能够暂且落于后面, 然而却绝对不能短缺去追赶模型的那种能力。

在围绕着蒸馏所具备的裨益以及所付出的代价这个方面, 我们同伦敦大学学院博士、布里斯托大学助理教授杨梦月进行了一期对话, 杨梦月最为主要钻研的是强化学习, 还有因果推理, 以及世界模型, 以下便是对话的实际 全部内容, 有标点符号。

01

大模型公司在蒸馏什么?

白鲸实验室, 临近时期张一鸣针对蒸馏所持的态度, 再度将“模型蒸馏”放置到显著位置。今年2月的时候张一鸣还发布文章指责几家本国生产的模型实施蒸馏行为, 那么大型模型进行蒸馏究竟实际蒸馏的是什么呢!

杨梦月表示, 其取决于目标模型所允许你去获得这一情况。实际上, 最好的蒸馏这种情况, 是你能够捕捉到它整个CoT(也就是思维链)。

白鲸实验室:这是最好的方式?

杨梦月表示, 能将推理链提炼出来, 大体上算是最为理想的蒸馏方式。然而, 情况并非绝对如此, 当下存在诸多技术种类, 举例来说, 就是运用这个模型向更出色的模型进行提问, 更出色的模型为当前这个模型提供指导, 这同样是一种蒸馏方式, 目前也颇为热门。“自蒸馏”并不在我们的探讨范畴之内。

如今, 许许多多的大模型制造厂商确实是存在着反蒸馏的相关策略的, 它并不会采取直接将CoT呈现展示出来的做法。而这实际上就取决于是否办得到, 运用某些法子将对方的CoT破解解读出来。

白鲸实验室, 在大家都纷纷大力推举编码以及智能体等能力的情形之下, 为何推理链是如此关键呢?

杨梦月: 鉴于CoT展现出了模型背后的推理进程, 编码能力绝不仅仅是最终给出一段代码, 更为关键的是问题分解、工具运用、验证以及修正的轨迹。

CoT做得出色, 根本上得依靠后续训练的RL, 然而RL训练极为艰难, 恰似一直深受RL困扰那般, RL也就是强化学习是相当困难之处, 大厂都会特意设立一个RL部门, 专门用以做之后的训练提升CoT能力。

白鲸实验室:蒸馏推理轨迹,是不是低成本追赶的捷径?

杨梦月表明, 蒸馏CoT, 实际上等同于在后续训练环节里节约了时间、耗费的精力以及成本。而不用去开展高成本的后续训练, 很大一部分方面借由蒸馏得出CoT, 效仿它就行。

白鲸实验室, 这个情况是表明, 在强化学习方面, 并未弄明白背后支撑的架构设计, 仅仅是凭借强行死记硬背记住了他人的成果?

杨梦月, 即便记住了他人之物, 然而要是数据量充足, 那么说不定会涌现出智能。

白鲸实验室:这个“数据量足够”,现实吗?

杨梦月称, 那也是存在不小难度的, 于蒸馏运算期间, 是需要朝着更为优良的模型去提出问题的。不过这番进行提问之时, 是无法全面囊括所有具体情形的,没办法做到完整呈现该模型全部用以研判的内在逻辑或者所运用的推理逻辑内容的, 仅能涉及到其中的一部分而已。

白鲸实验室: 将一部分进行蒸馏, 再加上自行研发, 是否会更易于智能涌现呢? 恰似我们人类, 学习皆是先开展模仿, 于模仿的进程里持续实现顿悟以及成长。

杨梦月: 以纯蒸馏的方式借助数据去进行已有能力的复制操作, 然而要是蒸馏这种方式再额外加上自主研发的举措, 那么就会更易于使得智能出现那种突现的状况。蒸馏可为其送上具备高精质量级别的先验以及基础能力, 而自主研发是通过展开探索, 历经尝试错误以便冲破已有知识所属的边界范围。人类的学习过程与之相类似, 先是进行模仿行为, 接着采取实践行动, 最终于实践过程里面形成自身独有的理解以及创新成果。

白鲸实验室问道, 除了知识以及上面才提及到的CoT之外, 还有别的哪些东西是没办法被蒸馏出来的呢?

如今已然演变成技术攻防战了, CoT被加密起来, 不会全然显露, 更为关键的是, 模型的具体架构是没法从那里直接得到的, 内部技巧同样如此, 数据管线在当前的输出里也不会直接呈现, 信息组织方式亦是这般, 训练配方也不会直接显现, 为什么会在某个阶段采用什么样的设计, 这些通通都不可能从输出当中直接获取到的。

即使能够依照输出进行反向推导, 然而反向推导所得到的结果不一定就能够准确吻合那原本模型的确切设计。

02

蒸馏的代价

白鲸实验室:你觉得字节为什么反复强调不要蒸馏?

杨梦月, 就深远一些的角度思量的话, 要是有一家企业并未将进行自主研发的一整套技术体系构建完善的情形下, 蒸馏这种方式仅仅能够处理当下急切需要解决的问题, 最终依旧是得依赖于自主研发的。

自我研发的确是极其困难的, 然而往后蒸馏同样会变得艰难起来, 只是自我研发这件事有着可持续性。

白鲸实验室:蒸馏的长期影响是什么?

有一个叫做杨梦月的人, 为了进行蒸馏, 去买token就挤压了其他方面的预算, 而这可能就会产生一种情况, 那便是对于其他原本的原创研发的支持度将会下降。要是持续进行蒸馏的话, 就可能过渡至依赖其他的模型。别人推出一个版本之后, 就蒸馏出一个版本, 到头来终究将会削弱在模型架构、infra这般层面上的自研能力。

模型的变化极为迅速, 不但模型自身迭代的速度有所加快, 并且风口的变化同样很快, 今儿是这个模型攀升至巅峰, 下一回或许会更换成另一个模型, 每个模型所蒸馏出的数据, 哪怕属于同一个模型不同迭代版本所蒸馏得来的数据, 对于后续模型的研发而言, 也并不会发挥起决定性的作用。

倘若不进行蒸馏的情形下, 从短期予以观察, 若是从零开始自行研究RL, 刚开始的时候效果是比较有限的, 可是经过长时间的训练, 将会形成一种复利效应, 其迭代的速度会变得越来越快。

白鲸实验室:这是长远影响吗?

杨梦月表示, 她认为当下处于海外SOTA模型着手强化防守的情形下, 去对这类模型进行蒸馏, 这是极为考验问题设计能力的。在那场攻防战当中, 对于进行蒸馏操作的一方而言, 也并不能讲技术不存在提高。

无论向别的模型开展提问, 还是向整个开放世界施行提问, 其颇具重要性的能力为可不可以设计出具备高质量的问题, 通过此类问题来覆盖崭新的、暂时未曾探索触及的场景。

倘若做得出色不错, 那还能够变成自研范畴内一项能力提升的导向所向。举例来讲, agent于一个OS系统也就是操作系统之中, 需去完成task , 并且还要朝着系统提出问询。

今年2月, 白鲸实验室指控称, 有三家国产模型, 它们蒸馏的次数总共超过了1600万次。此情况意味着什么? 这样的数据量是不是一个非常庞大的蒸馏数据量?

杨梦月这样说, 我们并不清楚究竟是怎样进行计算的, 其中是否存在着夸大的成分呢。要是其所做的数据统计不存在问题的话, 这的确是一个不算小的数字。

当然, 我同样认为, 国产模型即便存在蒸馏的那一部分, 然而必定也有着自研的架构, 有着infra的设计, 这些可不是经由蒸馏而得来的。具体而言, 到底怎样将蒸馏的数据输入进去, 进而做后来的训练, 均有着自身独特的框架设计以及创新之处。

白鲸实验室: 既然蒸馏算得上是一条捷径, 并且还得要有自研能力, 那为何不能够在进行部分蒸馏之际, 同时也保留一定的自研体系呢?

杨梦月表示, 从理论层面来讲是存在可行性的, 但鉴于现实状况, 预算方面存在着限制。大规模蒸馏这种方式, 是需要去购买数量众多的token的, 而这种价格并不低廉。要是资源显著朝着蒸馏的方向倾斜, 那么就极有可能对数据生产、预训练、后训练、评测、基础设施以及人才投入形成挤压之势, 这会破坏掉一个Model项目本应具备的那种平衡状态。

白鲸实验室:这个蒸馏的边界是什么?

针对杨梦月所说的, 很难去实现判断, 蒸馏模型的数据, 相较于自己去标注数据, 其具备价格便宜的特点, 且速度还更快, 然而要是蒸馏过多的话, 有可能容易让人上瘾, 存在这样的情况, 一些模型公司正面临着生存方面的压力, 处于这样的高压状况下, 很难能够做到拒绝不去这么去做。

白鲸实验室:纯自研就一定更好吗?

杨梦月表示, 并非如此, 单纯依靠自主研发, 速度会慢, 成本还高昂, 并且存在做不出来的可能性。若完全仰仗蒸馏方式, 又或许后期发展动力不足。更为实际的走向是, 找寻到能兼顾当下竞争能力以及长期可持续发展能力的合理比例搭配, 而这个比例并没有一致的标准答案, 有待行业不断进行探索深究。

03

硅谷的公司也蒸馏

白鲸实验室, 从硅谷公司所处角度出发, 它缘何对于蒸馏反应展现出那般强烈的反应呢?

杨梦月: 有一家企业投入了数目特别大的资金从而打造出顶级的模型, 而另外一方能够提炼出大概七八成的能力, 有可能是以其大概十分之一左右的价钱来提供API, 这将会直接对原本公司所设定的价格以及其护城河造成冲击。价格高昂的模型对此尤为敏感, 原因在于较为便宜的替代物会致使它降低价格。

白鲸实验室:为什么比的态度更激烈?

对于杨梦月而言, 这或许跟公司文化有关系, 跟创始人风格与之相关, 还和对待开源趋势的态度关联着, 或者因它具备很强而且定价较高的编码模型, 商业利益方面更直接些而已。同样存在会做反蒸馏这种情况, 只是不同的那些公司, 在公开表态这个行为上, 激烈程度是不一样的。

白鲸实验室:硅谷对开源和蒸馏的态度一致吗?

杨梦月表示, 情况并非一致, 开源已然得到相当广泛的支持, 然而蒸馏却依旧存在很大争议。

白鲸实验室, 我存有一个疑惑, 要是一个模型是借由蒸馏而得到的, 并且还选择了开源, 看上去在道德层面会更易于被理解, 倘若边借助蒸馏来获取能力, 与此同时又把模型设置为闭源, 甚至于开展商业化, 这般的做法是不是反倒会更易于引发道德方面的争议呢?

杨梦月表示, 蒸馏跟开源不应该强行进行绑定, 存在这样一种情况: 有一家公司, 在经过蒸馏之后它能够选择开源, 同样也能够选择闭源, 而这是属于技术选择方面的问题。

白鲸实验室, 马斯克曾提及, xAI在训练自家AI时部分采用了模型, 那么, 硅谷的其他公司也会去蒸馏出更强的模型吗?

杨梦月表示, 必定会存在, 缘由在于它属于一种数据获取的方式。数据获取单单依靠自身去做是不行的, 自身去做是其中一部分, 借助各种途径来获取同样是一部分, 这可算作途径当中的一种。

事实上呢, 蒸馏这项事情其自身存在着少许被过度渲染、歪曲理解的状况。蒸馏一词最初被创造出来的时候,它仅仅是一个不带有任何情感、价值倾向的中性技术用语。最初的时候, 仅仅是众人在广泛探讨一个规模庞大的模型究竟是否具备这样的一种能力, 也就是能够将它所蕴含的知识传递给予一个规模较小的模型之中。

现此刻, 谈及蒸馏此词汇, 一方面是在讲述蒸馏攻击这桩事宜, 另一方面对于蒸馏削弱自研怀有的忧心, 已然摇身变为负面用语了。

白鲸实验室提出: “哪些知识能够用于学习, 哪些能力是不可以去学的这点。”那么这会成为AI时代里新的边界情况, 对不对?

杨梦月表示会, 蒸馏与反蒸馏之间的争论, 从本质上来说, 也是在对行业边界以及规则定义进行争夺, 然而技术格局的变化速度非常快, 不存在哪一家公司能够长久地占据最高位置, 标准不太可能被单一公司轻易决定, 最终还是要历经长期博弈从而形成共识。