三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > 科技

纯血国产!4B模型越级打怪,杀入万亿赛道

时间:2026-09-02人气: 作者: 佚名

纯血国产!4B模型越级打怪,杀入万亿赛道(图1)

新智元报道

纯血国产!4B模型越级打怪,杀入万亿赛道(图2)

就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。

事情是这样的。

9月1日, Face上线了两个开源端侧模型:星火X2.5-4B和1.7B。

本以为只能干干文本补全的轻活,结果一上榜单,4B模型硬是当着一众大一两圈的对手,狠狠地秀了一把肌肉。

纯血国产!4B模型越级打怪,杀入万亿赛道(图3)

在考察智能体(Agent)、工具调用和真实任务完成率这几项硬指标上,更是实现了「越级打怪」。

1.7B版本也不含糊。在考察MCP工具使用的MCP-Atlas里,它拿了23.4分,同尺寸这一档里最高。

光看数字没意思,我们第一时间把它下下来跑了跑。

装进本地环境后,直接下指令:写一个霓虹烟花的HTML页面。代码出得极其利落,一口气吐完,中间不带卡壳的。

纯血国产!4B模型越级打怪,杀入万亿赛道(图4)

跑出来的效果确实惊艳。

鼠标点哪儿哪儿炸,一簇七十多颗粒子四散开来,同一朵烟花颜色高度统一,粉的、青的、橘的随机切换——烟花的物理动态和氛围感,一下就出来了。

纯血国产!4B模型越级打怪,杀入万亿赛道(图5)

值得一提的是,这两款模型从头到尾都基于全国产算力平台完成训练,部署端更是打通了英伟达、华为、海光及后摩等主流硬件平台。

做这件事的,是科大讯飞全资子公司「词元星火」。

端侧AI

跨越「好用」门槛

过去这两年,大模型的故事几乎全发生在云端。参数越堆越庞大,离真实用户却越来越远。想用?必须先联网,还得把数据乖乖交出去。

可现实中偏偏有一大批机器「碰不到云」。比如内网里的办公电脑、工厂车间里的终端设备。

这些无网场景当然也有人试过水,办法无非两种。

要么,硬往本地塞几十、上百B的开源大模型,结果对硬件要求极高,部署折腾半天,跑起来还像看幻灯片; 要么,退而求其次用个小尺寸模型。

可过去的小模型,能力大多停留在「陪聊」和「文字续写」。你把一叠报表扔给它说「帮我整理一下」,它大概率会一本正经地给你回复一段「整理建议」。

端侧模型的尴尬一直卡在这儿。它只会动嘴,动不了手。

而用户的诉求其实特别朴素:几十页的操作手册能不能一次性读完?一个需要多步操作的复杂任务能不能直接帮我干完?

星火X2.5这两个模型,冲的就是这件事。

要干脏活累活,第一步是得先「挤得进」那台机器。

在BF16精度下,4B模型的权重只占8个多G,1.7B模型只要3个多G。如果做一下4bit量化,体积还能再砍一半。

尺寸压到这份上,它的使用场景就非常清晰了。

实测

断网生啃两份八千字合同

为了探探它的底,我们把它接进Codex,丢给它两份八千多字的商业合同,要求它找出所有的改动痕迹。

从结果来看,它找出的其中三处暗雷,说实话,连我们自己用肉眼看都未必能挑得出来。

纯血国产!4B模型越级打怪,杀入万亿赛道(图6)

除此之外,它还严谨地逐条列出了A版原文、B版原文、对我方的影响以及风险等级,最后按高、中、低风险分档汇总,并附上了五条应对建议。这套东西拿到手,基本上可以直接转发给法务,连返工都省了。

审完文本合同,紧接着是更硬核的数据处理。

我们丢给它一张未经处理的原始表格。结果它自己写了段代码,自己跑通,自己生成了分析报告。

纯血国产!4B模型越级打怪,杀入万亿赛道(图7)

从理解需求、写脚本、执行到检查结果,全程零插手。它不是在给你提供「建议」,而是真刀真枪地自己动手,把文件盘了出来。

抓异常的眼光,更是极其毒辣。

单笔超5000审批上限的4条、字段缺失的3条、有拆单嫌疑的11条,被它揪得一清二楚。

连带周末报销、负数金额、小数位异常、工号姓名不匹配、甚至日期格式混乱这种恶心人的暗病,全被它挨个高亮标出。

纯血国产!4B模型越级打怪,杀入万亿赛道(图8)

最关键的是,交付的报告格式严丝合缝,打开就能直接用,彻底免去了人工二次排版的折磨。

对于财务、审计、法务这些天天跟敏感数据死磕的岗位来说,这才是决定AI到底「能不能用」的绝对分水岭。

而且别忘了,这一切全部是在一台断网的笔记本上完成的,合同数据连一个字节都没有离开过这台机器。

它究竟是怎么做到的?

为了让端侧小身板爆发出这种越级的智能体能力,词元星火在底层和后训练阶段,砸出了两套绝活。

第一招:混合注意力机制,把显存抠到极致。

要干复杂的活,首先得「看得全」。

星火X2.5不仅原生支持最长100万Token的上下文,还在底层架构上动了刀,极其聪明地把注意力层一分为二。

一层负责通读全文建立宏观联系,另一层则死抠眼前的局部细节。

这样既能看得足够远,又不需要在每一层都把算力拉满。

而省下来的,全是端侧最宝贵的显存。同样跑满100万Token,它占用的显存只有传统全局注意力模型的四分之一。

端侧模型记性差、长文本前言不搭后语的老毛病,就这么被治好了。

第二招:多教师在线策略蒸馏(MOPD),不教答案只教「走法」。

看全了之后,还得「会干活」。

为了把复杂的动作逻辑塞进4B的参数里,研发团队打出了一套叫MOPD的组合拳。

首先,用高质量数据打底,再按编程、推理、工具调用分科开小灶,练出一批在垂直领域登峰造极的「单科专家」大模型。

接下来就是核心环节——用这些老师傅去带徒弟。

传统蒸馏往往是老师给出标准答案,小模型照着死记硬背。但小身板的脑容量摆在这,硬知识装不下就是装不下。

而MOPD玩的,是更硬核的「在线策略」。

简单来说就是,小模型先自己上手去盘这道题,老师傅则在旁边全程督战,一步步纠正路线。读需求、挑工具、填参数、查报错,失败了换条路再来。

相比于硬塞知识的老路,它能把「遇到问题怎么解」这套动作机制,直接传给小模型。

千万台国产设备

在等一个能跑的模型

跑分和性能只是第一关。真正决定AI能不能大规模落地的,是它能不能顺畅地活在真实的行业设备里。

按照国资委79号文给出的时间表,到2027年底前后,央企国企必须完成信息化系统的信创替代——芯片、操作系统、中间件、基础软件,要求100%替换。

这背后是一个巨大的市场。

据券商测算,政企信创的市场空间动辄在数千亿乃至万亿级别。单单是党政口径,2025到2027年间的PC替换需求就在千万台量级。

而2026和2027,就是集中交付的关键节点。

再加上今年8月施行的《网络数据安全风险评估办法》明确规定,采用AI大模型等新技术必须纳入动态安全评估。于是,「这份数据要不要发给云端大模型处理」已经不是成本问题,而是合规红线问题。

这些机器嗷嗷待哺的,正是一个能在国产芯片上跑、不需要联网、尺寸又足够小能塞进存量硬件里的模型。

星火X2.5的出现,几乎是严丝合缝地对上了这个缺口:

目前,模型的权重、代码仓库和部署文档都已经毫无保留地在 Face、和上开放,API也同步上线了MaaS平台,限时免费。

Face地址: