在7月31日的下午时分, 静悄悄地做了一件颇为违背大众认知常理的事情, 将一个名字当中带有“轻量”这两个字的模型, 训练成为了那种能够把自家旗舰狠狠压制在地上摩擦的存在状态, 该所训练成样子的它还被称作Flash。
不是官方举办发布会, 并且也不存在通稿大肆宣传, 仅仅是于API文档当中更新了一项内容。然而恰恰就是这一条看起来并不起眼的日志, 其中隐藏着三个能够致使众多开发者重新进行核算的要点。
先讲讲它究竟开放了些什么, 此次进行公测的是 -V4-Flash-0731, 模型的骨架完全没有变动, 依旧是那个总参数为2840亿、每token仅仅激活130亿的MoE架构, 100万token的上下文被原封不动地保留了下来, 讲得十分直白, 改变的仅仅是后训练, 所针对的是接口调用场景。
真正全新的事物存在两个方面。其一为原生对 API 格式予以支持, 其二是深度与 Codex 生态达成适配。只要进行一次配置, 你便能够于 Codex CLI、桌面端以及 VS Code 的 Codex 插件当中直接调用它。直白来讲, 倘若你从事代码写作工作, 在当下就能将此模型融入自身的开发流程, 使其协助你编写代码、查找 Bug, 甚至搭建小型项目。

我有个从事独立开发的朋友, 之前打算承接一个能够自动运行终端命令、调试工具链的 Agent, 不是价格贵到令人心疼, 就是笨拙得无法使用。他在看完此次更新后告诉我, V4 - Flash接入进去以后, “终于好似一个能够干活的人了”。这大概便是Bench 82.7那个分数落地时的模样——并非榜单看起来好看, 而是实际干活的人少加了几个班。
但此次最令人头皮发麻的点, 并非接口处, 而是能力方面。这个所谓“轻量版”, 于Agent这件事领域, 将自家的Pro预览版完全超越在了后面。
瞧一瞧几个确切的数字, Bench 2.1(终端操作方面), 其数值从56.9急剧飙升至82.7;(网络安全攻防范畴), 从38.7上涨到76.7;(编程领域), 更是由7.3直接跃升至54.4。官方所罗列的九项agent基准, 全部超越。在相关的智能指数当中, 它获得了50分, 相较于前代提升了10分, 反而超过自家V4 - Pro 6分, 已然逐渐接近GPT - 5.6 Luna以及GLM - 5.2。

换个角度放大这件事来看, 实际上它正在拆解一个旧有的共识, 那就是这个共识所谓的大模型竞赛等同于堆砌参数以及比拼算力。而V4-Flash凭借使用同一个具备2840亿的骨架证实了, 训练“配方”方面存在的差距, 在某些时候相较于参数规模本身所存在的差距而言, 会显得更加具有致命性。如此一来对于那些算力以及预算都受到限制的中小团队而言就犹如吃了一颗定心丸, 原因在于这里并非是指定你必须要去追寻规模最大的那个, 而是将已经拥有的模型特训得更加“擅长发挥作用”, 如此这般或许才属于性价比更高的途径。
这就致使在行业里“Pro强而Flash弱”的那种默认认知被一下子掀翻了。更加关键之处在于, 并非它赢取的数量多少, 而是它所凭借的并非堆砌参数, 却是后续的训练。是同一个骨架情况之下, 改换为一种更为精细的训练策略, agent的能力便产生了质的进步跨越。这给全部那些紧盯着成本来维持运作的团队敲响了一记警钟: 模型朝着强大发展的路径, 或许比所想象的更为狭窄, 然而也更为低廉。
第三点, 并且是极易被忽视掉的一点, 那就是——他们将权重给开源出去了。他们在一个叫做Face的地方挂出来一个名为V4-Flash-0731的东西, 遵循的是MIT协议, 有着FP4或者是FP8的精度等级, 整个包大概有167GB的大小。把这个下载下来之后, 放到自己的机器上去运行, 如此一来数据就不会流出自己的门了。

然而需要将话说明白, 即: MIT呈现的是“开放权重”状态, 并非“完全开源”局面。权重代码具备可下载、可自行托管、可进行蒸馏以及可用于商业用途等特性, 且限制极为稀少。但训练代码以及数据集并未予以公开。研究机构若是想要复现训练过程, 依旧会受到限制。对于企业而言这样的情况是足够用的, 然而对于学术界来讲, 却缺少了关键的一步。
对那些针对数据敏感的金融方面、政务部分、医疗领域的客户来讲, “开放权重”这四字所具备的分量着实不轻。自身托管意在将提示词, 及和之对应的文档都限定在内网范畴内, 不存在跨境传输的情况发生, 并且也没有遥测参与其中。同样地具备趋向闭源旗舰程度的能力, 但在经济耗费上却从原本那种会令人每次心底暗觉心疼程度降级变更成为了可以随意使用的状态——也就是这样实际上的情形恰恰标志着把人工智能从仅供尝试新鲜的功能转变成为具备基础设施性质的一步。
它在开源方面处于何种位次呢? 有一组数据能够很好地表明情况。在聚合平台之上, V4 Flash在今年6月的月调用量可达18.4T token, 在全球开源模型里位居首位。再将视野放得更宽些, 中国开源大模型的整体下载量在全球所占比例已达到17.1%, 超越了美国的15.8%, 占据第一位置。此次, 为这个“第一”又增添了一份力量。

有意思的时, 此次发布之时, 距离完成首轮外部融资尚不足两个月。6月的那笔融资, 数额超过74亿美元, 投后估值超过500亿美元, 此融资创下了中国AI行业单轮纪录。那是资本进入之后的第一次技术兑现, Flash率先交出了答卷, 而Pro的正式版此刻仍在路上。
真正做到出圈的所在其实是价格, V4 - Flash 的输出价大概为 0.28 美元 / 百万 token, 它只是 3.1 Pro 的约十分之一, 同时是 GPT - 5.6 Sol 的约三十分之一, 缓存命中的时候输入几乎可以说是免费的。存在一个每月能够跑 500 万输出 token 的客服 Agent 团队, 使用 GPT - 5.6 Sol 的话大约需要 150 美元, 而换成它花费还不到 5 美元。
说来说去, 这两年不间断重复的同一桩事, 便是将“能力”的价格底线一回回朝下打压。V3能够把推理花费削减下来 , R1能够把推理效能显露出来 , 这次V4 - Flash又把“会做事的Agent”放进了几元钱的成本范围。当一个靠近旗舰水平的Agent能力强大到足以实现自托管 , 价格低廉到可以随意运行 , 曾被成本束缚的中小团队 , 首次拥有了与巨头一同竞争的机会。
当然, 我不会去吹嘘它未曾吹嘘过的那些牛。需要老实地讲出几个存在的短板: 它没有多模态, 这使得图音视频直接就被排除在外了;其极限推理能力相较于闭源旗舰仍落后几个月的时间;而这些基准是厂商自己上报的情况, 第三方还没有完全进行再现复现, 只能作为参考, 可以参考, 但不要把它当作硬性的衡量标准。
要划清另外一个范畴界限, 此次仅仅对Flash的API展开了操作, 普通人于今日开启App或者网页端时, 所获得的体验与昨天毫无差异性, V4-Pro的API同样未产生改变,宣称V4-Pro正式版本将会“尽快予以发布”, 直至那个时候, 普通用户才能够切实感受到此次技术迭代所带来的实际感受。
回溯至此事件自身, 再度将“能力”与“价格”这两件事情予以拆解, 它凭借一种轻量模型的成功转向表明: 有时促使模型切实走向强盛的, 并非更庞大的架构, 而是更为明智的训练, 对于受成本所限制的开发者以及企业而言, 这比任何发布会皆更具记录价值且值得一记。
OpenAI前员工刚跑路就喊话:要套现就赶紧套,别等IPO!
一位刚从OpenAI离职的员工,持有70万美元股权,在Ope...(98 )人阅读时间:2026-08-02
反超自家Pro、MIT开源:V4-Flash 正式版 API
DeepSeek 悄然发布 Flash 模型,在未公开宣传下...(60 )人阅读时间:2026-08-02
离开Kimi后,他做了一款“三年内没结婚就退款”的AI婚恋A
婚恋App不应过度关注用户留存和活跃度,而应聚焦于成功撮合婚...(173 )人阅读时间:2026-08-02
无人机加了条腿,跳出了一个新硬件品类
眺月科技研发的“跳跃机”是一款新型机器人,通过弹簧腿和四旋翼...(97 )人阅读时间:2026-08-02