三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

DeepSeek-V4-Flash正式版来了,新能力浮出水面,性价比之王开战

时间:2026-08-01人气: 作者: 佚名

7月31日午后, 凤凰网科技去官网查询, 发现-V4-Flash正式版API上线进行公测。此次分层逻辑不同于以往, 不像以往是“Pro强、Flash弱”, 这次更新传达出一个值得留意的信号, 那就是Flash正式版在多项Agent基准测试里的表现, 已经接近甚至超过了三个月前V4-Pro预览版的水准。

DeepSeek-V4-Flash正式版来了,新能力浮出水面,性价比之王开战(图1)

官方所展示的更新日志表明, V4 - Flash正式版本, 于Bench 2.1这个测试环境里, 分别取得了82.7分, 54.2分, 76.7分, 以及70.3分的成绩。然而, V4 - Pro预览版本, 在Bench 2.0这个测试环境下, 其得分是67.9分。

DeepSeek-V4-Flash正式版来了,新能力浮出水面,性价比之王开战(图2)

需要阐明一下, Bench 2.0 跟 2.1 可不是同一个版本的测试集合, 直接去做对比并不全然公平, 不过, 有这样一个激活参数祇有 130 亿的轻量版本, 在 Agent 能力方面能得出这样的分数, 已然在表明后训练阶段的优化余地, 或许比单纯地堆砌参数更具备杠杆作用。

此外, 还特地表明, 现如今公测仅仅局限于API, App以及网页端暂时没有办法去体验最新的能力。-V4-Pro正式版将会尽快予以发布。

DeepSeek-V4-Flash正式版来了,新能力浮出水面,性价比之王开战(图3)

“仅重新进行了后训练”

官方于更新日志里表明, “模型结构、尺寸方面, -V4-Flash-0731 与 -V4-Flash- 保持一样 , 只是重新开展了后训练。”。

按照官方技术报告来看, V4 - Flash的总参数是2840亿, 其激活参数为130亿;V4 - Pro的总参数是1.6万亿, 激活参数是490亿。这两者在模型规模层面相差一个数量级。要是Flash能够借助后训练将Agent能力提升至几乎接近Pro的水平, 那就表明对于特定任务来讲, 模型规模并非是具有决定性的因素, 训练方法以及数据质量的权重正在不断上升。

官方专门特别点明, 于本次公开基准测试里的 Code Agent 任务, 运用了精简至极的模式当作框架来展开测试, 处在 max 档位, topp 取值为 0.95, 且等于 1.0。这般一个细节由此透露出, 兴许在 Agent 框架这一层面同样进行了具有针对性的优化, 并非只是单单模型自身的提升有此情况。

这同样是官方自己研究制造之后, 头一回凭借正式的命名呈现出来, 在此之前, 梁文锋曾将AGI能够达成的路径比喻视为攀爬楼梯: 语言模型属于第一级;去年处理的是CoT(思维链);今年的那一级台阶是Agent;而在Agent之后务必要处理的问题, 是持续学习——即要叫模型如同人那样长时间去积累经验, 并非每次都得被喂入齐全的上下文随后才能展开工作。再往后, 才是自我迭代的 “奇点” 以及具身智能。

他说, AI当下并非欠缺品位以及直觉, 而是它所缺少的是具备能够持续展开学习那样的能力, 投资人关注Agent, 而我们关注的是如何解决学习这一问题。

持续学习听起来像是关于模型层面的一个命题, 然而, 它的工程落点, 恰恰就在这个上面。那个Agent团队是在今年3月组建而成的, 挂帅的人是崔添翼, 他是90后, 毕业于浙大计算机专业, 手里有6枚ACM亚洲区域赛金牌, 曾经在顶级量化机构Jane工作了九年时间, 今年3月加入进来, 在此之后, 他在5月的时候大力地进行招兵买马。

另一个消息是, 有透露称与之相关的规划会在V4正式版上线那个时候同步去推出。并且, 还有在日志末尾表达这样的意思, 即“-V4-Pro正式版将会以尽快的速度去发布。”。

DeepSeek-V4-Flash正式版来了,新能力浮出水面,性价比之王开战(图4)

生态层面的一次正面交锋

要是讲 2023 年之际大模型的竞争属于 “拼通用能力” 这种情况, 2024 年是 “拼长上下文” 这般状况, 这样一来 2026 年的关键词, 毫无置疑就是 Agent。

自主规划, 调用工具完成复杂任务这个 Agent 能力, 正成为衡量大模型实力的新标尺啦 , 从 Bench(终端操作), 代码仓库生成, 到网络安全任务, 、软件工程 SWE-bench, 一系列 Agent 基准测试正重新定义啥是好模型呢。

在全球范畴之内打量观看, Agent能力处于最高水平位置的第一梯队当中, 目前为止依旧是被那些采用闭源方式的大型垄断企业所控持。按.ai等作为由第三方设立的评测评估综合平台所给出的数据显示统计, GPT - 5.6 Sol、Opus这一系列, 在大多数的Agent基准测试检验之中所排名次序处于前面位置。在我们国家自己生产制造的阵营里面, GLM、Qwen等同样亦是在快速迅猛向前接近追赶速度。

此次对 Flash 的 Agent 能力进行大幅度提升, 其战略意图十分明晰: 运用具有高性价比的轻量模型, 切入 Agent 应用的规模巨大的市场。

毕竟, Agent场景对于推理速度以及成本所具有的敏感度, 比纯对话场景要远远高出很多。有一个Agent任务表现为此任务需要反复去调用工具, 并且是多轮推理的情况, 要是用旗舰模型来运行, 那么其成本有可能达到Flash的数倍, 甚至是数十倍之多。要是Flash能够在Agent能力方面达到“就算不是特别出色但起码可用”这样的水平, 那么它在性价比方面所具备的优势将会产生极大的杀伤力。

首先, 官方所公布的, 那两个内部测试集, 其目标也是有着明确指向的。其中一个是内部全栈开发测试集, 在此测试集中它的得分是68.7;另一个是Hard内部Agent难题测试集, 这个测试集的得分是59.6。而这两个测试集的得分情况, 从侧面印证了某个事物的定位, 即要把Flash打造成开发者以及Agent应用的首选底座。

一场悄然打响的生态暗战展开了, 正式版的V4 - Flash原生对存在的支持对象是API格式这一关系做到了支持展现, 并且针对Codex达成适配了这样一种面向适配的行为。

新一代 API 格式, 是被力推的 API, 它被称为 API, 比起传统形式的 Chat, 针对于 Agent 场景而言, 它更适配, 这种适配体现在, 它支持更为灵活的工具调用, 支持更为复杂的多轮交互, 还支持更为精细的输出控制。

以原本就支持的这种格式而言, 意味着进行开发工作的人员能够以更低的成本, 把在特定生态环境下开发得以出来的那类 Agent 应用转移到另一处。这将会形成两者在生态方面出现的一回正面相对的情况。

所针对的 Codex 的适配, 将焦点对准了代码生成以及软件开发这一垂直场景, Codex 属于面向代码领域的模型, 那般有针对性进行适配, 就等同于直接于其传统具备优势的领域展开挑战性行动。

这样的一些动作, 当放在一块儿去看, 其展现出的野心并非仅仅局限于去充当一个“价格低廉的替代物”, 反而是志在 Agent 这个时代构建起属于自身的生态位置。

DeepSeek-V4-Flash正式版来了,新能力浮出水面,性价比之王开战(图5)

500 亿融资之后:高估值下的时间窗口

此次更新,距离 完成首轮外部融资不到两个月。

于一个多月之前, 达成成立将近三年以来的首轮外部融资, 总额超过500亿元人民币, 创造了中国AI行业单轮融资的纪录, 投后估值约合520亿美元(大约折合人民币3500亿元)。投资方的阵容其中涵盖腾讯、宁德时代、京东等产业巨头, 以及多家国资产业基金。

DeepSeek-V4-Flash正式版来了,新能力浮出水面,性价比之王开战(图6)

七月中旬的时候, 有着推进新一轮私募融资的意向, 投前估值大概是710亿美元, 折合人民币约4800亿元, 比起首轮融资后的520亿美元估值, 上涨幅度约为37%。从520亿达到710亿, 所间隔的时间不足六周。

在所呈现的高估值背后, 存在着市场对于技术实力的一种认可, 同时这也是市场针对其商业化前景所作的押注。然而, 高估值却同样表明了有着高预期,以及随之而来的高压力。

有多家媒体进行了这样的报道, 创始人是梁文锋, 在首轮融资里, 他本人拿出差不多200亿元人民币来出资, 借助特殊架构, 他牢牢地把公司控制权掌控住了。梁文锋这个人脱胎于幻方量化, 在之前将近三年的时间里, 他始终坚持依靠自有资金投入, 现在呢, 从“不融资不上市”的状态转变为积极地去拥抱资本, 这本身就是一个特别强烈的信号——正在加速朝着商业化以及IPO的方向冲去。

Flash正式版本上线, 或许能够当作在资本助力下的一回技术实现。然而真正的考查还在后续: Pro正式版本是否能按时到来? Agent能力进步能否转换成实实在在的收益? 在、等大企业的围攻下,的高性价比途径将怎样施展长处。

战争大幕才刚刚拉开, 是关于Agent的。一个轻量模型大幅进化, 给行业出了一道新题。当后训练红利被充分挖掘, 当效率提升开始抵消参数差距, 大模型的竞争逻辑, 可能要被重新书写了。