终于V4-Pro的正式版来了。相比 4 月份那个 版本,这一次的 终于把 1.6T 大模型的 Agent 上限真正跑出来了。
官方 API 文档已经确认,-v4-pro 当前实际指向 -V4-Pro-0813,调用方式不变。仍然是 1M 上下文、384K 最大输出,同时支持 / Non-、Tool Calls、JSON、 API 和 API。
而且目前调用的价格还是不变,暂时维持原来的价格,百万输入(缓存命中)0.025元,百万输出 6元,简直是太残暴了~

V4 Flash 没有冲着 SOTA 去,但反而更恐怖——它几乎把 API 调用成本打成了电费,直接掀起了一轮低价风暴。
为什么大家都说 是行业“斩杀线”?因为它就像拿着除草机在后面追,同行只能拼命往前跑:跑输了,能力不如 ,价格还更贵,基本就寄了;跑赢了呢?也没什么奖励,因为 下一句还是——那你的价格呢?

这就是 性价比打法最恐怖的地方:它不一定非要做第一,但能逼着所有人不断降价、不断提能力。从能力花费曲线上看,一大波不在绿色区域的都可能被斩杀掉。
模型能力大幅提升
4 月 版其实一直有个很奇怪的问题:模型纸面规模巨大——1.6T 总参数、每 Token 激活约 49B——但真正放进 Agent 和长任务 里,并没有和 Flash 拉开想象中的巨大差距。 当时自己也说过,Flash 在简单 Agent 任务上和 Pro 基本旗鼓相当,只在高难度任务上存在差距。
0813 最大的变化,就是这个差距终于出来了。

其中最夸张的是 ,12.8 → 62.7; Bench 2.1 也直接涨了 15.8 个点。如果这些成绩能被后续独立评测基本复现,那么它已经不是“小版本优化”,而是一次相当成功的 Agent 后训练。
更关键的是,它开始进入真正的旗舰模型区间。按照 的横向评测, Bench 2.1 的 87.9 已经非常接近 Kimi K3 的 88.3;HLE + Tools 达到 60.0,和 Fable 5 的 63.0 差距也不算大; 甚至做到 83.3。
在官方放出来的榜单中,它的能力已经喝Opus-4.8相当了,而且逐步逼近Fable 5。在评测中,取得的分数在53,超越了之前国产的GLM-5.2模型,落后于Kimi-K3模型。

可以看到,更恐怖的其实还是价格
现在官方价格仍然是:缓存命中 $0. / M、缓存未命中 $0.435 / M、输出 $0.87 / M 。
这个价格配上 87.9 的 Bench,就有点离谱了。
V4 Pro 0813 开始变成:
“能力已经离最强闭源模型不远,结果价格还差一个数量级甚至几十倍。”
这会让所谓“最强模型”的竞争逻辑继续发生变化。企业跑 Agent 并不是只跑一道 ,而是可能一个任务调用几十次、几百次模型,读几十万 Token 的代码,再产生大量工具调用。在这种场景下,便宜 20%、30%意义不大,便宜 10~50 倍意义就完全不同了。
而 还有极低的 cache hit 价格,对 Agent 这种反复读取同一个代码仓库、 和历史 的工作负载尤其有优势。
不过这个优势可能不会维持太久: 已经在官方定价页明确写了,近期计划整体上调 API 价格,而且预计涨幅较大。
但这里有一个很值得注意的地方。
V4 Flash 的总参数量是 284B,每 Token 激活约 13B;V4 Pro 则直接扩大到 1.6T 总参数、49B 激活参数。也就是说,从 Flash 到 Pro,总参数规模扩大了约 5.6 倍,单次推理实际激活的参数量也扩大了约 3.8 倍。
但在 上,成绩只从 54.4 提升到 62.7,绝对提升 8.3 个百分点,相对提升约 15.3%。
这其实说明了一个越来越明显的趋势:后训练确实还能给模型带来非常大的能力增益,但单纯继续扩大参数规模,边际收益已经没有过去那么显著了。

这里可能有两个原因。
第一种可能,是高质量训练数据开始不够用了。模型规模扩得很快,但真正能够把这些新增参数“喂饱”的高质量代码数据、Agent 轨迹、复杂环境交互数据,并没有同步增长。如果数据质量和训练强度没有跟上,参数变大之后,自然很难线性转化成能力提升。当然,这目前更多还是一种猜测。
第二种可能,则是 本身已经越来越难准确反映旗舰模型之间的真实差距。
即使 已经算是目前评价很高、也相对接近真实 Agent 场景的 ,它本质上依然是在一套固定任务、固定环境和固定评分规则下衡量模型。到了今天这个级别,模型之间真正拉开差距的地方,可能已经不是“能不能把这道题做出来”,而是面对一个几十万行代码的真实项目时,能不能连续工作几个小时、正确拆解任务、调用工具、发现隐藏问题,并在中途出错之后自己恢复。
这些能力,很难被一个最终的单一分数完整表达出来。
所以 Flash 54.4、Pro 62.7,并不能简单理解成 Pro 只比 Flash 强 15%。它更可能说明:现有 对顶级模型能力的测量,正在逐渐接近自己的上限。
未来真正决定模型差距的,可能不再只是参数量,也不再只是某一个 分数,而是模型在超长任务、复杂环境、Agent 和真实生产场景中的持续完成能力。
实际测试体验
Q1:六边形中弹珠碰撞
请生成一个完整的HTML文件(将HTML、 CSS和均合并成一个文件)来模拟一个蓝色小球在顺时针缓慢旋转的正六边形内形成一个文件)来模拟一个彩色小球在针旋转的正字形内部弹跳的动画,要求如下: - 小球应受重力影响,并在碰到边界时发生反弹-小球与多边形之间的碰撞检测要真实-所有代码应包含在文件内,不要引用外部库或文件-动画要平滑,页面布局适配

具体的动画效果:整体效果不错,科技感、动态感都有,视觉上很像“模型能力在不断探索边界”。

Q2: 生成一个宇航员再月球上骑马的动态svg

这一次生成的效果感觉就一般了,可能还需要等官方的进行适配效果才会更好。
Q3:用 Three.js 实现一款“我的世界风格”的3D飞机大战。
这是我用最新的DS-V4-Pro模型做出来的效果

这是用的是之前的-V4 预览版模型生成的效果

对比来看,专家模式优点主要体现在“视觉完成度更高、风格更统一、观感更舒服”这几个方面。
首先,上面的那个图的整体美术风格更统一,更接近“我的世界”那种低模像素沙盒感。地面网格、树木、云朵、飞机、敌机这些元素都保持了同一套方块化语言,画面会显得更协调。相比之下,下面的图虽然元素更多,但地面、草、敌机、UI之间的风格整合感没那么强,第一眼会稍微有点杂。
整体来看,这次生成效果是比较好的,已经不只是“把需求实现出来”,而是有了比较完整的产品雏形。

主要体现在产品感很强。从标题“微旅程”、副标题“每天一张世界小众角落,一段治愈故事”,到日期切换、卡片式内容区、底部轻文艺说明,整个页面已经有明确的定位,不像一个简单的 demo,而更像一个可以继续打磨上线的内容型网站首页。主题和表达是统一的,这一点很好。
视觉风格匹配题意。这个需求本质上是“轻旅行 + 小众角落 + 治愈叙事”,而当前生成出来的是偏米白、浅棕、低饱和的配色,整体很安静、温柔,和“微旅程”这个名字是契合的。
Q5:写一个包含风、雨、晴、雪四种天气的 HTML 动画卡片,深色设计,要有动效和按钮切换。

写在最后
V4 Flash 更像“斩杀线”:能力够强,价格又低,逼着同行一边提能力、一边降价。
但 V4 Pro 明显是冲着旗舰模型去的。1.6T 参数配合更强的 Agent 后训练,已经开始逼近最前面那一档模型。
实际测试下来,它在网页、Three.js、复杂交互这些任务上的完成度也明显更高,不过动态 SVG 这类任务依然不算稳定。说明现在真正决定体验的,已经不只是模型本身,而是 模型 + + 工具环境。
所以我现在更期待的,反而是 后续自己的 。
Flash 负责把价格打下来,Pro 则开始盯着 SOTA。
那个 2025 年春节的 ,好像又回来了。
梁文锋、马斯克同时开火!DeepSeek V4 Pro,Gr
专注AIGC技术的DeepSeek悄然上线V4 Pro正式版...(99 )人阅读时间:2026-08-13
DeepSeek V4 Pro 正式版来了:这次,大鲸鱼盯上
DeepSeek V4-Pro 正式版上线,支持1.6T大模...(108 )人阅读时间:2026-08-13
阿里没留住的人:资本抢着投,新公司估值20亿美元
林俊旸自2019年加入阿里达摩院参与大模型研发,2022年底...(104 )人阅读时间:2026-08-13
奥特曼震撼预言:6个月后,ChatGPT将彻底接管你的人生
OpenAI CEO奥特曼预测,终极AI助理仅需6个月模型迭...(97 )人阅读时间:2026-08-13