就在刚刚, -V4-Flash正式版的API上线!而-V4-Pro还尚未到来, 官方表示将会在8月初上线!
这次, Flash版本的能力, 属于超级加强, 在官方给出的评分里头, 能够看到, 部分能力, 也就是高难度编码以及自动化任务, 已得到成倍翻倍的极大加强!
那极具冲击力的那一组数据存在于此, 去跑分数值从7.3涨至54.4, 这可是涨到了7倍还要多,上一代对于此项来说差不多呈现出那种近乎于不会写代码的水平状态, 而这一代直接就能够去做那专业工程师所从事的工作了。
先是从38.7涨至76.7 , 这般情况是网络安全攻防模拟 , 其要求AI找出当中漏洞 , 还要去复现攻击路径。那上一代属于是"业余选手" , 而这一代干脆提升到了"接近专业人员" 的水平。
以及-Hard直接就翻倍有余, 其中的一类是借助自动化工具推动的任务类别;另外一种是具备挑战性颇大情形的编码方向专门项目, 它们两个全都是脚踏实地对AI能不能“自身去完成工作内容”给出考验的项目类型存在。
哎, 你瞧, Opus - 4.8它可是那个啥的当家旗舰, 它的模型体量很大, 训练成本也特别高, 而且,这两者都远远超过了像Flash这种所谓的“轻量版”。
在Bench这种“日常Agent任务”上, V4 - Flash跟Opus - 4.8的表现已然咬得紧致, 差距处于5%范围以内。在‘Last Exam’这里, 数据直接呈现为25.2比25.7, 近乎获得平手局面。
于、-Hard这般“超冗长链路、极繁杂代码”之上, Opus - 4.8确具显著优势 , 此二者所检验的乃是AI可否承受住一个真实大型项目自起始搭建直至完结 , Opus之根基更为深厚。
先不多说别的话了, 我打算去在真实的业务方面尝试一下它的水准了, 欢迎各位关注我, 后续会更新实际的体验感受~



Agent自动优化多GPU部署!AMD联合开源面向实时多模态
语音Agent等应用部署时,模型本身并非瓶颈,关键在于多模型...(65 )人阅读时间:2026-08-03
DeepSeek偷偷放了个大招!V4正式版本来了
DeepSeek-V4-Flash API正式上线,能力大幅...(125 )人阅读时间:2026-08-03
深度|太空基建的万亿缺口:全球极少数“航天+具身”团队如何卡
土豆送入太空成本大幅下降,但建月球基地费用却急剧增加。这源于...(174 )人阅读时间:2026-08-03
办公级Agent三国杀一触即发
互联网大厂纷纷调整组织,整合内部办公桌面产品。字节跳动整合飞...(86 )人阅读时间:2026-08-03