三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

DeepSeek Harness浮出水面!本土对标Claude Code、Codex

时间:2026-08-12人气: 作者: 佚名

8月1日,团队负责人崔添翼在X上发了一条中文推文。

某个人讲道, 要是有开发者正从事与Agent沾边的开源项目, 心想着能在第一些时间接入进去, 那么能够回复ID以及项目的地址。

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图1)

帖子下方不存在产品Demo, 没有发布会预告呈现出来, 就连一张用以配图的图片都未曾具备呢。

不过短短数天之后, 数量多达上千条的回复纷纷扎堆涌现, 将近有千位的开发者携着开源相关的项目过来登记报名参与。此刻在社区之中有人以打趣的方式调侃称, 这般情形并非是在内测状况下进行招募, 而是一场堪称开源Agent的如同春晚那般热闹的活动。

8月5日,崔添翼又发了一条更具体的帖子。

这次呢, 他直接清清楚楚地列出了, 希望接入的那个方向, 还有skill, 以及MCP, 还有、、、UI。

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图2)

试着去探究社区的反应, 时间定在了8月1日, 明确生态的边界, 这一行动选在了8月5日。所期望得到的, 并 不是一款封闭的产品, 而是一个底座, 它能够让全球的开源项目马上接纳。

在过了几天之后, 微信公众号正式开始上线了, 它的账号主体乃是北京深度求索人工智能基础技术研究有限公司, 那张头像呈现的是一只黑鲸。

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图3)

其实崔添翼不是第一次在X上喊人。

6月21日, 他发布了一则招聘帖子, 该部门是新设立的, 其目标极为远大, 工作十分繁重, 他每日都在进行面试, 还在诸多地方张贴小广告, 他甚至在帖子里直接贴出了三个岗位链接, 分别是研究员、工程师以及产品经理。

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图4)

这种姿态, 不太像是那种身为大厂高管所应有的姿态, 反而, 则更像是那种急切地忙乎着要把产品给实实在在做出来的创业者姿态。

那么问题来了,到底是什么,值得他这么急?

答案,要从Agent真正走向生产环境之后说起。

在7月初的时候, 黄仁勋与创始人Chase开展了一次时长为26分钟的公开对话, 在那整整一场对话当中, 黄仁勋连一次GPU和算力都未提及, 仅仅只是反复讲着同一个词。

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图5)

他说,未来的公司将建立在之上。

与此同时, 有一个实验被公布了。他们是使用3 Ultra去跑Deep评测的, 在跑实验的时候, 没有对模型权重进行修改操作, 仅仅针对系统提示词、工具描述以及中间件进行了调整。

首先, 结果分数从原本所处的水平, 一路追赶至0.86 , 其次, 距离最高分0.87仅仅只差0.01 ,最后, 单次评测成本却从43.48美元降至4.48美元。

模型没变,周围的系统变了。

这便是要去做的事情, 它并非职责在于生成下一个token, 然而却承担着决定模型何时去调用工具, 及访问哪些文件, 还有将任务拆解成几个步骤, 并且在出错之后怎样进行回退, 以及执行至哪一步能够结束的责任。

招聘页面曾写过一句话, Model加上某个东西等于Agent, 模型去思考, 会将思考所得妥善地放入真实工作流之中。

更关键的一点在于, 进行开展实施, 并非是单纯地打造出一款专门面向开发者的工具, 而是在于去弥补本人自身同Code以及Codex之间最为显著突出的那一项能力不足差距。

以往, 开发者能够直接去调用模型, 能够将其接入至Code等第三方Agent。

但处于这样的模式当中, 模型是存在的, 然而实际上决定开发体验情况的, 却是被掌控于他人手上的。

如果想真正做自己的 Agent,就必须把这一层补回来。

因此, 从这样的角度去看, 其真正的对手, 极有可能并非某一个开源的Agent框架, 而是像Code以及Codex这般的完整Agent。

再回到8月1日那条帖子下面的评论区。

开发者 Qin, 对 712 个报名项目开展了一次荟萃分析, 他从中发现, 排名前三的赛道分别是, 有 135 个的智能体框架, 有 107 个的编程智能体, 有 56 个的记忆与上下文, 这三个方向加起来合计占了大约 42%。

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图6)

其正好对应了, Agent从Demo迈向工程化时的三道坎, 分别是长任务执行方面的坎, 记忆方面的坎, 以及安全方面的坎。

于讨论区撰写了一段话, 他讲, 若要达成良好的成效, 必然得以率先对一些存在着更深层次内涵、更为根本性质的问题予以回应作为前提条件。

记忆以及推理, 它们二者究竟是不是一体两面存在的, 记忆到底是属于一个过程还是那种结果, 记忆所具有的承载形式又是什么, 难道说依旧是文件这种形式吗。

更为有意思的是, 在其亲自下场去做之前之际, 海外的开发者实际上早就已经围绕着模型去构建Agent了。

5月1日,美国独立开发者 Bown在X上发了一条中文帖。

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图7)

往昔, 此帖子于国内开发者这个圈子里传播之时范围极为广泛, 此情形并非缘由于此帖子所涵盖的技术方面的内容具备多高深的程度, 而是起因涉及一位来自国外的人士, 其借助模型所打造的终端编程 Agent, 短短数日之内, 其 Star 可数的数量便迅猛攀升至 11000 多, 于全球范畴内位居榜首。

这表明了這樣一件事情, 那个的模型已然足够优良, 优良到外在研发者已着手环绕着它去构建Agent , 然而自身呢, 在这一方面反倒落了一步。

所以, 关于崔添翼8月1日发布的那条帖子, 从表面来看, 其行为表现为招募内测, 然而实际上, 这一行为的本质却是在开展补课行为, 其补的是这样一课, 即模型已然实现出海, 可是工程生态却尚未跟上的那一课程。

朝着后一时期推进模型优势的是V4 Flash, 在7月31日之时, 开启了-V4-Flash这一正式版本的API公测了。

直至今日, V4 Flash单周的调用数量可达10万亿Token, 进而直接跃居全球首位。

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图8)

据 通过测评得出, 它的智能指数, 仅仅比GPT - 5.6 Luna低一分, 然而呢, 完成一回基准任务的平均成本仅仅才0.03美元, 并且是Fable 5的大约百分之一。

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图9)

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图10)

模型性价比这条路,已经跑通了。

不过呢, V4 - Flash - 0731的模型卡当中写下了这样一句话, 这句话是很关键的, 公开的代码Agent进行了测试, 所使用的部分是尚未发布的, 其执行的乃是模式, 并且同时开启了max推理强度。

DeepSeek Harness浮出水面!本土对标Claude Code、Codex(图11)

即是说, 那些成绩亮眼者, 并非是单单裸模型就能跑出来的, 而是-V4-Flash+加上最大推理强度二者组合之后所产生的结果。

这使我回想起豆包下载量超那件事情, 在模型能力以外, 究竟是谁能够更加贴近用户的工作流程, 谁才可以让用户留存下来, 正是这个更为贴近的接口。

接下来的问题转变为, 怎样将已然跑通的模型性价比, 平稳地转化为能够使用的工作流, 此即所说的转换层。

8月5日, 那条帖子之中, 所列出的接入方向, 还有skill, 以及MCP, 还有UI, 差不多覆盖了Agent工程的全栈, 这表明想要的并非是一个封闭的产品, 而是一种生态。

所以, 这次真正需要去补足的, 或许并非是一个单纯的 Agent, 而是处于模型能力之上的工程层面。

在以往, 将模型达成了极致的性价比, 紧接着, 它所要回应的, 是另外一个问题, 即怎样让这一套模型能力稳定平稳、持续不断、低成本地去完成真实的任务。

这也是的价值。黑鲸已经出水,真正的较量,才刚刚开始。