三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

我把DeepSeek塞进Codex跑了3个真实任务,只花了0.24元

时间:2026-08-01人气: 作者: 佚名

昨夜时分, V4 Flash 的软件上线了, 随着它上线, 时间线迅速地被各种各样的跑分给填满了。

我对着那些展现着领先具体分数情况、呈现出一点点朝着谁靠近态势的图, 看了好长一段时间, 最终还是没能抑制住一个更为贴合实际状况的问题。

它进了 Codex,真能在我的仓库里干活吗?

我拿出一个 API 账户, 其余额仅有 6.21 元, 接着把 V4 Flash 接入 Codex, 然后持续进行了 3 个真实任务。

它要做的, 既不是编写贪吃蛇程序, 还不是去完成一道相应算法题。三个任务, 全都源于我这座内容自动化仓库的往昔需求。我手头存有那时候真正合并过的变动, 模型运行结束后能够逐行进行比照。

最后的结果有点超出预期。

我把DeepSeek塞进Codex跑了3个真实任务,只花了0.24元(图1)

全部完成了三个任务, 总共耗费了八分四十二秒。账户原本余额是六点二一啊却变成五点九七了, 还被扣掉了零点二四, 是这么一笔金额了。

它并非一次性就完成了。其中最具复杂性的任务, 在进行过程中出现了两次失败, 自己读取错误提示, 改动实现方法, 重新运行, 最终将测试结果挽救了回来。

在这0.24元当中, 正好隐匿着我所认为的, V4 Flash最为值得去写出来的事物。

我把DeepSeek塞进Codex跑了3个真实任务,只花了0.24元(图2)

为什么不自己做一个 Codex?

这次进行发布, 最为有意思的动作, 在于, 并非是围绕着模型又重新打造出一个编码工具。

官方对于 V4 Flash 直接开展了上原生 API 的相关操作, 并且对其做以明确的书写表明是针对 Codex 进行过适配的, Codex CLI 能够供其使用, 桌面端也能够供其使用, IDE 扩展同样能够供其使用, 而且底层是共用一份配置的。

初始时像那般于 Codex 里读取文件, 执行命令, 查看 diff, 进行审批, 当下依旧按此方式运用, 仅仅是将发动机替换为 -v4-flash。

要是把这件事以拆解的方式去看待, 模型就愈发类似发动机, 而Codex就好比成是方向盘、仪表盘以及那个变速箱。去阅读文件, 去运行命令, 对上下文进行管理, 生成那个补丁, 在失败之后再进行尝试, 可以说全部都是经由这套工作台给组织起来的。开发者平日里所讲的, 所指的正是这一层外壳。

换的是发动机,没有逼开发者换车。

我把DeepSeek塞进Codex跑了3个真实任务,只花了0.24元(图3)

处于官方的一键脚本而言, 会先针对配置展开备份操作, 接下来才对共享的~/.codex/.toml以及模型目录施⾏修改。因我并不期望测试去扰及主环境, 所以构建了一个用以临时的。API key仅仅放置于临时环境变量当中, 一旦运行完毕便即刻予以清除。

要是你也打算去尝试, 起码得先确定备份已然生成。模型价格低廉, 可历史会话以及工作流并非价格低廉。

它在真实仓库里到底能干多少?

我从仓库历史里挑了三档任务。

任务

耗时

最终结果

修正文档里的两档内容预算规则

23 秒

完成,有一处表达仍略含糊

修复空 feeds 扫描和错误候选计数

2 分 15 秒

完成, 全过

新增一套付费痛点信号雷达

6 分 4 秒

完成,中途失败两次后自修

我把DeepSeek塞进Codex跑了3个真实任务,只花了0.24元(图4)

第一个任务规模较小, 仅仅是对规则文档进行修改。V4 Flash定位准确, 同时添补了240分钟以及300分钟这两档限制。然而, 它留存下一行240 - 300 min的旧展示内容, 功能并无问题, 只是读起来不像我手中的历史答案那般清晰。

第二个涉及的任务着手去触碰 Bash 的边界, 其提出的要求是, 在当天若是没有相关素材的时候, 就不要去生成空白的报告, 状态页仅仅能够去计算真正的处于候选状态的标题, 它首先会去读取现有的脚本, 接着补充两个内容 , 最后进行 11 行的新增操作以及 4 行的删除操作, 其行为以及验收的情况都是符合要求的, 实现的方式相较于历史答案而言稍微绕了那么一点, 不过仍然是处于可以接受的范围之内。

有一个任务, 它是第三个任务, 这个任务和日常开发最为接近, 此任务有这样的要求, 要给素材流水线加一个付费痛点雷达, 要抓取4个社区, 要进行中英文关键词扫描, 再者每个候选最多展示5段上下文, 最后还要接进all、、help和独立命令。

这个任务跑了 6 分钟,走了近 50 次命令调用。

首次, 其借助Bash数组来收集文件, 于macOS自带的Bash 3.2情形中, 空目录引发了, 它目睹失败状况之后, 舍弃数组, 转而变为流式读取。

再一次, 中英混杂排列的变量界限又出现了状况。它持续读取错误, 为变量添加上花括号, 重新运行中文命中、7条命中被截断、空文件、状态统计, 最终bash -n、git diff --check以及全部通通都通过了。

我把DeepSeek塞进Codex跑了3个真实任务,只花了0.24元(图5)

可是, 在那最终的结果当中, 我终究还是捕捉到了一个问题。它, 顺手就给原本存在的 RSS 命令补上了 || true , 其给出的理由乃是为了防止 set -e 提前出现退出的情况。这种修改的举动是具备一定合理性的, 然而却并不在任务所规定的要求范围之内。整个的实现过程相较于历史答案而言, 多出了大概三十来行的内容。

我看完 diff 的结论很具体,能干,但不能放养。

它已然能够独立自主地完整走过读取代码、予以实现、遭遇差错、进行定位、再次测试这条连贯通道, 然而范围控制方面仍旧离不开有人密切注视。

这相较于一次生成一段看上去正确无误的代码而言, 重要程度要高得多。真实仓库当中的 Agent, 其价值体现于失败之后是否还具备自行恢复的能力。

这 0.24 元到底花在哪?

经历三次任务, 累计输入数值为415.6万 , 当中的403.7万成功命中缓存, 缓存率达到97.12%。此处所呈现的是Codex多轮调用之后的累计数值, 并非一次请求就塞进了400多万。

在官方价格当中, 缓存命中输入每达到百万, 其价格仅为 0.0028 美元, 未能命中的输入价格则是 0.14 美元, 而输出的价格为 0.28 美元。Codex 会不断地携带上仓库规则、文件以及工具结果, 高缓存率直接对它能否便宜地运行长任务起到决定性作用。

我把DeepSeek塞进Codex跑了3个真实任务,只花了0.24元(图6)

这样的情况亦是我针对 V4 Flash 所产生的最为重大的看法改观, 以往低价模型常常被用作单轮分类, 被用于摘要, 还被用于简单问答, 如今花费 0.24 元能够购得三轮完整的 Agent 执行, 并且其中一轮允许其出现错误, 且可以返工, 还能够再次验证。

便宜的价值不只体现在单次调用。它让失败循环也付得起钱。

诚然, 人类所经历的时间并未被纳入这零点二四元之中。哪怕只是多修改一处本不该变动的代码, 依旧极有可能致使你于线上付出更为高昂的代价。账单倘若能够被忽视, 验收程序却绝计是不可以的。

同一副骨架,后训练能把它推多远?

更新日志里写得相当直截, V4 - Flash - 0731, 它的Flash架构跟4月时候一样, 规模同样一样, 仅仅是重新做了下后训练, Flash有着284B的总参数, 还有13B的激活参数, 同期的Pro却是具有1.6T的总参数, 49B的激活参数。

我把DeepSeek塞进Codex跑了3个真实任务,只花了0.24元(图7)

宣称新的Flash的Agent已经急剧远远超出V4 - Pro -, 所给出的Bench 2.1是82.7, 另一数值是54.4。第三方的Index给出50的值, 比某个值高10分, 在他们的测试口径范围里还比当前V4 Pro高出6分。

混着把这些数字当作结论不行。官方自测超过Pro, 编码测试所用力的自家, 有的尚未公开, 那两个可是内部的哦;同样存在着专属自己那类情况的题目以及权重。当下所跑的同题里, 这次并未拿、Pro以及GPT或者另外的那个去跑, 所以不会依据此情况宣布谁被谁超越了这一结论。

但方向已经很清楚。

模型架构未曾改变, Agent表现却依旧能够有较大幅度的移动动作。随后的训练此时正在全力专注于着手解决另外一大批另一类别的问题。具体包括怎样去进行工具的调用事宜的操作, 怎样在所需执行的长任务过程当中始终坚持下去, 怎样从出现的失败日志当中实现恢复, 怎样严格遵守仓库所要求的一定规矩或准则。

我于第三个任务里头瞅见的, 恰恰是这般能力。它头一回写错并无惊艳之感, 能够将Bash 3.2的错误逐一修正直至全部皆绿, 方才仿若一个可投入使用的执行者。

我把DeepSeek塞进Codex跑了3个真实任务,只花了0.24元(图8)

它适合替我干什么?

假定任务的边界清晰明确, 验收标准可被写成命令, 那么我会乐意将V4 Flash放置到执行层。

大量修复微小的程序故障、做补充验证、更改脚本代码、进行整理并迁移、运行并行的子代理程序, 这些工作最为适配它。一回没做准确也并无大碍, 只要测试能够将差错显露出来, 再次操作的成本低得极为惊人。

架构方面的决策, 跨仓库进行的重构, 安全敏感的代码, 以及最后的diff, 我暂时不会全部交予它。这次仅仅测试了一个以Bash为主的仓库, 无法进行外推到复杂前端, 大型项目或者数据库迁移。

我更倾向于选用一种质朴的分工方式, 由强大的模型或者人来负责明确问题、清晰写明验收标准, V4 Flash 承担执行工作, 最后再交给新的上下文去完成。

直接进到 Codex, 致使这个分工减去了一层工具转换, 执行模型是能够改变的, 然而 spec、测试以及习惯依旧留在自身手中。

写在最后

比起榜单名次,我更看重另一件事。

靠后训练, 同一副由字母数字组合成的特定骨架, 能令使用者学会更稳稳当当地利用工具, 把原有的工具使用方式变得更稳定;再借助一套成熟完备的东西, 直接进入开发者原本的工作台, 那东西叫Codex。从来没有过, 模型像这样, 工具像这样, 价格又像这样, 三者的情况拼合得如此顺畅。

它会写更多, 会出现越界情况。此外, 它会被一个 Bash 空数组阻拦到绊倒前行的步伐。不过, 它能够领会、晓得失败的意味, 并且再花费几分钱将既定的工作完成掉。

对于独立开发者来讲, 这种虽谈不上完美可返工得了的执行力, 相较一张满分的榜单而言, 更具价值。

Token 已便宜至极, 便宜到了能够忽略不计的程度, 而真正稀缺难得的, 是清晰明确的任务, 以及能够清楚知晓的验收。

模型可以便宜到忽略,验收不能。

我是洞见,下次见。