从2026年3月起, 崔添翼加入后开始着手组建团队, 到如今, 已经憋了5个月, 这回, 真的, 那个工具, 要来了吗?
一张截图在各大AI社区流传,内容是 的内部测试招募通知。
据截图所述内容, 计划在本周稍后时间开启内测, 首批用户要从范围较小的群组里头进行筛选, 那些被选上的人, 得提交个人资料, 并且签署《保密承诺函》, 如此方可拿到产品访问权限。
而且截图表明, 一旦出现泄密情况, 不但当次资格会被取消, 而且还会对日后各类模型、产品的内测以及合作机会的入选产生影响。
即便截图到底是真是假没办法去验证, 然而结合先前有关V4正式版发布日期的公告, 并且崔添翼曾讲出会和V4一块儿发布, 如此一来这条传闻很有可能是真实的。
然而当下市面上不存在任何有关产品形态的报道, 依循以往的行事风格而言, 若是重要产品, 那么它的研发以及设计必定是严格予以保密的。
然而, 我们依旧能够借助, 各式各样的细微线索, 大概推测判断出, 此物究竟是何种模样。
01
到底长什么样
到底呈现出怎样的模样呢? 当前所公开的讯息仅仅存在两块内容, 其一乃是负责人崔添翼所具备的量化背景, 其二则是有关部分的招聘职位描述即JD。
伊始讲起第一块, 崔添翼并非以从事AI而起始。他于Jane历经了长达九年之久的量化交易系统相关工作。
于量化交易系统当中, 极具价值者乃是执行系统 , 讲究的在于软件究竟能否于毫秒层次将策略转化为交易 , 能否于出现异常之时实现自动恢复 , 又能否在每一步皆遗留下可追溯的日志?
如果把这个思维搬到上,那么其大体逻辑可能会是这样的:
在量化交易当中, 要是慢了那么一毫秒, 钱就会被其他人给赚走。所以, 系统的每一个步骤都必须严格地按照毫秒级来进行优化, 绝对不可以存在多余的步骤。
故而, Agent循环之中, 每一轮的推理环节要快, 执行环节要快, 反馈环节也要快, 绝不能存在冗余开销。你向AI讲出一句话, 它不可以历经许久都毫无反应。从它开始思考那一刻起, 到调用工具这一过程, 到获取结果之时, 再到琢磨下一步举措, 整个循环务必得快。
与此同时, 量化系统务必得极为可靠才行。要是量化系统出现崩溃的情况, 那么亏掉的可是实实在在的金钱。因而哪怕行情繁杂得超乎想象、数据偏差得匪夷所思, 系统自身也绝不能停止运行, 必须得能够自行恢复过来才成。
作者声明:该图片由AI生成
模型存在犯错的可能性, 甚至会输出某些离谱的事物给你, 然而这个框架自身绝不能崩溃, 必须能够承接住结果, 通过想办法把模型拉回来继续开展工作。
实际上, 于量化交易当中, 网络出现中断情况、交易所接口发生故障挂掉、行情数据呈现异常状况, 此种情况皆是习以为常的, 系统绝不能够一遇遭遇到问题便陷入瘫痪状态, 对此需要具备重试机制、拥有备用方案, 实在没有办法可行之时就进行降级处理, 举例比如当无法获取实时行情之际, 那便先用延迟之后的数据予以暂时支撑。
模型同样如此, 工具调用失败了, 文件读不出来, 网络超时了, 这些皆为平常之事。好的不会因一次工具调用失败就使整个任务废弃, 它会自动重试, 换种方法, 实在不行便降级处理, 继而推进任务。
另外, 鉴于量化系统关联着大量金钱, 交易出现问题后, 要能够查找到出错的具体步骤在哪, 或许是下单的时刻有误, 又或许是行情解析存在差错。每一个步骤都必须具备日志, 如此方可进行复盘。
同样地, 倘若 AI 将事情搞砸了, 你必须能够回溯查看它究竟是怎样一步步迈向失误境地的, 究竟是哪一步策虑有误, 究竟是哪个工具调用得出了异常的结果, 它缘何做出了那个错误的抉择。
于整个量化系统之中, 订单状态亦是极具重要性的。不可以产生“自己觉得已下单然而实际上并未下达”以及“重复进行下单”这般的状况, 每一个步骤的状态务必都为确定的、保持一致的句号。
放置于上, 于当下所有人皆对长程任务、复杂任务进行押注的情形下, 是否能够维持模型中间所处的状态, 这么个情况会决定整个情况的成功概率, 不容许先行对A文件予以改动之后, 于后续改动B文件之时将A的改动忘却。
而后是风控以及安全方面了, 量化交易设有熔断机制, 在行情出现异常状况的时候它会自动停止交易, 以此避免因一个bug致使钱亏完。此外, 高风险的操作必须是要有审批的, 不是能够随便说着下单就下单的。
那么, 往回说这事儿, 在促使AI去执行诸如删文件、实行格式化硬盘操作, 还有运行sudo rm -rf这种高危指令之前, 就必然得停顿下来予以确认。绝不能任由它想怎么操作就怎么操作, 必须得设有一道安全闸门才行。
02
从的JD里看产品
说完了第一块再说第二块,官方挂出来的岗位JD。
在JD当中, 提及了KV Cache, 同样也提到了长上下文裁剪与压缩算法, 由此表明将会采取一种智能的上下文管理措施。
跟V4的前缀缓存能力相结合的情况下, 相同上下文的任务不会重复进行计算, 在长对话里会自动针对历史消息制作摘要, 把关键的信息留存下来, 将token空间释放掉, 并依据任务的复杂程度动态性地调整上下文策略, 简单的任务运用短上下文来省去成本, 复杂的任务则调满百万token的长上下。
作者声明:该图片由AI生成
等于说, 是将每一份的那算力, 都用在关键之处, 小事情能节省就节省, 大事情把算力全部充分发挥出来。
JD当中还提及了向量存储方案的选型, 以及会话状态的持久化与回放, 这便意味着存在长期记忆系统, 它会记住你项目的架构, 记住你项目的编码规范, 记住你项目的常用模式, 下次打开项目时会自动进行加载。
即便你把终端关了之后又重新打开, 之前的对话状态是存在的, 修改记录也还留存着, 执行轨迹同样都还在, 这便是会话持久化的体现。甚至连你命名所惯有的风格都会给予记忆, 你喜欢遵循使用的框架版本, 横跨不同对话, 也能记住你各式各样的习惯。
JD当中提及了Tool Use以链式方式进行调用、如发生错误则回退以及自动重试这些情况, 这所表达的乃是具备完整的将工具进行调用的编排能力, 能够针对多步工具调用编排形成有方向且不存在循环的图形。在工具调用出现失败状况时会自动进行重试, 倘若重试无法达成则进行降级并更换方案, 要是依旧不可行那就回滚至前一个处于稳定的状态。
着重强调要点, 并且存在一种可能性即是会对动态注册全新工具予以支持, 而Agent能够自行发觉并且进而学会去运用。
JD当中提及了多Agent之间通信协议的设计, 还提到了任务的分解以及结果的聚合, 这表明存在子Agent架构, 有一个主Agent承担任务规划以及协调的工作, 多个子Agent负责具体的执行。
不同的子Agent有着各异的系统提示词,各异的工具权限, 各异的上下文窗口。主Agent对复杂任务进行拆解当作子任务, 将子任务分发至子Agent, 并聚合结果成为最终输出。每一个子Agent在单独的上下文里运行, 或者在单独的进程进行运行, 相互不介入, 一旦出错不会牵涉主流程。
JD当中还提及了任务规划图实施, 执行路径于线上进行优化之处。这便表明存在规划以及自我进化的能力呀。
任务来了以后, 依照规划就会先去生成执行计划, 要划分成几步, 每一步要采用什么工具, 预期会产出些什么。在执行进程当中, 会依据实际情形进行动态调整, 并非是呆板地依照原计划行进。每完成一步之后, 就要自我开展检查, 要是不对, 就会自动进行修正。
并且, 极有可能存在着一套于内部的, 每一次架构出现变动之时, 都会完整地运行一遍的, 用于查看究竟是朝进步方向发展了还是朝着退步方向变化了的, 凭借这样的方式来达成工具自身进化的机制。
最有意思的一点, 存在于JD的最后部分, 其中提到, 需要促使模型进行共同进化, 达成模型之间的深度适配。
这就意味着, 会借助-V4模型的特性, 像是V4的稀疏注意力、前缀缓存。它并非通用框架, 而是紧密与模型绑定的一体型产品。
其实这也是现在的理念。
此前, 存在两条相互独立的后训练线, 一条专属代码的Codex线, 一条用于通用推理的GPT线。直至GPT - 5.5阶段, 两条线实现合并, GPT - 5.5 - Codex把代码能力以及通用推理能力融入到同一模型之中。
就如同汽车一般的情况, 原厂恰似汽车生产制造厂家自行制造发动机及变速箱, 其知晓发动机的扭矩曲线变化情况, 以及转速方面的特性表现, 对应变速箱的换挡逻辑能够达成精准适配。然而要是将这样的事情交付给第三方去进行操作, 那对于第三方而言发动机等同于黑盒状态, 他们仅能够凭借感觉来调试变速箱, 如此一来便导致始终无法调试到像原厂那般呈现出丝滑的境地。
03
V4正式版,跳票一个月
不是一个人来的。崔添翼曾表示,V4正式版和将同步发布。
4月24日, 发布了V4, Pro版本与Flash版本同步进行开源, 在两个月后的6月29日, 向API用户发送邮件, 明确表示V4正式版计划于7月中旬上线, 然而眼看着就要到8月了, 却依然没有任何有关V4正式版的消息。
曾经有过这样的传闻, 说是因为7月24日的时候, 旧的API -chat和-进行了正式退役, 所以V4正式版会在同一个时期发布。毕竟啊, 更换API接口, 一向是为新版本让出道路的前置性动作。
V4正式版仍然没有被发布。仅仅是两个旧的模型名字正式停止使用, 所有的调用都必须更换为新的 -v4-flash以及 -v4-pro。也就是说, API接口名称改换了, 然而模型自身还是预览版时的那一套标准。
那么正式版比预览版强在哪?
综合多个内测信源的说法,称V4正式版在三个方向上做了升级:
核心推理能力再上一个台阶。
日常对话的响应速度明显优化。
Agent能力针对性迭代。
有人参与了灰度测试, 他们进行了总结, V4正式版的整体表现, 接近于Opus 4.8的级别, 其编码能力, 不比GPT-5.6 Sol弱, Agent能力以及3D、SVG生成能力, 都有了大幅提升, 在同样的任务上, 与Fable 5相比, 迭代轮数还要少。
不过这些说法都来自非官方渠道,没有公开确认。
其实社区里针对预览版的问题讨论得挺多的。V4在编程能力方面与Kimi K2.7、GLM 5.1相近, 然而比起当下的主流模型还是稍显逊色的。
特别是在那些繁杂的任务当中, 有实验者发觉, 就算规定模型“不开展外部依靠”, 模型仍然引用了外部CDN。
碰到确确实实复杂的任务时, 得手工去添加等于最大值, 也就是推理强度处于最高状态, 这样才能够获取到更深层次的思考深度, 然而要是变成智能体的话, 常常就会忽略掉这个带有提示信息的词语咧, 进而致使模型思考的强度达不到目标要求。
同样存在这样一点情况, 尽管当下已经将识图模式也就是OCR予以上线了, 然而-V4所拥有的多模态能力依旧是属于短板范畴。
关于官方所讲的, 预览版呈现为纯文本模式, 正式版本首次原生实现对图像推理予以支持, 引擎能够在同一思考进程里针对图片展开分析, 再者是对截图开展解读, 如此这般也会在客观上使得工具背负的压力有所增加。
而且, V4正式版将会增添某些企业功能, 然而, 具体的情况究竟是怎样的, 官方并未做出更进一步的披露。
再说价格,这是争议最大的部分。
V4正式版会引入峰谷定价机制, 高峰时段是北京时间9:00 - 12:00以及14:00 - 18:00, 此时API价格会直接翻倍。详细说说, V4 Pro缓存命中输入, 平时是0.025元每百万token, 高峰时段为0.05元;缓存未命中时, 平时是3元, 高峰是6元;输出方面, 平时是6元, 高峰是12元。V4 Flash缓存命中, 平时是0.02元, 高峰是0.04元;缓存未命中时, 平时是1元, 高峰是2元;输出平时是2元, 高峰是4元。
峰谷定价此情况, 从好的方面来讲, 是将算力选择权交还给用户, 不着急的任务转移到低谷时段去运行, 成本会更为低下。但从另一方面而言, 在平常的办公时间, 运行相同的任务, 成本便会出现增加的状况。
这不是第一次在定价上换思路。
在2025年2月的时候, 进行过夜间错峰优惠活动, 其中V3能够享受五折优惠, R1则是二五折优惠。到了2025年9月, V3.1发布了, 夜间优惠被取消, 实行全天统一价格, 而且输出价格还向上提高了50%。
然而, 关键的问题并非是价格有没有上涨, 而是在于两者结合以后, 整套的使用成本将会呈现怎样的状况?
第三方测试表明, 在完成相同任务情境之时, 不同的对象存在着token消耗方面的巨大差异。测试机构借助V4 Flash这一工具, 针对Code、Pi这三个市面上最为常见的工具展开了分别测试。测试结果发现, 这三种工具在代码质量层面基本保持一致的情况, 不过Code在完成每个任务之中时, 平均会奔跑大约70次工具利用行为, 而Pi只有大约22次这样的行为。
另外, 一样的任务, 于弱的(Pi)当中失败了, 转而到强的(Code)里面竟然成功了。
因此,如何去平衡价格与性能,这是做必须要面对的问题。
不过有一点我很放心,在省钱这件事上,梁文锋还是太权威了。
把Codex接入Claude Code!OpenAI开源专属
开发者使用Coding Agent时,虽然更换模型,但组织上...(181 )人阅读时间:2026-07-30
新智元火到硅谷了?VC大佬走访中国实验室,爆料长文连夜刷屏
新智元因一篇报道在硅谷引起轰动,被一位风投大佬盛赞。文章指出...(66 )人阅读时间:2026-07-30
这家Agent创企融了2亿!前微软员工创业,ARR涨超5倍
以色列AI初创公司Encore AI完成3000万美元A轮融...(77 )人阅读时间:2026-07-30
北京手术机器人龙头,买了一家骨科植入物公司
天智航医疗公告将于7月30日复牌,并发布《发行股份购买资产并...(179 )人阅读时间:2026-07-30