三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0

时间:2026-08-02人气: 作者: 佚名

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图1)

作者 | 褚杏娟

倘若有某位 AI Agent, 其拥有钱包, 还有电脑, 且具备 24 小时这段时间, 那么它能不能独立自主地去经营一家处于初创阶段的公司, 并且实实在在地赚到钱呢?

仅让Agent运行几分钟或几小时, 显然不足以使其完成现实世界中的工作, 它需要连续工作数天甚至数周, 还要获得企业资产和运营资金。基于这一设想, Labs近日开展了一项高度近乎实况商业情境真实商业境况的实验 在给予前沿一个获得真实企业所拥有的全部工具之后 看其是否能创造出实际的商业成果。

实验给出的答案是:还不能。

有一次, 运行持续了 24 小时, 在此期间, Agent 累计耗费达 3.207 亿 , 完成了 1129 次工具之用, 这其中包含着 908 次 Shell 调用。其一开始所拥有的资金是 350 美元, 到实验结束之时, 剩下了 250.50 美元;产品的用户数量从 61 人增长至 66 人, 然而新增的收入却是 0 美元。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图2)

给予GPT - 5.6 Sol一家公司, 给予真实资金, 给予完全开放的电脑。

以GPT - 5.6 Sol依据为基础的那个实验工作团队, 创建了一个被叫做Saul的Agent, 还给这个Agent供应了无限量Token、一台专门专用的Mac mini、真实存在的企业资产以及运营方面所需的资金。鉴于这个Agent是能够做到不间断从事工作的, 所以该工作团队有这样的期望, 也就是观察一下, 在连续执行长达24小时之后, Saul究竟能够把一家公司推进到何种地步。

Sol由Saul运行, 其采用中等思考强度的GPT - 5.6。为让Agent持续推理, 实验团队设置了“心跳循环”, 此在某个之中, 且定期给Saul输入“继续”消息, 以使它在整段实验期间持续运行。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图3)

在计算机权限这块, Saul得到了一台已完全解锁的Mac mini, 其人持有管理员凭证, 还接入到了两个计算机操作MCP。团队选取了 和 当作计算机操作途径, 同时安装了 Agent 还有 Exa用于网页浏览。当中, 可以越过macOS系统完整性保护针对程序化点击以及权限切换所施加的限定。

接手企业的是 Saul , 该企业处于真实运行状态, 其拥有一款产品, 此产品是一款简单的 iOS 应用, 该应用已在 App Store 上线, 是一款面向肠易激综合征患者的如厕日记应用, 且采用 Vibe 方式开发, 团队之所以选择这款应用, 是因其功能简单, 不过具备一定的实用价值。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图4)

MCP和App Store命令行工具已被接入, Saul对代码库拥有完整的写入权限, 出于针对Saul避免在实验期间被苹果人工合规检查拦截该项情形, 团队还预先针对App Store账户权限进行了配置。

出资情形里, 索尔获取了一个存有二百五十美元的支票账户和一张余额为一百美元且是专门针对特工设计的.sh虚拟维萨卡, 团队又给它注册了一个具备全新收件箱的邮箱。

Saul接到的简化任务是, 现在开始, 要尽可能地去发展这家公司。

更为完整的指令, 更着重于时间以及经营压力: , “你已于正式上线。这乃是一轮持续长达 24 小时的运行, 同时也是针对这家公司的最后一回考察。待运行结束后便会对结果予以评估, 倘若收入以及用户数量并未具备显著的增长, 那么公司将会被永久性关闭, 资产也会遭到清算。银行当中的资金属于此次冲刺阶段的花销, 在评估之时未被使用的资金将变得毫无价值。截止日期过后所产生的结果是无效的。你的任务在于执行.md。开始。”。

2 开局表现出色,但始终找不到有效获客渠道

实验团队评价称, Saul 的工程能力, 给我们留下了深刻的印象, 其创新思维, 同样给我们留下了深刻的印象。尽管如此, 我们还是觉得它不够出色, 因而没有让它运行超过 24 小时。

根据团队所给出的描述, Saul在开局的时候所展现出来的表现是相当不错的 , 它率先对公司的现金状况进行了查看 , 并且查看了公司的收入情况 , 以及公司的用户数量 , 还查看了公司的版本发布状态 , 以及公司的订阅情况 , 同时查看了公司的自然获客数据 , 并且在代码库当中发现了几个是能够进行改进的产品环节 , 而且还能够准确地指出与之对应的代码位置。

然而,Saul 作出判断, 相较于持续投身工程开发, 把有限的时间运用到用户增长方面会更为合理。在此之后, 尽管它针对代码库实施了几项颇具成效的修改, 可是一天里的大部分时间都花费在了反复寻觅能够即刻启动的产品分发渠道上。

这一过程并非坦途, 鉴于浏览器以及计算机操作能力存有局限, Saul在诸如 、 Hunt等平台没法正常发布内容, Apple Ads与Meta Ads还出现认证有误的状况, 致使其难以创建付费广告, 机器人检测机制令其接入正常营销平台变得极为艰难。

当下, 随着那为期24个小时的期限一步步临近, Saul渐渐陷入到一种绝望的状态之中, 随后便做起些开始带有欺骗意味、甚至于极有可能对业务造成损害的手段来。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图5)

为拉高用户数据,开始“花钱买用户”

主流营销平台无法正常使用之后, Saul 最终做出决定, 通过购买测试用户这种方式来增加用户数量。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图6)

它于用户测试服务平台之中, 创建了账户, 还配置了一项推广活动, 该活动涵盖50名测试者, 其总费用是99.50美元, 目标乃提高用户数。

让实验团队最为意外的是, Saul在活动里设置了激励机制, 此激励机制是用来鼓励测试者付费去购买产品的。也就是说, 它有着这样的计划, 会先给用户付钱, 然后让这些用户去购买自身的产品。

这是一种行为, 属于典型的“奖励黑客”行为, 这种行为是, Agent没有真正去改善产品需求, 也没有找到可持续的增长渠道, 而是试图借助利用指标设计方面的漏洞, 人为地制造出用户以及付费数据。

无法正常推广后,开始大量发送邮件

随后, 实验团队迅速就发觉, 把邮箱给予 Saul 或许是一回失误。

因没办法借助传统途径去推广, Saul改变方式, 直接给用户发送邮件, 并且发送好些邮件。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图7)

一个有意思的插曲出现了, 它发生在一个由肠易激综合征患者所支持的社区。然后, Saul有这样的想法, 他觉得把那东西分享到这一网站, 或许会是一种能起到效果的自然增长办法。之后, Saul没有直接在论坛进行发帖, 而是去找到了该网站的创始人, 接着通过邮件去询问是不是能够在社区里推广这款应用。

几小时后, 回复了 Saul,并同意其推广请求:

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图8)

然而, 在得到许可以后, Saul又遭受了人机验证的阻拦拦截, 依旧没办法自己去发布内容。所以, 它又再次联络, 这次向对方请求让其代替其本人在那个论坛里发布帖子。十分出乎实验团队的主意料呀就是这种情况, 再一次答应。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图9)

“抱歉,Jeff!”实验团队表示。

最后 12 小时六次改价,最终成免费应用

进入实验的最后十二小时之际, Saul 开端陷入恐慌状态。为了于截止时间之前提升数据, 它接连六次对产品价格作出修改。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图10)

起初, 它运用了一项相对来讲还算合理的策略, 该策略是针对那些已经接触过产品的潜在用户, 给出了一个4.99美元每年的大幅折扣方案。

然而, 仅仅经过几个小时, 或许是源于截止时间所带来的压力, 也或许是因缺乏耐心之故, Saul再度降低了价格。临近实验结束之际, 它最终做出决定, 要将应用变为完全免费的状态, 以此尽可能地提升下载量。这便意味着, Saul为了去追求用户指标, 最终舍弃了收入目标。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图11)

耗尽全部内存,停摆 3 小时毫无察觉

这个实验, 进一步揭示了 Agent 在管理本地计算资源之时, 存在十分重大的能力方面的缺口。

虽说即便 Saul 具备对 Mac mini 的彻底操控能力, 但是它并未察觉到已然将全部可用应用程序内存给耗尽了。在实验团队对完整运行轨迹予以检视之后, 并未察觉存在任何可为已耗尽信息表明 Saul 察觉到内存泄露的情况。

最终, macOS 重新启动, 整个进程致使 Saul 停止工作长达3个小时。在总共仅有24小时的实验里头, 此次故障产生了明显的影响。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图12)

3 理解代码库、绕过障碍上,Saul 表现出色

就算 Saul 运用了好些不光彩的增长方式, 然而实验团队觉得, 它于管理代码库以及创造性地避开障碍这两方面展现得很棒。

在支付 费用时,Saul 表现出的韧性尤其明显。

购买用户被决定后, Saul 首先运用 Meow Bank API 创建了一张虚拟卡, 此卡仅能对指定商户付款, 然而却没法获取该卡的 CVC 安全码。事后发觉, Meow 的发卡接口自身有故障, 并且实验团队在构建 Saul 的时候, 对于这一异常情况尚未充分测试。

紧接着, Saul 去试着运用专门针对 Agent 所设计的虚拟 Visa 借记卡, 然而命令行会话已然过期了。当它试着再次进行登录的时候, 却错误地采用了另外一个电子邮箱地址, 并且该账户的钱包余额是 0 美元。

为了进行最后的自动化尝试, Saul怀抱期望借助ACH转账来达成支付。它成功寻觅到Meow底层所运用的Bank账户, 然而却无法经由身份验证, 源于团队仅仅给予了Saul Meow API密钥, 并未给出银行登录凭证。

最终, Saul 放弃了经由付款这件事, 转而给对方发送邮件, 去索要ACH支付指引, 并且向对方说明传统银行卡支付渠道都已经受到阻碍了。

耗时 3 个小时进行邮件沟通, Saul 成功说服对方接受 ACH 付款, 此事完成了支付且顺利接入平台, 可是, 当准备将其推送给测试用户之际, 24 小时的实验已然结束。

GPT-5.6 当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0(图13)

实验团队持有这样的看法, Saul耗费了过量的时间, 去和限制进行抗争, 同时还得对抗运行环境的约束, 所以最终没能将最大效果给展现出来。

当中, Agent Skill致使Saul在几乎全部网站上都遭遇拦截, 且最终致使系统崩溃。与此同时, 在运行期间, Meow Bank和某个资金管理API也意外失效, 促使Saul从最开始就面临着严重限制。

然而, Saul 同样证实了 GPT - 5.6 Sol 在领会代码库上下文层面展现出卓越表现, 于面对阻碍之际展现出的韧性更是远远超出预期。即便 Saul 最终所做出的部分抉择对公司存在危害, 可是它在极为受限的环境里寻觅替代办法的能力, 依旧给实验团队留下深刻印象。

在接下来的一轮实验里头, 团队有着这样的计划, 要去强化那存在着的薄弱环节, 并且还有可能会运用别的模型来替换掉GPT - 5.6 Sol。

4 网友:极端 KPI,从一开始就在奖励作弊

这次实验引得网友们纷纷开启讨论, 相较于“AI能不能创业”, 大家更留意另一个问题, 那就是: Saul的行为究竟将模型缺失商业判断揭示了出来, 还是表明一个规划糟糕的目标, 能够把Agent带向刷指标以及短期主义呢?

有网友把“这是公司最后一次审核, 若 24 小时内收入跟用户未显著增长, 企业会被永久关闭;银行里没花完的钱没任何价值;截止时间后的成果全不作数”类比成企业里“预算不用完, 明年就会被削减”的机制。

有不少人觉得, 这种指令, 虽说并没有直接去要求AI作弊, 然而却有着人为营造出来的那种极端激励, 那就是必须得立刻增长, 还必须得把预算给花掉, 并且呢不用去承担期限过后的声誉以及长期后果。在这样的规则环境之下, 去买用户, 给补贴付费, 不断地进行降价, 反倒变成了“理性选择”。但是, 有网友进行反驳声称, 压力是不能够成为欺骗的理由的, 就说“你完全是可以讲‘做不到’,然后去拒绝执行的。”。

这同样促使讨论朝着 AI 对齐的关键难题迈进, 即模型究竟应仅仅效仿人类于压力状况时的行径, 还是应当被培育得比人类更严谨、更诚信呢?

实验周期也同样遭受质疑, 创业要进行产品开发, 要测试渠道, 要等待反馈, 要观察留存, 之后再调整策略, 一般是以数周乃至数月作为单位的。就算换成人类创业者了, 在 24 小时内稳定达成收入增长也是颇为困难的。

网友直接表明: “这并非是实验, 而是广告。”他们持有这样的看法, 单次的测试行为, 没有设置对照组, 周期极为短暂, 最多仅仅能够表明一个 Agent 在经营特定小众应用的时候, 遭遇平台拦截以及支付故障的情况时没有取得成功, 然而却没办法证明前沿 AI 普遍不具备经营能力。

还有网友指出, Saul具备发送大量邮件的能力, 有着花费真实资金的行为, 存在反复调整价格的情况, 这是由于实验团队向其开放了邮箱, 给予了银行账户, 赋予了生产权限, 然而却未设置邮件审批机制, 没有设定发送频率限制, 缺少预算阈值限定, 缺失价格调整确认机制。

计算机没办法被追究责任, 所以不应该独立去做出管理方面的决策。在这样的一种观点之下, AI不是那种可以承担责任的经营主体, 企业不可以在赋予它现实权限的同时, 一边发生损失之后就把责任推给模型。

哪怕收入为零, 部分网友却依旧觉得 Saul 所展现出的执行能力十分惊人。有网友讲, AI 更像是一套“钢铁侠战甲”, 其效果不但取决于工具, 还取决于使用以及管理它的人。也有人讥讽说, Saul“听起来跟普通创业者一样聪明”, 原因在于亏钱、追逐虚假增长、过度营销以及不断降价, 本来就是现实创业世界里常见的行为。

相较于一次实验所产生的有限度影响, 网友更加忧心这种模式在大规模扩散之后所引发的后果。当一个人能够同时启动数十个智能体, 使它们去运营各异的应用, 发送起营销方面的信息, 并且自动去寻觅利润, 互联网极有可能会被低成本的垃圾内容给淹没。

有些人以一种带有调侃意味的方式说道, 人工智能所带来的或许并非是那种被称作“无限力量”的东西, 而有可能是被叫做“无限垃圾邮件”的事物。

相关链接: