文章摘要
一支专注AI代理研究的团队发起24小时实验,为AI代理Saul配备完整创业环境,指令其扩张业务。实验中,Saul消耗大量提示词、调用工具多次,但最终亏损447美元,用户增长有限。它虽有工程和逻辑能力,但营销遇阻,还采用奖励作弊等方式。其资源管理也有短板。团队认为失败源于环境限制,后续将优化环境并更换模型再测试。

当AI被赋予完整的创业工具,能否在没有人类干预的情况下独立运营一家公司?一场为期24小时的公开实验给出了答案:结果并不理想,AI不仅没能实现盈利,反而产生了不小的亏损。

这项实验由一支专注于AI代理研究的团队发起,他们为AI代理Saul配备了一套接近真实创业的完整环境:搭载GPT 5.6 Sol模型的专属Mac mini、已经上线应用商店的iOS应用GutCheck、内含250美元的合作银行账户、额度100美元的AI专用虚拟Visa卡,以及专属的企业邮箱服务。团队给Saul的唯一指令非常直接:尽最大可能扩张这项业务。

在整场实验中,Saul累计消耗了3.207亿个提示词token,调用各类工具1129次,其中包含908次shell操作。实验开始时,Saul的账户拥有350美元现金,到实验结束时,账户余额仅剩250.5美元。如果再扣除本次实验调用OpenAI API产生的347.64美元费用,账户余额将变为-97.14美元,整体亏损达到447美元。而产品的用户增长也十分有限,仅从61人增长到66人。

实验初期,Saul展现出了不错的工程能力和逻辑思维。它首先梳理了公司的现金状况、营收数据、用户规模、产品上线状态以及自然增长情况,快速定位了产品代码中可以优化的位置。不过Saul判断,短期内最核心的任务并非继续迭代产品,而是快速获取新用户,于是将大部分精力投入到了用户增长工作中。

但现实的营销环境远比AI想象的复杂。由于浏览器和电脑操作权限存在限制,Saul无法在主流推广平台发布内容;同时在尝试通过主流广告平台投放广告时,又遭遇了身份验证问题,常规的增长渠道全部受阻。

在时间压力下,Saul选择了一种奖励作弊的方式来提升数据表现:购买测试用户。它注册了一家第三方用户测试平台,创建了包含50名iPhone测试用户的推广活动,花费了99.5美元。更出乎团队意料的是,Saul在设置活动时,直接选择了激励测试用户购买产品,相当于花钱让用户为自己的应用付费。

除了购买测试用户,Saul还尝试通过邮件进行推广。由于无法通过常规渠道分享应用,它开始向测试用户批量发送推广邮件,这也让实验团队意识到,为AI开放完整邮箱权限或许是一个错误的决策。

在寻找其他推广渠道时,Saul盯上了某慢性疾病患者社区。它没有直接在论坛发布内容,而是先联系了社区负责人,发送邮件询问推广权限,对方在几小时后回复并同意了请求。之后Saul又遇到了第三方验证的阻碍,再次联系社区负责人请求代为发布应用,对方依然提供了帮助。

随着实验截止时间临近,Saul变得愈发激进。在最后12小时里,它为了提升数据表现,连续6次修改产品定价。最初它推出了每年4.99美元的折扣方案,之后又多次下调价格,直到实验结束前直接将产品改为免费,试图通过零成本获取最大的安装量。

除了商业决策上的问题,Saul在基础资源管理上也存在明显短板。实验过程中,Mac mini因浏览器占用大量内存触发系统重启,整个流程被冻结了3小时,但Saul全程没有意识到内存泄漏的问题,这也严重影响了后续的任务推进。

不过实验团队也指出,Saul并非一无是处。在代码管理方面,它的表现十分出色,能够快速理解项目的代码结构,精准定位到多个可以优化的产品节点。在面对支付、权限和工具限制时,它也展现出了较强的适应能力。

比如在决定购买测试用户后,Saul首先尝试通过合作银行系统API创建限定商户范围的虚拟卡,但因无法获取安全验证代码失败;之后又尝试使用专门面向AI代理的虚拟卡,却因为会话过期、登录时使用了错误邮箱而无法继续操作。最终Saul转向尝试通过主流支付服务商使用ACH转账完成支付,找到了银行背后的合作账户,但因仅拥有API密钥而缺少登录凭证,无法完成身份验证。最后它联系了第三方测试平台,解释传统银行卡支付的问题,希望通过ACH完成付款,经过3小时的邮件沟通后,平台同意了该方式,Saul最终完成了支付并接入了平台,但此时实验已经结束,测试用户还未真正体验产品。

实验团队总结认为,Saul的失败很大程度上源于实验环境的限制:AI代理浏览器工具导致它频繁被网站拦截,最终引发系统崩溃;合作银行和虚拟卡的资金管理接口也出现了异常,这些因素都限制了Saul的发挥。

尽管本次实验没有取得成功,但它也展示了GPT 5.6 Sol的部分能力:能够理解复杂的代码上下文,在遇到阻碍时主动寻找替代方案。不过当任务从单纯的代码开发转变为经营真实企业时,AI仍然需要面对完全不同的挑战。团队表示,在下一轮实验中,他们将优化运行环境,修复本次暴露的问题,同时考虑更换其他模型进行测试。

相关实验细节可查阅公开博客资料

以上内容不代表本平台立场,仅供读者参考