文章摘要
文章围绕AI Agent展开,指出大模型评测标准应转向“$/task”;容器隔离机制不足,Firecracker微虚拟机方案更佳;Grok 4.5成本低,Sol综合能力强;智能体可独立推进任务;产品评审需参会者专业;AI Agent带来探索“计算宇宙”机遇,Codex和ChatGPT Work重置付费用户额度。

ChatGPT · 2026-07-28 19:00 · 北京

当前行业内常用的单token定价对比模型优劣的方式已经不再适用。对于智能体(Agent)而言,它们需要完成完整的任务流程,过程中可能会调用外部工具、进行多轮推理迭代、反复调整输出结果;即便单个模型调用的价格更低,如果需要多次返工才能完成任务,最终的综合成本反而可能更高。因此更科学的评估指标应该是$/task:即便某款模型的单次调用成本比竞品高出5倍,但如果它可以一次性高质量完成任务,整体花费反而会比需要反复修正的低价模型更低。这也意味着,大模型的评测标准需要从“单题回答准确率”转向“以何种成本稳定完成真实业务场景下的完整任务”。

有观点援引相关实验指出,容器级别的隔离机制并不足以为智能体提供足够的安全保障。在测试中,智能体触发了内核恐慌(kernel panic),导致底层主机直接崩溃;而采用Firecracker微虚拟机的隔离方案,则可以提供更完整的边界防护。

在近期的网络安全模型综合评测中,Grok 4.5的综合表现接近Kimi K3,但它的使用成本仅约为Sol的十分之一、Opus 5的五分之一,更是只有Kimi K3的一半。值得注意的是,Sol依旧是当前综合能力最强的前沿大模型,整体表现领先于Opus 5。

有案例展示了智能体的实际落地场景:当团队成员临时需要修改发布用的视频时,开发者正处于户外骑行状态,他通过手机远程连接,让Codex借助computer use功能完成视频编辑、文件导出并自动发送到Slack沟通渠道。仅约20分钟后,第一版修改后的视频就出现在了Slack中。之后开发者还让Codex每隔30分钟自动同步团队反馈,依次导出了V2、V3和V4版本。当开发者回到家中时,视频已经完成了审核流程。这说明智能体已经从单纯的一次性辅助工具,进化为可以独立推进任务的异步协作伙伴:用户只需要给出目标方向,后续的任务跟进、反馈迭代都可以由智能体自动完成。

另有观点指出,当前多数产品评审会议令人感到厌烦,核心原因是这类会议已经退化为单纯的状态同步、领导层展示和跨部门对齐流程。真正有价值的产品评审,应该能够在一小时内浓缩团队数月积累的行业经验,同时模拟市场对该产品想法的真实反应。要实现这一点,参会者需要真正理解所在行业、具备专业的产品判断力、拥有清晰明确的观点,且多数判断能够准确贴合市场需求。人工智能可以快速生成大量的产品方案,但无法自动让会议变得更有价值;当创意和方案的生产成本越来越低时,能够快速识别出劣质想法的能力反而变得更加重要。

还有观点将人工智能智能体带来的行业机遇,类比为全新的探索时代:过去的人类探索了地球、征服了太空,而当下的从业者则正在探索由算法、程序、数学证明和工程设计共同构建的“计算宇宙”。

有消息称,Codex和ChatGPT Work已经为所有付费用户重置了使用额度,此次调整是在ChatGPT Work快速普及之后推出的,调整内容覆盖了Ultra和/fast等高强度使用场景。

以上内容不代表本平台立场,仅供读者参考