Claude Fable 5.1重磅更新:性能跃升 新增文件整理技能

Claude系列的最新迭代版本已经展现出强劲的性能跃升,一个新的代码工具就能等效过去五个智能体的工作效率。本次同步推出的Claude Fable 5.1和Mythos 5.1中,Mythos 5.1仍仅对少量用户开放,因此我们的测试和分析将聚焦于Fable 5.1。
从纸面数据来看,Fable 5.1的Agent科研能力提升尤为显著:相比上一代Fable 5提升27.9个百分点,比GPT 5.6 sol版本高出30个百分点。
值得关注的是,新版本的使用成本也有所下调。基础的输入输出价格仍维持在每百万token 10美元/50美元,但Fable 5.1的缓存读取成本相比Fable 5降低了75%,降至每百万token 0.25美元。根据官方预估,普通任务的整体成本下降25%,高智能体复杂度的任务成本降幅可达45%。
不过我们仍对订阅计划的文字游戏感到遗憾:所谓的20倍额度实际仅在5小时限制窗口内生效,实际仅相当于专业版的6到8倍;5倍额度也仅为专业版的3.5倍,更像是借新版本发布转移注意力的营销手段。
既然新版本已经推出,我们不妨实际测试其性能提升是否值得期待。
作者此前搭建的AI提示语案例网站goodcase.ai上线至今访问量已突破1万人次,期间我们发现了不少可以优化的细节:比如首页左右比例不协调, slogan区域会压缩素材展示位;自动提取的AI视频标题经常出现与内容不符的情况;当原素材为视频或竖版图片时,截图流程也会出现画面移位的问题。
而Fable 5.1在浏览器自动化和桌面自动化方面的表现已经追平了Codex GPT 5.6的水准。此前即便开启全部权限,让模型在Supabase中执行SQL语句、修改GoodCase的存储权重逻辑时,经常反复失败,最终仍需要手动通过终端操作——这类问题不仅出现在Fable系列,在Opus 5上也同样存在。
但Fable 5.1这次可以完整扫描整个网站的所有页面,输出每个页面的详细参数和差异说明,完成PC端和移动端的对比测试,同时保留完整的截图记录。我们仅用一句简单的提示“找一个goodcase项目的UI优化点”,就得到了清晰的优化方案。
经过Fable 5.1优化后,首帧截图不会再出现主体被截断一半的问题:它会根据素材和展示框的偏移度进行智能处理,偏移度较小的素材会适当裁剪以铺满展示框,获得最佳视觉效果;如果偏移度超过0.2,则会完整保留素材并添加左右留白;如果原案例包含多张正方形图片,还会自动拼接为九宫格形式完整展示所有效果。
最终的展示页面既保留了素材的核心主体,又能适配不同尺寸的内容,让多种类型的案例都能在页面中合理呈现。
此前为了精准调整UI,我们尝试了Claude的Design模式,虽然可以实时移动画布,但迭代周期会变长,不如直接让模型自主调整更高效。而Fable 5.1在批量UI修改场景下的前端美学表现有了明显提升,比如在优化首页时,可以平衡slogan的展示大小和右侧案例区域的尺寸,让用户既能快速了解网站功能,又能清晰查看优质案例。
我们此前将AI热点网站ai news radar、热点地图ai map以及AI agent教程learnprompt整合到了同一个站点中,Fable 5.1还帮助我们更新了热度衰减算法,可以每日自动统计各案例的热度数据。
除了UI优化之外,我们还解决了AI编程大类的提示语稳定提取问题,但此前收集的大量提示词案例缺乏分类体系,无法用于新模型的性能测试——部分已经完善的案例包含在线视频链接和3D效果文件,虽然展示效果出色,但无法准确测试模型的性能上限。
而Fable 5.1针对我们的采集路线进行了优化,新增了三个提示词分类,同时更新了Agent Skill体系,现在可以按照类目随机抽取案例来测试新模型的性能。
新版的GoodCase也已经上线,后续将升级案例自动收录和人工混合打分机制,平台也将从当前的三个平台拓展至13个全平台覆盖。
另一个明显的优化点是Fable 5.1对历史对话文件的搜索能力变得更加主动和稳定。此前模型仅会被动响应我们的历史对话查询,需要主动提示对应的对话内容;而现在当我们开启新对话总结最新的采集路线时,模型可以自动找到数天前讨论过的相关文件进行复用。
在高频迭代GoodCase的过程中,我们还遇到了硬件性能的瓶颈:在低配Mac mini上同时运行Claude Code、Codex和Grok时,内存经常不足。我们设置了定时监控任务,当内存占用超过90%时就会收到提醒,但根据Codex的优化经验,这类问题只能通过删除可再生缓存临时解决,基本每三四天就需要清理一次。
基于LLM Wiki的框架思路,我们让Fable 5.1梳理了历史上经典的文件整理方法论,并基于这些理论开发了全新的文件整理技能carl-file-organizer:
1876年,图书馆员杜威提出的十进分类法,为每个物品分配固定编号和位置,这也是现代电脑文件夹层级结构的雏形;20世纪印度学者阮冈纳赞提出的分面分类法,通过人物、材料、时间、空间等多维度组合描述对象,比传统文件夹树更灵活;比他们更早两百年的约翰·洛克提出的Commonplace Book索引法,主张无需提前规划分类,只需确保后续可以通过关键词定位内容,通过关键词首字母加元音的方式快速查找,轻量且实用;哲学家瓦尔堡则提出了不同的思路,他认为整理的终极目的不是为了查找,而是为了创造意外的思想连接,通过「好邻居法则」将可能产生思想碰撞的内容放在一起,并持续调整排列;最后是卢曼的卡片盒笔记法Zettelkasten,通过独立编号和链接构建思想网络,卡片的价值取决于其与其他内容的关联数量,也是现代「第二大脑」工具的前身。
carl-file-organizer正是基于这五大理论开发的:它会首先识别并移除重复文件,根据文件混乱度生成全新的文件结构,最终以知识图谱的形式展示整理后的布局。这个技能本质上是一组提示词,可以在Windows、Mac、Linux等所有系统的本地智能体中直接安装使用,相关代码仓库可访问github.com/LearnPrompt/carl-skills。
最后我们用经典的3D版愤怒的小鸟来测试模型的实际创作能力,这也是我们最喜爱的测试项目之一,后续我们还计划开发植物大战僵尸的相关测试。我们仅用一句提示“做一个3D版的愤怒的小鸟,要有关卡和物理反馈”,同时向GPT 5.6 sol和Fable 5.1开启计划模式并执行任务。
GPT 5.6 sol完成了3个关卡,添加了弹跳和碰撞音效,还原了原作中猪会自动倒地或被建筑压住的设定,在3D场景中猪会前后滚动或被压垮。而Fable 5.1的完成度更高:它在单个HTML文件中实现了4种经典鸟类(黄、红、蓝、黑鸟),制作了8个关卡,甚至在开发过程中主动询问我们是否需要将游戏适配移动端。
GPT 5.6 sol制作的木质材质中,鸟类一碰就会破碎且没有耐久度设定;而Fable 5.1为每种鸟类都设置了独立的密度和耐久参数,游戏难度大幅提升,我们制作了8个关卡,但自己通关仅成功1次。我们已经将这个项目上传至GitHub,大家可以尝试挑战通关:github.com/LearnPrompt/fowl-fortress。
Fable 5.1还出色还原了游戏的镜头跟随效果,完美呈现了原作的紧张感:鸟类落地后会有滚动动画,3D世界没有边界限制,鸟类可以向任意方向滚动;击中猪后,建筑坍塌的波及效果和猪的自主滚动碰撞都得到了精准还原,我们甚至还截取了黑鸟炸开清场的画面,最后因为操作失误直接让模型自动通关了。
最后我们测试了两款模型的写作能力,让Fable 5.1和Opus 4.6分别撰写一段GoodCase的介绍词,对比下来Fable 5.1的表现确实还有优化空间。
又是一个通宵的测试,Codex和Grok还在不断重置额度,在这个快速迭代的AI时代,或许在通用人工智能到来之前,我们需要学会左右脑交替睡眠来保持24小时的工作状态。

