AI编程新趋势:垂直专业化才是破局关键

Claude Code的创造者Boris Cherny在一场访谈中分享了多个颠覆传统软件工程认知的案例:一个Prompt仅用11天就将十万行级别的Zig代码库完整重写为Rust,而团队甚至删掉了80%的系统提示词,模型的表现反而更出色。这场在Y Combinator Startup School 2026上的对话,揭开了AI辅助开发领域的全新玩法。
Opus 5的突破性能力刚发布的Opus 5在ARC-AGI-3抽象推理测试中直接冲到30%的分数,而此前行业最好成绩仅为十几percent。这款模型最引人注目的两个能力:一是搭配Auto Mode可以连续运行数天、数周甚至数月,完全不需要额外搭建脚手架,模型会自主判断任务进度并持续推进;二是对提示注入攻击的防御能力大幅提升,通过三层防护体系——经过三年对齐训练的基础模型、基于机制可解释性的提示注入分类器、自动模式分类器,内部团队已经无法演示出一次成功的注入攻击。
反常识的减法:砍掉80%的系统提示词很多人不知道,Claude Code背后的运行框架一直在做减法:每次推出新模型,团队都会删掉大量系统提示词和冗余工具。这是因为不同模型的适配性差异极大,三个月前为修正某个模型问题写的指令,放到下一代模型上可能完全无效。在Opus 5发布时,团队直接删掉了80%的系统提示词。他们还在内测了一个叫Simple Mode的功能,清空所有提示词和工具自带指令后,模型的基础表现反而更好——不过作为面向普通用户的产品,保留部分提示词可以优化使用体验和行为预期。
重建提示词:用实证代替预设删掉提示词之后,如何重新构建?团队的方法完全颠覆了传统软件工程逻辑:不要提前猜测模型需要什么指令,而是真正跑起产品,观察模型在哪里卡壳、哪里表现出色。只有当模型反复卡在同一个问题时,才把对应的提示词加回去——过早添加反而会增加模型的推理负担。这种开发方式更像养育一个会成长的个体,而非组装一台固定参数的机器,需要持续观察、实证调整。团队甚至建议普通用户每隔六个月,删掉CLAUDE.md、技能包和触发脚本,看看模型会带来怎样的惊喜。
连评测集都会过时在频繁的迭代中,唯一相对稳定的是评测集,但也只能撑1到3代模型。随着模型进步速度进入指数级增长,旧的评测集很快就会被跑满,需要不断用实际使用中发现的漏洞来构建新的测试标准。真正不会过时的不是任何一份具体的提示词或评测集,而是持续观察、持续重建的实证思维。
Unhobbling:拿掉限制,释放模型潜力访谈中提到的“Unhobbling”概念,指的是拿掉套在模型身上的“脚镣”,释放其本来具备的能力。这对应着“产品过剩潜力”现象:当前的模型已经能完成很多任务,不需要等待未来更强的版本,只是大部分产品设计挡住了能力的发挥。Claude Code本身就是最好的例子:两年前的初代产品基于Sonnet 3.5开发,当时市场上的编程工具大多只能做单行补全或简单对话,而Claude Code直接拿掉了所有冗余脚手架,让模型一次性完成完整文件的编写,这正是挖掘了当时被隐藏的模型能力。如今的模型依然有大量类似的潜力等待挖掘。
给模型出题:设定边界而非规定步骤想要用好模型,不要把指令写得过于具体,比如强制要求按固定步骤执行。反而应该拉高任务层级,清晰描述任务边界和验收标准,让模型自主探索最优路径。这和带团队的逻辑类似:过度规定会限制下属的创造力,真正的管理能力从写详细指令变成定义任务边界和完成标准。
十万行代码重写的实战案例Bun团队用Claude完成了一次极具代表性的重写任务:Bun本身是用Zig语言开发的JavaScript运行时,团队最初让Claude做模糊测试来排查内存泄漏,后来有人尝试让模型直接重写整个代码库。经过几代模型迭代,到Opus 5时代,仅用一个Prompt搭配Dynamic Workflows,就用11天完成了整个十万行代码库的重写,且代码已经投入生产环境。这个任务能成功的核心前提,是Bun本身拥有完善的测试覆盖,可以快速验证重写结果的正确性。
意外的隐藏能力:用OpenCV画画Anthropic内部还发现了一个有趣的现象:给Opus5搭配OpenCV计算机视觉库,不需要专门训练绘画能力,模型就能画出肖像、动物和风景,这就是所谓的“激发缺口”——模型本身具备能力,只是从未被正确的方式唤醒。团队猜测当前的模型还隐藏着上百个类似的未被发现的能力,而挖掘这些能力的核心,不再是写提示词的技巧,而是设计合适的任务,以及建立有效的结果验证机制。
连续运行两周的自主任务Boris Cherny自己做过一个实验:让Claude将Electron开发的桌面应用用Swift重写,仅给出任务要求和逐像素比对的验证规则,没有任何额外的步骤指令。这个任务连续跑了两周多,更让人意外的是,模型还自主在内部Slack频道创建了进度汇报频道,每隔几分钟就发送截图同步进展。这说明当给予足够长的任务和自由度时,模型会展现出类似专业工程师的自主职业习惯。
拒绝一招鲜:实证思维才是核心想要用好Claude,首先要抛弃网上流传的“一招鲜”技巧。真正的用法是用实证思维接近模型:给一个稍具难度的任务,搭配和你自己做这件事时同款的验证工具,观察卡壳点并针对性调整。很多资深工程师容易陷入过度规定的陷阱,需要学会把模型当成真正的同事来对待,而非只会执行指令的工具。
批量调度Agent:新的计算模式想要一次性调度成百上千个Agent,最简单的方式是使用Dynamic Workflows,只需一句指令就能自动触发。其背后的原理是用Bun作为沙箱,启动虚拟机调度多个Agent,根据任务拆分层级执行,既可以顺序执行也可以并行处理,最大化利用Token完成复杂任务。这是一种全新的推理阶段计算模式,打破了过去靠训练规模提升模型能力的思路。除了Dynamic Workflows,Loops和Routines可以实现定时重复任务,比如内部已经用20-30个Routine自动维护代码库:清理死代码、合并重复抽象、补全测试、下线过期实验功能等,把工程师从重复工作中解放出来。
编程真的被解决了吗?当被问到编程是否已经被解决时,Boris Cherny补充了边界:他所说的“被解决”仅针对他接触的领域,复杂系统代码、分布式系统、细节界面校验等场景,Claude依然会遇到瓶颈,Opus5在视觉和操作能力上有巨大进步,但仍不完美。现场调查显示,已经有不少开发者完全依靠Agent写代码,更多人超过一半的工作依赖Agent,这说明编程正在朝着被解决的方向快速前进。真正用得好模型的人,核心能力是放下过去的经验和固有认知,用实证思维观察模型表现,持续调整方法,这种“放下经验”的能力反而成了稀缺的竞争优势。
CS学生的学习重心对于正在学习计算机专业的学生,Boris Cherny分享了自己的经历:他最早在中学用TI-83计算器学BASIC编程,初衷是为了在数学考试中作弊,后来为了解决微积分的问题又学习了汇编语言。他建议学生不要只停留在计算机科学理论本身,更要学习如何应用技术:创业、产品设计、商业直觉、用户沟通、数据分析,这些能力和技术结合才是真正的价值。真正的护城河从来不是会不会写汇编语言,而是你有没有真正想解决的问题,以及判断模型输出结果是否正确的能力。
最后的思考:从控制到检验的工程逻辑整场访谈的所有核心做法——删掉系统提示词、抛弃过时评测、拿掉模型的限制、用实证代替预设——都指向同一个方向:从“提前控制一切”转向“事后验证结果”。传统工程的本能是提前规划所有细节来降低风险,而AI时代的工程逻辑变成了:先放手让模型尝试,再用验证机制来确保结果正确。当做出产品的成本越来越低,真正的瓶颈会转移到判断任务是否值得做、结果是否正确上。学会放手和建立验证机制,或许就是未来最值得打磨的能力。


