文章摘要
文章指出AI正颠覆GPU生态,AMD ROCm.AI实现对CUDA的降维打击。Anthropic团队借助Claude在AMD MI355X机架上快速完成部署,后续将开展大规模部署并合作优化。ROCm.AI是全套GPU开发工具箱,其AI Agent可自主完成多项工作。AI Agent能填补生态缺口,将生态追赶从按年计算变为按任务推进,有望弥补与CUDA 20年的生态差距。

只用一个周末,Anthropic的团队就让自家最前沿的AI模型Claude,在一台全新的AMD MI355X机架上稳定运行,且性能还在持续优化。全程没有人类工程师修改过一行代码,就跨过了英伟达花费20年搭建的CUDA生态护城河。

前段时间,AMD向Anthropic交付了搭载MI355X的算力机架。团队原本做好了长期适配新平台与软件栈的准备,没想到这次只需要借助Claude就能快速完成部署。

工程师只需要向Claude下达了一句简单指令:让这台机器跑起来。等到周末结束回到工位,屏幕上已经出现了持续上涨的性能曲线,不仅成功启动了模型,还在一轮轮优化中不断提升表现。

Anthropic联合创始人兼首席计算官Tom Brown分享这个案例后,AMD的苏姿丰第一反应是让团队前去协助,结果却得知对方已经全部完成了适配工作。

这场周末实验很快升级为正式的部署计划。近期Anthropic宣布,将在AMD Helios系统中部署最高2GW的Instinct GPU,首批1GW的部署计划将于2027年上半年启动。同时双方还将合作使用Claude优化AMD工作负载,加速ROCm软件开发流程。

芯片开发迎来非人类开发者

Claude能够实现对CUDA生态的突破,离不开AMD专为AI开发的GPU调优工具。在AMD相关AI大会上发布的ROCm.AI,就是面向多类AI模型打造的全套GPU开发工具箱。

这套工具的入口是AMD Skills,其中整合了经过验证的ROCm专业知识。AI Agent可以直接调用这些知识,自主完成环境搭建、模型部署、日志读取、故障排查等工作,再通过ROCm CLI对接真实硬件。开发者只需要提出目标,剩下的适配流程都可以由Agent自主完成。

为了让AI能够更好地适配硬件,AMD甚至重新设计了芯片文档的编写方式。相关负责人透露,每一代AMD GPU都会公开指令集,并提供AI可读的格式文档。

AI Agent读懂这些文档后,就可以直接对GPU性能进行调优。AMD将这项工作交给了Hyperloom工具:它可以启动推理服务,先跑出性能基线,再定位CPU与GPU的性能瓶颈,测试不同配置组合,生成定制化内核,最后将优化后的方案重新运行验证。

在现场演示中,Hyperloom将MiniMax M3的输出速度提升了38%。AMD还让它一次性运行1.4万个模型,将测试结果沉淀为可复用的经验,供后续Agent直接调用。

目前AMD正在与多家前沿AI模型公司合作,训练专属的硬件适配能力,相关负责人将其描述为“让前沿模型天生精通AMD编程”。未来评估一款芯片的标准,将不再仅仅是峰值算力与显存带宽,AI能否读懂、调用并优化其性能,也将成为核心参数之一。芯片厂商需要争夺的开发者群体中,又多了一类新成员:AI Agent。

ASI带来的生态降维打击

CUDA生态从2006年发展至今,依靠的是无数工程师数十年的代码积累,从编译器、数学库、调试器到性能分析工具、开发文档,整套生态体系已经非常完善。更难以复制的,是一代代工程师沉淀下来的实操经验:如何调优算子、如何优化通信链路、如何分配显存、分布式部署的常见问题与解决方案,这些经验大多掌握在少数专家手中。

即便其他厂商能够推出性能相近的芯片,想要追赶CUDA的生态壁垒,也需要按年为单位重新搭建整套软件体系。芯片流片可以按季度推进,但生态积累却需要漫长的时间。

而AI Agent恰好填补了这一缺口。它可以自主读取平台文档、调用性能分析工具,定位性能瓶颈,自动完成代码修改、编译与测试。一个方案效果不佳就切换方向,跑分提升就沿着该路径继续优化。

培养一名顶级GPU工程师需要数年时间,而启动一个AI Agent只需要开启一个新任务。一名工程师可以同时调度多个Agent并行排查错误、定位瓶颈,一次跑通的配置、编写的内核以及踩过的坑,都可以快速成为后续Agent的优化起点。

将按年计算的生态追赶压缩为按任务推进的并行优化,这正是AI能力对CUDA生态的降维打击。如今,国内工程师已经站在这场AI改造GPU软件栈的最前线,他们沉淀的底层经验正在被整理为更多Agent可调用的知识。

追赶CUDA的全新起点已经出现:将硬件接口与软件工具交给AI,让Agent直接开工。20年的生态差距,第一次可以交给一群Agent昼夜不停地弥补。

以上内容不代表本平台立场,仅供读者参考