长期以来,NVIDIA凭借CUDA软件生态在GPU计算领域建立了深厚优势,成为人工智能、高性能计算等领域的重要基础平台。然而,随着AI智能体(Agent)能力快速提升,这一持续二十年的技术壁垒正迎来新的变量。近日,Anthropic分享的一项实践案例显示,Claude成功完成AMD最新Instinct MI355X GPU平台的部署与优化,引发业界对GPU软件生态未来发展的广泛关注。
Claude完成AMD新GPU部署,AI首次展现自动优化能力
据Anthropic介绍,AMD此前向公司提供了一套搭载Instinct MI355X处理器的服务器机架。面对全新的硬件平台和软件栈,团队原本预计需要投入大量工程资源进行环境适配和性能调优。
不过,工程团队尝试采用另一种方式,仅安排一名工程师将Claude接入系统,并向其下达简单任务——让整个平台正常运行。
经过一个周末,当工程师返回查看系统时,发现GPU不仅已经成功运行,而且性能曲线持续提升,系统不断完成新一轮优化。
Anthropic联合创始人兼首席计算官Tom Brown在分享这一案例时表示,整个过程中,人类工程师几乎没有修改任何代码,而Claude持续完成环境配置、调试以及性能优化等工作。
AMD董事长兼首席执行官苏姿丰(Lisa Su)也透露,当她得知Anthropic仅安排一名工程师负责MI355X部署时,第一反应是要求AMD团队立即提供支持。但随后得到反馈称,Claude已经完成了绝大多数工作,无需额外介入。
Anthropic计划部署2GW Instinct GPU,加速AI基础设施建设
这一实验很快进入实际部署阶段。
Anthropic宣布,未来将在AMD Helios系统中部署最高可达2GW规模的Instinct GPU集群,其中首批约1GW算力计划于2027年上半年投入使用。
与此同时,双方还将利用Claude持续优化AMD GPU工作负载,并进一步推动ROCm软件生态开发,提高AI模型在AMD平台上的运行效率。
对于快速增长的生成式AI产业而言,这类自动化部署能力有望进一步缩短大型AI基础设施建设周期。
ROCm.AI面向AI智能体开放GPU开发能力
能够快速完成平台适配的重要原因,在于AMD正在打造更加适合AI智能体使用的软件工具链。
AMD在Advancing AI 2026大会期间发布ROCm.AI,这是面向Claude、Codex、Cursor等AI智能体打造的一整套GPU开发工具包。
其中,AMD Skills作为核心入口,整合了经过验证的ROCm知识体系。
当智能体掌握这些知识后,可以自主完成:
自动完成GPU环境部署
AI能够自行安装开发环境、配置运行平台,并完成模型部署。
自动分析日志并排查故障
智能体可持续读取系统日志,定位运行异常,完成错误修复。
自动调用GPU资源完成优化
借助ROCm命令行工具,AI能够直接控制GPU设备,对性能瓶颈进行分析并不断调整配置,而开发人员只需提出目标即可。
这种开发模式意味着,大量重复性的GPU调优工作开始逐步由AI承担。
AI可直接读取GPU指令集,加速性能优化
AMD AI软件与解决方案副总裁Anush Elangovan介绍,未来每一代AMD GPU都会公开对应指令集(ISA),同时提供适用于AI理解的机器可读版本。
一旦AI智能体掌握这些底层信息,便可直接开始针对GPU性能进行自动优化。
相关优化能力由Hyperloom提供支持。
整个流程包括:
自动建立性能基准
首先运行推理服务,获得基础性能数据。
自动寻找CPU与GPU瓶颈
随后分析计算过程中的性能限制。
自动生成定制Kernel
AI测试不同配置方案,并自动生成更适合当前模型的新Kernel。
持续验证优化效果
完成优化后再次运行测试,不断提升执行效率。
现场演示中,Hyperloom成功将MiniMax M3模型推理速度提升约38%。
此外,AMD还利用该系统一次性测试约14000个模型,并将大量优化经验沉淀下来,为后续项目直接复用。
GPU竞争正在从硬件走向AI生态
AMD同时正与多家前沿AI模型团队合作,希望让这些大模型“天然具备AMD编程能力”。
业内人士认为,未来评价GPU产品时,除了峰值算力、显存带宽等传统指标之外,一个新的竞争维度正在形成——AI是否能够快速理解芯片架构、调用硬件能力并充分释放性能。
这意味着,芯片厂商未来吸引的不仅是开发者,也包括越来越多能够自主完成开发任务的AI智能体。
CUDA二十年生态优势迎来新的变量
自2006年推出以来,CUDA经过大量开发者持续建设,形成了覆盖编译器、数学库、调试工具、性能分析以及开发文档的完整软件生态。
更重要的是,大量GPU优化经验长期掌握在资深工程师手中,包括算子优化、通信加速、显存管理以及分布式部署等复杂技术积累。
过去,即使后来者推出性能相近的GPU产品,也需要多年时间重新建设软件生态,因此CUDA始终保持领先优势。
而AI智能体正在改变这一过程。
借助平台文档、性能分析工具以及自动测试能力,智能体能够持续寻找性能瓶颈、修改代码、重新编译并不断验证结果。如果新的方案性能更高,便继续沿着这一方向自动优化。
相比培养一名顶级GPU工程师需要多年时间,部署更多AI智能体仅意味着启动更多并行任务。
多个智能体可以同时排查故障、定位瓶颈,并将成功经验迅速共享,形成持续迭代能力,大幅缩短软件生态积累周期。
AI智能体或推动GPU生态进入新阶段
此次Claude完成AMD MI355X平台部署,被不少业内人士视为AI智能体参与GPU软件开发的重要案例。
随着AI逐渐具备理解芯片架构、调用底层接口以及持续优化性能的能力,传统依赖长期人工经验积累的软件生态模式可能发生变化。未来,GPU厂商之间的竞争不仅体现在硬件性能,更体现在AI是否能够快速适配、优化并释放平台潜力。对于整个AI计算产业而言,这也可能成为下一阶段GPU生态竞争的重要方向。

Jun Chen 是 descargitas.com 的撰稿作者,主要关注新闻、政治、商业、科技、体育、娱乐及生活方式等领域的最新动态。他注重信息的准确性与清晰表达,致力于为读者提供及时、实用且易于理解的内容。通过持续关注时事热点和社会发展,他分享与读者密切相关的新闻报道和故事,帮助读者更全面地了解当下的重要议题与趋势。