AMD收购AI推理芯片初创公司Taalas:将模型蚀刻硅片,推理速度提升48倍

2026年8月6日,AMD正式宣布达成最终协议,收购总部位于加拿大多伦多的AI推理芯片初创公司Taalas。AMD收购AI推理芯片初创公司Taalas这一战略举措,将Taalas独特的“模型固化硅片”技术纳入AMD的AI产品路线图。Taalas的芯片不依赖高带宽内存(HBM)存储模型权重,而是将权重直接蚀刻进硅片之中。其首款测试芯片HC1在运行Meta Llama 3.1 8B模型时,实现了每秒16,960个token的输出速度,约为英伟达GPU的48倍。AMD计划将Taalas技术与AMD Instinct GPU、EPYC CPU及Helios机架级解决方案整合,构建差异化的AI推理计算体系。

AMD收购AI推理芯片初创公司Taalas的战略背景
AI推理市场的高速增长
生成式AI热潮进入第四个年头,行业重心正逐渐从模型训练转向模型推理。推理——即AI模型在实际业务中响应用户请求、生成答案或输出的计算过程——正在成为AI市场中增长最快的领域之一。随着AI应用从技术演示走向大规模商业部署,推理工作负载日益专业化,对硬件提出了新的要求。
通用GPU的局限性日益显现
AMD长期以来依靠GPU推动数据中心业务增长,云服务商持续抢购先进AI芯片。然而,行业越来越清楚地认识到,GPU并不能完成所有事情。通用GPU虽然具备高度灵活性,能够支持不断演进的各类AI模型,但在特定模型的推理任务上,通用架构带来了显著的计算和内存瓶颈。这些瓶颈导致能效比不理想、延迟偏高、成本偏高等问题。
AMD的AI全栈战略布局
AMD首席执行官苏姿丰此前明确表示:“我十分坚信,芯片领域不存在一套方案适配所有场景”。她指出,GPU凭借高度通用性仍将占据AI芯片市场的主流份额,但不同应用场景也需要更加专业化的加速器共同构建完整的AI计算生态。AMD收购AI推理芯片初创公司Taalas正是这一战略思路的延续——在通用GPU之外,为特定推理场景部署专用加速器,形成多元化的AI计算产品矩阵。
在此之前,AMD已在AI领域展开密集收购:2024年以6.65亿美元收购AI模型开发商Silo AI,随后以49亿美元收购服务器厂商ZT Systems为Helios机柜产品线奠定基础。此外还收购了推理软件开发商MK1等多家AI初创企业。AMD收购AI推理芯片初创公司Taalas进一步完善了这一全栈AI生态布局。
AMD收购AI推理芯片初创公司Taalas的技术核心:模型专用集成电路
“模型固化硅片”的颠覆性思路
Taalas的技术路线与主流GPU、Groq LPU及Cerebras晶圆级加速器等数据流架构存在本质区别。传统GPU依赖HBM存储模型权重,每次推理都需要从内存中读取权重数据,这构成了主要的性能瓶颈。Taalas则另辟蹊径——将模型权重直接蚀刻进硅片之中,形成模型专用集成电路(MSIC)。
从结构上看,Taalas芯片主要由两个功能区域构成:用于存储模型权重的掩膜ROM召回结构,以及用于存放KV缓存和微调适配器的SRAM召回结构。这种设计使得芯片不再需要在运行时频繁访问外部内存读取权重,从而彻底摆脱了HBM的束缚。
牺牲通用性换取极致效率
这种技术路线的核心取舍在于:Taalas的加速器针对单一AI模型进行定制或硬连线,而非通用型设计。芯片在制造阶段就已将特定模型的参数固化其中,因此无法像GPU那样灵活适配不同的AI模型。但正是这种“牺牲通用性”的代价,换来了更低的芯片成本和更高的推理输出速度。
Taalas首席执行官Ljubisa Bajic在公司官网表示,Taalas已开发出“把任何AI模型转化为定制硅片的平台”。从接收到一个全新的AI模型到完成硬件实现,仅需约两个月时间。
HC1测试芯片的性能数据
2026年2月,Taalas正式发布了首款测试芯片HC1。该芯片采用台积电6纳米工艺制造,拥有815平方毫米的芯片面积和530亿个晶体管。HC1将Meta Llama 3.1 8B大语言模型的参数直接固化于硬件,在单用户场景下的初步基准测试中实现了每秒16,960个token的输出速度。
这一数据在当时约相当于英伟达GPU的48倍、Cerebras加速器的8.5倍。虽然Llama 3.1以当前标准已非最新模型,但HC1的主要目的在于验证技术概念的可行性。
第二代HC2芯片的规划
Taalas计划于2026年夏季推出第二代HC2芯片,目标是将单芯片支持的参数量提升至200亿。虽然200亿参数本身并不算庞大,但通过类似GPU的流水线并行方式,模型权重可分布在多颗加速器上协同运行。以单芯片200亿参数计算,仅需50颗加速器即可支撑万亿参数级别的大模型。
作为对比,英伟达近期发布的LPX系统在运行同等规模模型时,需要数十颗GPU与至少2,000颗Groq LPU配合。Taalas方案在空间占用与功耗效率方面具备显著优势。
AMD收购AI推理芯片初创公司Taalas后的整合路径
与Helios机架系统的协同部署
AMD收购AI推理芯片初创公司Taalas后,计划将Taalas技术与Instinct系列GPU搭配Helios机架使用,构建分离式架构。在这种架构中,计算密集型的提示词(prompt)处理由GPU负责,而token生成任务则卸载至Taalas加速器。这种分工充分发挥了两种架构各自的优势——GPU擅长处理需要大量并行计算的提示词编码,而Taalas专用芯片在自回归生成阶段具备极高的吞吐效率。
另一种部署模式是“tick-tock”迭代节奏:客户先在Instinct加速器上部署和验证模型,待效果确认后再迁移至Taalas加速器。这种分阶段部署方式既保留了GPU的灵活性用于模型探索和验证,又能在模型定型后通过Taalas专用芯片获得极致的推理效率。
融入AMD全栈AI平台
AMD计划将Taalas的技术整合进自身的加速器路线图,并与AMD Instinct GPU共同开发系统级解决方案。Taalas的技术将补充AMD的全栈AI平台,包括AMD Helios机架级解决方案、AMD Instinct GPU、AMD EPYC CPU、AMD ROCm软件以及不断扩大的AI生态系统。
AMD人工智能集团高级副总裁Vamsi Boppana表示:“AMD正在构建一个全栈AI平台,让客户能够为每一种AI工作负载部署合适的计算解决方案。Taalas的技术和世界一流的工程团队通过提供差异化的推理性能和效率,强化了我们的AI产品组合”。
加拿大人才与研发的保留与扩展
AMD收购AI推理芯片初创公司Taalas也体现了AMD对加拿大半导体和AI生态的持续承诺。AMD自2006年收购ATI Technologies以来,在加拿大已有长期布局。AMD表示将继续保留并发展加拿大的技术人才。值得一提的是,Taalas首席执行官Ljubisa Bajic在创立Taalas之前曾在AMD度过了大部分职业生涯,此次收购某种意义上也是一次“回归”。
AMD收购AI推理芯片初创公司Taalas后的应用场景
高吞吐量的AI聊天与对话系统
AI聊天机器人和对话式AI系统对推理延迟和吞吐量有极高要求。Taalas专用芯片每秒近17,000个token的输出速度,意味着用户几乎感受不到等待时间。对于部署大规模AI客服、AI助手等应用的企业而言,AMD收购AI推理芯片初创公司Taalas后所提供的专用推理方案,能够在保持极低延迟的同时支持海量并发请求。
实时搜索与智能问答
实时搜索和智能问答场景要求AI模型在用户输入后迅速给出首条响应,首token延迟至关重要。Taalas将模型固化在硅片中的设计消除了权重读取延迟,使首token响应时间大幅缩短。这类专用推理芯片尤其适用于对延迟敏感的实时应用场景。
代码助手与AI代理
AI代码助手和AI代理(Agent)类应用需要频繁调用模型进行代码补全、错误修复和任务规划。AMD收购AI推理芯片初创公司Taalas后,能够为这些高频率、低延迟的推理任务提供专用加速方案。与通用GPU相比,Taalas方案在相同功耗下可支撑更多的并发推理会话。
自动驾驶与边缘智能
自动驾驶和边缘智能设备对推理的实时性和功耗效率有着苛刻要求。Taalas芯片的低延迟特性和摆脱HBM束缚的设计,使其在功耗敏感的边缘场景中具备独特优势。虽然目前Taalas的产品主要针对数据中心场景,但其技术路线在边缘推理领域同样具有潜力。
AMD收购AI推理芯片初创公司Taalas与竞品方案横向对比
| 对比维度 | AMD+Taalas(模型固化) | 英伟达GPU(通用计算) | Groq LPU(数据流架构) | Cerebras(晶圆级) |
|---|---|---|---|---|
| 推理速度(Llama 3.1 8B) | 16,960 token/s | 约353 token/s(估算) | 数据流架构 | 约2,000 token/s |
| 速度相对优势 | 基准(1x) | 约1/48 | 数据待验证 | 约1/8.5 |
| 模型权重存储方式 | 蚀刻于硅片(掩膜ROM) | HBM内存 | 数据流SRAM | 晶圆级SRAM |
| 芯片通用性 | 单一模型专用 | 高度通用 | 数据流通用 | 晶圆级通用 |
| 模型更换周期 | 约2个月硬件重构 | 软件更新即可 | 软件更新即可 | 软件更新即可 |
| HBM依赖 | 不依赖 | 高度依赖 | 不依赖 | 不依赖 |
| 单芯片参数量 | HC2目标200亿 | 不限(GPU显存决定) | 数据流架构 | 晶圆级集成 |
| 万亿参数模型所需加速器数量 | 约50颗(200亿/颗) | 数十颗GPU+数千颗LPU | 约2,000颗 | 数颗晶圆级芯片 |
| 适用场景 | 定型模型的规模化推理 | 训练+推理全场景 | 低延迟推理 | 大模型训练+推理 |
| 技术成熟度 | HC1验证完成,HC2开发中 | 高度成熟 | 商业化部署中 | 商业化部署中 |
从横向对比可以清晰看出,AMD收购AI推理芯片初创公司Taalas所带来的“模型固化”技术路线在推理速度、空间效率和功耗效率方面具有显著优势。其代价是通用性的丧失——芯片绑定特定模型后无法适配其他模型。但AMD的整合策略巧妙地弥补了这一局限:通过将Taalas专用芯片与Instinct通用GPU配对使用,客户可以先用GPU进行模型探索和验证,再将定型后的模型“固化”到Taalas芯片上实现规模化推理部署。
AMD收购AI推理芯片初创公司Taalas对行业格局的影响
AI推理市场的竞争升温
AMD收购AI推理芯片初创公司Taalas发生在英伟达斥资200亿美元收购高性能AI芯片设计商Groq相关资产的七个多月之后。两大GPU巨头几乎同时将专用推理芯片公司纳入麾下,反映出AI推理芯片正成为行业竞争的新焦点。
英伟达通过Groq的交易获得了数据流架构技术,而AMD通过收购Taalas获得了模型固化技术。两条技术路线代表了两种不同的“专用化”思路:Groq的数据流架构通过优化数据流动来提升推理效率,而Taalas则通过将模型“刻入”硅片来彻底消除内存瓶颈。
从单芯片竞争到系统级竞争
此次收购也反映出AI数据中心竞争已从单颗芯片扩展至整机柜系统竞争。AMD近期已向Meta、微软等客户交付其首款机柜级AI系统Helios,与英伟达DGX系统展开直接竞争。AMD收购AI推理芯片初创公司Taalas后,将把Taalas的推理芯片及相关技术整合进公司产品路线图,与EPYC CPU、Instinct GPU及整机系统协同发展。
对AI应用开发者的影响
对于AI应用开发者和企业用户而言,AMD收购AI推理芯片初创公司Taalas意味着未来在推理硬件上将有更多选择。Taalas的“两个月硬件化”能力意味着企业可以在模型定型后快速获得专用的推理加速器。这对于那些已经确定了核心模型、需要大规模部署推理服务的企业尤其具有吸引力。
与此同时,AMD计划将Taalas技术整合进ROCm软件生态,使开发者能够在统一的软件栈中同时使用GPU和Taalas加速器。这种“软件统一、硬件多元”的策略降低了开发者的迁移成本。
AMD收购AI推理芯片初创公司Taalas的局限与挑战
模型迭代的硬件锁定
Taalas技术最大的局限在于模型固化后无法灵活更换。AI模型迭代速度极快,新模型层出不穷。一旦将某个版本的模型固化到硅片中,后续模型的升级就需要重新制造芯片。虽然Taalas声称可在两个月内完成新模型的硬件化,但这一周期仍远长于GPU的软件更新。
AMD对此的解决方案是“先GPU验证、后Taalas固化”的分阶段部署策略。但对于模型频繁迭代的场景,这种模式的成本效益仍需验证。
芯片制程与规模的挑战
目前Taalas的HC1芯片采用台积电6纳米工艺制造。虽然6纳米属于成熟制程,有助于控制成本,但随着模型规模不断扩大,单芯片需要集成的参数越来越多。HC2目标支持200亿参数,但要支撑万亿参数级别的大模型,仍需通过多芯片并行来实现。
多芯片并行带来了新的挑战:芯片间的通信延迟、负载均衡和功耗管理都需要在系统层面解决。AMD的Helios机架级系统为此提供了基础设施,但实际部署效果有待验证。
市场竞争的不确定性
AI推理芯片市场正处于快速演变之中。英伟达通过Groq交易获得的数据流架构、Cerebras的晶圆级加速器、以及众多初创公司的各类专用推理方案,都在争夺这一快速增长的市场。AMD收购AI推理芯片初创公司Taalas后,能否在系统层面实现有效的技术整合和商业落地,将直接影响这笔交易的最终价值。
常见问题解答
问:AMD收购AI推理芯片初创公司Taalas的具体交易金额是多少?
答:AMD未披露此次收购的具体金额。不过根据公开资料,Taalas自2023年成立以来已累计获得约2.19亿美元的风险投资。据The Register报道,这是一次真正的收购而非人才收购(acquihire)。
问:Taalas的芯片技术与其他AI芯片有何不同?
答:Taalas的技术核心是将AI模型的权重直接蚀刻进硅片之中,而非像传统GPU那样将权重存储在HBM内存中并在运行时读取。这使得Taalas芯片彻底摆脱了内存瓶颈,推理速度大幅提升。但代价是芯片针对单一模型定制,不具备通用性。
问:AMD收购AI推理芯片初创公司Taalas后,Taalas的芯片会取代AMD的GPU吗?
答:不会。AMD明确表示Taalas技术将作为GPU的补充而非替代。在AMD的规划中,计算密集型的提示词处理由GPU负责,token生成任务则卸载至Taalas加速器。两者形成协同互补的关系。
问:Taalas HC1芯片的实际性能如何?
答:Taalas HC1测试芯片在运行Meta Llama 3.1 8B模型时,实现了每秒16,960个token的输出速度。这一成绩约为英伟达GPU的48倍、Cerebras加速器的8.5倍。该芯片采用台积电6纳米工艺制造,拥有815平方毫米面积和530亿个晶体管。
问:AMD收购AI推理芯片初创公司Taalas后,现有Taalas客户会受到影响吗?
答:目前Taalas的产品主要面向特定客户进行技术验证,尚未大规模商用。AMD表示将把Taalas技术整合进自身的产品路线图,未来通过AMD的全栈AI平台向更广泛的客户提供相关能力。
问:Taalas的技术能够适配哪些AI模型?
答:Taalas已开发出“把任何AI模型转化为定制硅片的平台”。从接收到全新的AI模型到完成硬件实现,仅需约两个月。目前Taalas的产品主要支持Meta的Llama 3.1模型,并正在开发适用于更大规模模型的新产品。
问:AMD收购AI推理芯片初创公司Taalas对加拿大科技产业有何影响?
答:AMD自2006年收购ATI以来在加拿大已有长期布局。AMD表示将继续保留并发展加拿大的技术人才。不过此次收购也意味着多伦多失去了三家知名芯片初创公司中的最后一家。AMD此前还收购了多伦多的Untether工程团队。

