分析丨从GPU到专用硅,AMD收购Taalas想补上哪块拼图?

IP归属:广东

文章AI导读

一键萃取文章精髓,核心观点即刻呈现

前言

近日,AMD宣布收购多伦多初创公司Taalas,这家公司的芯片有一种偏执:一颗芯片只运行一个模型,模型换掉,芯片作废。
 
在GPU的通用性统治AI算力十年之后,苏姿丰为这份偏执开了支票。

AMD的缺口藏在GPU覆盖不到的推理深水区

AI基础设施的重心正在由训练转向推理,这不仅改变芯片需求,也让延迟、功耗和单Token成本成为客户反复核算的指标。
 
Gartner预计,2026年全球AI优化型IaaS支出中,推理将达到206亿美元,占比55%,首次超过训练。
 
德勤则预计,推理将占AI计算量约三分之二,推理优化芯片市场超过500亿美元。
 
训练像修水库,推理更像千家万户持续拧开的水龙头,调用越频繁,成本压力越直接。
 
AMD已有强劲的通用计算主线。2026年第二季度,其数据中心收入达到67.18亿美元,同比增长107%,主要由EPYC处理器和Instinct MI350系列GPU推动。
 
新量产的Helios机架进一步集成72颗MI455X GPU、18颗第六代EPYC CPU、网络与ROCm软件,AMD称其每美元推理Token数较主要竞品最高提升30%。
 
但大模型自回归解码存在典型的「内存墙」:计算单元常常等待模型权重和KV缓存搬运。针对H100的研究显示,即使扩大批量,注意力计算仍明显受内存限制,超过50%的相关内核周期可能因数据访问停顿。
 
GPU的优势是通用、灵活,却也要持续承担数据搬运成本。AMD缺少的,正是一条针对高频、稳定模型的专用硬件路径,以牺牲部分通用性换取更高推理效率。
 
Taalas带来的正是这块拼图,它覆盖的路径很窄,却可能切入推理市场中调用量最大、成本优化价值最高的那部分流量。

Taalas值钱的是把模型变成硅片的流水线

Taalas的HC1技术验证芯片,把Llama 3.1 8B模型直接装进一颗台积电6纳米芯片中。芯片面积815平方毫米,集成530亿个晶体管,10张卡组成的服务器功耗仅2.5千瓦。
 
公司测试显示,在输入、输出序列均为1000 Token时,HC1可达到每名用户每秒17000 Token。
Taalas称,其速度接近同期先进方案的10倍,系统建造成本约为1/20,耗电约为1/10。
 
Taalas预先完成绝大部分芯片设计,只需在约100层制造结构中的2层金属互连上修改掩模,即可将模型权重和数据流固化进基于掩模ROM的结构,少量SRAM则用于KV缓存和微调权重。
 

因此,一款新模型从拿到权重到完成定制芯片,大约只需2个月。权重贴近计算后,HC1可以省去HBM、3D堆叠、复杂先进封装和高速I/O,并采用风冷运行。
 
Taalas真正想出售的是模型到芯片(model-to-silicon)能力,它没有继续追逐更高带宽,而是试图减少AI服务器最昂贵的动作之一:数据搬运,让硅片围绕具体模型重新组织存储与计算。
 
对AMD而言,收购Taalas更像买下一份计算架构的选择权。模型快速变化时继续依靠GPU;当模型趋于稳定、调用规模足够大,再将其压成专用硅片。配合Cerebras、MK1、MEXT和ROCm,AMD正在尝试把不同计算资源装进同一套AI基础设施版图。

AMD的收购线索终于连上

过去几年AMD的并购越来越像沿着数据中心机架逐层收集零件,Xilinx带来FPGA和自适应计算,Pensando补进DPU与网络,ZT Systems提供机架级系统设计,Silo AI强化模型与软件能力,Enosemi切入共封装光学。
 
进入2025年末和2026年,节奏又明显靠近推理,MK1的高吞吐推理软件、MEXT的预测型内存优化、FastFlowLM的端侧推理流程相继归队。
 
Taalas落在链条最靠近执行端的一格,它把专用推理硅和模型固化工具流带进了AMD。
 
AMD公告中的用词很克制,Taalas技术将进入加速器路线图,并与Instinct GPU共同组成系统级方案,同时补充Helios、EPYC和ROCm。
 
由此可以推断,AMD暂时没有打算让HC1单枪匹马另立门户,更合理的方向是构建异构推理系统。
 
训练、长提示预填充、频繁变化的模型继续使用GPU,高调用量模型的解码阶段交给更专用的引擎,CPU、网络和软件负责把任务在不同硅片之间调度起来。
 
竞争焦点已经越过单颗GPU峰值,来到一套系统能否把预填充、解码、网络与内存交给更合适的芯片。
 
这种组合也符合AMD一贯擅长的模块化思维,EPYC靠芯粒设计打开服务器市场,Xilinx积累了自适应计算经验,半定制业务又让AMD熟悉围绕大客户需求做硅。

英伟达买灵活|AMD押注凝固

去年平安夜,英伟达用约200亿美元以非独家授权加团队收编的方式拿下Groq,创下自身历史上最大一笔交易,那家公司的LPU用大容量片上SRAM替代HBM,把延迟压到极限,芯片却依然可编程,什么模型都能跑。
 
今年5月Cerebras以约560亿美元市值完成IPO,6月Etched宣布Transformer专用芯片在台积电N4P工艺流片,手握超过10亿美元客户合同,英特尔被传与SambaNova签下收购意向书,高通在接触Tenstorrent。
 
整个行业的钱都在涌向同一个判断,推理值得专用芯片,分歧只在于专用到什么程度。
 
Taalas恰好站在这条光谱最极端的一端。Groq牺牲显存架构换速度,Etched牺牲模型多样性换效率,Taalas连架构层面的通用性都放弃了,一颗芯片只忠于一个模型。
 
英伟达的200亿美元买的是一个进可攻退可守的灵活位置,AMD买下的则是光谱尽头无人占住的那一格,两家巨头在同一块战场上押了方向相反的注,这比交易金额本身更值得咀嚼。

赌局的筹码是模型换代的速度

模型的大版本周期若维持在一年左右,蚀刻硅片的窗口就足够宽,可一旦出现颠覆性的新架构,所有刻死的芯片都可能在一夜间变成昂贵的沙子。
 
Bajic的辩护是底层算子正在收敛,即便架构生变,需要重做的也只是顶部金属层而非整颗芯片,这套辩护能否经得起时间检验,眼下没有答案。
 
AI辅助的芯片设计工具正在把定制硅片的门槛持续打低,Synopsys、微软和AMD自己都在今年展示了智能体驱动的设计流程,Taalas那条两个月从模型到硅片的生产线,放进AMD的工程体系里只会转得更快。
 
数据中心愿不愿意为一堆单一用途的芯片操心,Forbes分析师Karl Freund的提醒很直白,没有哪家数据中心受得了同时管理几十种加速器SKU。
 
反驳同样有力,推理流量正在向少数旗舰模型集中,Meta的机房里跑着Llama家族,Anthropic的机房里跑着Claude家族,真正需要刻进硅片的型号也许一只手就数得过来。
 
这桩生意最微妙的地方在于,大模型市场越是赢者通吃,Taalas的账本就越成立。

结尾

AI计算正在经历一次细密的分工。训练时代最醒目的单位是一颗GPU,推理时代更像一座工厂,每道工序都开始寻找自己的机器。
 
Taalas补给AMD的,正是模型级专用计算这一格。
 
部分资料参考:AMD Investor Relations:《AMD Acquires Taalas to Advance Compute Solutions for Rapidly Growing AI Inference Market》,AMD Investor Relations:《AMD and Cerebras Announce Industry-Leading Ultra-Low-Latency and High Throughput AI Inference Solution》,Taalas:《The Path to Ubiquitous AI》

陀螺科技现已开放专栏入驻,详情请见入驻指南: https://www.tuoluo.cn/article/detail-27547.html

AI芯天下专栏: https://www.tuoluo.cn/columns/author1911711/

本文网址: https://www.tuoluo.cn/article/detail-10130672.html

免责声明:
1、本文版权归原作者所有,仅代表作者本人观点,不代表陀螺科技观点或立场。
2、如发现文章、图片等侵权行为,侵权责任将由作者本人承担。

相关文章