产业丨边缘AI芯片将面临何种残酷挑战?

IP归属:广东

文章AI导读

一键萃取文章精髓,核心观点即刻呈现

前言:

边缘AI的叙事建立在诱人的前提上,把推理从云端搬回本地,每个月就能省下巨额的API账单。 

2022年到2024年这个故事是真的,2025年开始它变得可疑,2026年它已经站不住了。 

算力的边际成本在下降,承载算力的介质的边际成本在暴涨。 

当一台设备需要16GB还是32GB内存才能把多模态模型的KV Cache塞进去时,算力数字的涨幅永远追不上内存价格的涨幅。厂商在规格表上写的那些漂亮数字,落到BOM上就成了一道减法题。

作者 | 方文三

图片来源 | 网络

算力指标通胀让判断力退化

打开手机芯片的发布会PPT,第五代骁龙8至尊版、天玑9500、苹果A19,NPU算力齐齐站上100 TOPS量级,号称能本地运行4B到13B参数的多模态模型。汽车端更夸张,英伟达Thor最初宣称2000 TOPS,地平线征程6P标到560 TOPS。

边缘推理的瓶颈早就从乘加运算转移到了数据搬运,Thor的2070 TFLOPS是稀疏FP4条件下的理论峰值,而它的LPDDR5X内存带宽只有273GB/s。 

实测中,大模型生成文本的速度几乎由带宽单变量决定,而非算力。这就像给一辆跑车加满油门,却只配了一根吸管粗细的油管。 

比带宽更深层的错位,是两种时间的冲突。 

芯片从立项到量产要三到五年,5nm以下设计项目的成本超过5亿美元,单次流片费用约3000万美元;而模型架构的迭代周期已经缩短到几个月,Transformer刚站稳,Mamba、混合专家、视觉语言行动模型又轮番登场。

2026年出货的边缘AI芯片,规格表上的数字非常漂亮。 

高通Snapdragon X2 Elite的NPU达到80 TOPS,极致版达到85 TOPS,AMD的Ryzen AI 400系列是60 TOPS,英特尔Core Ultra系列3的NPU为50 TOPS。 

时至2026年,这道门槛已经被所有主流平台轻松跨过,于是TOPS这个数字失去了区分度。

而它在衡量大语言模型速度时,几乎没有预测力。

自回归解码是内存带宽受限的,而非算力受限的。在这个公式里,TOPS不出现在任何一项的位置上。 

2026年的一组对比中,高通Snapdragon X Elite的NPU算力是453 TOPS,带宽136 GB/s,AMD Ryzen AI 9 HX 370的算力是505 TOPS,带宽128 GB/s,两者TOPS相差52点,生成速度却落在同一个区间。

AMD Ryzen AI 300在NPU上跑Stable Diffusion需要约70秒一张图,换到集成GPU上只要约30秒,NPU在真实负载下反而更慢。 

分水岭已经转移到了内存容量和内存带宽,一台标称50 TOPS的笔记本本地跑大模型只有9.4 token每秒,这并非芯片有缺陷,而是带宽受限的必然结果。 

指标通胀带来的代价是判断力退化,当所有人都在追逐TOPS数字时,采购方失去了辨别差异化的能力,而厂商也乐见这种混淆,因为更高的数字意味着更高的溢价空间。

英伟达Jetson Thor的规格表提供了观察样本,2070 TFLOPS的FP4稀疏算力对上一代Orin的INT8稀疏算力,提升倍数被广泛引用为7.5倍。 

类似的模糊操作在行业里普遍存在,高通Dragonwing IQ-2390的NPU只有1.1 TOPS,MediaTek Genio 420是7.2 TOPS,Jetson Orin NX是100 TOPS,三者相差近两个数量级,却经常被放进同一张对比表格里。

AI只是一项功能而非产品本身,NPU带来的功耗和成本远超预期。Hailo-10H这类5瓦级别的模块能够完成7B级模型的推理,而3499美元的Jetson Thor能完成70B级模型的实时推理,这两者在各自的工作区间里都是正确的选择。

芯片不赚钱,生态才赚钱

云端AI训练芯片的格局是英伟达一家独大,边缘市场则完全是另一幅图景。 

2025年排名第一的高通也只占15.6%的份额,英伟达9.3%,英特尔8.8%,其余三分之二的市场散落在几十家厂商手里。

分散的根源在于场景本身不可通约,一只常开唤醒的耳机需要微瓦级的关键词检测芯片,一辆L3级汽车需要100到300 TOPS且通过ASIL-D功能安全认证的域控,一台人形机器人需要百瓦级的多模态大脑,没有任何一颗芯片能同时出现在这三个地方。 

汽车是少数跑出规模的孤岛,也因此成了观察这场战争的最佳样本。 

地平线2025年芯片方案出货超过400万套,同比增长38.8%,其中支持NOA的中高阶芯片出货180万套,一年翻了接近五倍,贡献了超过八成的产品与解决方案收入。到2026年上半年,地平线在中国自主品牌智驾芯片市场以31.94%的份额压过英伟达的29.38%,城区NOA开始装进8.99万元的大众轿车。

戏剧性的是对立面的姿态,英伟达车载Thor从2024年跳票到2025年8月,宣传的2000 TOPS交付时缩水成700 TOPS,汽车业务仅占英伟达营收的1%,这个市场对英伟达的战略优先级,天花板肉眼可见。 

巨头的边缘业务,恰恰是专业玩家的核心腹地,这种注意力错位就是缝隙市场里最真实的生存逻辑。 

把目光从产品参数表抬升到财务报表,会发现巨头们的打法高度一致:芯片只是钩子。

英伟达在边缘复制的是CUDA的护城河—,etson硬件捆绑Isaac机器人栈、Omniverse仿真和Metropolis平台,开发者一旦进入就很难迁移。 

高通2025年3月收购拥有25万开发者的边缘AI开发平台Edge Impulse,10月再收购坐拥3300万用户的开源硬件社区Arduino,并推出44美元的UNO Q开发板。

商业模式也在悄然换轨,硬件一次性销售的毛利越来越薄,厂商开始把芯片和软件订阅捆绑:模型版本管理、安全补丁、设备编排,这些生命周期服务能为厂商增加15%到20%的利润空间。

夹在中间的初创公司处境微妙,SiMa.ai累计融资3.55亿美元,2026年新一轮融资估值约14亿美元;Hailo、Axelera AI、EnCharge各自押注存内计算或专用数据流架构,EnCharge宣称其模拟存内计算能做到150 TOPS/W的能效。

资本还在下注,因为边缘市场尚未形成统一赢家,但窗口在收窄,巨头收购开发者社区的速度,就是窗口关闭的速度。

机会藏在约束的另一侧

Fortune Business Insights测算,全球边缘AI半导体市场将从2025年的258.1亿美元增至2034年的1078.6亿美元;Grand View Research更乐观,给出2033年2918亿美元、年复合增速34.7%的预测。

中国市场同样凶猛,IDC预测到2027年推理将占智能算力需求的70%以上,仅2025年上半年中国边缘计算市场规模就突破420亿元、同比增长28.6%。 

约束杀不死需求,只会重排需求的形状,三个变化值得盯住。 

①端侧智能体开始规模化:面壁智能、腾讯混元等机构把模型压缩到300MB到1.6GB,让AI助手在手机和眼镜上完全离线运行,端侧进入自主完成多任务的阶段。模型变小比芯片变大更快,这直接改写了对算力的需求曲线。

②物理AI打开了功耗信封的上限:机器人和无人机的视觉系统市场预计2033年超过90亿美元。机器人不计较100瓦的功耗,计较的是确定性和开发效率。 

③存储危机正在倒逼架构革命:当内存比算力更贵、更稀缺,减少数据搬运的存内计算、事件驱动的类神经形态芯片就有了真实的经济理由。神经形态架构预计将以48.3%的年复合增速增长,数倍于大盘。

结尾:

云端的大模型住着宽敞的数据中心,电表随便转;边缘侧的芯片却只分到几瓦的口粮,还要在摄像头、方向盘和机器人的关节里当场作答。 

当AI从云端走向万物,最难的一仗,恰恰打在最小的那块硅片上。 

部分资料参考:TrendForce:《Mobile DRAM price surge pressures design planning》,

瑞银:《存储芯片迎涨价周期》,KB Securities:《AI热潮冲击供应链》,Counterpoint:《Edge AI Statistics 2026: Market Size, Chips, Adoption & Sector Data》,三个皮匠报告:《2026边缘AI规模化路径:四道门槛决定LMIC能走多远》

陀螺科技现已开放专栏入驻,详情请见入驻指南: https://www.tuoluo.cn/article/detail-27547.html

AI芯天下专栏: https://www.tuoluo.cn/columns/author1911711/

本文网址: https://www.tuoluo.cn/article/detail-10131438.html

免责声明:
1、本文版权归原作者所有,仅代表作者本人观点,不代表陀螺科技观点或立场。
2、如发现文章、图片等侵权行为,侵权责任将由作者本人承担。

相关文章