当前位置:首页 > 投稿

存算一体:打破冯诺依曼瓶颈的下一代芯片,真的能落地吗?

2026-09-28 22:24:53yangzhan投稿9
现在跑一个千亿参数的大模型,整栋楼的空调都压不住那堆服务器发出来的热量。训一次模型花出去的电费,够一个小县城用三个月。 问题出在哪? 冯诺依曼瓶颈。

冯诺依曼墙下,存算一体到底解决了什么问题

我们用了七十多年的通用芯片,都是走的“存储计算分离”的路子。计算单元要处理数据,就得专门发指令把数据从内存搬到计算单元,算完了再搬回内存存起来。 这个过程里,传输消耗的能耗和延迟,比计算本身要高出两个数量级。大模型出来之后,这个老问题直接从“使用感不好”变成了“行业玩不起”。 存算一体的核心逻辑其实一点都不复杂。让计算直接在存储单元内部完成,不用来回搬数据。 传统冯诺依曼架构存算分离示意图传统冯诺依曼架构存算分离示意图 业内现在把路线分成两种。一种是近存计算,说白了就是把存储堆得离计算单元更近,缩短传输距离,本质还是传统架构的优化。另一种才是真正的存内计算,直接用存储单元本身做计算,比如常见的RRAM阻变存储器,不同的导电状态对应不同的数值,直接就能完成AI推理最核心的矩阵乘法运算。 很多人不知道,现在不少厂商拿着近存计算的产品吹成新一代存算一体割韭菜,懂行的都心里有数。

产业落地进度:边缘先跑,云端跟风

存算一体的概念喊了快十年,为什么这两年突然爆火?说白了就是端侧大模型带起来的需求。 现在手机、智能汽车、可穿戴设备都要本地跑AI,不能什么都传云端,既延迟又不安全,传统芯片的功耗根本扛不住。存算一体天生低功耗低延迟的优势,刚好戳中了这个痛点。 国外IBM早早就拿出了面向边缘推理的存算一体AI芯片,国内几家头部芯片设计公司和一众初创公司,也都完成了多轮流片,去年已经有消费级产品上市了。比如TWS耳机的AI降噪,智能摄像头的人脸识别,换了存算一体芯片之后,功耗直接砍半,延迟还降了两成,体验提升很明显。 存算一体AI芯片晶圆实物图存算一体AI芯片晶圆实物图 说实话,我上个月跟一个硬科技投资人聊天,他说现在只要是团队背景过硬的存算一体创业项目,BP递出去不到一周,TermSheet就能拿到好几个,热得发烫。 不过话说回来,现在真正能大规模落地的,全都是边缘低功耗场景。云端还没怎么见真正能用的产品。为什么?核心问题还是卡在上游工艺。

绕不开的坎:远没到颠覆的时候

绕不开的坎:远没到颠覆的时候绕不开的坎:远没到颠覆的时候 第一个坎是精度。现在主流的存算一体方案走的是模拟计算路线,天生就有器件误差,层数堆多了误差累积起来,推理结果直接错得离谱。现在行业都是靠算法校准来补误差,补来补去,存算一体好不容易省下来的功耗和成本,又被算法吃掉了一大半。 第二个坎是良率和成本。存算一体要用到新的存储工艺,不管是RRAM还是MRAM,工艺成熟度都远不如主流的CMOS,一块12寸晶圆做下来,良率能到三成已经算不错了,成本根本降不下来,没法跟成熟的GPU、NPU拼性价比。 第三个坎是生态。现在AI开发的整个工具链都是围着传统架构转的,CUDA生态已经养了十几年,开发者根本没必要为了一点功耗优势去重新适配一套完全陌生的架构,没有应用,芯片做得再好也卖不动。 说到风险和监管,存算一体其实还带来了一个新的问题:当端侧就能跑大规模大模型,数据不用流出本地,对用户隐私确实是好事,但恶意开发者也能在本地做违规的AI应用,监管难度比云端AI大得多,这个问题现在还没人拿出成熟的解决方案。

未来三五年的真实走势

未来三五年的真实走势未来三五年的真实走势 很多自媒体吹存算一体是颠覆冯诺依曼的下一代计算,我觉得太夸张了。它就是解决当前算力功耗矛盾的一个关键技术路线,不是什么银弹。 未来三五年,我判断第一个大方向就是端侧大规模落地。可穿戴、手机AI、汽车自动驾驶的感知芯片,这些场景对功耗敏感,对精度要求又没有云端训练那么苛刻,刚好匹配存算一体的优势。不出意外,三五年后你买的旗舰手机,里面的AI加速单元大概率就会用到存算一体技术。 第二个方向,云端会先从专用推理卡切入,慢慢迭代,不会碰训练任务。工艺慢慢磨,良率慢慢提,成本降下来之后再慢慢渗透。数字存算一体的路线现在也越来越受重视,它精度更高,更容易适配现有生态,就是功耗优势比模拟路线差一点,平衡下来反而可能更快跑出大规模应用。 存算一体不是天顶星科技,但是它刚好踩在了AI向端侧普及的风口上。现在看不起它,觉得它还是实验室玩具的人,过五年回头看,多半要拍大腿。