中兴微谈RISC-V服务器如何破解大模型推理成本困局

您当前的位置:   首页 > 首页 > 新闻资讯
中兴微谈RISC-V服务器如何破解大模型推理成本困局
发布时间:2026-07-11 03:13:41

7月17日,在上海举办的2025年RISC-V中国峰会上,中兴微电子副总经理石义军发表了题为《大语言模型推理部署RISC-V服务器应用及架构研究》的演讲。他系统分析了大模型推理在RISC-V服务器中的部署机遇与挑战,提出需通过架构创新与生态共建,推动RISC-V在AI时代的规模化落地。

中兴微电子副总经理石义军

中兴微谈RISC-V服务器如何破解大模型推理成本困局(图1)

大模型推理的算力需求与矛盾

石义军指出,大语言模型在服务器推理场景中呈现出显著趋势:从密集型(Dense)向稀疏型(MoE)架构迁移,计算重心从算力转向效率。随着模型参数规模突破万亿级,推理过程中的算力需求虽有所下降,但对存储带宽、缓存容量的要求却持续攀升。这一特性使得存储优化成为AI解决方案的核心,而RISC-V的开放性与灵活性为其在这一领域提供了差异化优势。

他进一步揭示了大模型推理部署中的两大核心矛盾:

  1. 计算与带宽的动态切换:预填充(Prefill)阶段需高算力保障首Token生成速度,解码(Decode)阶段则依赖高带宽支撑吞吐量,这对硬件架构提出了动态适应性要求。
  2. 存储成本与数据活跃度的背离:MoE模型中,每个Token仅激活少量专家参数,但低频专家仍需承担高昂存储成本,导致资源利用率低下。

混合推理:降本增效的关键路径

针对上述矛盾,石义军提出混合推理架构的价值。

中兴微谈RISC-V服务器如何破解大模型推理成本困局(图2)

他指出,在中小规模私域部署中,基于CPU的方案因DDR存储成本仅为HBM的1/5~1/7,具备显著性价比优势;而在云端大规模部署中,GPU与CPU的协同可实现低频专家卸载,减少GPU部署数量,从而降低整体TCO。例如,通过将MoE中8/256的专家路由至CPU,可提升HBM利用率并减少存储冗余。

他强调,RISC-V在混合推理中的潜力源于其可定制性与扩展性。当前,RISC-V已支持FP16、BF16、INT8等AI数据格式,并可通过自定义指令加速低比特精度计算(如FP4/FP8),进一步降低带宽与存储需求。同时,RISC-V的开放标准允许快速适配Block Scale等量化技术,在保持精度的同时优化能效。

RISC-V服务器的挑战与突破方向

尽管前景广阔,石义军坦言RISC-V在大模型推理中仍面临多重挑战。

首先是架构与算法协同优化。MoE等算法的持续演进对底层算力架构提出新要求,需探索矩阵扩展(如AME)、多核通信效率提升等技术,以匹配算法迭代速度。其次通过定制指令集优化低byte数据操作,结合Scale机制维持精度,可以实现带宽与算力的双重优化。

其次是超长上下文管理。智能体(Agent)应用催生数万级上下文需求,CPU需强化KV Cache管理能力,并通过本地化注意力计算卸载,避免跨芯片通信瓶颈。

中兴微谈RISC-V服务器如何破解大模型推理成本困局(图3)

最后是异构计算标准统一。当前RISC-V与GPU在数据格式、任务卸载接口上存在差异,需推动标准化工作,降低混合部署的复杂度。针对多核同步开销问题,中兴微电子推动RISC-V多核扩展标准,在案例测试中降低39%的通信延迟。

“我们正与新思科技合作,通过Chiplet技术实现RISC-V CPU与GPU的高效互联。”石义军透露,这一方案已在中兴微电子的AiCube训推一体机中应用,兼容DeepSeek等大模型,显著降低企业AI部署成本。

构建开放生态:从标准到产业协作

石义军呼吁行业共同推进RISC-V生态建设。他提出三点建议:

中兴微谈RISC-V服务器如何破解大模型推理成本困局(图4)

  • 底层标准先行:加快RVV向量指令集、矩阵扩展(IME/VME/AME)等标准的完善,统一AI数据格式与算力接口,为编译器与工具链提供稳定基础。
  • 场景化创新:聚焦轻量级推理、私域部署等细分场景,发挥RISC-V在存储成本与定制化上的优势,打造标杆解决方案。
  • 产学研协同:通过开源社区、认证实验室、人才培育等多维度合作,构建“可用→好用→落地”的完整生态链,推动RISC-V从实验室走向产业化。

石义军总结称,RISC-V在大模型推理中的成功取决于技术突破与生态共建的双重推进。“开放性是RISC-V的基石,而生态的繁荣将决定其能否在AI时代占据一席之地。”他相信,通过架构创新与产业协作,RISC-V有望在混合计算、存储优化等领域实现突破,最终在全球AI算力市场中树立新的标杆。

责编:Luffy