自2017年Transformer架构诞生以来,从GPT-2到DeepSeek-v3,尽管模型内部结构不断迭代(如FFN从MLP演进至MOE架构),但底层架构始终基于Transformer。
与此同时,核心算子逐渐趋同,例如在DeepSeek 7B模型中,11个核心算子中Matmul(矩阵乘法)占比高达95%,成为算力需求的集中点。
针对这一趋势,RISC-V凭借其开源与可扩展性,成为适配大模型的关键平台。

7月18日,在上海举办的2025年RISC-V中国峰会人工智能分论坛上,知合计算解决方案总监黄怡皓发表了主题为《大模型在RISC-V架构上的技术创新与应用》的演讲。他系统剖析了大模型在RISC-V架构上的技术演进路径,并展示了知合计算如何通过算子优化与生态协同,推动AI能力从“识别”向“认知”的跃迁。
知合计算解决方案总监黄怡皓
黄怡皓强调,RISC-V的AME(Advanced Matrix Extension)指令集完美匹配Matmul算子需求,仅需优化11个算子中的3个外,其余均可通过AME实现高效加速。此外,RISC-V支持从FP32到FP8的多种数据格式,进一步提升了大模型的灵活性与能效比。
黄怡皓指出,大模型的应用正从单纯的“识别”功能迈向“认知”能力。
他以传统CNN网络与Transformer的对比为例:前者仅能识别物体(如行人、汽车),而后者通过统一表征,可判断物体间的动作与关系(如“熊猫吃竹子”或“昆虫停留在植物上”)。
在具体场景中,知合计算的A210端侧芯片已实现多个创新应用。例如,在政务与客服系统中,基于A210的AI智能体可完成增删改查操作,通过语音输入直接处理复杂指令(如“删除巨无霸汉堡并替换为拼盘加可乐”)。另一款A600芯片则通过统一接口设计,支持从特征提取到模糊搜索的全流程处理,无需针对特定场景进行二次训练。
黄怡皓还在视频中演示了“模糊搜索”功能显示,用户可通过简单指令(如“门打开的场景”)精准定位视频中的关键帧,显著降低开发门槛。

黄怡皓认为,大模型算子的统一性为RISC-V带来了“生态红利”。他指出,传统架构(如ARM)因生态壁垒难以快速适配新兴算子,而RISC-V的开源特性使得矩阵乘法、向量计算等核心功能的优化更加高效。通过与达摩院等机构的合作,RISC-V已集成AME指令,为算子优化提供了标准化路径。
此外,RISC-V的“通推一体”架构(如知合计算的A210与A600)实现了通用计算与AI推理的高效融合。例如,A210的8核CPU与12 TOPS算力结合自研Torq架构,不仅支持Transformer模型,还可通过Zmedia架构处理多媒体任务,满足从点餐系统到安防监控的多样化需求。
黄怡皓总结道,RISC-V与大模型的结合不仅是技术突破,更是生态协作的胜利。随着大模型的开源化与RISC-V指令集的持续扩展,开发者能够更快速地实现算子优化,推动AI能力从“识别”走向“认知”。他呼吁更多企业与开发者加入RISC-V生态,共同探索AI在端侧、边缘及云端的无限可能。

