嵌入式AI的典型架构有一个特点,由于嵌入式设备算力有限,行业普遍采用“训练-推理分离”模式,即在服务器端训练模型,再在嵌入式设备执行推理。硬件架构上,通常结合专用加速器(如NPU)与通用计算单元(如RISC-V VPU)。
“NPU适合固定算子加速,但缺乏灵活性;而RISC-V VPU通过向量扩展,可随算子演进而升级,成为通用加速的理想选择。”——
芯来科技嵌入式软件工程师舒卓
7月18日,于上海举办的RISC-V中国峰会人工智能分论坛上,芯来科技嵌入式软件工程师舒卓以《Nuclei AI Library,使用RISC-V扩展加速AI推理》为题,系统阐释了RISC-V V扩展在嵌入式AI领域的创新实践。他指出,面对嵌入式设备算力有限的挑战,芯来科技通过Nuclei AI Library与RISC-V V扩展的深度融合,为AI推理提供了高效、灵活的加速方案。
针对嵌入式AI“训练-推理分离”的典型架构,舒卓指出了专用加速的局限性——DSA或NPU虽算力强,但灵活性不足,难以适配快速演进的AI算子。而RISC-V V扩展通过指令集扩展,可随算子需求灵活升级,成为嵌入式AI通用加速的理想选择。
芯来科技推出的Nuclei AI Library,旨在通过RISC-V V扩展为NPU提供补充方案。舒卓强调:“客户对高算力需求通常采用NPU加速,但对于自定义算子或不适合NPU的场景,V扩展的灵活性至关重要。”该库的核心优化策略包括:
1. GEMM算子优化:榨取每一寸算力

通用矩阵乘(GEMM)是AI模型中占比最高的算子(据IBM研究,占比超50%)。芯来科技通过三项技术提升其效率:
避免低效指令:减少Reduction类指令的使用;
数据复用:最大化已加载数据的利用率,减少内存访问;

寄存器满载:充分利用V数据寄存器容量,提升计算密度。
在Nuclei NX900fdv平台的实测中,GEMM算子性能提升显著:
16×16矩阵:加速8.51~14.23倍;
128×128矩阵:加速最高达89.96倍。
2. CONV2D算子优化:两种路径适配不同场景
针对卷积神经网络的核心算子CONV2D,芯来科技提供两种优化方案:
Im2col+GEMM:将卷积转化为矩阵乘法,适配大尺寸卷积核;
Winograd+GEMM:减少小尺寸卷积核的计算量,再通过GEMM加速。
在Nuclei Evalsoc平台的测试中,多种AI算子(如Abs、Add、BatchNormalization)的加速倍数从数倍到上百倍不等,印证了V扩展在多样化场景中的普适性。
3. BF16格式优化:突破精度与效率的平衡
为适应AI对低精度计算的需求,芯来科技自定义了BF16格式的V扩展指令:
CS寄存器创新:通过设定不同CSR寄存器值,直接以BF16格式计算,避免官方扩展中“BF16转FP32”的额外开销;
性能跃升:相比RISC-V官方BF16扩展,性能提升超1倍,同时带宽需求降低50%。

芯来科技同步引入矩阵扩展(如Xxlvqmacc指令),遵循IME group规范设计,支持8位整数扩展至32位精度,进一步拓宽了RISC-V在AI领域的应用边界。舒卓指出,Nuclei AI Library与NPU的协同模式已成为嵌入式AI的主流方案。

在分工协作方面,NPU处理专用算子(如大规模卷积),V扩展处理灵活算子(如自定义层)。以图像识别场景为例,NPU负责特征提取,V扩展加速全连接层分类,整体性能提升30%以上。
舒卓总结,RISC-V V扩展的开源特性与算子统一趋势,为嵌入式AI提供了“通用加速与专用加速互补”的新路径。芯来科技将持续优化Nuclei AI Library,推动RISC-V在边缘计算、智能家居等场景的落地,助力AI从“识别”向“认知”的更深层次演进。