7月18日,在上海举办的2025年RISC-V中国峰会人工智能分论坛上,希姆计算AI应用技术总监肖正宇发表了主题为《RISC-V加速AI创新,行业智能体的实践》的演讲。他系统展示了希姆计算在RISC-V矩阵扩展指令集、行业智能体解决方案及实际落地案例中的技术突破与创新实践。
希姆计算AI应用技术总监肖正宇
肖正宇首先介绍了希姆计算在RISC-V Matrix扩展领域的核心成果。其设计的矩阵运算指令集包含8个专用寄存器与8个累加器,支持内积、外积等多种硬件实现方式,并兼容存算一体等新型器件。该指令集采用模块化架构,具备高扩展性,可适配从SIMD阵列到CIM(Compute-in-Memory)的多样化硬件需求。
希姆计算与RISC-V国际社区紧密合作,推动开源规范与工具链建设。自2022年起,团队已发布Matrix指令集草案,并与达摩院等机构达成多项技术共识。2024年11月,v0.5版本正式推出,配套开源项目(如riscv-matrix-spec、LLVM工具链)已在GitHub公开。
此外,希姆计算还与北京大学合作开设研究生课程,获得斯坦福大学、苏黎世联邦理工学院(ETH)的高度认可。未来,团队将继续推进Matrix指令集的标准化工作,为全球AI开发者提供开放生态支持。
希姆计算基于RISC-V构建了覆盖“芯片-算力层-模型适配层-应用层”的行业智能体解决方案。在芯片层,其自研的NPU950系列支持RISC-V生态的CPU、GPU等核心算力单元;算力适配层通过自研基础架构兼容多种硬件设施;模型适配层则适配主流大模型(如千问系列、DeepSeek系列),并推出自研“希姆九州大模型”。
在算力平台架构上,希姆计算采用Kubernetes(K8S)实现弹性部署,支持共享/独占算力资源的动态调度。其模型推理框架针对新兴大模型(如DeepSeek R1)进行了优化,通过定制算子与NPU指令调优,显著提升系统吞吐量。例如,针对长文本场景(如600页标书),平台通过工程化处理解决数万Token输入的挑战,为下一代芯片设计提供方向指引。
希姆计算的多智能体系统采用“指挥官+领域智能体”模式,由一个中央智能体协调任务编排,并协同5个领域智能体:

Search智能体:语义向量库检索所需数据;
Business智能体:处理业务逻辑;
Question智能体:执行发散性推理与总结;
Verification智能体:审核法规合规性与数据安全(如内网外网隔离);
Generation智能体:生成最终输出结果。
该架构通过多模型协同(如OCR、Embedding、Reranker)实现复杂工作流编排,同时满足高并发与低延迟需求。例如,在政务智能体场景中,系统可处理黄浦区36个部门的2046项服务事项,通过人机对话实现政务服务导办,显著提升办事效率。
案例一:黄浦开发区政务智能体希姆计算为黄浦开发区打造的导办智能体,覆盖小区政务服务点、医院医保、出生证明等场景。公众可通过人机对话快速办理咨询事项,减少人力投入并提升效率。

案例二:广州公共采购集团“彩翼平台”该平台通过模拟招投标评审人员的思维模式,对异议点进行法规分析与推理,平均每次推理处理13万Tokens,帮助工作人员在数小时内完成原本需两三天的评标审标流程。
希姆计算的核心技术体系包括:
高效资源分配:算力云平台动态调整资源,根据负载自动扩展/缩减;
硬件指令集优化:直接调用NPU原生ISA接口,绕过传统内核调度栈,实现算子级流水线优化;
深度学习编译器:通过整图调度、动态切分、算子融合等技术释放硬件性能;
异构通信抽象:构建统一P2P传输层(Register/DMA/PCIe),实现跨卡集群零拷贝通信;

宏KernelTemplate编译:将LLM计算图编译为单一持续内核,消除层间启动开销。
肖正宇总结称,RISC-V的开放性与模块化为AI创新提供了关键支撑。希姆计算通过矩阵指令集、行业智能体解决方案及核心技术体系,正在推动AI从云端向边缘的深度渗透。他呼吁更多开发者加入RISC-V生态,共同探索低功耗、高灵活性的AI算力未来。
