首页 > 创新亦庄 > 创新举措

神州光大启动大模型后训练技术规模化推广

  本报讯(融媒体中心 李玉凤)近日,北京经开区人工智能企业神州光大依托昇腾国产算力集群,在客户真实业务场景中完成万亿参数级MoE模型的全参数后训练验证,模型算力利用率(MFU)稳定达到34%以上,与业界前沿论文技术结论相互印证,实现从学术成果到产业级应用的关键跨越。以此为基石,神州光大启动高效大模型后训练技术的规模化推广计划,将围绕MoE模型(混合专家模型)、国产算力、真实业务场景三条主线,打造可复用的优化工具链与配方库,推动高效后训练从“项目制突破”走向“产品化交付”,加速进入金融、能源、制造、政企等高价值场景。

  本次实践首先验证MoE大模型后训练的高效工程化能力。与传统稠密模型不同,MoE模型的专家路由、Token Dispatch/Combine、All-to-All通信与稀疏激活模式,会显著放大并行策略、流水线和算子实现的复杂度。神州光大基于论文技术路径,围绕专家—张量并行协同、流水线气泡压缩、MoE通信与计算重叠、双缓冲Swap Optimizer等关键环节进行工程重构,使万亿参数级MoE模型在全参数后训练过程中,不再被通信等待、显存碎片和无效空转持续吞噬算力,而是让训练吞吐真正贴近硬件能力上限。其次,这次落地更是一次国产算力全栈能力的集中检验。所面向的Ascend SuperPOD与昇腾NPU体系,并非对GPU技术路线的简单平移,而是需要围绕SIMD架构、Ascend C算子、UB驻留、MTE流水、通信原语与集群拓扑建立一整套新的优化方法论。神州光大在客户项目中,将并行策略推荐、瓶颈Profiling、算子融合重写、通信重叠调度、显存治理与稳定性监控贯通起来,形成了一套面向国产算力的“MFU提升工程配方”。

  以此成果为基础,神州光大启动高效大模型后训练技术的规模化推广计划。“这次验证最重要的意义,不是把某一个指标做高,而是证明国产算力上的MoE全参数后训练,能够在真实业务里同时做到高效、稳定和可运营。”神州光大AI基础设施该负责人表示,“34%以上MFU是起点,不是终点。神州光大的目标,是把前沿方法变成客户业务里可感知的训练提速、成本下降和迭代确定性。”


相关新闻