国产 AI 算力实现历史性跨越!近日,深圳河套学院 AI 训练平台项目团队联合哈尔滨工业大学(深圳)、深圳市大数据研究院、华为技术有限公司等多方力量,依托昇腾 910C 千卡级国产算力集群,成功完成1.6 万亿参数 DeepSeek-V4-Pro 大模型全参数后训练,成为全球首个第三方机构在国产算力上完成该级别 MoE 架构大模型全参数训练的里程碑事件,标志着国产算力正式突破万亿级大模型训练 “卡脖子” 难题,彻底告别 “只能推理、不能训优” 的被动局面。
长期以来,全参数后训练是超大模型落地的核心壁垒,其难度远超常规推理与微调。1.6 万亿参数的 MoE 架构模型,训练时需调动海量参数协同计算,对集群算力密度、显存调度、跨卡通信稳定性提出极致要求。此前,全球万亿级大模型训练几乎完全依赖海外高端算力,国产算力仅能支撑小规模推理或轻量化微调,全参数深度训练长期处于空白状态,成为制约我国 AI 产业自主可控的关键短板。
本次攻关中,产学研团队针对昇腾 910C 集群特性,攻克三大硬核技术难题,实现从 “能跑” 到 “能训、训稳、训优” 的质变。
- 显存拼图技术:打破单卡显存限制,通过精细化分布式参数拆分,将 1.6 万亿参数精准分配至千卡集群,实现算力资源高效协同,解决超大模型 “装不下” 的核心痛点。
- 智能负载均衡调度:针对 MoE 模型 “专家忙闲不均” 难题,优化动态调度策略,平衡跨卡通信负载,将通信时延压缩至 50 毫秒内,彻底杜绝 “算力堵车”。
- 全链路稳定保障体系:构建 7×24 小时监控与故障自愈机制,实现1500 + 步长稳训练无中断,算力利用率(MFU)超 30%,关键训练算子效率提升 14%,各项指标均达工业级标准。
作为华为自研的旗舰级 AI 芯片,昇腾 910C 凭借 “昇腾 + CANN” 全栈自主生态,成为本次突破的核心底座广东省人民政府国有资产监督管理委员会。其搭载的 “灵衢” 高速互联技术,实现芯片间数据交换速度较传统方案提升 4 倍,千卡集群线性度达 93.12%,性能比肩国际顶尖算力集群,为万亿级模型训练提供坚实算力支撑。
业内专家表示,此次突破具有双重战略意义。一方面,验证了国产算力的全栈能力,证明昇腾 910C 集群可完全承载世界级超大模型训练任务,打破海外算力垄断;另一方面,完善了国产 AI 生态闭环,为后续更大规模、更高性能大模型的自主研发奠定基础,加速我国 AI 产业从 “技术追赶” 向 “生态引领” 跨越。
当前,深圳已建成全国首个万卡级全栈自主可控智算集群,总算力达 14000P,全部采用昇腾 910C 芯片构建,为国产大模型训练提供充沛算力保障广东省人民政府国有资产监督管理委员会。未来,随着国产算力生态持续完善,将有更多万亿级大模型实现 “中国训练、中国落地”,为数字经济高质量发展注入强劲动能。