近日,国际顶级学术期刊《自然》(Nature)在线刊发我国人工智能领域重磅原创成果——由北京智源人工智能研究院主导,联合清华大学、北京大学等国内顶尖高校共同完成的多模态大模型Emu3(悟界)相关研究论文正式上线,纸质版将于2026年2月12日刊发。这是我国科研机构完全主导的大模型研究成果首次登陆《自然》正刊,标志着中国在人工智能基础理论、大模型核心技术领域实现历史性突破,跻身全球AI基础创新第一梯队。
作为全球科学界最具权威性的顶级期刊之一,《自然》对人工智能领域成果的刊发标准极为严苛,尤其重视研究的原创性、突破性与普适性。此次我国自主主导、全程自主研发的大模型成果成功发表,彻底改写了我国大模型领域核心原创成果长期依赖国际顶尖团队的格局,填补了国内科研机构主导大模型成果登顶《自然》正刊的空白,是中国通用人工智能基础研究发展的重要里程碑。
据悉,该论文题为《Multimodal learning with next-token prediction for large multimodal models(通过预测下一个词元进行多模态学习的多模态大模型)》,聚焦当前多模态大模型领域的核心技术痛点,创新性提出纯自回归统一多模态学习框架,攻克了传统多模态模型技术路线碎片化、适配性弱、训练复杂度高的行业难题。此前,全球主流多模态大模型普遍采用“自回归+比对学习”的混合架构,不同模态数据训练逻辑割裂,导致模型兼容性差、泛化能力受限、落地成本高昂,长期制约通用人工智能的规模化发展。
本次研究实现了颠覆性技术创新,首次证明仅依靠“下一个词元预测(NTP)”单一自回归任务,即可高效统一文本、图像等多模态数据的学习与生成,构建出架构极简、性能顶尖的通用多模态大模型Emu3。该创新路线大幅简化了大模型训练架构,降低了模型迭代优化与产业落地的技术门槛,同时显著提升了模型在跨模态理解、内容生成、场景适配等核心任务中的综合性能,为全球多模态大模型的技术迭代提供了全新范式。
相较于传统模型,Emu3大模型具备架构简洁、泛化性强、适配场景广、落地成本低四大核心优势。在多项国际权威通用AI评测中,该模型在图文理解、图像生成、跨模态推理等核心指标上达到国际先进水平,既能精准完成复杂文本交互、精准图像创作,也能实现多模态信息的深度融合与逻辑推理,完美适配智能创作、智能制造、智慧医疗、自动驾驶等多元产业场景,具备极强的科研价值与产业应用潜力。
业内专家表示,此次成果的发表,不仅是单一模型技术的突破,更是我国AI基础研究体系能力的全面跃升。该成果由国内科研团队自主构思、自主攻关、自主验证,核心技术、训练框架、模型算法均实现完全自主可控,摆脱了对国外开源框架与核心技术的依赖,充分彰显了我国在人工智能基础理论、原创算法、大模型工程化领域的硬核实力。
近年来,我国持续深耕人工智能基础研究与核心技术攻关,大力推进通用人工智能产业创新发展,已形成从基础研究、技术研发到产业落地的完整创新生态。北京智源人工智能研究院作为国内AI基础研究的核心力量,长期聚焦大模型底层技术创新,持续开源核心模型与技术体系,累计推出200余款开源模型,为国内AI科研创新与产业升级提供了坚实的技术支撑。
此次大模型成果成功登顶《自然》,不仅验证了我国自主AI技术路线的科学性与先进性,更为全球通用人工智能发展贡献了中国方案、中国智慧。未来,国内科研团队将持续深耕大模型基础研究,聚焦通用人工智能核心瓶颈,持续突破底层算法、架构创新、安全可控等关键核心技术,加速推动人工智能技术与实体经济深度融合,助力我国人工智能产业高质量发展,持续提升中国在全球AI领域的创新话语权与核心竞争力。