6 月 3 日,京东正式对外开源自研JoyAI-Echo 长音视频生成全链路框架,项目代码、预训练权重同步上线 GitHub 开源仓库与官方项目主页,面向全球开发者、内容创作者免费开放二次开发权限。不同于行业多数产品快速上线变现的思路,京东明确该项目技术研发优先、商业落地后置,先通过开源共建打磨长视频生成底层技术底座,再循序渐进探索产业商业化路径,标志京东正式跻身全球长视频生成技术第一梯队。
当前 AI 生成领域短视频技术日趋成熟,但分钟级长音视频始终受制于角色形象跳变、音色错乱、生成效率低下三大行业痛点,大量长视频模型难以落地工业化内容生产。JoyAI-Echo 瞄准行业核心瓶颈落地四项关键技术创新,系统性破解长视频生成顽疾:
其一,首创跨模态音视频记忆库,持续留存角色外貌、声纹特征,实现最长 5 分钟多镜头成片中人物形象、音色全程统一,杜绝跨镜头角色 “变脸” 问题,攻克长时序内容一致性行业难题;
其二,依托记忆驱动后训练 + DMD 分布匹配蒸馏技术,在保障画质前提下实现推理速度提升 7.5 倍,大幅压缩长视频生成耗时,解决算力成本高、出片慢痛点;
其三,搭载 Director Agent 智能导演助理,依托自然语言交互实现边聊边改,用户仅需修改局部镜头指令,系统精准重绘对应片段,无需整段视频重新生成,革新视频从静态一次性制作转向动态交互式创作模式;
其四,配置轻量化实时超分模块,支持两档高清分辨率智能拉升,兼顾成片清晰度与实时渲染稳定性。
官方实测数据显示,依托自建百套故事、3000 + 镜头专业评测数据集验证,JoyAI-Echo 语音内容准确率达0.8646;用户盲测调研中,81.7% 受访者认可其音频质量、80.6% 认可提示词遵循精准度、63.6% 优选画面美学表现,多项核心指标领跑同类开源模型。
在商业化规划层面,京东确立技术定位前置、商业落地延后的发展策略:现阶段不推出付费 SaaS 产品、不急于落地营收模式,以全开源模式聚拢全球开发者生态,开放底层框架能力,推动数字人直播、品牌短视频量产、动漫短片制作、教育互动课件、游戏剧情内容等多元场景的技术验证与生态共创。
据京东 AI 研发团队介绍,JoyAI-Echo 是京东 JoyAI 开源体系继大模型 JoyAI-LLM Flash、图像编辑模型后的又一重磅成果,延续京东 “AI 基建开源、产业生态共建” 技术路线,依托自身零售、供应链产业资源沉淀,后续将基于开源社区反馈迭代优化技术,待底层技术成熟、行业应用场景标准化后,再分步推进 B 端商业化落地。
行业分析人士表示,AI 长视频赛道正告别野蛮量产变现阶段,算力成本高企、落地门槛偏高已成行业共识,京东 “先开源筑技术底座、后稳步商业化” 的模式,既规避盲目商业化带来的产品粗制问题,也能借助社区迭代完善技术,为国内长音视频生成产业提供可持续发展范本。
结尾
目前 JoyAI-Echo 项目 GitHub 开源链接、官方项目页已全面对外开放,开发者可自由下载源码、权重进行微调、二次开发与场景落地测试。