具身智能热度持续走高,VLA(视觉‑语言‑动作)模型、世界模型成为行业高频热点,不少观点期待人形机器人快速复刻大语言模型的爆发拐点。复旦大学深度学习实验室主任、未来信息创新学院教授陈涛在接受专访时警示,行业当前过度聚焦数据层面迭代,但底层模型架构短板尚未解决,两年之内很难迎来具身智能的 “GPT 时刻”。
作为横跨学术研究与产业落地的研究者,陈涛同时担任具身智能企业眸深智能联合创始人,拥有海外科研机构与产业研发经历。在他看来,当前主流 VLA 训练范式存在明显缺陷:训练素材大多为机器人成功执行轨迹,极度匮乏失败样本,一旦机器人在真实物理环境动作出现偏差,很难自主纠错,无法像人类一样从失败交互中迭代经验,直接限制机器人在非预设场景的泛化能力。
“语言模型架构天然适配文本世界,但未必适配物理世界,这个前提本身并不成立。” 陈涛提出核心质疑。当下大量具身模型直接沿用大语言模型基座做改造,行业资源集中投入数据采集与 VLA 调优,却没有直面物理交互所需要的原生底层架构设计,仅仅在现有语言模型框架上做叠加,难以真正解决物理空间感知、实时动作控制、动态环境适配等硬核难题。
谈及火热的世界模型赛道,陈涛表示,完整对物理世界做全量建模,会带来海量的数据、算力与成本开销,技术门槛极高,并非普通企业能够承担。不应一味追求 “全知全能” 的世界模型,更应当聚焦机器人本体动作、环境交互的真实需求,探索适配机器人的原生具身大脑架构。
针对产业现状,他也点出现实痛点:目前大量机器人演示属于场景定制化展示,真正能够在工厂稳定持续作业的具身机器人占比不足 10%,泛化能力、成本、作业节拍协同仍是落地三大拦路虎,很多设备完成演示拍摄后便撤出产线,并未实现规模化实用运转。
在他的判断中,具身智能想要抵达类似 GPT 的质变拐点,不能单纯复制大模型的缩放路线,必须跳出语言模型思维,从物理交互第一性原理出发重构底层架构,补齐失败交互数据闭环,实现端侧实时持续学习,才能推动机器人从演示走向大规模真实落地。行业需要理性看待发展周期,不宜对短期爆发抱有过高预期。