中国政策档案 Governance Archive HOLDINGS 235,224 · FONDS 122
Record · qbitai ACC. 900072576

World's First Embodied-Specific MoE Video Model Open-Sourced

刚刚,全球首个具身专属的MoE视频模型,开源了!

Issuer
Date
2026-07-09
Instrument
other
Cited by
0
Ant Group's Lingbo (蚂蚁灵波) has open-sourced LingBot-Video, the world's first large-scale MoE video foundation model designed specifically for embodied intelligence. The model features 30 billion parameters (3 billion activated) and has been trained on over 70,000 hours of embodied-related video data to generate physically realistic scenes for training robots.
Full text · 原文 4,616 字
金磊 发自 凹非寺<br> 量子位 | 公众号 QbitAI<br> 终于,专属具身智能的视频模型来了!<br> 话不多说,直接来看生成的效果:<br> 视频地址:<br> https://mp.weixin.qq.com/s/shwkij9ul5GpCBfNYMxU7Q<br> 这就是蚂蚁灵波刚刚正式开源的LingBot-Video——<br> 全球首个面向具身智能的大规模MoE视频基础模型、视频物理引擎。<br> 或许有小伙伴要问了,像刚才视频里的机器人切西红柿、吸床单和收纳口红,目前很多视频生成的AI不也能搞出来吗?<br> 确实。<br> 但既然说了LingBot-Video是具身版的专属视频模型,那说明它从架构、数据到训练目标全链路都是为机器人、人形智能体量身打造的。<br> 而且其它视频生成AI的关注点,更多的是时长、美学、画质、运镜等等。<br> 但到了LingBot-Video这里,重中之重,变成了是否符合物理规律。<br> 除此之外 ,LingBot-Video的亮点还包括:<br> 架构上采用MoE,让模型容量和推理成本更好平衡;<br> 30B参数,推理时仅激活3B;<br> 数据上引入超70000小时具身相关视频,让模型学习机器人操作、导航、第一视角等场景;<br> 训练上加入多维奖励系统,把物理合理性、任务完成度纳入优化目标。<br> 已在RBench上超越业内通用视频生成标杆模型。<br> LingBot-Video一经开源,同样也是引发了网友们不小的热议,他们直呼:<br> 它的功能远不止于生成视频,如此大规模的训练,让模型对现实世界中的互动有了更深刻的理解。<br> 为什么机器人需要自己的视频模型?<br> 对于这个问题,答案其实蛮现实且刚需的。<br> 通用视频模型的训练目标,主要围绕视觉质量、语义对齐、运动连贯展开。人看视频时,也更容易被画质、光影、构图、风格打动。<br> 但机器人看世界的方式却截然不同。<br> 它不只是看见一个杯子,还要判断自己伸手过去以后,杯子会怎么动;看见一条路,还要判断从这里走过去,会不会撞到障碍……<br> 所以,我们可以认为内容视频和具身视频其实是两套评价体系。<br> △图片由AI生成<br> 通用模型里偶尔出现的穿模、物体凭空消失、动作违背惯性,对短视频创作来说可能只是瑕疵。观众看一眼,最多吐槽一句“AI味有点重”。<br> 但如果把这些错误视频拿去训练机器人,那问题可就大了。<br> 因为这就相当于在教机器人一套错误的世界规律,它们会误认为手可以穿过物体、杯子可以无缘无故复原、液体可以悬在空中……<br> 所以LingBot-Video生成的视频,就是要让机器人的大脑学会真真实实的物理规律。<br> 例如下面这三组生成的工业场景的视频:<br> 视频地址:<br> https://mp.weixin.qq.com/s/shwkij9ul5GpCBfNYMxU7Q<br> 视频中,机械臂在产线上对零件进行抓取、放置、定位,有的还涉及焊接、加工这样的动作。但重点在于末端执行器、工件、工作台之间的相对关系能不能在连续帧里保持稳定。<br> 这对应的正是机器人真正需要学习的能力,包括看懂物体,靠近物体,作用于物体,然后预测物体状态的变化。<br> 再如更复杂的动态场景:<br> 视频地址:<br> https://mp.weixin.qq.com/s/shwkij9ul5GpCBfNYMxU7Q<br> 一个是第一视角滑雪镜头,从雪坡向前冲下,雪雾、坡面、身体姿态都在快速变化;另一个画面里,人形机器人则在雪道上和滑雪者并行绕旗门前进。<br> 这类场景考验的,便是机器人对于空间的理解、运动的预测和动态环境的建模等能力。<br> 还有机器人打排球、踢足球:<br> 视频地址:<br> https://mp.weixin.qq.com/s/shwkij9ul5GpCBfNYMxU7Q<br> 排球场上,机器人起跳、挥臂、击球,球沿着空中轨迹飞出;足球场上,机器人完成摆腿、触球、射门,球和身体动作之间有明确对应关系。<br> 这就有点接近我们人类期待的具身智能所拥有的灵活的运动能力。<br> (LingBot-Video完整能力视频如下)<br> 视频地址:<br> https://mp.weixin.qq.com/s/shwkij9ul5GpCBfNYMxU7Q<br> 在看完效果之后,那么接下来的问题就是:<br> LingBot-Video是怎么做到的?<br> 30B的大脑,仅3B出手<br> 要让视频模型更懂机器人,第一步是架构。<br> 从此次团队发布的技术报告来看,较为吸睛一点便是引入了MoE架构。<br> 为啥要这么做?打个比方。<br> 传统Dense模型更像一个大办公室,每来一个任务,所有人都要一起上场。好处是稳,坏处是贵。模型越大,每次调用成本越高。<br> 而MoE则像一个大型专家库,任务来了,不用所有专家都出手,只叫最相关的一组专家来处理。<br> LingBot-Video的体量共计30B参数,但正因引入了MoE,单次生成大约激活3B参数参与计算。<br> 由此,不仅计算成本变得更低,扩展方式也从直接堆参数变成了按需激活。<br> 毕竟机器人训练、策略评估、动作规划,天然需要大量模拟和试错,若每次生成视频都要激活全部参数,那成本自然贵得离谱,那这个视频物理引擎也就很难真正被用起来。<br> 更具体来说,视频要模拟连续物理世界,需要处理复杂运动轨迹、三维空间一致性、材质纹理等复杂分布;稀疏MoE可以在固定计算预算下扩大参数容量,把总参数规模和每个Token实际激活的计算量解耦。<br> 从实验结果来看,MoE30B-A3B在1M Token长度下,对比Dense6B、Dense 14B、Dense 30B的速度比分别达到1.50×、2.59×和3.18×;同时,稀疏框架还能保持接近3B规模模型的推理效率。<br> 除了架构之外,LingBot-Video另一大技术亮点,便在于它的数据。<br> 大语言模型为什么能起来?一个很重要的原因是,互联网天然积累了海量文本。<br> 但机器人并没有属于自己的互联网,网上不存在几十亿小时的机器人动作数据。<br> 真实机器人数据要靠遥操作、真实设备、真实场地一点点采集,不仅成本高、速度还慢;当然,仿真数据也是一条路,不过仿真器里学会的东西,到了真实世界常常会遇到sim-to-real gap。<br> 而LingBot-Video选择的是第三条路,即把通用互联网视频和具身数据结合起来。<br> 从发布的技术报告来看,模型引入了超过70000小时的embodiment-oriented footage,覆盖机器人操作VLA、导航、第一视角视频,还包括真实机器人、仿真、开源、第三人称视角,以及人形机器人、四足机器人等平台。<br> 这些数据不是简单拼接进去的,而是在训练流程的专门阶段里,针对稀缺但高价值的具身数据做了刻意的“少筛选、多保留”,防止被海量的普通互联网视频稀释掉。<br> 所有素材都会经过五维结构化标注,精准标记物体、材质、动作时间戳、受力交互关系;同时采用课程式五阶段渐进训练,从低清静态图像打底,逐步过渡到高清长时序视频,循序渐进让模型掌握复杂物理交互逻辑。<br> 针对机械操作、精密抓取这类长尾场景,团队还通过分布感知采样做加权强化,补齐小众工业、家用机器人场景生成能力。<br> 最后,还要一个强化学习环节。<br> 传统视频模型仅用画面美观度、文本匹配度做优化目标,不太不约束物理逻辑。而LingBot-Video搭建一套分层强化学习奖励体系,从感知、物理、执行三个维度同步约束生成结果:<br> 感知维度:保障画面清晰度、文字描述匹配度、动态流畅度;<br> 物理维度:模型核心优化指标,校验物体不穿透、无凭空消失、运动符合重力惯性、材质受力形变合理;<br> 执行维度:校验机器人肢体结构完整、动作流程可落地、任务目标完整完成。<br> 训练采用GRPO组相对策略优化方案,搭配负感知微调规避奖励黑客问题。同时原生支持Action-to-Video动作条件生成,输入机器人动作指令,就能直接输出后续完整视觉变化,可直接对接机器人运动规划模块。<br> 另外模型还配套级联精炼方案,先生成480p基础时序画面保证运动逻辑,再精炼至1080p高清画质,如此一来,便可平衡推理速度与画面细节。<br> 在评测过程中,LingBot-Video被拿来和NVIDIACosmos3、LongCat-Video、LTX-2.3等开源模型比较。<br> 结果显示,在TI2V任务上,LingBot-Video在开源竞品中达到SOTA水平,并在general quality和embodied domain两项得分中位居第一;在T2V任务上,虽然general quality排名第二,但embodied domain得分仍超过Cosmos等竞争基线。<br> 除此之外,LingBot-Video已在RBench上超越业内通用视频生成标杆模型。<br> 视频模型的终点,是机器人大脑的起点<br> 在看完效果和评测结果之后,其实我们可以清晰看到一个新的信号:<br> LingBot-Video开源这件事,更像是在视频生成赛道里,把另一条路线摆到了台面上。<br> 因为若是我们把视频模型看作世界模型,它的价值就会变成给机器人提供一个低成本、可反复试错的物理世界模拟器。<br> 再细分其价值,我们大致可以划分为三层。<br> 第一层,是Data Engine。<br> 机器人真实数据太贵,采集太慢。如果视频物理引擎能生成足够可信的动作过程和场景变化,就有机会为机器人训练提供更多低成本数据。<br> 第二层,是Policy Evaluator。<br> 真实世界试错很危险,尤其是工业机械臂、人形机器人、四足机器人这些系统。视频模型可以在虚拟视觉环境里先跑一遍策略,提前观察可能结果,降低真实测试风险。<br> 第三层,是Action Planner。<br> 机器人面对真实场景时,可以借助模型预测“执行这个动作后会发生什么”,再辅助决策规划与异常预判。技术报告也明确把LingBot-Video定位为面向机器人社区的Data Engine、Policy Evaluator和Action Planner。<br> 由此,LingBot-Video和其它普通视频生成模型的区别便一目了然了。<br> 这也是为什么视频模型正在从内容创作赛道,外溢到世界模型和具身智能赛道。<br> 李飞飞创办的World Labs押注空间智能,试图让AI理解、生成并交互3D世界;LeCun团队的V-JEPA 2则直接从视频自监督学习切入,探索让模型理解、预测并规划物理世界……已然是具身智能下一阶段的兵家必争。<br> 不过在具身智能专属视频生成模型这件事上,长时序一致性、柔性物体和液体等复杂物理交互、视频预测能力向真实机器人闭环的转化,以及具身视频模型评测标准建设,都还在演进中。<br> 但LingBot-Video至少证明了一件事,那就是视频模型正在从内容生产工具,往物理世界模拟器推进。<br> 也许再往后看,视频生成的尽头,还真不一定是电影。<br> 它也可能是下一代机器人大脑的起点。<br> GitHub:https://github.com/robbyant/lingbot-video<br> Tech Report:https://arxiv.org/pdf/2607.07675<br> Project Page:https://technology.robbyant.com/lingbot-video<br> HuggingFace:https://huggingface.co/collections/robbyant/lingbot-video<br> Model Scope:https://www.modelscope.cn/collections/Robbyant/LingBot-Video