首页 /
资讯中心 /
小时级、可交互、会自我生长:新一代世界模型LingBot-World 2.0开源
资讯
小时级、可交互、会自我生长:新一代世界模型LingBot-World 2.0开源
Tidhive
2026-07-09 16:18
47 阅读
今年夏天,一部几乎没有台词、没有明星、全靠一个封闭空间撑起悬念的电影《后室》成了现象级话题。发霉的地毯、嗡嗡作响的日光灯、令人不安的黄色墙纸,构成了一条看不到尽头的走廊——这种"永远走不出去"的空间感,成了无数人讨论的焦点。
几乎在同一时间,一支技术团队做了一件更有意思的事:他们用AI把这样一个走不到头的空间"实时生成"了出来,还能让人亲自走进去探索。上传一张图片,AI就能把图中的场景变成一个可以自由行走的世界,全过程只需要几十秒。
实现这一切的,是刚刚正式开源的新一代实时交互世界模型——LingBot-World 2.0。发布后迅速登上了Reddit热榜,在开发者和创作者群体中引发了不小的讨论。
从"生成一段视频"到"运行一个世界"
以往的视频世界模型有一个公认的老大难问题:长时漂移。只要生成时间一拉长,画面里的物体就会开始变形、细节逐渐崩坏、场景结构说散就散——刚建好的一栋房子,镜头转一圈回来可能就变成了废墟。一个连"记性"都没有的模型,很难称得上在构建一个真正的世界。
LingBot-World的上一代版本已经把连续无损生成的时长做到了接近十分钟,这次的2.0则直接把时间单位换成了"小时级"——支持长时间连续生成,且画面质量在长时间运行后没有明显衰减。团队给出的验证案例相当硬核:连续运行超过一小时,跨越二十个风格迥异的场景,从竹林、运河一直到月宫、地球之窗,全程画质保持稳定。
这种稳定性不只是体现在时间轴上,也体现在空间的"锚定"能力上。在神庙场景里来回环顾,光线随视角自然变化,建筑结构不会出现常见的扭曲;骑马穿越开放世界时,脚下的地面在实时演算,但远处的天际线和地标始终保持一致,不会因为镜头转动而"漂移走位"。
720p/60fps,跨过"能玩"的门槛
如果说时长决定了一个世界能撑多久,那么帧率和延迟决定的就是这个世界"好不好玩"。一个真正可交互的世界模型,必须能对操作做出即时反馈,稍微慢半拍体验就会被打断。
LingBot-World 2.0在720p分辨率下实现了稳定的60fps输出,转身、加速、急停等操作几乎感觉不到延迟。即便是在"沙漠滑沙"这类高速移动场景,或是同时渲染怪兽逃生、火山喷发、陨石坠落等多重动态特效叠加的复杂画面,系统依然能保持流畅的实时演算。
交互能力大幅扩容:不止是移动,还能"改写"世界
上一代版本里,用户能做的交互基本停留在移动和转视角,也就是简单的方向控制加鼠标。2.0版本把动作库大幅扩展,加入了攻击、施法、射击等更复杂的交互类型。
比如生成一个雾气弥漫的城市街头,配上一名戴尖顶帽、穿长风衣的巫师角色,按下不同的"攻击"指令,角色就会做出对应的施法动作,配合视觉特效呈现出连贯的战斗反馈。在第一人称射击类场景中,系统会根据交战距离和情境,动态判断该呈现近战还是远程攻击的画面效果。
更值得关注的是文本驱动的事件注入能力——用户可以直接打字来改变世界的走向。比如角色走进一个山洞时,输入"突然出现一群蝙蝠",画面里就会实时生成蝙蝠群并与角色产生物理互动;输入"变成冰窟",岩洞就会在几秒内冻结成冰晶世界。
在构建初始场景时,还可以同步定义交互规则,比如把"翅膀闪耀""风暴袭来""急速侧转"等具体事件绑定到不同按键上,相当于在创造世界的同时,也把这个世界的"物理规则"和"操作手册"一并写好了。
内置Agent系统:世界不再需要人一直"喂"
过去几乎所有实时世界模型都有一个共同的隐藏设定——世界是被动的,一旦没有外部输入,画面就会像被按下暂停键一样停滞不动。
LingBot-World 2.0引入了一套名为Agentic Harness的机制,让世界第一次具备了自主演化的能力:即便用户不做任何操作,天气会变化,角色会自己行动,新的事件也会主动发生。团队展示的一个例子是:仅仅上传一张静止的油画,系统就会自动"续写"出画中的场景——服务员端上咖啡,街道上开始出现行人和车辆,一幅静态画作逐渐变成一个有生命力的场景。
这套系统的核心是"大脑—小脑"式的双Agent协同架构:
Pilot Agent 负责规划和执行角色的具体行为;
Director Agent 则像一位隐形导演,实时观察场景状态,主动生成并注入新的事件与环境变化。
一个视觉语言模型(VLM)承担"大脑"角色,负责语义层面的判断和因果推理;底层的视频生成模型(DiT)则作为"小脑",把这些决策转化为符合物理直觉的连贯画面。两者配合,让整个系统从单纯的"逐帧预测"变成了一个具备自我维持、目标驱动特征的动态世界。
用户与这个世界的交互也因此分成了两种模式:一种是直接的语义交互,做出动作后由系统判断合理的后果;另一种是借助分割追踪技术实现的物体级交互,可以选中场景中的具体物体单独下达指令,系统会持续追踪并保持空间一致性。
技术架构:因果性是核心设计原则
团队随模型一同发布的技术报告中,开篇引用了休谟在《人性论》中的观点——原因必先于结果。这句话被直接写进了模型架构:世界模拟被形式化为一个沿时间轴推进的因果生成过程,每一个状态只依赖历史上下文和当前输入,不能"偷看"未来。
具体训练分为两个阶段:
第一阶段(教师模型):训练一个能长时间稳定运行、且可被精确控制的因果世界模型。为了解决长序列生成中的漂移问题,团队设计了一种混合双向与自回归特性的注意力掩码机制,在保证因果性的前提下补充一定的全局视野,用来抑制长序列生成中的过拟合和画质塌陷。
第二阶段(学生模型):由于教师模型运算量大、无法满足实时性要求,团队通过一致性蒸馏大幅压缩去噪步数,并结合分布匹配蒸馏技术提升画质、进一步压制漂移问题,最终实现720p/60fps的实时交互生成。
开源版本与获取方式
此次LingBot-World 2.0一次性提供了两个版本:
14B主模型:面向最高画质与最复杂交互场景的研究与应用;
1.3B轻量模型:面向普及推广,单张消费级显卡即可部署运行。
此外,团队还开发了支持多人同时进入同一世界的接口,模型权重、代码与在线体验入口均已随论文一并公开。
写在最后
从"生成一段视频"到"运行一个持续演化的世界",LingBot-World 2.0代表的不只是画质和帧率上的提升,更是交互范式的转变——世界不再需要被逐帧预先写好剧本,而是可以在用户与AI的双向反馈中自我生长。
对游戏和内容创作而言,这意味着开放世界的构建方式可能发生根本变化:过去需要团队一砖一瓦搭建的地图和剧情,如今可以让世界自己生长,玩家走到哪,故事就演化到哪。而对机器人训练、自动驾驶等需要大量试错场景的领域来说,一个高保真、低成本、可无限复现极端情况的"数字练习场",也提供了新的可能性。
一个不停机的AI世界,正式开服了。