fantasy001
V2EX  ›  人工智能

最近世界模型好像突然多起来了

By fantasy001 at 24 天前 · 1091 次点击

最近 World Model 这个方向好像一下子热起来了,前两天看了下 World Labs 的 Atlas 和 Runway 的 Solaris ,感觉两家的思路还挺不一样。

Atlas 是 World Labs 9 月 1 日刚发布的 omni world model ,主要做 Spatial Intelligence 。它比较有意思的一点是,不只是单纯的视频生成模型,而是把 text 、image 、video 、camera pose 、depth 等信息放到同一个 3D spatial context 里处理。

所以它既可以做 camera-controlled video ,也能做 3D reconstruction 和空间模拟。比如输入几张图片后,可以重建场景,然后指定新的相机位置和运动轨迹去生成画面。官方目前展示的视频最高能到 1440p 、1 分钟左右,还可以输出 point cloud 、Gaussian splat 之类的 3D 数据。

我找资料的时候看到有个页面把 Atlas 的几个能力整理得比较直观: https://worldmodelatlas.org/

另外一个是 Runway 最近发布的 Solaris 。

Solaris 的方向更特别,Runway 把它定义成 Interface World Model 。传统网页或者 App ,本质上还是开发者提前写好页面、组件和交互逻辑,用户点击之后切换到预先设计好的状态。

Solaris 想做的是另一件事:界面本身由模型实时生成。用户点击、拖拽或者输入以后,模型直接根据当前画面和操作生成下一帧 UI ,而不是调用一个提前写好的页面。

所以它更像是在尝试“生成软件”而不是单纯生成图片或者视频。如果以后延迟、稳定性和成本能解决,感觉 UI 的形态可能真的会发生比较大的变化。

这边有个页面整理了一些 Solaris 的 Demo 和原理: https://runwaysolaris.com/

两个放一起看还挺有意思。Atlas 更偏真实世界、3D 空间和物理环境,Solaris 则是把 World Model 的思路用到了数字界面。

感觉现在大家说的 World Model ,已经不只是“生成一个可探索的 3D 世界”这么简单了。

1 条回复  •  2026-09-04 15:23:23 +08:00
MerenguesGeek
   1
MerenguesGeek  
   23 天前
也不是最近多起来的吧,去年就有很多 Neo Labs 押世界模型了
© 2026 V2EX · 33ms · 3.9.8.5