任丘市奥力斯涂料厂
澄迈pvc排水管专用胶水 刚刚,李飞飞掀桌!全球个多模态世界模型发布,几张照片省掉几百个机位
产品中心
产品中心

澄迈pvc排水管专用胶水 刚刚,李飞飞掀桌!全球个多模态世界模型发布,几张照片省掉几百个机位

泡沫板橡塑板专用胶

前脚友商还在为你追我赶生成几秒钟的「电子榨菜」卷到头秃;后脚李飞飞创办的 World Labs 微微笑,把桌子掀了——

就在刚刚,全球个多模态世界模型 Atlas 正式登场!

▲官博客� � https://www.worldlabs.ai/blog/atlas

按照官定义,Atlas 是款面向空间智能的 omni world model,从开始完成预训练,可以原生处理文本、图像、、相机位姿与 3D 度信息,并在同套模型中完成世界生成、空间重建和时空模拟。

先来看直观的炸场操作:

Camera Controlled Generation(相机控制生成)。

以前大玩生成模型,多少有点玄学抽。我们在 Prompt 框里卑微敲下:「镜头缓慢向左拉升、绕着人物微仰角旋转」,回车之后全凭老天。

对比之下,Atlas 的做法是:直接把「相机位姿参数」当作底层原生输入。

你要什么角度、什么轨迹、走多快?

直接给坐标!

只要丢进去 1 到 6 张普通照片,定好运镜轨迹,Atlas 就能生成长达 1 分钟、1440p 分辨率 的大片。

画面不崩,空间几何丝滑致,堪称外挂运镜。

夸张的是它的空间「脑补力」澄迈pvc排水管专用胶水。

输入张只拍到机器人正面的照片?Atlas 能把人背影完完整整脑补出来;

给张泳池边角照?它靠着脑子里的「世界常识」,默默帮你把隔壁没拍到的草坪和远山给修好了。

从官放出的 Demo 来看,Atlas 在镜头运动和空间致上确实比普通生成模型进大步。

不过,镜头旦进入原图没有拍到的区域,Atlas 实际上仍然需要依赖模型先验去猜,视角跨度越大、生成路径越长,局部几何漂移、物体形状变化和纹理闪烁也越容易暴露出来。

换句话说,它生成的像是个视觉上理的三维世界,未就是原来那个世界的精确数字复刻。

而种种操作的背后,也绕不开个名为 Spatial Context(空间上下文)的行业术语。

大语言模型看上文接下文,Atlas 则是给每张图片绑死三维坐标和度,在脑子里搭出个带轴网的房间。

说得直白点,Atlas 很多能力的底层,其实都绕不开多视角成。

它会把来自不同角度、不同机位的图片和,起塞进同个三维空间里,先判断它们彼此之间的相对位置,再补足没拍到的区域,继续生成新的视角。

单张图输入时,它多依赖模型先验去「脑补」世界;输入视角旦变多,它就像是在做次带空间约束的多视角融,把散画面慢慢拼成个连续、可漫游的三维场景。

甚至你随便抓两张八竿子不着的照片往空间里扔,Atlas 都能强行给你脑补出走廊、大门和房间,把俩场景缝焊在起。

演系同学看到这里,战术沉默,缓缓出个问号:着以后运镜不用实拍,直接在电脑里「云开机」就完事了?

除此之外,Atlas 还有二张:Spatial Reconstruction(空间重建)。

传统的 3D 斯泼溅(3D GS)或者点云扫描澄迈pvc排水管专用胶水,得扛着业设备围着目标转几十圈,拍几百上千张照片,费钱又费腿。

但 Atlas 再次露出秘的微笑:边去,哪来这么多的规矩。

官直接甩出了个斯坦福大学 Main Quad 案例,只需把 2 到 25 张游客视角的地面平拍照片塞进去,就能轻松草坪、拱廊以及纪念教堂外墙的全部细节。

镜头随后直接拔地而起,来了段上帝视角航拍的漫游。

在 DTU、ETH3D、ScanNet 等堆公开数据集上,门测稀疏视角重建误差(AbsRel × 10 ⁻ ³):Atlas 拿下了 25.3 的分数(分数越低越好)。

对比之下,Pi3X 是 28.7,Depth Anything 3 飙到 39.3,MapAnything 是达 47.7。

而且输出直接对接点云和 3D Gaussian Splatting,能缝接进 World Labs 自的 Marble 平台,帧率即时渲染。

的还有「子弹时间」式的 Reframing Video。

不用好莱坞几百台相机的环形阵列,研究员拿三五个普通手机、运动相机随手架,塞进背包带走;

拍段日常闹,Atlas 就能在虚拟空间里随意切换视角,原地复刻《黑客帝国》。

当然,李飞飞和她旗下的公司 World Labs 折腾这大出,终目标肯定不是为了跟好莱坞特饭碗。她的星辰大海,pvc管道管件胶是这代 AI 大的痛点:

具身智能与机器人。

现在搞机器人训练的朋友都知道,具身智能的大痛点其实就是「虚拟训练场不够用」。

让机器人真的去工厂、仓库和庭里反复试错,数据采集速度慢,成本也;换到仿真环境里训练澄迈pvc排水管专用胶水,又得先花大量人力搭建 3D 场景、材质、光照和物体。

业内甚至有种估,如果依靠传统式收集足够规模的机器人训练数据,终成本可能达到 100 万亿美元的量。

Atlas 给出的 Real to Sim 路线,相当于直接省掉了中间大量人工搭建仿真世界的工作。

拿手机拍两段 24 帧的工厂或房间,喂给模型;Atlas 原地吐出个精度的 3D 物理空间,机器人就可以钻进这个孪生空间里狂「跑图」试错。

甚至机器人走到哪,Atlas 就当场渲染出机载摄像头应该看到的 RGB 图和度图。

机械臂碰下刚箱子、拉下铰链柜门、捏下软体海绵,Atlas 统统能模拟出受力反馈。

只要录段真实现场,就能衍生出千万种光照、摆放和障碍物条件。

技术底座上,World Labs 这次掏出了套其硬核的组拳:

Multimodal Autoregressive Diffusion Transformer,多模态自回归扩散 Transformer。

拆开来看,它兼采了当前两大主流范式的长处:

Multimodal:原生融通文本、二维图像、相机位姿与 3D 度;

Autoregressive(自回归):像语言模型预测下个词样,在时空序列中逐预测新的空间状态;

Diffusion(扩散机制):基于 Rectified Flow 逐步去噪,确保连续维信号的画质与几何精度;

Transformer:以成熟的矩阵乘法结构为底座,缝适配现有大规模力集群。

这套架构让 Atlas 能够同时享受到 LLM 域的 KV Cache、分布式理优化,以及扩散模型的采样蒸馏与先验引。

在针对镜头运动控制的真人 Blind Test(盲测)里,战况简直是场单面的骑脸输出:

面对 MiniMax H3,Atlas 胜率 75;面对 Gemini Omni Flash,胜率 81;面对 FLUX 3,胜率直接冲上 93;面对 Seedance 2.5,胜率达到凶残的 94!

除了世界生成和空间重建,Atlas 还顺带具备了不错的图像生成能力。虽然这不是它的主攻向,但复杂 Prompt、文字渲染,以及写实、电影感、油画、漫画等多种风格,它都能处理。

有意思的是,Atlas 还能直接根据文字或图片生成 360 ° 全景图。相比普通文生图只要保证个固定画面成立,360 ° 场景还要处理前后左右的空间连续,对模型的空间理解要求。

值得提的是,除了能,World Labs 在 Atlas 身上强调的另个关键词是 Scaling。

官博客提到,随着参数量和计力成倍上翻,模型展现出了类似大语言模型那种「突然开窍」的涌现能力。

Scaling 依然是版本答案。

目前 Atlas 已经向部分作伙伴开放 Early Access,并将在未来成为 Marble 和 World Labs 其他产品的底层模型。

回过头看,从二十年前奠基计机视觉的 ImageNet,到斯坦福实验室十年来耕「视觉+机器人学习」,再到创办 World Labs,李飞飞本质上是死磕同条轨道。

ImageNet 解决的是「让机器在像素中识别世界」,而她越来越关心的,是个难的问题:机器看见张图之后,究竟有没有理解背后的三维空间,以及下秒会发生什么?

李飞飞曾把今天的大语言模型形容为「黑暗里的文字手」,能谈论现实,却缺少真正生活在现实中的经验。

个模型可以解释杯子为什么会从桌上掉下来,但机器人真要伸手拿杯子,还得知道杯子离桌边多远、手从哪个向过去,以及碰到它以后整个场景会发生什么变化。

Atlas 所代表的空间智能,某种程度上就是给已经十分发达的语言智能继续加上层关于几何、物理、时间和行动的世界经验。

LLM 把互联网里的知识交给了机器,世界模型接下来争夺的,则可能是机器从数字世界走向现实世界的那张真实的入场券。相关词条:玻璃棉     塑料挤出机厂家     钢绞线    管道保温    PVC管道管件粘结胶

奥力斯    万能胶厂家    联系人:王经理    手机:18231788377(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。