
这项由韩国科学技术院(KAIST)人工智能学院联Holiday Robotics公司共同完成的研究,于2026年7月以预印本形式发布,论文编号为arXiv:2607.11498。感兴趣的读者可以通过这个编号在arXiv平台上查阅完整论文。
**、从个让机器人困惑的难题说起**
假设你蒙着眼睛,有人用手机从不同角度拍了张桌上杯子的照片发给你,然后问你:杯子在你面前哪个向、距离多远、你的手应该伸向哪里去拿它?
这对你来说几乎不可能完成。照片告诉你杯子长什么样,却没有告诉你它在你身体坐标系里的确切位置。而现代机器人每天面对的,正是类似的困境。
目前的机器人控制系统,学名叫做"视觉-语言-动作模型"(Vision-Language-Action Model,简称VLA)。你可以把它理解成机器人的大脑,它同时读取摄像头看到的画面和人类发出的语言指令,然后决定机器人的手臂下步应该怎么动。然而,这类大脑存在个根本的矛盾:机器人的手臂是在以自身为中心的三维坐标系里运动的,但大脑看到的画面却来自摄像头——而摄像头通常被安装在旁边的架子上或机器人手腕处,它看世界的角度和机器人自身的角度不同。
这就好比,你坐在驾驶席上,要靠旁边驾驶座位上的摄像头画面来判断向盘应该往哪边。当摄像头固定不动时,你虽然视角别扭,但至少每次看到的画面和向盘动作之间的对应关系是固定的,记住了就行。但如果每次开车,摄像头都被放在不同位置——有时在后排,有时在车顶,有时在引擎盖上——那你就需要每次都重新摸索画面和向盘之间的关系,其困难。
现代机器人训练数据面临的,正是这种"摄像头位置各不相同"的困境。为了训练个通用的机器人,研究者们会收集来自世界各地不同机构的操作演示数据,而这些数据是用不同位置、不同角度的摄像头拍摄的。于是机器人大脑面临个其繁重的学习任务:不仅要学会如何完成任务,还要同时学会"从这个摄像头角度看到这个画面,对应的动作应该是什么;从那个摄像头角度看到相似画面,对应的动作又是什么"。
KAIST的研究团队提出了种简洁而有的解决案,他们称之为"机器人视角点图"(robot-centric pointmap)。核心思路是:既然机器人的手臂是在以自身为中心的坐标系里运动的,那何不干脆把摄像头看到的世界,也转换到这个坐标系里再喂给大脑?这样来,不管摄像头放在哪里,机器人大脑看到的都是"以我自身为中心,目标物体在我的前0.4米、左0.1米、上0.3米"这样直接明了的信息,而不是"从某个角度的摄像头画面里,那个东西在画面的左上角某个位置"这样需要大量转换的间接信息。
**二、点图究竟是什么,它和普通照片有什么不同**
要理解点图,可以从普通照片和度图说起。
普通RGB照片,就是我们手机拍出来的那种彩图片,每个像素记录的是颜信息:红多少、绿多少、蓝多少。它告诉你每个位置"看起来像什么",但不告诉你那个位置的东西"距离你有多远、在哪个向"。
度图是在此基础上的步改进。现在很多机器人摄像头都是RGB-D摄像头(比如研究中用到的英特尔RealSense系列),可以同时拍摄彩图像和度图像。度图的每个像素不记录颜,而是记录该位置的物体距离摄像头有多远。这让机器人知道了"远近",但问题是,这个距离是以摄像头为中心量的,跟机器人自身的坐标系还是不样。
点云是进步的表示式。通过度图加上摄像头的内参(焦距、光心位置等参数济源家具封边胶厂 ,决定了像素和射线向的对应关系)以及外参(摄像头相对于机器人基座的位置和角度),可以把每个像素对应的物体位置计成机器人坐标系下的三维坐标,得到堆散乱的三维点,称为点云。点云直接在机器人自身坐标系里描述了世界,是机器人动作所需要的信息格式,但它有个致命缺点:散乱的点集没有规则结构,法直接被为处理图像而设计的经网络使用,而且通常需要对原始数据进行下采样(只保留部分点),会丢失细节。
点图则综了两者的优势,回避了各自的缺点。点图在外形上和普通图片模样,是同样度乘以宽度的规则网格,每个"像素"的位置和原始彩图片对应。但每个像素里存储的不是颜,而是该位置对应的物体在机器人坐标系下的三维坐标,即x、y、z三个数值。
具体的计过程分两步:步,利用摄像头内参和度值,把每个像素"反投影"到摄像头坐标系下的三维点;二步,再用摄像头外参(旋转矩阵和平移向量),把这些点从摄像头坐标系变换到机器人基座坐标系。这样,同个物体上的某个点,不管从哪个向的摄像头拍摄,在点图里存储的三维坐标都是样的——因为它在机器人坐标系里的位置就是固定的。
这个质其关键。从摄像头A拍到的杯子某个角点,和从摄像头B拍到的同角点,在各自的点图里存储的机器人坐标相同。这就消除了摄像头视角变化带来的不致。
**三、还差步:以末端执行器为中心的精妙设计**
研究团队在点图的基础上还做了个额外的精妙处理:把整张点图再减去机器人末端执行器(也就是机械手的当前位置)的坐标,得到所谓"以末端执行器为中心的点图"。
为什么要这么做?可以通过个场景来理解。假设机器人要完成的任务是"把杯子抓起来",这个动作本质上是"把手移动到杯子所在位置"。在以机器人基座为原点的坐标系里,如果杯子在厨房水槽旁边,它的坐标可能是(0.4, 0.5, 0.3);如果杯子在微波炉旁边,坐标可能是(0.6, 0.1, 0.8)。尽管两种情况下机器人需要执行的是几乎样的"手向目标靠近"动作,但以基座为中心看,目标物体的位置却不同,大脑需要分别记忆两种情况下的操作策略。
但如果改成以当前机械手位置为原点呢?当机械手已经接近杯子准备抓握时,不管杯子是在水槽旁还是微波炉旁,杯子相对于手的坐标都接近(0, 0, 0)——因为手就在杯子附近。这样,两种看似不同的场景在以末端执行器为中心的点图里看起来几乎样,大脑只需要学会种"手在目标附近时如何抓取"的通用策略。
研究团队用实验数据验证了这设计的价值。以机器人基座为原点的点图,在固定摄像头评估时成功率是34.7,换成随机摄像头评估时下降到32.7,下降了2.0个百分点。而换成以末端执行器为中心后,固定摄像头时成功率提升到36.9,随机摄像头时成功率是36.6,几乎没有下降,只差0.3个百分点。这说明末端执行器中心化的点图对摄像头视角变化具有强的鲁棒。
**四、如何把点图"喂"给已有的机器人大脑**
解决了"点图是什么"的问题之后,研究团队还需要解决"怎么用"的问题。现有的VLA模型都是用普通RGB图片训练的,直接把点图塞进去不定有。
研究团队的解决案巧妙地利用了点图与图片结构相同这特。他们为点图单配备了个图像编码器(经网络模块,负责把图片转换成机器人大脑能处理的特征向量),这个编码器的架构和处理RGB图片的编码器相同,初始权重也直接复制自RGB编码器。然后,将点图编码出来的特征,与同位置RGB图片编码出来的特征,按照像素对应关系直接做加法叠加。
这个"加法融"而非"拼接融"的选择也很关键。如果把两套特征拼接在起(即把点图特征排在RGB特征后面),那么点图特征和RGB特征就变成两个立的序列,它们之间的空间对应关系就丢失了。而加法融则让每个位置的RGB信息和该位置的三维空间信息直接叠加成个统的表示,保留了空间对应关系,也不增加任何额外的信息序列长度,对已有的VLA架构改动小。
实验证明了这个设计的优越。用加法融的点图法成功率是34.7济源家具封边胶厂 ,用拼接融的则下降到30.7,相差4个百分点。
**五、为什么不直接用点云,或者直接给机器人看摄像头参数**
研究团队系统地比较了几种看似理的替代案,回答了两个关键问题。
个问题是:与其预先计好三维坐标,不如直接把度图和摄像头参数起给机器人大脑,让它自己学会转换,是否可行?
研究团队测试了几种案,从简单的纯RGB图片(不给任何度或摄像头信息)开始,逐步增加信息量。纯RGB成功率是27.9。加上"普吕克射线"(种把每个像素对应的三维射线向和摄像头位姿编码进来的六维向量)后,成功率升至28.7。再加上度信息(此时大脑已经拥有计点图所需的全部原材料),成功率提升到31.6。而直接给机器人预计好的点图,成功率则达到34.7,比有相同原始信息但需要大脑自己转换的案出3.1个百分点。
这个对比说明,PVC管道管件粘结胶提供度和摄像头参数作为线索是有帮助的,但直接把机器人坐标系下的三维几何预先计好再输入,比让大脑自己从原始参数里果好。
二个问题是:点图和点云都携带相同的三维信息,为什么要用点图而不直接用点云?
研究团队测试了两种点云案:种用简单的MLP(多层感知机,种基础经网络)处理1024个点,成功率只有24.2,甚至低于纯RGB基准;另种用为三维点云设计的Point Transformer v3这个业架构,成功率提升到32.8,但仍然低于点图的34.7。
差距的来源很清晰:点云不保留与RGB图片像素对应的规则网格结构,因此它编码出来的特征法和RGB特征进行按位置对应的加法融,只能用拼接式,损失了空间对应关系。此外,处理点云需要门的三维编码器,法复用VLA已有的图像编码器的预训练权重,相当于从头学习,而点图编码器可以直接继承图像编码器的预训练知识。
**六、随着摄像头位置越来越多变,点图的优势越来越大**
研究团队做了组精心设计的对照实验,直接量化了摄像头视角变化程度对两种案的不同影响。
实验在RoboCasa这个机器人仿真平台上进行,设置了三个别的摄像头随机化程度:固定(每次演示摄像头位置样)、低随机化(每次演示摄像头位置和角度在5厘米、3度范围内随机浮动,对应RoboCasa默认设置)、随机化(浮动范围扩大到10厘米、6度)。
结果形成了鲜明的对比。对于纯RGB案,随着随机化程度从到,成功率从34.5直线下滑到24.9,跌幅达9.6个百分点。而加入点图后,随机化从到,成功率只从37.6小幅下滑到35.8,跌幅仅1.8个百分点。当随机化为(固定摄像头)时,两种案的差距只有3.1个百分点;当随机化为时,差距扩大到10.9个百分点。这直接证实了研究团队的核心假设:摄像头视角变化越大,点图的相对优势就越大。
**七、在真正的大型机器人模型上的测试结果**济源家具封边胶厂
上面的实验都在个相对基础的架构上进行,目的是隔离变量、验证设计原则。在终评估阶段,研究团队把点图案移植到两个真正大型的预训练VLA模型上测试。
个是π0.5,这是个在大量机器人操作数据上预训练过的大规模VLA模型。加入点图后,它在RoboCasa 24个任务上的平均成功率从55.3提升到62.9,在所有五个任务类别(开关门、开关抽屉、咖啡机操作、拿放物品、旋转物品)上都有提升,整体提升7.6个百分点。在能体现精确空间判断能力的咖啡机任务中,某个子任务的成功率从46跃升到76,提升幅度非常显著。
二个是SmolVLA,个轻量的VLA模型,加入点图后平均成功率从37.2提升到41.4,提升4.2个百分点。
研究团队还将他们的法与当时该域的代表对比法进行了比较。这些对比法分三类:注于摄像头感知的VLA(OC-VLA和KYC)、附加了用三维模块的VLA(GeoVLA和PointVLA),以及立的点云策略(FP3)。所有使用π0.5底层架构的对比法中,KYC(59.1)和PointVLA(57.3)是强的,但两者都低于加了点图的π0.5(62.9)。FP3作为个不共享π0.5底层架构的立三维点云案,只达到42.8,明显落后于所有基于π0.5架构的法,说明大规模视觉语言预训练的知识迁移对机器人任务仍然很有价值。
**八、在真实机器人上的验证,包括摄像头移到没见过的位置**
仿真实验的结果再好,也需要在真实世界里验证。研究团队使用Franka Research 3机械臂进行了真实机器人实验,配备了个固定在手腕上的D405度摄像头,以及个可以移动位置的外部D435i度摄像头。
训练数据用三个不同的外部摄像头摆放位置各收集了15条演示,每个任务共45条,四个任务(拿放物体、叠积木、开抽屉、关抽屉)共180条演示数据。
评估时设置了两种场景:种是把摄像头放在训练时见过的三个位置之(称为"已见视角"),另种是把摄像头移到个训练时从未见过的位置(称为"未见视角")。
在已见视角评估中,点图版π0.5平均成功率78.3,比纯RGB版π0.5的73.35.0个百分点,也于从训练的三维点云法DP3的63.3。说明在正常情况下,点图就已经是有帮助的。
能说明问题的是未见视角的结果。当外部摄像头移到训练时没见过的位置,纯RGB版π0.5的成功率从73.3骤降到55.0,下降了18.3个百分点,受摄像头位置变化的影响很大。而点图版π0.5的成功率从78.3降到66.7,只下降了11.6个百分点。换成两者之间的差距:在已见视角时差距是5.0个百分点,到了未见视角时,差距扩大到11.7个百分点。这说明越是在训练时没见过的摄像头视角下,点图的优势越大——这正是点图要解决的核心问题。
DP3这个三维点云案也展现了三维信息对抗视角变化的定果:它从63.3下降到48.3,降幅是15.0个百分点,比纯RGB的18.3个百分点下降略少。但DP3整体成功率仍然明显低于点图版π0.5,说明图像形式的三维信息加上预训练VLA的组,比单纯的点云案强。
**九、这项研究有哪些局限,未来还能怎么改进**
研究团队在论文中坦诚地指出了几个尚未解决的问题。
先,点图需要精确的摄像头内参和外参(也就是摄像头本身的光学参数,以及摄像头相对于机器人的精确位置和角度)。在实验室或工厂环境中,这些参数可以通过精确的手眼标定来获取,但在随意的日常使用场景中,标定可能不够精确或者难以实施,这限制了点图在那些环境中的应用范围。
其次,研究团队在点云对比实验中只使用了固定数量的点,没有测试用多点是否能缩小与点图的差距。
再者,研究对摄像头变化的测试主要集中在摄像头位置和角度的变化上,没有测试摄像头数量变化或者视野范围变化的情况。
此外,研究没有系统探讨点图注入式与VLA内部动作模块之间的相互作用,也没有入分析点图与VLA预训练数据的佳式。这些都是未来可以继续入的向。
说到底,这项来自KAIST和Holiday Robotics的研究做了件看似简单却切中要害的事:既然机器人在自己的坐标系里行动,就应该在自己的坐标系里观察世界。点图把摄像头画面和机器人坐标系之间那道始终存在的隔阂,在数据输入环节就提前弥了,而不是让机器人大脑在学习过程中自己慢慢摸索怎么跨越这道隔阂。果是实实在在的:在摄像头位置多变的训练环境下,任务成功率显著提升;重要的是,当摄像头被移到训练时从未见过的位置,点图法的能下降幅度远小于不使用点图的案。
这对机器人域意味着个清晰的原则:当摄像头标定信息可以获取时,应该先把观察数据转换到机器人行动所在的坐标系,再交给策略模型,而不是把这个转换的负担留给模型自己去学习。个有趣的思考向是:如果未来出现不需要精确标定、能从图像中自动估三维坐标的技术,这套框架是否可以和那些技术结,进步降低对标定的依赖?这或许正是未来研究值得探索的路径。有兴趣入了解这项研究所有细节的读者,可以通过arXiv编号2607.11498查阅完整论文。
---
Q&A
Q1:机器人视角点图和普通度图有什么区别?
A:度图记录的是物体距离摄像头的远近,坐标是以摄像头自身为中心的,当摄像头位置变化时,同个物体的坐标值也会跟着变。点图则在度图基础上进步做了坐标变换,把每个像素对应的三维位置转换到机器人基座坐标系下表示,同个物体不管从哪个摄像头拍摄,点图里存储的坐标值都是样的。这个差别让点图在摄像头视角多变的情况下,能给机器人提供稳定致的空间信息。
Q2:点图法需要额外添加门的三维处理硬件吗?
A:不需要。点图本质上是张和普通图片尺寸相同的"图像",每个像素存的是三维坐标而不是颜,它可以直接用和处理普通图片样架构的经网络来处理。研究团队的案只是在现有的VLA模型旁边增加了个图像编码器(初始参数还是从原有图像编码器复制过来的),对原有模型架构改动小,不需要用的三维点云处理硬件或者特殊的编码模块。
Q3:末端执行器中心化的点图在实际使用中需要实时知道机器人手的位置吗?
A:是的,需要。末端执行器中心化点图的计式是用机器人坐标系下的三维点坐标减去当前机械手的位置坐标,所以在每时刻生成点图时,都需要知道机械手当前的位置。不过这并不是额外的负担,因为机械手的当前位置(本体感知信息)本来就是机器人控制系统会持续追踪并提供给策略模型的基础信息,获取它不需要额外的传感器或计步骤。相关词条:铁皮保温施工 隔热条设备 锚索 离心玻璃棉 万能胶生产厂家
奥力斯 万能胶生产厂家 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
