具身智能与世界模型:近30天全景(7.7–8.6)
2026-08-06 06:22 UTC
亮点
-
- 与具体形态无关的接触点轨迹使得能够从人类视频中进行跨机器人技能迁移,无需针对每种形态重新训练;而在其他视频模型方法中,像素空间掩码被用作控制接口。
- 具有显式4D几何的世界模型 [citation] 以及对物理参数可辨识性的研究 [citation] 探索了纯视频生成的替代方案,因为后者在接触和长时间范围的条件下可能产生物理上不正确的推演结果 [citation]。
- 边缘部署性能分析发现,输出令牌生成是关键的能量瓶颈,紧凑的流式架构可与更大规模的 GPU 绑定模型相媲美。
世界模型从规模转向结构:几何、记忆与物理揭示原始视频生成的局限
推动世界模型结构性重构的核心诊断,指向长时程预测中的根本性错位:模型能够生成运动学上貌似合理的序列,却违背了动力学现实。 1 将这一失败重新界定为结构性的运动学—动力学缺陷,而非泛化的累积误差:内部一致的位置—速度轨迹忽略了摩擦、接触等物理约束,在短期推演中保持稳定,却在物理状态发生切换时灾难性崩溃1。 这一发现直接推动了用嵌入几何与物理结构的表征替代原始视频生成。
针对这一缺陷的攻关方向,是将显式4D几何信息注入世界模型流程。 2 提出了一种投影式4D表征,在统一扩散过程中联合生成同步的RGB、深度与光流(RGB-DF),保留了2D视频模型所丢失、且精确6自由度机器人操作所需的空间关系2。 在一项互补设计中,3 仅在训练阶段将4D几何先验迁移至World Action Model的潜在表征中,使部署时的表征携带与动作相关的时间几何信息,同时不增加推理延迟。 其操作准确率在LIBERO上达到98.2%,在RoboTwin 2.0上达到92.6%,优于缺乏精确空间关系的表观导向视频潜在表征3。 两种方法共同表明,几何注入相比纯视频方案能直接提升操作性能。
视频生成模型的局限性由两条证据线进一步界定,它们从根本上限制了模型所能认知的内容。 4 引入了一种证书门控协议,用以从原始观测中测试物理参数的可辨识性; 当参数可辨识时,协议会颁发可恢复性证书,为特定条件下的可辨识性提供形式化保证 4。 同时,5 指出了一种统计捷径:动作条件世界模型常常利用视觉惯性和重复的运动模式,而非学习真正的动作依赖动力学,因此看似准确的预测掩盖了其对动作因果效应建模的失败 5。 尽管 4 中的证书协议能在可辨识成立时验证可恢复性,但 5 所揭示的统计捷径表明,纯视频目标仍然容易受到混杂因素的干扰,从而降低其在接触密集型长时域控制中的可靠性 4,5。
一种新的数据基础设施使得系统验证世界模型是否真正捕捉了场景物理成为可能。 6 提供了一个大规模数据集,包含约 850,000 个镜头级世界状态片段,每个片段在源自工业计算机图形生产流水线的共享时空框架内,联合对齐了三维场景状态、多模态观测、动作、物理及反事实分支 6。 这一资源为评估模型是否内化了真实的场景结构(而非表面相关)提供了缺失的真值。
综合来看,这些结果指向了一个结构性转变:世界模型正围绕显式的四维几何、物理参数可辨识性和因果动力学进行重新架构,正是因为原始视频生成——即便在运动学上令人信服——已被证明在动力学上不足。 每一项来源均为 arXiv 预印本(同行评审状态未知)1,2,3,4,5,6,并且 4 仅以摘要形式提供,因此其完整的协议细节在此阶段仍未经验证。
开源 VLA 模型通过数据量而非参数量缩小性能差距
审查期内的一系列开源发布和预印本初步表明,视觉-语言-动作(VLA)模型的规模化优先级正在重新调整:数据量和具身多样性,而非参数数量,正成为泛化的主要驱动力,这挑战了专有十亿级参数模型具有不可逾越优势的假设。
据媒体 The Decoder 报道,小米的 Xiaomi-Robotics-1 机器人基础模型使用了超过 10 万小时的操作记录进行训练,这些记录通过便携式手持夹爪(UMI)在 1700 多个环境中采集,数据收集过程中基本绕开了实体机器人 7。 该报道指出,这项工作提供了有力的实证证据,表明机器人 AI 的规模化定律与 LLM 的规模化定律不同——数据多样性和数据体量远比模型规模重要 7。 与此同时,QbitAI 描述的蚂蚁凌波(Ant Lingbo)发布消息称,开源的 LingBot-VLA 2.0 模型整合了 6 万小时精心策划的真实世界物理数据,覆盖 17 个机器人品牌和超过 20 种构型,涵盖头部、腰部、末端执行器和移动底盘等全身控制自由度 8。 一篇相关预印本进一步说明,该模型的数据管线覆盖了 20 种机器人具身的 6 万小时预训练数据,从而实现了跨具身泛化和长时域移动操作 9。 这些并行的叙述共同描绘出一个模型,其通用能力植根于训练时具身的广度,而非异常庞大的参数量。
进一步强化这一观点的是,QbitAI 报道称,ModelBest 开源的 MiniCPM-Robot 系列中包含专用于操作的 15 亿参数 VLA 模型 MiniCPM-RobotManip,其在基准测试上的得分能与体量远大于自己的系统相竞争,并且在 H100 上实现每步决策约 120 毫秒的真实硬件延迟,而更大的 π0.5 模型则约为 234 毫秒 10。 这表明,每 FLOP 效率而非纯粹的规模,或许才是更关键的性能轴。 一篇介绍 TurboVLA 的预印本直接挑战了以 LLM 为中心的范式:作者声称,通过用直接的 V+L→A 映射取代传统的 V→L→A 通路,一个紧凑的 2 亿参数模型即可匹敌或超越体量大得多的 VLA 策略,证明执行层的控制并不需要建立在十亿参数级 LLM 之上 11。
综合来看,这些进展——尽管出自媒体报道和预印本——暗示着一种初步的收敛趋势:开源 VLA 模型正在靠挖掘大规模、多样化的真实世界数据集并重新审视架构瓶颈来缩小性能差距,而非在参数数量上超越闭源系统。 如果这些报告的结果站得住脚,该领域的竞争壁垒可能会从对大型模型的获取,转向对数据收集基础设施和跨具身数据整理的投资。
动作表征与具身解耦,解锁从人类视频到跨机器人技能迁移
一种面向具身无关控制的基础架构,将机器人指令投射到与视觉世界模型相同的二维像素空间中:该方法把动作表示为部分揭示的轨迹——即视频帧中某个实体的掩码时空模式 12。 通过以这种原生视频格式编码动作,该方法消除了对每个具身单独设计动作头的需求,使单个预训练视频骨干能够控制多种机器人形态 12。 ContactFlow 进一步扩展了这种解耦,它将操控表示为执行者手部与目标物体接触点三维轨迹的二维投影,使得动作编码对于特定机器人的运动学保持不变 13。 这种表征直接实现了跨具身迁移:在人类与机器人演示视频混合数据上训练的世界模型,可以将学到的接触点操控知识部署到运动学结构不同的机器人上 13。
光流提供了一种互补的原生视频动作表征,弥合了数值指令向量与预训练视频生成器之间的鸿沟。 FlowWAM 采用稠密光流作为 World Action Models 的统一动作空间,使动作与 Stable Video Diffusion 等生成式视频先验已捕获的运动模板对齐,从而允许在大规模互联网视频上进行无标签预训练 14。 这种利用未标注视频的能力,绕过了最顽固的数据瓶颈之一——带有动作标注的机器人演示数据稀缺——让模型能够从易于获取的无动作标签视频数据集中汲取规模化信号 14。
Mixture of Frames 策略进一步放松了对固定运动学参考系的依赖,它在多个坐标框架(例如末端执行器、基座、世界)上并行地对动作进行去噪,并通过学习路由器或均匀加权动态融合每个框架的去噪分数 15。 这种设计赋予了内部灵活性,表明单一架构可以在较少的动作空间重新设计下服务于不同的运动学配置 15。
从确定性潜动作转向分布性潜动作,增强了从无标签视频中可提取的信号。 DLAM 将潜动作参数化为对角高斯分布,并通过时序合成与逆转约束进行训练,同时监督转移均值和逐维方差 16。 在仅使用无动作视频学习时,对完整分布建模能产生时序上更一致的转移,并且这种分布形式在下游 VLA 微调中能与带动作标签的机器人数据无缝集成 16。 WALA 给出了一个实用的集成方案:先在无动作视频上预训练语义-几何潜动作模型,通过预测 DINOv3 特征空间与稠密深度空间中的未来差值来避免不确定的像素级重建,随后在带动作标签的机器人演示与无动作视频上联合训练策略 17。 由此,模型将无标签视频中的物理场景演化建立在潜动作之上,这些潜动作可直接迁移为可执行的机器人控制,大幅降低对稀缺且昂贵的动作标注的依赖 17。
这些表示——像素空间点轨迹、二维投影接触点轨迹、光流场、多帧运动融合和分布性潜动作——共同指向一个设计原则:每一种都用人类视频天然承载的模态来编码机器人动作。 这种对齐使通用策略能够从海量无标签人类视频语料中吸收知识,并迁移到各式机器人形态上,无需按具身重新训练,从根本上降低了数据壁垒。 本文引用的所有工作均为 arXiv 预印本,同行评审状态未知,因此这些能力仍处于积极验证阶段。
测试时自适应与运行时引导成为替代高昂 VLA 重新训练的可行方案
多个独立框架中涌现的测试时自适应机制表明,冻结的视觉-语言-动作(VLA)策略可以被引导以应对领域外泛化,而无需承担全面重新训练的代价。 一份预印本介绍了 RoboTTT,它将测试时训练(TTT)融入机器人基础模型,在推理延迟不增加的情况下将视觉运动上下文扩展到 8000 个时间步——比此前策略高出三个数量级 18。 这确立了 TTT 作为处理部署过程中长程分布偏移的实用机制。 一篇媒体报道描述了 Galbot 的 WAM-TTT,并称之为首个面向具身 AI 大模型的测试时训练框架,该方法同样用人类视频替代昂贵的遥操作数据采集,且据称表现出对灾难性遗忘的抵抗力 19。 尽管媒体的“全球首个”提法未经独立核实,但其方法与 18 范式的契合暗示出一种共识——推理时的在线策略自适应可以绕开高昂的重新训练成本。
除测试时训练之外,另一些框架通过对内部表征或输出轨迹施加轻量、模块化的干预来引导冻结模型。 根据摘要,RL²-VLA 训练一个轻量级离线强化学习策略,该策略以冻结 VLA 的动作专家提取出的表达性潜在表示为条件,然后在推理时将其流速度与 VLA 组合,从而在无需大规模数据采集的情况下提高鲁棒性 20。 在互补的方向上,PriGo 推出一种即插即用框架,在测试时强制使用组合式运动基元结构,以在分布偏移下引导基于扩散和流式的操作策略,从而在不重新训练的情况下提升泛化与长程执行能力 21。
测试时自适应同样针对执行阶段与环境之间对视觉信息依赖程度不一的问题。 IDR 提出一种无需训练、不依赖模型的“推断—诊断—修复”循环,可以在测试时诊断并纠正冻结 VLA 的视觉过度依赖或依赖不足,无需改动策略即可直接缓解性能退化 22。 另一份独立的预印本摘要介绍了 ActFovea,一种运行时安全防护层,用于检测并缓解视觉观测、机器人状态与执行动作之间的时空错位——在不重新训练的前提下应对视觉叠加、动作漂移等安全风险 23。
综合来看,这些框架涵盖了测试时训练、隐空间引导、基元指导、模态重加权以及运行时一致性检查,它们都运行在冻结的 VLA 策略之上。 这些独立工作的趋同表明,推理时自适应正在成为一种可行的架构范式,能够提供与重新训练相当的分布外泛化能力,同时大幅降低所需的数据和计算成本。
具身世界模型成为可训练模拟器,但其判断尚未验证
有媒体报道,Dexmal 发布了 DW0.5,这是一款在公司的 DFOL 2.0 框架中用于视觉-语言-动作(VLA)后训练的学习型仿真环境24。 另外,一篇预印本引入了 Boundless World Model(BWM),这是一个开源、受动作条件制约的世界模拟器,它融合了初始环境嵌入、动态视觉历史缓冲区和时间对齐的机器人动作条件,能对未来的观测帧生成状态化的自回归预测25。 两套系统共同勾勒出一种成熟趋势:世界模型开始被当作经典模拟器的替身,无需耗费成本去搭建基于物理的环境,就能为强化学习提供闭环反馈。
这股范式转向与另一篇预印本发出的直接警告撞个正着——该预印本指出了一个“信任倒置”现象:当生成式世界模型取代基于物理的模拟器进行闭环策略测试时,模型的输出就被视作安全证据,尽管模型本身只是一个未经验证的学习产物26。 该预印本强调,不同于经典模拟器,世界模型的预测如果没有经过显式验证便不可采信,这直接动摇了“从数据构建的模拟器可以充当可靠预言机”这一假设26。 另一篇预印本揭示了这种不可靠性背后的一项机制:受动作条件制约的世界模型会钻统计捷径的空子——尤其是视觉惯性(当运动极小时直接复用上一帧)和重复出现的运动模式——而不是真正学会由动作驱动的动力学,由此引入的偏差会扭曲所下达的动作与所预测结果之间的因果关系5。
缓解这一矛盾的潜在途径出现在一篇预印本中,该预印本提出了 WorldCycle——一种自验证强化学习框架,利用可逆动作循环对交互式视频世界模型进行后训练:模型必须在一段动作序列下生成前向推演,随后反转这些动作以重建初始观测,通过循环一致性约束来提升长时程物理合理性,且无需依赖真实轨迹标注 27。 尽管该方法将验证机制直接嵌入训练目标,从而弥合了信任缺口,但它仍只是一份预印本提案。 综合来看,这些结果揭示出一个结构性悖论:世界模型通过提供廉价的闭环反馈来加速强化学习 104,但同样的模型也继承了统计偏差,削弱了其作为评估工具的可信度; 而确认其判断所需的显式验证机制 27 仍处于早期阶段。
具身人工智能的对抗性漏洞已在机制层面被验证,安全性从猜测变成工程化攻击面
基于具体机制层面的对抗攻击方法已在具身 AI 流水线上得到验证,安全性由此从一种推测性担忧转变为可工程化的攻击面。 一项针对大语言模型、AI 智能体和具身智能体的安全风险比较调查,提出了一个覆盖数据层、模型层、系统层、内容层和应用层的分类体系; 该分类体系的广度表明,向自主智能体和具身智能体的演进可能会扩大攻击面 28。 近期两项工作从机制层面具体展现了这种扩大。
VLAGuard 是一篇已被《Ad Hoc & Sensor Wireless Networks》录用的论文,它揭示了视觉-语言-动作机器人中策略关键的动作-视觉注意力劫持问题 29。 物理对抗补丁将模型的交叉注意力从任务相关区域引开,从而导致不安全的运动行为,尤其是在 VLA 模型作为移动边缘节点部署时 29。
arXiv 预印本 BadWAM(同行评审状态未知)提出了世界-动作漂移攻击,利用了一类针对世界-动作模型的全新漏洞 30。 该攻击会保留想象中的未来——视觉预测看起来正常——同时劫持实际执行的动作,使任务成功率从 96.5% 降至 43.1% 30。 因此,那些检查想象未来的安全监控器会被绕过,因为它们看到的是一段合理的前向推演,无法察觉动作执行中的偏差 30。
模块化防御方案也在并行提出。 arXiv 预印本(仅摘要)描述的 ActFovea 提供了一个即插即用的运行时保护框架,能够在不重新训练底层 VLA 策略的情况下,检测由视觉观测、机器人状态和已执行动作之间的时序错位所导致的故障 23。 它针对的时序与一致性故障类别,与注意力劫持和世界-动作漂移攻击造成的后果直接重叠 23。
两种免重训框架提供了形式化安全保证。 Acc-CBF-QP 已被 IROS 2026 接收,它将任意预训练 RL 策略包装在基于加速度的二次规划安全过滤器中,并利用控制屏障函数,在真实的 H1 人形机器人硬件上将安全违规减少了 92%,并在 Kinova Gen3 机械臂上完全消除了违规 31。 通过障碍增强流匹配实现的安全视觉语言动作模型以 arXiv 预印本(仅摘要)形式呈现,将流匹配生成模型与控制屏障函数安全保证集成到模块化 VLA 推理框架中,有望在不重训的情况下实现安全的动作生成 32。 ActFovea 作为运行时一致性监视器运行,而基于 CBF 的方法则提供了形式化的动作级安全过滤器,二者共同构成了针对已暴露的具身控制对抗面的分层响应。
触觉感知与接触建模逐渐成为灵巧操作中缺失的关键模态
单纯依赖视觉无法在接触过程中分辨滑移、力与微对准,这长期制约着灵巧操作的发展,而视觉‑触觉世界模型、跨传感器架构与可及硬件的融合正系统性地填补这一短板。 ViTacWorld 33 提出了一种动作条件的视觉‑触觉世界模型,可生成时间对齐的视觉与触觉推演序列,利用模拟触觉信号更窄的仿真‑现实差距来解决同步视觉‑触觉‑动作数据稀缺的问题。 TouchWorld 34 则构建了一个触觉基础模型,同时进行预测性接触建模和反应式在线修正,将慢速推理与快速接触适应解耦,在六个真实机器人长时域任务中达到了65.0% 的成功率。 FeelWorld 35 给出了一个分层视觉‑触觉世界模型,在预测未来视觉隐变量的同时,对二值接触、编码受力形变的三维隐变量以及时序滑移这三个触觉状态进行显式监督,从而超越粗粒度的接触感知,转向精细物理接触建模。 然而,这些视觉‑触觉世界模型目前仅在严格限定的任务套件和物体集上完成了评测 33, 34, 35; 它们泛化到非结构化、日常操作全部多变场景的能力尚未得到验证,而从仿真或脚本交互中学到的接触表征的可迁移性仍是一个悬而未决的问题。
触觉感知与通用策略的融合在 UniTac 的推动下更进一步——据 QbitAI 报道 37,它提出了一种统一跨传感器触觉理解与生成的架构,并集成到 VLA 模型中。 这种设计将触觉感知扩展到异构传感器类型,并瞄准柔软、易碎或接触密集的物体操作,这些场景下仅靠视觉无法胜任。 同时,这类模型驱动方法的硬件门槛正被 MIDAS Hand 38 拉低,这是一款开源、低成本(3000 美元以下)的灵巧手,具备高密度三轴触觉感知和直驱传动,专为降低高质量触觉数据采集难度、支持从模拟到现实的迁移而设计,从而为渴望数据的视觉-触觉世界模型提供了可行的基座。 33, 34, 35, 36
与此并行,QbitAI 报道称,BeingBeyond 的 Being‑H0.8 被描述为首个在人类视频上训练的隐式触觉世界-动作模型,试图在没有专用触觉传感器的情况下推断接触 36。 这一方法提示了一条可能绕开硬件依赖的替代数据路径,但同时也带来了接触推断保真度方面的未决权衡,而原文报告并未对此量化。 这些进展共同标志着填补接触理解缺口的系统性推动:33、34 和 35 提供了学习和预测接触动力学的架构,37 则将这类表示扩展到跨传感器模态,并纳入 VLA 框架,38 使得所需触觉数据的采集成本显著降低,而 36 则探索能否从被动人类视频中习得接触推断。 33 和 35 对模拟触觉信号的高度依赖,加上 34 中现实世界成功率仅属中等水平,表明弥合触觉感知模型与稳健通用的灵巧操作之间的鸿沟,仍是一项活跃且悬而未决的挑战。
边缘部署约束重塑 VLA 架构:能耗、延迟与内存驱动模型重新设计
对端侧视觉-语言模型推理的系统性剖析动摇了具身智能的一个核心假设:占据能耗主导地位的并非视觉处理,而是输出 token 的生成。 有分析解读认为,一项首开先河的研究 39 发现视觉 token 剪枝最多只能节省 10% 的能耗,而控制输出长度则可节省高达 97%。 这一发现将效率优化的重心从模态压缩转向了语言与动作生成流水线,而这正是传统视觉-语言-动作(VLA)架构的核心。
TurboVLA 直接体现了这一设计理念的转变。 该系统将基于大语言模型(LLM)的 V→L→A 通路替换为直接的 V+L→A 映射,从根本上将数十亿参数的 LLM 从执行级控制中移除,借助一个 0.2B 参数的模型在 RTX 4090 上实现了 32 Hz 的实时控制,显存占用不足 1 GB,且性能匹敌或优于参数量大得多的 VLA 策略 11。 VQVLA 则进一步强化了能耗剖析与架构响应之间的关联,这是一个算法-硬件协同设计框架,针对 VLA 模型的 transformer 骨干——在 LLaMA2-7B 等大模型中,该部分可能主导推理延迟——采用运动感知的向量量化和质心复用技术来加速边缘推理 40。 TurboVLA 完全去除了 LLM,而 VQVLA 保留了 transformer 但重构了其计算逻辑,两者的路径不约而同地汇聚在能源研究发现的同一瓶颈上:生成动作条件输出 token 的成本。
Jetson-PI 直面低功耗硬件上的实时控制差距,提出一种前瞻对齐的异步校正方法,用于在 Jetson Orin 设备上部署 VLA 模型。 这种异步调度相较于朴素的 PyTorch 和 vla.cpp 基线方案带来了显著的控制频率提升,使机载执行更接近响应式操作所需的循环速率 41。 前述工作是从模型本身入手重构,而 Jetson-PI 解决的是计算与调度的错配问题,表明延迟问题也可以在不改变策略架构的前提下,在运行时层面得到缓解。
这一簇紧凑架构与调度策略并未止步于 VLA 模型。 Faster-WAM 表明,世界-行动模型(WAM)可以在不牺牲控制性能的情况下实现 VLA 级别的推理延迟:它在冻结的视频扩散 Transformer 骨干网络上附加轻量级“Transformer 扩展坞”头,相比 Fast-WAM 提速 3.2 倍,并在 LIBERO-Plus 的分布外任务上达到 75.0% 的成功率 42。 这一结果进一步证明,执行时的控制不必经过深层、参数繁重的行动模块。 与此互补,PhyAI 提供了一个统一运行时,用单一代码库横跨机载、边缘与云端层的 VLA 和世界-行动模型 43,减少了为这些新兴架构产生的多样化部署场景维护独立推理栈的工程负担。 将这些线索综合来看,它们描绘出的领域图景是:性能分析洞察与架构创新正在共同推动 VLA 设计远离单体式 LLM 管线,转向紧凑、专业化的模型和异步服务策略,以满足物理机器人对推理延迟与内存预算的严苛要求。
机器人与具身系统重要发布
在四足运动控制方面,一篇预印本提出了针对扭矩标注运动数据的统一框架与基于 Transformer 的 VAE,在非结构化地形的高台阶上实现了 4.25 m/s 的瞬时峰值速度,并在下落机动中达到了 6 m/s 44。 另一篇论文采用多种强化学习(RL)方法训练定制自行车机器人,使其能够完成跳跃、翻滚和翘头等特技动作,弥合了轮式效率与足式敏捷性之间的差距 45。 针对人形机器人,一篇仅有摘要的预印本提出了一种技能增长方法,可将预训练的行走策略扩展至慢跑和奔跑,无需从头重新训练 46。 硬件平台 Handroid 提供了一套开源系统,将灵巧操作与双足移动相结合,具备 27 个可控自由度,降低了跨具身研究的门槛 47。
在应用驱动系统方面,一篇预印本表明,利用神经网络近似计算流体力学数据,可使自主水下航行器在实地测试中降低 31% 的能耗,并将航点遍历速度提高 11% 48。 农业机器人领域取得进展,一篇被 IROS 2026 录用的论文将草莓采摘的完整流程——障碍物分离、果实脱离和放置——建模为序列决策问题 49。 一篇预印本介绍了 LabRobFail,这是一个用于化学自动驾驶实验室机器人故障分析的仿真平台与基准测试,涵盖了 70 个任务场景和 5 种故障类别下的 2 万余条轨迹 50。 一篇预印本描述了一种端到端流水线,能够仅凭单张 2D 肖像自动合成用于仿生机器人的无碰撞面部机构 51。 在微型机器人方面,一篇被 Nature Machine Intelligence 录用的论文提出了一种学习框架,可在 10 分钟内训练出自主导航策略 52。 一篇研究论文展示了神经细胞自动机的大规模物理实现,利用数百个简单模块验证了涌现式自我识别与损伤恢复能力 53。
开发者基础设施因 RLinf v0.3 得到扩展,QbitAI 报道称该版本将数据采集、SFT、RL、评估及真机部署统一到单一平台,并新增六个具身模型 54。 一篇研究论文提出了面向足式机器人的 sim-to-real RL 流程,该流程将永磁同步电机的物理能量模型与系统化执行器辨识相结合 55。 另一篇预印本介绍了 NeuralActuator,这是一种面向低成本伺服驱动机器人的数据驱动模型,能联合预测扭矩代理量与外作用力 56。 一篇预印本解决了免标定的灵巧手重定向问题,可将人类动作映射到多种手部形态,无需繁琐标定 57。 一篇仅有摘要的预印本给出了一种城市级室外导航范式,利用商用地图工具的方向指令,减少了对稠密预构建地图的依赖 58。
Google DeepMind 正式发布 Gemini Robotics 2,一个将全人形机器人控制范围从脚底延伸到指尖的视觉-语言-动作模型 59,以及 Gemini Robotics ER 2,此次具身推理模型升级加入了实时视频进度追踪与多机器人协作,可通过 API 调用 60。 QbitAI 报道,Yuanli Lingji 发布了 DM0.5,一个 40 亿参数的通用具身基础模型,数据量较上一代多出 400%,在 RoboChallenge 和 LIBERO 上刷新纪录 61。 据 QbitAI 报道,科大讯飞旗下耀方智能详细介绍了 iFLYTEK‑Embodied‑Omni,这是一个经过显式身体感知训练的统一多模态基础模型 62。 蚂蚁集团 LingBot 团队开源了 LingBot‑Vision,QbitAI 指出这是一种空间原生具身视觉模型,旨在赋予机器人超越语义标签的空间常识 63。
基础模型、世界模拟与生成式进展
面向具身智能的基础模型不断扩展模态与任务覆盖范围。 小米机器人的预印本 64 介绍了 U0,这是一个 380 亿参数的多模态自回归模型,统一了文生图、图像编辑以及具身场景和视频生成。 The Decoder 报道的 BAAI 的 Orca 65 是一个世界基础模型,在 12.5 万小时视频和 1.6 亿个事件描述上训练,没有任何动作标签; 它将世界理解与任务执行解耦,在包括上架、堆叠和舀取等真实世界操控任务上,性能可对标 π0.5 等专用系统。 一篇预印本描述的 LingBot‑Video 66 是首个大规模开源的混合专家视频基础模型,专为具身智能设计,用稀疏 MoE 模块替代密集的前馈层,将参数容量与每词元计算量解耦。 据 The Decoder 报道 67,Black Forest Labs 的 Flux 3 可通过图像、视频和音频模态的联合训练,生成长达 20 秒并自带原生音频的视频; 该报道引用的早期厂商偏好评估显示,93% 的情况下 Flux 3 比 Luma Ray 3.2 更受青睐。
世界建模的效率依旧是一项迫切挑战。 在一篇预印本68中提出的 DriftWorld 是首个基于漂移生成模型(而非扩散模型)的动作条件世界模型,能在单次前向传递中以超过 30 fps 的速度生成未来帧。 其作者指出,该模型比基于扩散的基线方法提速 17 倍,并认为这有望使基于模型的实时规划在机器人操作中变得可行。 MoWorld 则构思了一种“Flash World Model”,目标是在无需高端 GPU 的 NPU 上达到 50 FPS,通过对数据、训练、蒸馏和推理进行协同设计,向当前以规模换速度的主流取舍发起挑战69。 来自阿里巴巴 AMAP CV Lab 的 ABot-World-0 70 是一种动作条件视频世界模型,能在单个桌面 GPU 上实现实时、长时程的闭环交互,并将数据、控制、稳定性和部署这些相互耦合的瓶颈重新框定为统一的系统挑战。 Wonder 框架提出了一种面向实时摄像头可控视频世界模型的系统级协同设计,结合了矫正自强制式蒸馏流程和摄像头感知的对抗正则化71。 INTACT 引入了一种端到端 JEPA 架构,并配备同构的意图-动作预测器,通过共享参数将物理运动意图和目标部署意图映射为动作块; 作者宣称规划器延迟降低约 300 倍,足以支持更高频率的实时控制回路72。 作为开源因果世界模型的 LingBot-World-Infinity,能够在 720p 分辨率、60 fps 下进行无边界实时交互生成,同时具备长达一小时的无漂移稳定性和多样化动作,为具身 AI 仿真和开放式游戏生成提供了实用基础73。
在驾驶领域,世界模型在多传感器生成与蒸馏方面取得了进展。 预印本 74 提出的 M4World 是一种多视图多模态驾驶世界模型,能够联合生成同步的相机与激光雷达流,并支持对空间布局和视觉外观进行细粒度的对象级控制。 作者指出,相比强基线,该模型将 FID 从 41.7 降至 34.8,FVD 从 346.1 降至 288.7,对象级视觉保真度从 13.4% 提升至 62.7%。 Orbis 2 提出了一种分层式驾驶世界模型,在 BDD100K、OpenDV、Honda HAD/HDD、ONCE、nuScenes 和 nuPlan 的 260 万帧数据上训练,通过在不同抽象层级上分解生成过程,以更好地平衡长期稳定性和感知保真度 75。 WAM‑Diff2 将 8B 的扩散教师模型蒸馏为面向自动驾驶 VLA 的紧凑 2B 学生模型,通过分层式自回归到扩散的蒸馏方式,实现 2.8 倍的解码加速,同时保持多任务语义能力 76。 SafeGen 将基于 VLM 的自动驾驶中安全关键场景生成重新定义为目标条件下的扩散过程,以此应对传统仿真器中明显的 sim‑to‑real 差距以及缺乏真实人机交互动态的问题 77。
生成仿真环境与物理真实的资产在多个方向上取得了进展。 Image2Sim 提供了一个实时神经仿真器,能将带位姿的 RGB‑D 序列转换为可用于具身导航的交互式环境,旨在权衡扫描场景的视觉真实感与合成仿真器的可扩展性 78。 Genie Sim PanoWorld 的预印本摘要描述了一个两阶段前馈流水线,无需逐场景优化便能从单张 360° 全景图重建出可自由导航的 3D 场景 79。 MIT News 报道了 SceneSmith 80,它采用设计师、评论家与编排者三个协作的 VLM 智能体,从文本提示生成物理就绪的 3D 室内场景,并支持将在真实世界训练的策略零样本迁移到生成场景中。 PlanCraft 将不完整的设计草图衔接至家具齐全的 3D 住宅场景,视设计为一种内在渐进的过程,并以 2D 平面图作为不可替代的空间先验 81。 SONG 是一个社交导航仿真平台,使用 3D 高斯散点技术处理静态环境与动态人体化身,再配合大型语言模型驱动的行为模型,以弥补先前社交导航仿真器所欠缺的照片级真实感 82。 GS‑Agent 通过将物理引擎置于回路中,从自然语言生成动态且物理合理的 4D 世界,绕开了纯数据驱动视频生成模型在物理合理性上的局限 83。 UniPhysGen 贡献了一个包含 4 万项资产、物理真实的数据集以及一个经人工验证的基准,利用 SO(3) 增强与球轴参数化,为仿真就绪的 3D 物体实现了几何鲁棒的关节接地点 84。
导航与空间推理方面的工作攻克了基础性的表征瓶颈。 SoftNav(已被 IROS 2026 接收)通过轻量级投影器,将实体级三维场景编码器表征以软令牌形式直接注入视觉语言模型的隐空间,并首次给出实证证据,表明基于文本的接口——而非模型容量——才是基于 VLM 的导航流程的主要瓶颈85。 AutoPath 在无需人类演示的情况下学习可迁移的目标条件随机路径先验,将无关具身的几何路径生成与平台特定的轨迹优化解耦,使得单一先验无需重新训练即可从差速驱动机器人迁移至四足机器人86。 EAGOR 将具身 360° 方向推理重新形式化为直接在球面流形上的递归贝叶斯估计,避免了等距矩形投影畸变,在无地图导航和视觉搜索上分别取得 +34.4% 和 +45.1% 的平均相对增益87。 一篇关于解析‑搜索‑确认(PSC)的预印本提出无需训练的空中视觉对话导航框架,通过搜索思维链进行层次化目标探索,并借助确认思维链实现细粒度验证,同时配备结构化空间记忆模块88。 FactorJEPA 将未来预测分解为布局、智能体和交互通道,并推出 DENSEWORLD‑115k——一个覆盖 22 座印度城市、时长 1000 小时的车载、步行与空中视频数据集,专门针对标准基准未覆盖的密集、异质城市场景89。 DynTrace 是一种无需训练的框架,通过解耦真实物体运动与相机引起的表观运动来持续追踪动态物体证据,从而提升多模态大语言模型的四维时空推理能力90。 CAIRN 将三维大型多模态模型扩展到多房间家庭场景理解,突破了现有 3D‑LLM 中主流的单房间范式91。 IGGT4D 将在线四维场景理解形式化为流式几何‑实例预测,从序列视频中联合估计相机运动、三维几何与时间一致的目标身份; 作者认为,这一联合形式对于在长动态视频中穿越遮挡持续跟踪目标至关重要92。
物理推理与仿真到现实迁移出现了明显的方法学进展。 被 ECCV 2026 录用的 SiPhy 是首个仅凭单张 RGB 图像就能预测像素级密度和杨氏模量以及物体级质量的单图框架,无需多视图重建或基于物理的监督 93。 一篇题为《Physics from Video》的理论预印本刻画了仅通过编码器流水线直接从原始视频像素恢复二阶线性常微分方程参数所需的最小轨迹条件,由此在无需高昂计算代价的重建过程下连通视觉感知与物理理解 94。 World Translation 提出后向动力学提取,从已观测到的转移结果反推不可观测的隐变量,并在历史信息缺乏信息量的场景中借助非配对域翻译来缩小仿真到现实的差距 95。 同样被 ECCV 2026 录用的 GARFIELD 框架,学习给定图像与可选稀疏约束下未来场景运动可能的概率时空潜分布,直击视频世界模型把容量消耗在外观上,而既有运动模型又无法提供可访问的概率密度这一双重局限 96。
记忆、结构化推理与模型压缩共同构成了这一时期的生成方向进展。 HDR将树结构层次化潜变量融入流式自回归扩散过程,从而在决定帧级输出之前实现粗到细的多步视觉推理,在兼顾流式生成效率的同时满足了视频生成对全局修正的需求 97。 ReMind训练视频扩散Transformer,使其利用现有的KV缓存机制作为动态记忆,用于维护视线外状态的演化,旨在当物体或场景在镜头中被遮挡或切出时产出一致的时间输出 98。 Narrative World Model将聚焦、事件顺序、戏剧功能等叙述结构作为时间状态图中的一等原语进行编码,在长篇小说的多跳问答上显著优于强时序知识图谱基线(0.898 vs. 0.539) 99。 UniVR探索完全从纯视觉演示中联合学习复杂推理、精细物理动态和长期规划,无需特定任务的启发式方法或图文配对数据; 该项目发布了开源代码、数据和模型,以加速具身智能与视觉推理交叉方向的研究 100。 MobileSAM2采用超图知识蒸馏方法,将SAM2压缩为面向移动设备的轻量模型族,为大视觉模型提供了一个具有推广潜力的压缩框架 101。 据QbitAI报道,Taku Komura因其2016年发表的角色运动合成深度学习论文获颁2026年SIGGRAPH时间检验奖,这一研究方向有望提供人机交互先验模型,有助于弥合具身智能领域的数据稀缺瓶颈 102。
基准、数据集与评估基础设施
一篇研究论文提出了 RealX3D 103,这是一个真实采集基准,包含 55 个高分辨率场景,按四类退化(光照、散射、遮挡和模糊)组织,填补了精心设计的合成退化数据集与多视图一致性失效的真实部署条件之间的空白。 QbitAI 报道称,RoboDojo 104 将 42 个仿真任务与 18 个真实机器人任务配对,覆盖三个双臂平台,结果令人警醒:最优模型在仿真中成功率仅 8.80%,在真实世界中为 12.8%,而人类专家分别达到 76.03% 和 100%; 开放语义任务的成功率低至 1.67%。 一篇预印本提出了 DexVerse 105,这是一个面向灵巧操作的模块化仿真基准,包含八个类别的 100 项任务(包括接触丰富的插入、双臂协调和工具使用),支持三种机械臂和六种灵巧手,目标是实现现有基准未能共同支持的高自由度协调控制。 另一篇预印本介绍了 NavVerse 106,这是一个基于物理的基准,在连续机器人执行下统一了室内、室外及室内到室外导航,暴露了跨情境适应差距,并纳入了安全指标和运动动力学约束。 在具身场景理解方面,一篇预印本(已被 ECCV 2026 接收)将 3D Gaussian Splatting 分割扩展到广义指代任务,并贡献了两个新基准 GR-LERF 和 GR-ScanNet 107,支持具身 AI 中常见的多目标和零目标查询; 另一篇预印本则提出了 HIOcc 108,这是一个分层室内语义占用基准,统一了 ScanNet、ScanNet++ 和 Matterport3D,用于评估从局部视角到建筑尺度环境的长时间具身建图。
世界模型评估基础设施同样取得进展:一篇预印本提出了 KineBench 109,一种面向具身世界模型的无逆动力学模型闭环基准,通过显式运动学定位管线替代学习型逆动力学模型,以消除此前闭环评估中世界模型误差与动作提取误差之间的归因模糊。 110, 111
数据管线与社区驱动基础设施表现活跃。 一项预印本详细介绍了 Ego2Robot 110,该端到端管线通过动作对齐、视觉对齐和多级筛选,将以自我为中心的人类操作视频转换为具体化身的机器人训练数据,有望通过利用海量的自我中心视频资源,降低机器人策略训练的规模化成本壁垒。 另一篇预印本推出 AXIS 111,这是一个可生长的社区驱动数据引擎,结合了基于浏览器的 MuJoCo-WASM 遥操作用于大规模演示采集、LLM 驱动的自动任务生成以及统一处理管线,旨在用可访问的界面替代依赖专用硬件的遥操作方式,拓宽社区参与数据集增长的渠道。
综合与展望
上述研究进展共同印证了一种结构性脱钩,正在重新定义具身AI的发展轨迹。 开源VLA模型通过多样化数据规模而非参数扩展实现泛化,这一结论与“与具身无关的动作表征”的出现直接呼应——后者使得跨机器人技能迁移可从人类视频中获取。 综合来看,这些发现表明,该领域的数据瓶颈并非依靠单体模型扩张来解决,而是通过在不同具身形态和模态间大幅多样化训练语料来实现,涵盖人类视频、多机器人游走数据和程序化生成的仿真数据。 世界模型方面同步向显式4D几何和基于物理的结构倾斜,加上触觉感知正成为接触密集任务关键缺失模态的共识日益增强,进一步反映出一种共同的转向:朝向视觉无法独自提供的几何与物理 grounding。 在这一追求更丰富世界仿真的动力与“所学世界模型在统计上仍有偏差、且未经校验不能作为预言机”的证据之间,存在一种有益的张力:那些加速策略训练的仿真器,若不加验证便加以信任,同时也会威胁其可靠性。 这一张力与新近对对抗性漏洞的机理式理解以及运行时安全防护机制的提议相交汇; 而对性能剖析的洞见——输出token生成而非视觉编码是边缘设备上主要的能量瓶颈——则意味着任何推理时适配或安全过滤都必须满足严格的延迟约束。 一个悬而未决的问题是:通过测试时操控进行的冻结策略适配,能否在不引入计算开销的前提下,对诸如注意力劫持这类已证实的攻击手段保持稳健,同时又不削弱那些已被证明可部署的紧凑流式架构的性能。 关键在于,这些攻击目前仅在数字视觉-语言场景中得到验证; 它们能否迁移到具身情境中的物理动作选择——其中真实世界的反馈回路和传感器-执行器动态可能改变攻击面与失效模式——仍有待实验检验。
原文链接与引用索引
- [1] 想象轨迹是运动学的,而非动力学的:长程世界模型故障诊断 — arXiv · Tier A/research_paper
- [2] RynnWorld-4D:面向机器人操作的4D具身世界模型 — arXiv · Tier A/research_paper
- [3] 面向推理高效的世界动作模型学习四维几何先验 — arXiv · Tier A/research_paper
- [4] 潜在世界模型能知道什么?多模态预测表示中的物理参数可辨识性 — arXiv · Tier A/research_paper
- [5] 克服动作可控世界模型中的统计偏差 — arXiv · Tier A/research_paper
- [6] CG-World:面向世界模型研究的大规模世界状态数据集与协议 — arXiv · Tier A/research_paper
- [7] 小米Xiaomi-Robotics-1表明:训练机器人运动时,更多数据胜过更大模型 — The Decoder · Tier D/other
- [8] 支持17家机器人厂商20多种构型,蚂蚁灵波LingBot-VLA 2.0正式开源 — 量子位 QbitAI · Tier C/media_report
- [9] 从基础到应用:在实践中改进视觉-语言-动作(VLA)模型 — arXiv · Tier A/research_paper
- [10] 1.5B开源通用VLA模型,冲进具身智能第一梯队 — 量子位 QbitAI · Tier C/media_report
- [11] TurboVLA:在RTX 4090上以32 Hz实时运行的视觉-语言-动作模型,显存占用低于1 GB — arXiv · Tier A/research_paper
- [12] 用于统一世界建模的掩码视觉动作 — arXiv · Tier A/research_paper
- [13] ContactFlow:一种可跨本体迁移的视频动作条件表示 — arXiv · Tier A/research_paper
- [14] FlowWAM:将光流作为世界动作模型的统一动作表示 — arXiv · Tier A/research_paper
- [15] 混合坐标框架策略:面向双手移动操作的多帧动作去噪 — arXiv · Tier A/research_paper
- [16] DLAM:具有时间约束的分布式潜在动作模型 — arXiv · Tier A/research_paper
- [17] WALA:从带动作标签的演示和无动作标签的视频中学习可执行的潜在动作 — arXiv · Tier A/research_paper
- [18] RoboTTT:机器人策略的上下文扩展 — arXiv · Tier A/research_paper
- [19] 全球首个!银河通用新框架仅需人类视频即可部署,特斯拉蚌埠住了 — 量子位 QbitAI · Tier C/media_report
- [20] RL²-VLA:面向视觉-语言-动作模型的自适应RL潜空间组合引导与测试时缩放 — arXiv · Tier A/research_paper
- [21] PriGo:面向自适应机器人操作的扩散与流策略测试时原语引导 — arXiv · Tier A/research_paper
- [22] 面向VLA模型测试时模态适应的因果感知推断-诊断-修正框架 — arXiv · Tier A/research_paper
- [23] ActFovea:基于时空视觉-动作一致性的VLA策略运行时安全防护 — arXiv · Tier A/research_paper
- [24] 用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界 — 量子位 QbitAI · Tier C/media_report
- [25] BWM:面向机器人学习的低成本高保真世界模拟器 — arXiv · Tier A/research_paper
- [26] 在信任其裁决之前先验证梦境:世界模型模拟器的可采信性 — arXiv · Tier A/research_paper
- [27] WorldCycle:面向长程视频世界模型的自验证强化学习 — arXiv · Tier A/research_paper
- [28] AI系统安全风险比较综述:从大语言模型到AI智能体与具身智能体 — OpenAlex: peer-reviewed AI venues · Tier A/research_paper
- [29] VLAGuard:一种用于评估和缓解无线传感器网络中视觉-语言-动作机器人物理注意力劫持的框架 — arXiv · Tier A/research_paper
- [30] BadWAM:当世界-动作模型想象正确却执行错误时 — arXiv · Tier A/research_paper
- [31] 基于加速度CBF-QP约束执行的强化学习策略安全部署方法 — arXiv · Tier A/research_paper
- [32] 通过屏障增强流匹配实现安全的视觉-语言-动作模型 — arXiv · Tier A/research_paper
- [33] ViTacWorld:面向富接触机器人操作的视触觉世界模型规模化 — arXiv · Tier A/research_paper
- [34] TouchWorld:面向灵巧操作的预测-反应式触觉基础模型 — arXiv · Tier A/research_paper
- [35] FeelWorld:用于分层接触预测与规划的视觉-触觉世界模型 — arXiv · Tier A/research_paper
- [36] 世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型 — 量子位 QbitAI · Tier C/media_report
- [37] 让VLA更懂接触,优理奇UniTac让机器人拥有“触觉想象力” — 量子位 QbitAI · Tier C/media_report
- [38] MIDAS Hand:模块化低阻抗直接驱动类人感知手 — arXiv · Tier A/research_paper
- [39] 看是免费的,说不是:揭示边缘VLM推理中真正的能耗瓶颈 — arXiv · Tier A/research_paper
- [40] 面向高效VLA推理的运动感知向量量化与质心复用框架 — arXiv · Tier A/research_paper
- [41] Jetson-PI:通过前瞻对齐的异步推理实现机载实时机器人控制 — arXiv · Tier A/research_paper
- [42] Faster-WAM:世界动作模型是否需要深层动作模块? — arXiv · Tier A/research_paper
- [43] PhyAI:边缘端实时物理AI与云端可扩展Rollout — arXiv · Tier A/research_paper
- [44] 面向野外四足机器人的敏捷感知多技能运动 — arXiv · Tier A/research_paper
- [45] 基于强化学习的自行车特技 — arXiv · Tier A/research_paper
- [46] GaitSpan:从行走到跑步的人形机器人运动能力生长 — arXiv · Tier A/research_paper
- [47] Handroid:桥接灵巧手与人形机器人 — arXiv · Tier A/research_paper
- [48] CORAL-AUV:面向自主水下航行器的 CFD 强化学习控制 — arXiv · Tier A/research_paper
- [49] 面向草莓完整采收过程的强化学习:障碍物分离、果实摘取与放置 — arXiv · Tier A/research_paper
- [50] LabRobFail:化学自动驾驶实验室中机器人故障分析基准 — arXiv · Tier A/research_paper
- [51] 面向对话式动画机器人的面部机构自动合成 — arXiv · Tier A/research_paper
- [52] 微机器人导航的分钟级训练 — arXiv · Tier A/research_paper
- [53] 用于去中心化形状分类与损伤恢复的智能细胞砖块 — Nature Communications · Tier A/research_paper
- [54] RLinf v0.3来了!从模型生态到真机部署五大能力跃升,无问芯穹与清华大学联合打造 — 量子位 QbitAI · Tier C/media_report
- [55] 弥合差距:面向多样化足式机器人的系统性仿真到真实迁移 — OpenAlex: peer-reviewed AI venues · Tier A/research_paper
- [56] NeuralActuator:面向机器人动力学与外力感知的神经执行器建模 — arXiv · Tier A/research_paper
- [57] AnyDexRT:基于少量人类引导的免标定灵巧手重定向 — arXiv · Tier A/research_paper
- [58] DA-Nav:方向感知的城市级视觉语言导航 — arXiv · Tier A/research_paper
- [59] Gemini Robotics 2 为机器人带来全身智能 — DeepMind Blog · Tier B/official_tech_blog
- [60] 推出 Gemini Robotics ER 2 — Google AI News · Tier B/official_tech_blog
- [61] Zero-Shot提升31%!原力灵机DM0.5登场,15万小时数据喂出 — 量子位 QbitAI · Tier C/media_report
- [62] 机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」 — 量子位 QbitAI · Tier C/media_report
- [63] 刚刚,首个空间原生的具身视觉基模开源!机器人更会看我们的世界了 — 量子位 QbitAI · Tier C/media_report
- [64] Xiaomi-Robotics-U0:基于世界基础模型的统一具身合成 — arXiv · Tier A/research_paper
- [65] 中国Orca世界模型无需任何动作标签即可匹敌专业机器人系统 — The Decoder · Tier D/other
- [66] 面向具身智能的混合专家视频预训练规模化研究 — arXiv · Tier A/research_paper
- [67] Flux 3 可生成带原生音频、长达20秒的视频,Black Forest Labs 首次实现 — The Decoder · Tier D/other
- [68] DriftWorld:通过漂移实现快速世界建模 — arXiv · Tier A/research_paper
- [69] MoWorld:闪速世界模型 — arXiv · Tier A/research_paper
- [70] ABot-World-0:在单台桌面GPU上实现无限交互式世界推演 — arXiv · Tier A/research_paper
- [71] Wonder:更优的视频世界模型 — arXiv · Tier A/research_paper
- [72] INTACT:面向无搜索世界模型的同构意图到动作学习 — arXiv · Tier A/research_paper
- [73] 具有多样化交互的无限世界 — arXiv · Tier A/research_paper
- [74] M4World:一种用于交互式物体操控与分钟级流式生成的多视角多模态驾驶世界模型 — arXiv · Tier A/research_paper
- [75] Orbis 2:面向驾驶的分层世界模型 — arXiv · Tier A/research_paper
- [76] WAM-Diff2:面向高效自动驾驶VLA的分层自回归到扩散蒸馏方法 — arXiv · Tier A/research_paper
- [77] SafeGen:面向基于VLM的自动驾驶的安全关键场景目标条件视频扩散生成 — arXiv · Tier A/research_paper
- [78] Image2Sim:通过生成式神经模拟器扩展具身导航 — arXiv · Tier A/research_paper
- [79] Genie Sim PanoWorld:基于全景场景建模与仿真的无限室内3D世界生成管线 — arXiv · Tier A/research_paper
- [80] AI智能体创建虚拟训练场,为机器人提供关键训练数据 — MIT News: Computer Science · Tier D/other
- [81] PlanCraft:受建筑师启发的渐进式三维住宅场景生成——草图、细化与家具布置 — arXiv · Tier A/research_paper
- [82] SONG:用于社交导航基准测试的光照真实感3D高斯仿真平台 — arXiv · Tier A/research_paper
- [83] GS-Agent:通过生成式仿真创建4D物理世界 — arXiv · Tier A/research_paper
- [84] UniPhysGen:面向仿真就绪3D资产的统一物理基础化 — arXiv · Tier A/research_paper
- [85] SoftNav:将3D场景令牌注入视觉语言模型以实现具身导航 — arXiv · Tier A/research_paper
- [86] AutoPath:学习可迁移的目标条件随机路径先验,实现无需人类演示的安全导航 — arXiv · Tier A/research_paper
- [87] EAGOR:全方向具身推理 — arXiv · Tier A/research_paper
- [88] 解析、搜索与确认:基于思维链推理与结构化空间记忆的免训练空中视觉对话导航 — arXiv · Tier A/research_paper
- [89] FactorJEPA:将整体未来分解为布局-智能体-交互通道,面向拥挤混乱的全球南方城市世界 — arXiv · Tier A/research_paper
- [90] DynTrace:面向MLLM 4D时空推理的动态物体证据追踪 — arXiv · Tier A/research_paper
- [91] CAIRN:基于拓扑感知大型多模态模型的跨房间三维场景理解 — arXiv · Tier A/research_paper
- [92] IGGT4D:流式4D实例感知几何Transformer — arXiv · Tier A/research_paper
- [93] SiPhy:单图像物理属性推理 — arXiv · Tier A/research_paper
- [94] 从视频中发现物理规律:最小轨迹条件下时不变二阶常微分方程的可辨识性 — arXiv · Tier A/research_paper
- [95] World Translation:通过反向动力学提取与无配对域转换最小化仿真到现实差距 — arXiv · Tier A/research_paper
- [96] 薛定谔的猫:潜在场景运动学的概率表示与预测 — arXiv · Tier A/research_paper
- [97] 面向多步视觉推理的层次化去噪 — arXiv · Tier A/research_paper
- [98] 教会视频生成器记忆:激发用于不可见状态演化的动态记忆 — arXiv · Tier A/research_paper
- [99] 叙事世界模型:基于叙事学的长篇虚构写作记忆系统 — arXiv · Tier A/research_paper
- [100] UniVR:在视觉空间中思考以实现统一视觉推理 — arXiv · Tier A/research_paper
- [101] MobileSAM2:面向空间智能的轻量级Segment Anything模型 — arXiv · Tier A/research_paper
- [102] SIGGRAPH时间检验奖揭晓:这项研究,提前十年押中了物理AI — 量子位 QbitAI · Tier C/media_report
- [103] RealX3D:面向多视角视觉恢复与重建的物理退化3D基准 — OpenAlex: peer-reviewed AI venues · Tier A/research_paper
- [104] 具身智能“高考”难疯了!人类100分,最强模型12.8 — 量子位 QbitAI · Tier C/media_report
- [105] DexVerse:面向多任务、多本体灵巧操作的模块化基准测试 — arXiv · Tier A/research_paper
- [106] NavVerse:在连续机器人仿真中基准测试室内到室外具身导航 — arXiv · Tier A/research_paper
- [107] ZeroSplat:3D高斯泼溅中的广义指代分割 — arXiv · Tier A/research_paper
- [108] GEM-Occ:从视觉几何证据到具身语义占用记忆 — arXiv · Tier A/research_paper
- [109] KineBench:通过无逆动力学模型的运动学接地基准测试具身世界模型 — arXiv · Tier A/research_paper
- [110] Ego2Robot:从第一人称人类数据中可扩展地合成机器人数据 — arXiv · Tier A/research_paper
- [111] AXIS:面向可扩展机器人操作的可持续增长社区驱动数据引擎 — arXiv · Tier A/research_paper