WLA$^3$: World Latent Action Modeling for Semantics, Dynamics, and Kinematics
本文提出WLA³模型,通过学习世界状态变化来解决多源数据下动作监督不足的问题,利用人类第一视角视频和机器人轨迹提高动作识别准确性。
0 citationsRead paper
本文提出WLA³模型,通过学习世界状态变化来解决多源数据下动作监督不足的问题,利用人类第一视角视频和机器人轨迹提高动作识别准确性。
本文针对3D虚拟人物多模态同步输入下的自然行为生成问题,提出MOCO框架,通过迭代扩散模型处理语音、文本等多模态数据,生成连贯且逼真的动作。
该研究提出了一种前馈INR图像编码架构PIC,解决了INR编码速度慢和解码效率低的问题,实现了快速编码与毫秒级解码。
为了解决动作条件视频模型数据获取难题,本文提出基于虚幻引擎的两阶段合成数据生成管道,生成大规模动作条件多视角视频。
本文针对视觉-语言模型在物理世界空间推理上的局限,提出FactoSR框架,通过分解为平面对应、深度一致性和时间可逆性三个子目标,强化4D一致性,提升3D和4D推理能力。
本文提出WLA³模型,通过学习世界状态变化来解决多源数据下动作监督不足的问题,利用人类第一视角视频和机器人轨迹提高动作识别准确性。
本文针对3D虚拟人物多模态同步输入下的自然行为生成问题,提出MOCO框架,通过迭代扩散模型处理语音、文本等多模态数据,生成连贯且逼真的动作。
该研究提出了一种前馈INR图像编码架构PIC,解决了INR编码速度慢和解码效率低的问题,实现了快速编码与毫秒级解码。
为了解决动作条件视频模型数据获取难题,本文提出基于虚幻引擎的两阶段合成数据生成管道,生成大规模动作条件多视角视频。
本文针对视觉-语言模型在物理世界空间推理上的局限,提出FactoSR框架,通过分解为平面对应、深度一致性和时间可逆性三个子目标,强化4D一致性,提升3D和4D推理能力。