Diffusion Policies for Short-Horizon Planning in Robot Crowd Navigation

📅 2026-08-27
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
研究提出PDPO方法,通过生成短期动作序列解决机器人在密集人群中的安全高效导航问题,预训练与在线微调结合,提升导航成功率。
📝 Abstract
Robot crowd navigation requires safe and efficient decision-making under dense, dynamic, and multimodal human--robot interactions. Existing reinforcement-learning methods typically output a single reactive action at each timestep, which limits their ability to represent diverse short-term avoidance strategies. We propose Planning Diffusion Policy Optimization (PDPO), an offline-to-online reinforcement-learning framework that uses a diffusion policy to generate short-horizon action chunks for crowd navigation. PDPO is first pretrained on collision-avoidance demonstrations and then fine-tuned online with PPO by treating the denoising process as an internal decision process. During execution, the policy generates a five-step action chunk and applies it in a receding-horizon manner. Furthermore, we observe an evaluation artifact in common crowd-navigation benchmarks: without explicit boundary constraints, learned agents may leave the valid domain and bypass dense crowds. To address this, we introduce a setting in which boundary violations are treated as collisions. Experiments show that PDPO obtains an improved success rate over strong baselines, and ablations demonstrate that action chunks are especially important for the modified bounded benchmark.
Problem

Research questions and friction points this paper is trying to address.

Robot Crowd Navigation
Reinforcement Learning
Short-Horizon Planning
Collision Avoidance
Dense Human-Robot Interactions
Innovation

Methods, ideas, or system contributions that make the work stand out.

diffusion policy
short-horizon planning
offline-to-online reinforcement learning
crowd navigation
action chunks
🔎 Similar Papers
No similar papers found.
💼 Related Jobs
No related jobs found.