Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Individual Control Barrier Functions-Guided Diffusion Model for Safe Offline Multi-Agent Reinforcement Learning

About

Offline reinforcement learning allows control policies to be learned directly from data without online interaction, making it suitable for safety-critical tasks. Recent studies have applied diffusion models to offline reinforcement learning to leverage their strong capacity for modeling complex data distributions. However, existing approaches primarily focus on single-agent settings, leaving the safety challenges in multi-agent environments largely unexplored. In this work, we propose a safe offline multi-agent reinforcement learning algorithm that embeds neural individual control barrier functions into the diffusion model to enhance safety during trajectory generation, with control policies recovered through inverse dynamics. We evaluate our algorithm across diverse benchmarks, demonstrating substantial safety improvements while maintaining competitive rewards.

Qingyun Guo, Junyi Shi, Jianuo Huang, Tianyu Shi• 2026

Related benchmarks

TaskDatasetResultRank
Safe Offline Multi-Agent Reinforcement Learning2ant good
Reward1.05
3
Safe Offline Multi-Agent Reinforcement Learning2ant medium
Reward0.6
3
Safe Offline Multi-Agent Reinforcement Learning2ant poor
Reward0.33
3
Safe Offline Multi-Agent Reinforcement Learning4ant good
Reward0.99
3
Safe Offline Multi-Agent Reinforcement Learning4ant poor
Reward0.4
3
Safe Offline Multi-Agent Reinforcement Learning2halfcheetah poor
Reward0.13
3
Safe Offline Multi-Agent Reinforcement Learningsimple spread md
Reward82
3
Safe Offline Multi-Agent Reinforcement Learningsimple spread medium
Reward0.88
3
Safe Offline Multi-Agent Reinforcement Learningsimple spread random
Reward0.56
3
Safe Offline Multi-Agent Reinforcement Learning2halfcheetah good
Reward (2halfcheetah)1.08
3
Showing 10 of 13 rows

Other info

Follow for update