Real-world reinforcement learning from suboptimal interventions
Yinuo Zhao, Huiqian Jin, Lechun Jiang, Xinyi Zhang, Kun Wu, Pei Ren, Zhiyuan Xu†, Zhengping Che†, Lei Sun, Dapeng Wu, Chi Harold Liu, Jian Tang✉.
arXiv, 2025
SiLRI uses a learnable state-wise Lagrange multiplier to balance imitation and RL under suboptimal expert interventions, cutting the time to 90% success by at least 50% versus HIL-SERL and reaching 100% success on long-horizon tasks.