DGPO: Discovering Multiple Strategies with Diversity-Guided Policy Optimization

Wenze Chen (Tsinghua University), Shiyu Huang (Tsinghua University), Yuan Chiang (Tsinghua University), Ting Chen (Tsinghua University), Jun Zhu (Tsinghua University)

Abstract

Recent algorithms designed for reinforcement learning tasks focus on finding a single optimal solution. However, in many practical applications, it is important to develop reasonable agents with diverse strategies. In this paper, we propose Diversity-Guided Policy Optimization, an on-policy framework for discovering multiple strategies for the same task. Our algorithm uses diversity objectives to guide a latent code conditioned policy to learn a set of diverse strategies in a single training procedure. Experimental results show that our method efficiently finds diverse strategies in a wide variety of reinforcement learning tasks. We further show that DGPO has similar performance and achieves a higher diversity score or better sample efficiency compared to other baselines.