FedHPD: Heterogeneous Federated Reinforcement Learning via Policy Distillation
Abstract
This paper focuses on Federated Reinforcement Learning (FedRL) in black-box settings with heterogeneous agents. Existing studies mostly assume agent homogeneity and knowability of internal details. To tackle these issues, we propose Federated Heterogeneous Policy Distillation (FedHPD). FedHPD uses action probability distributions as a medium for knowledge sharing among heterogeneous agents. Extensive experiments show that FedHPD achieves significant improvements across various benchmark tasks.