D3PO: Multi-Objective Reinforcement Learning
D3PO trains a preference-conditioned policy to discover diverse, high-quality trade-off solutions in multi-objective environments.
Research summary
The method addresses destructive interference and mode collapse in multi-objective reinforcement learning through decomposed optimization, late-stage weighting, and a diversity regularizer.