当我为各种问题实施代理时……我已经看到我的演员损失正在按预期减少。但是即使学到的策略非常好,我的评论家损失也一直在增加。这发生在 DDPG 、 PPO 等。
为什么我的评论家损失在增加的任何想法。
我尝试使用超参数,它实际上使我的策略变得更糟。
artificial-intelligence reinforcement-learning
artificial-intelligence ×1
reinforcement-learning ×1