diff --git a/torchy_baselines/a2c/a2c.py b/torchy_baselines/a2c/a2c.py index ea27d71..5f0d507 100644 --- a/torchy_baselines/a2c/a2c.py +++ b/torchy_baselines/a2c/a2c.py @@ -97,8 +97,9 @@ class A2C(PPO): values = values.flatten() # Normalize advantage (not present in the original implementation) + advantages = rollout_data.advantages if self.normalize_advantage: - advantages = (rollout_data.advantages - rollout_data.advantages.mean()) / (rollout_data.advantages.std() + 1e-8) + advantages = (advantages - advantages.mean()) / (advantages.std() + 1e-8) # Policy gradient loss policy_loss = -(advantages * log_prob).mean()