AI4Finance-Foundation / AI4Finance-Foundation/ElegantRL
SAC alpha update problem
Offen
- Vorherrschende Sprache
- Python
- Sterne
- 4.4k
- Forks
- 978
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
In `obj_alpha = (self.alpha_log * (self.target_entropy - log_prob).detach()).mean()` when alpha_log=0, alpha will be 1forever.
the correct way is `obj_alpha = (self.alpha * (self.target_entropy - log_prob).detach()).mean()` .
this problem is also found in rlkit.
Algorithm details in the source code of :
https://github.com/rail-berkeley/softlearning/blob/13cf187cc93d90f7c217ea2845067491c3c65464/softlearning/algorithms/sac.py#L256
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Bewertung
Dieses Issue wurde noch nicht bewertet.