AI4Finance-Foundation / AI4Finance-Foundation/ElegantRL

AgentPPOHterm的update_net解析trajectory数据时存在bug?

Ouverte
#229 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
bug
Langage dominant
Python
Étoiles
4.4k
Forks
978
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

`AgentPPOHterm`类的`update_net`函数,会解析之前在`train_and_evaluate`里面通过`AgentPPO.explore_one_env`生成的trajectory(并且由于PPO是on_policy算法,所以并不会把trajectory放入replay buffer然后重新采样),但可以看到,`AgentPPOHterm`类的`update_net`函数解析trajectory数据格式和存放时并不一致(和`AgentPPO`类的`update_net`函数也不一致),看起来是个bug

AgentPPOHterm类`update_net`函数里的trajectory解析:
https://github.com/AI4Finance-Foundation/ElegantRL/blob/1d5bf9e1639222c5d2a462adcc0c4eab453bbe70/elegantrl/agents/AgentPPO.py#L671

AgentPPO类`explore_one_env`函数里输出的trajectory格式:
https://github.com/AI4Finance-Foundation/ElegantRL/blob/1d5bf9e1639222c5d2a462adcc0c4eab453bbe70/elegantrl/agents/AgentPPO.py#L92

AgentPPO类`update_net`函数里的trajectory解析:
https://github.com/AI4Finance-Foundation/ElegantRL/blob/1d5bf9e1639222c5d2a462adcc0c4eab453bbe70/elegantrl/agents/AgentPPO.py#L139

除了这个解析顺序的问题,`AgentPPOHterm`类`update_net`需要的两个字段`buf_mask`和`buf_noise`似乎不能直接与`undones`和`logprobs`对应?不知道是不是代码实现上还没完成?

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Évaluation

Cette issue n'a pas encore été évaluée.

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.