AI4Finance-Foundation / AI4Finance-Foundation/ElegantRL
AgentPPOHterm的update_net解析trajectory数据时存在bug?
- Ngôn ngữ chính
- Python
- Star
- 4.4k
- Fork
- 978
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Mô tả
`AgentPPOHterm`类的`update_net`函数,会解析之前在`train_and_evaluate`里面通过`AgentPPO.explore_one_env`生成的trajectory(并且由于PPO是on_policy算法,所以并不会把trajectory放入replay buffer然后重新采样),但可以看到,`AgentPPOHterm`类的`update_net`函数解析trajectory数据格式和存放时并不一致(和`AgentPPO`类的`update_net`函数也不一致),看起来是个bug
AgentPPOHterm类`update_net`函数里的trajectory解析:
https://github.com/AI4Finance-Foundation/ElegantRL/blob/1d5bf9e1639222c5d2a462adcc0c4eab453bbe70/elegantrl/agents/AgentPPO.py#L671
AgentPPO类`explore_one_env`函数里输出的trajectory格式:
https://github.com/AI4Finance-Foundation/ElegantRL/blob/1d5bf9e1639222c5d2a462adcc0c4eab453bbe70/elegantrl/agents/AgentPPO.py#L92
AgentPPO类`update_net`函数里的trajectory解析:
https://github.com/AI4Finance-Foundation/ElegantRL/blob/1d5bf9e1639222c5d2a462adcc0c4eab453bbe70/elegantrl/agents/AgentPPO.py#L139
除了这个解析顺序的问题,`AgentPPOHterm`类`update_net`需要的两个字段`buf_mask`和`buf_noise`似乎不能直接与`undones`和`logprobs`对应?不知道是不是代码实现上还没完成?
Hướng dẫn đóng góp
Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này
Đánh giá
Issue này chưa được đánh giá.