AI4Finance-Foundation / AI4Finance-Foundation/ElegantRL
AgentPPO中的explore_one_env
- Lenguaje dominante
- Python
- Estrellas
- 4.4k
- Forks
- 978
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Descripción
请教下AgentPPO中的explore_one_env中的splice list 的作用是什么
` def explore_one_env(self, env, target_step):
traj_temp = list()
state = self.states[0]
last_done = 0
for i in range(target_step):
action, noise = [ary[0] for ary in self.select_actions((state,))]
next_state, reward, done, _ = env.step(np.tanh(action))
traj_temp.append((state, reward, done, action, noise))
if done:
state = env.reset()
last_done = i
else:
state = next_state
self.states[0] = state
'''splice list'''
traj_list = self.traj_list[0] + traj_temp[:last_done + 1]
self.traj_list[0] = traj_temp[last_done:]
return traj_list`
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Línea de trabajo
Start with AgentPPO.explore_one_env and trace where self.traj_list is initialized and consumed. Follow traj_temp, last_done, and the concatenation and slices around the “splice list” comment. Done means documenting why completed-episode data is returned while the unfinished rollout remains buffered.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python
- Área
- machine-learning
- Tipo de issue
- Documentación
- Dificultad
- 2/5
- Tiempo estimado
- 1-3 horas
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 25/100