MegEngine / MegEngine/MegDiffusion
Handle with saving checkpoint failed
Nadie ha tomado este issue todavía.
- Lenguaje dominante
- Python
- Estrellas
- 19
- Forks
- 0
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Descripción
If the machine is preemptive, it might be scheduled to be preempted (or encounter other situations that cause the machine to go down). If the checkpoint is being saved at the exact moment, the original data will be corrupted. Therefore, it is reasonable to keep multiple backups locally. Considering the disk space occupancy, it is better to support cloud storage, such as supporting the use of AWS s3.
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Línea de trabajo
No se nombran archivos, tests ni puntos de entrada. Empieza por localizar el flujo de guardado de checkpoints y revisa cómo gestiona las interrupciones; aclara si el alcance esperado incluye varias copias de seguridad locales, compatibilidad con AWS S3 o ambas cosas, y luego define la finalización con tests para la recuperación y el comportamiento del almacenamiento.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- aws, python
- Área
- cloud, machine-learning
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 25/100