MegEngine / MegEngine/MegDiffusion
Handle with saving checkpoint failed
Personne n'a encore pris cette issue.
- Langage dominant
- Python
- Étoiles
- 19
- Forks
- 0
- Métriques de merge des PR
- Aucune PR mergée en 30 j
Description
If the machine is preemptive, it might be scheduled to be preempted (or encounter other situations that cause the machine to go down). If the checkpoint is being saved at the exact moment, the original data will be corrupted. Therefore, it is reasonable to keep multiple backups locally. Considering the disk space occupancy, it is better to support cloud storage, such as supporting the use of AWS s3.
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Piste de recherche
Aucun fichier, test ou point d’entrée n’est nommé. Commencez par localiser le flux d’enregistrement des checkpoints et examinez la manière dont il gère les interruptions ; précisez si le périmètre attendu couvre plusieurs sauvegardes locales, la prise en charge d’AWS S3, ou les deux, puis définissez l’achèvement à l’aide de tests pour la récupération et le comportement du stockage.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- aws, python
- Domaine
- cloud, machine-learning
- Type d'issue
- Fonctionnalité
- Difficulté
- 5/5
- Temps estimé
- Plus d'une semaine
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 25/100