deepinsight / deepinsight/insightface

memory growth during training

Open
#2,264 1 comment 0 reactions 0 assignees View on GitHub
Dominant language
Python
Stars
29.7k
Forks
6.1k
PR merge metrics
No merged PRs in 30d

Description

Ram is growing during train loop
I'm training arcface in recognition/arcface_torch.

`torchrun --nproc_per_node 2 train_v2.py configs/custom_ds_pfc03_40epoch_2gpu_vits` - script launch

```
from easydict import EasyDict as edict

config = edict()
config.margin_list = (1.0, 0.0, 0.4)
config.network = "vit_s_dp005_mask_0"
config.resume = False
config.output = None
config.embedding_size = 128
config.sample_rate = 0.3
config.fp16 = False
config.weight_decay = 0.1
config.batch_size = 64
config.optimizer = "adamw"
config.lr = 0.001

config.verbose = 2000
config.dali = False

config.rec = "/var/ssd/face/"
config.num_classes = 1_000_000
config.num_image = 5_000_000
config.num_epoch = 20
config.warmup_epoch = config.num_epoch // 10
config.val_targets = []
```
my config.

Script takes some memory on load (~20 gb) and then progressively grows to full (48gb) and script fails.

I tried to lower number of workers, prefetch size (didn't work) and ram still grows.

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.