akanimax / akanimax/big-discriminator-batch-spoofing-gan
Training not progressing 1024x1024 on multigpu
- Lenguaje dominante
- Python
- Estrellas
- 45
- Forks
- 7
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Descripción
I run a few hours on 8GPUs wihtout any progress. Each sample is pixelwise copy of each other in all layers.
4x4

64x64

setup
```
git clone git@github.com:akanimax/BBMSG-GAN.git
conda create -n bbmsg python==3.7
conda activate bbmsg
conda install pytorch torchvision cudatoolkit=10.0 cudnn scipy==1.2.0 tensorboard -c pytorch
pip install tensorboardX tqdm
```
training
```
# calc real fid stats before training
python ../BBMSG-GAN/sourcecode/train.py \
--images_dir="$IMGS" \
--sample_dir="$SAMPLES" \
--model_dir="$MODELS" \
--depth=9 \
--batch_size=24 \
--num_samples=36 \
--feedback_factor=5 \
--checkpoint_factor=1 \
--num_epochs=50000 \
--num_workers=90 \
--log_fid_values=True \
--fid_temp_folder=/tmp/fid_tmp \
--fid_real_stats="$FID" \
--fid_batch_size=64 \
--num_fid_images=5000
```
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Línea de trabajo
Start with sourcecode/train.py and reproduce the reported 1024x1024 multigpu run using the setup and command shown in the issue. Inspect why training produces identical samples across layers and does not progress; done means the run advances and generated samples are no longer pixelwise copies.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python, pytorch
- Área
- machine-learning
- Tipo de issue
- Error
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 25/100