DiamondLightSource / DiamondLightSource/python-dlstbx

Better handle failed processing jobs when terminated by cluster

Aberta
#289 2 comentários 0 reações 0 responsáveis Ver no GitHub

Ninguém assumiu esta issue ainda.

Linguagem predominante
Python
Estrelas
2
Forks
3
Merge médio
1d 11h
PRs com merge (30d)
2

Descrição

Raised by Mark; this collection has a permanent spinning cog: https://ispyb.diamond.ac.uk/dc/visit/mx37593-40/id/18159036

This corresponds to a reprocessing run that combined several datasets:

Image

The log file shows it terminating in the middle of integration (I assume due to OOM errors):

...
oooooooooooooooooooooooooooooooooo.ooooooooooooooooooooooooo
oooooooooooooooooooooooooooooooooooooooooooooooooooooooooooo
oooooooooooooooooooooooooooooooooooooooooooooooooooooooooooo
oooooooooooooooooooooooooooooooooooooooooooooooooooooooooooo
"o" => good        "%" => ok        "!" => bad rmsd
"O" => overloaded  "#" => many bad  "." => weak
"@" => abandoned
Mosaic spread: 0.413 < 0.413 < 0.413
-------------------- Spotfinding SWEEP2 --------------------
67030 spots found on 3600 images (max 1798 / bin)
              ***
            ******
           *********                       ****
         *************                  *********
*     ******************* ***          *************     ***
** *****************************   ******************** ****
************************************************************
************************************************************
************************************************************
************************************************************
1                         image                         3600
------------------- Autoindexing SWEEP2 --------------------
All possible indexing solutions:
aP  40.40  57.05  77.35 102.77  94.67 100.11
Indexing solution:
aP  40.40  57.05  77.35 102.77  94.67 100.11
-------------------- Integrating SWEEP2 --------------------

possibly we need to have a service that occasionally checks the cluster status for known reprocessing jobs, and marks it as failed if the cluster job has gone away but no status update written?

Guia de contribuição

Nenhum guia de contribuição indexado para este repositório

Primeiros passos

  1. Leia a issue inteira e depois o guia de contribuição do projeto.
  2. Comente na issue dizendo que vai assumir — evita que duas pessoas façam o mesmo trabalho.
  3. Faça um fork do repositório e trabalhe em uma branch.
  4. Abra um pull request que referencie o número da issue.

Direção de pesquisa

Nenhum arquivo, teste ou ponto de entrada é nomeado. Comece rastreando como os jobs de reprocessamento recebem atualizações de status e como o encerramento do cluster é representado; está concluído quando um job conhecido é marcado como falho ao desaparecer o job do cluster sem uma atualização de status, em vez de permanecer em um estado de carregamento contínuo.

Escrita pelo modelo de indexação a partir do texto da issue.

Avaliação

Stack de tecnologia
python
Domínio
backend, distributed-systems
Tipo de issue
Bug
Dificuldade
4/5
Tempo estimado
3-5 dias
Status de atividade
Estagnada
Clareza
Precisa de esclarecimento
Facilidade para iniciantes
35/100

Receba novas issues na sua caixa de entrada

Um resumo curto de issues do GitHub para quem está começando.