DatathonInfo / DatathonInfo/H.D.A.I.2021

[주제2] 데이터 및 평가지표, 제출방식과 관련하여 질문드립니다.

Open
#26 1 comment 6 reactions 0 assignees View on GitHub
Dominant language
No language data
Stars
7
Forks
3
PR merge metrics
No merged PRs in 30d

Description

넘겨주신 xml로 이루어진 ecg 데이터와 관련하여 몇 가지 여쭤볼 것이 있습니다.

1. train set에 있는 ecg 데이터를 맨 앞의 넘버링을 기준으로 3가지 카테고리(5, 6, 8)로 나눌 수 있을 것 같은데요, 데이터를 살펴보니 5와 8은 8개의 leads(I, II, V1~V6)로 이루어져있고 6은 12개의 leads로 이루어져 있었습니다. 8개의 leads에 V 채널들과 함께 I, II 채널들이 포함되어 있기 때문에 5, 8번 데이터들은 메뉴얼하게 12개의 leads로 만든 뒤, 12개의 lead 채널을 input으로 받는 모델을 학습시킬 수 있을 것 같긴 한데요, 이렇게 담고 있는 정보량 자체가 같긴 하지만 input channel들이 다른 경우를 handling하는 것이 대회에서 의도한 바가 맞나요?

2. 5번 데이터들을 보면 두 가지의 waveform data가 있는데요, 앞의 것은 짧고 뒤의 것은 5000개의 sample size로 이루어져 있는 것 같습니다. 이 경우에는 뒤의 긴 signal data를 학습 데이터로 사용하면 될지요?

3. 모델을 학습시킬 때 end to end로 xml 파일을 바로 forwarding시키는 게 아니라, 오프라인으로 전처리를 진행한 뒤 전처리가 완료되어 dump시킨 데이터를(e.g. .mat / .npy, ...) 학습 코드의 input으로 넘겨주는 방식으로 구성해도 될까요? 관련해서 전처리 코드 및 실행 방법은 readme에 명시할 예정입니다.

4. 주어진 데이터의 레이블이 multi-label로 이루어져 있나요, 아니면 single-label로 이루어져 있나요? 즉, 각 샘플에 대해서 레이블링된 진단명이 하나씩만 있는지, 아니면 여러 진단명이 있을 수 있는지 여쭤봅니다.

5. evaluation metric이 auroc인데요, binary class가 아니다 보니 auroc가 각 클래스마다 나올텐데, 이 때 micro / macro 둘 중 무엇으로 aggregation해야 하나요?

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.