mimic3wdb-matched RECORDS file hast too many entries
Dieses Issue hat noch niemand übernommen.
- Vorherrschende Sprache
- Jupyter Notebook
- Sterne
- 853
- Forks
- 322
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
We are trying to download the mimic3wdb-matched database via wfdb.io.dl_database like so:
wfdb.io.dl_database("mimic3wdb-matched", "mimic3wdb-matched", records='all', annotators='all', keep_subdirs=True, overwrite=False)
After a long wait, we get an error indicating a missing file:
wfdb.io._url.NetFileNotFoundError: 404 Error: Not Found for url: https://physionet.org/files/mimic3wdb-matched/1.0/p01/p017488/3783537_10000.hea
While investigating we found that the corresponding RECORDS file contains more records than there are in the database:
https://physionet.org/files/mimic3wdb-matched/1.0/p01/p017488/RECORDS
RECORDS file:
Actual content:
wfdb.io.dl_database generates unique urls using this RECORDS file which then leads to the mentioned error above.
Some questions:
- Can someone adapt the RECORDS file to reflect the database content
- The download via
wfdb.io.dl_databaseis excruciating slow. Would it make sens to rewritewfdb.io.dl_databaseto use multi-threading? Or what approach do you use to dump the whole database efficiently?
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Erste Schritte
- Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
- Forke das Repository und arbeite in einem Branch.
- Öffne einen Pull Request, der die Issue-Nummer nennt.
Rechercherichtung
Beginne mit wfdb.io.dl_database und vergleiche die verknüpfte mimic3wdb-matched RECORDS-Datei mit den Inhalten der Datenbank, einschließlich der fehlenden 3783537_10000.hea-URL. Bestätige, wie die zusätzlichen Einträge Download-Fehler verursachen, und überprüfe anschließend, dass beim Herunterladen der Datenbank keine nicht vorhandenen Datensätze mehr angefordert werden; die vorgeschlagene Änderung für Multithreading ist eine separate, umfassendere Frage.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python
- Bereich
- backend, data
- Issue-Typ
- Bug
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 35/100