python / python/mypy

Sqlite writes limit parallel scaling

Offen
#21,235 9 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen

Dieses Issue hat noch niemand übernommen.

parallel checking performance
Vorherrschende Sprache
Python
Sterne
20.6k
Forks
3.3k
PR-Merge-Kennzahlen
PR-Kennzahlen ausstehend

Beschreibung

I measured time spent in sqlite operations when running the mypy_parallel benchmark. When using 8 workers, sqlite writes were over 10x slower compared to using just 1 worker, likely because only one worker can be writing at any time. This seems to be one of the main sources of limited parallel scaling on macOS at least.

Here are some ideas which might help:

  1. Instead of writing cache files in each worker, send them via IPC and have the main process write everything.
  2. Use a separate extra cache file per worker, and the main process will copy per-worker cached data to the main database. Every worker reads from the main database.
  3. Use a separate extra cache file per worker, and somehow allow each worker to read from the right database but always write to their own database.
  4. Shard the database -- have 1 (non-exclusive) database per worker, and use module name based hash to choose the target database for both reading and writing.

Next steps:

  • Measure on Linux as well
  • Prototype some of the ideas and measure impact (at least ones that are easy enough to implement)

cc @ilevkivskyi

Beitragsleitfaden

Beitragsleitfaden öffnen

Erste Schritte

  1. Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
  2. Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
  3. Forke das Repository und arbeite in einem Branch.
  4. Öffne einen Pull Request, der die Issue-Nummer nennt.

Rechercherichtung

Beginne damit, den mypy_parallel-Benchmark nachzustellen und die SQLite-Schreibzeit mit einem und acht Workern unter macOS und Linux zu messen. Überprüfe anschließend die vier vorgeschlagenen Ansätze zum Schreiben des Caches und erstelle Prototypen der einfachsten Kandidaten. Als erledigt gilt, wenn vergleichbare Messungen und die Auswirkungen auf die parallele Skalierung berichtet werden.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
python, sqlite
Bereich
databases, performance
Issue-Typ
Feature
Schwierigkeit
5/5
Geschätzter Aufwand
Über eine Woche
Aktivitätsstatus
Ruhig
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
35/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.