google / google/gemma.cpp

Batch mode in GPU

Offen
#826 3 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
C++
Sterne
7k
Forks
660
Ø Merge
20 Std. 43 Min.
Gemergte PRs (30 T.)
33

Beschreibung

We like minimalist and productive inference, thank you!
But our use cases, and those of many users, require batch processing.
Batch mode isn't productive on CPUs. Do you have plans to implement inference execution on GPUs (TensorRT, CUDA)?

If so, you'll become the top solution for ETL processing that requires generative models.

Beitragsleitfaden

Beitragsleitfaden öffnen

Bewertung

Dieses Issue wurde noch nicht bewertet.

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.