google / google/gemma.cpp

Batch mode in GPU

Ouverte
#826 3 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Langage dominant
C++
Étoiles
7k
Forks
660
Merge moyen
20 h 43 min
PR mergées (30 j)
33

Description

We like minimalist and productive inference, thank you!
But our use cases, and those of many users, require batch processing.
Batch mode isn't productive on CPUs. Do you have plans to implement inference execution on GPUs (TensorRT, CUDA)?

If so, you'll become the top solution for ETL processing that requires generative models.

Guide de contribution

Ouvrir le guide de contribution

Piste de recherche

L’issue ne mentionne aucun fichier, test ou point d’entrée ; commencez par localiser les chemins d’exécution de l’inférence et de batching dans le projet C++ et examiner comment la prise en charge du GPU serait liée à TensorRT ou CUDA. Pour considérer le travail comme terminé, il faudrait définir d’un commun accord le périmètre d’implémentation de l’inférence par lots sur GPU, que l’issue ne définit pas encore.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
cpp
Domaine
machine-learning
Type d'issue
Fonctionnalité
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
25/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.