Batch mode in GPU
- Langage dominant
- C++
- Étoiles
- 7k
- Forks
- 660
- Merge moyen
- 20 h 43 min
- PR mergées (30 j)
- 33
Description
We like minimalist and productive inference, thank you!
But our use cases, and those of many users, require batch processing.
Batch mode isn't productive on CPUs. Do you have plans to implement inference execution on GPUs (TensorRT, CUDA)?
If so, you'll become the top solution for ETL processing that requires generative models.
Guide de contribution
Ouvrir le guide de contribution
Piste de recherche
L’issue ne mentionne aucun fichier, test ou point d’entrée ; commencez par localiser les chemins d’exécution de l’inférence et de batching dans le projet C++ et examiner comment la prise en charge du GPU serait liée à TensorRT ou CUDA. Pour considérer le travail comme terminé, il faudrait définir d’un commun accord le périmètre d’implémentation de l’inférence par lots sur GPU, que l’issue ne définit pas encore.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- cpp
- Domaine
- machine-learning
- Type d'issue
- Fonctionnalité
- Difficulté
- 5/5
- Temps estimé
- Plus d'une semaine
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 25/100