Batch mode in GPU
- Lenguaje dominante
- C++
- Estrellas
- 7k
- Forks
- 660
- Merge medio
- 20 h 43 min
- PR fusionados (30 d)
- 33
Descripción
We like minimalist and productive inference, thank you!
But our use cases, and those of many users, require batch processing.
Batch mode isn't productive on CPUs. Do you have plans to implement inference execution on GPUs (TensorRT, CUDA)?
If so, you'll become the top solution for ETL processing that requires generative models.
Guía de contribución
Línea de trabajo
El issue no menciona archivos, pruebas ni puntos de entrada; comienza por localizar las rutas de ejecución de inferencia y batching en el proyecto C++ y revisar cómo se relacionaría la compatibilidad con GPU con TensorRT o CUDA. Para darlo por terminado, sería necesario acordar el alcance de implementación de la inferencia por lotes en GPU, que el issue todavía no define.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- cpp
- Área
- machine-learning
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 25/100