google / google/gemma.cpp

Batch mode in GPU

Abierto
#826 3 comentarios 0 reacciones 0 asignados Ver en GitHub
Lenguaje dominante
C++
Estrellas
7k
Forks
660
Merge medio
20 h 43 min
PR fusionados (30 d)
33

Descripción

We like minimalist and productive inference, thank you!
But our use cases, and those of many users, require batch processing.
Batch mode isn't productive on CPUs. Do you have plans to implement inference execution on GPUs (TensorRT, CUDA)?

If so, you'll become the top solution for ETL processing that requires generative models.

Guía de contribución

Abrir la guía de contribución

Línea de trabajo

El issue no menciona archivos, pruebas ni puntos de entrada; comienza por localizar las rutas de ejecución de inferencia y batching en el proyecto C++ y revisar cómo se relacionaría la compatibilidad con GPU con TensorRT o CUDA. Para darlo por terminado, sería necesario acordar el alcance de implementación de la inferencia por lotes en GPU, que el issue todavía no define.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
cpp
Área
machine-learning
Tipo de issue
Nueva funcionalidad
Dificultad
5/5
Tiempo estimado
Más de una semana
Estado de actividad
Estancado
Claridad
Necesita aclaración
Aptitud para principiantes
25/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.