google / google/gemma.cpp

Batch mode in GPU

オープン
#826 コメント 3 件 リアクション 0 件 担当者 0 名 GitHub で見る
主要言語
C++
スター
7k
フォーク
660
平均マージ
20時間 43分
マージ済み PR(30日)
33

説明

We like minimalist and productive inference, thank you!
But our use cases, and those of many users, require batch processing.
Batch mode isn't productive on CPUs. Do you have plans to implement inference execution on GPUs (TensorRT, CUDA)?

If so, you'll become the top solution for ETL processing that requires generative models.

コントリビューションガイド

コントリビューションガイドを開く

調査の方向性

この issue にはファイル、テスト、エントリポイントが記載されていません。まず、C++ プロジェクト内の推論実行とバッチ処理のパスを特定し、GPU サポートが TensorRT または CUDA とどのように関係するかを確認してください。完了とするには、GPU バッチ推論の実装スコープについて合意する必要がありますが、そのスコープはこの issue ではまだ定義されていません。

索引モデルが issue の本文から書いたものです。

評価

技術スタック
cpp
領域
machine-learning
issue の種類
機能追加
難易度
5/5
見積もり時間
1週間以上
活発さ
停滞
明瞭さ
説明が足りない
初心者へのやさしさ
25/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。