[Feature] 支持 qwen3-vl-embedding 等多模态向量模型的图文检索
オープン
まだ誰も着手していません。
Type: Feature Request
- 主要言語
- Python
- スター
- 22.8k
- フォーク
- 3.2k
- 平均マージ
- 45分
- マージ済み PR(30日)
- 270
説明
MaxKB Version
2.10.5
Please describe your needs or suggestions for improvements
当前 MaxKB 的知识库向量化和检索流程只支持纯文本 Embedding,无法使用 qwen3-vl-embedding 等多模态向量模型进行图片向量化和图文跨模态检索。
在配置多模态向量模型后,图片内容仍只能先经过 OCR 或视觉模型转换为文本,再生成文本向量,无法直接生成图片向量。因此无法实现“文字检索图片”“图片检索文字”以及图文统一向量空间检索。
Please describe the solution you suggest
建议增加多模态向量模型能力:
- 在模型配置中标识文本、图片或图文多模态输入能力;
- 向量化任务支持将图片文件传递给 Embedding 模型,而不仅是
List[str]; - 查询侧支持文本、图片和图文混合输入;
- 向量存储和索引记录模型、维度及模态信息,避免与现有文本向量混用;
- 保持现有纯文本 Embedding 和已有知识库的兼容性。
Additional Information
MaxKB v2.10.5-lts 的 PGVector 入库和查询均调用 embed_query(text) / embed_documents(List[str]),当前模型抽象没有图片输入通道。
コントリビューションガイド
はじめの一歩
- issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
- 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
- リポジトリをフォークし、ブランチを切って変更します。
- issue 番号を参照したプルリクエストを送ります。
調査の方向性
まず、embed_query(text) と embed_documents(List[str]) を呼び出す PGVector の取り込みおよびクエリのエントリポイントを追跡し、次にモデル抽象化がサポートする入力型を調べます。既存のテキスト埋め込みを維持しながら、画像入力と混合テキスト画像入力、モデルメタデータ、次元数、モダリティ情報をどのように表現するかを定義します。互換性のある取り込みおよび検索パスが要求されたモダリティをサポートし、互換性のないベクトルを混在させないことが完了の条件です。
索引モデルが issue の本文から書いたものです。
評価
- 技術スタック
- python
- 領域
- backend, databases, machine-learning
- issue の種類
- 機能追加
- 難易度
- 5/5
- 見積もり時間
- 1週間以上
- 活発さ
- 活発
- 明瞭さ
- 説明が足りない
- 初心者へのやさしさ
- 30/100