1Panel-dev / 1Panel-dev/MaxKB

[Feature] 支持 qwen3-vl-embedding 等多模态向量模型的图文检索

オープン
#6,879 コメント 1 件 リアクション 0 件 担当者 0 名 GitHub で見る

まだ誰も着手していません。

Type: Feature Request
主要言語
Python
スター
22.8k
フォーク
3.2k
平均マージ
45分
マージ済み PR(30日)
270

説明

MaxKB Version

2.10.5

Please describe your needs or suggestions for improvements

当前 MaxKB 的知识库向量化和检索流程只支持纯文本 Embedding,无法使用 qwen3-vl-embedding 等多模态向量模型进行图片向量化和图文跨模态检索。

在配置多模态向量模型后,图片内容仍只能先经过 OCR 或视觉模型转换为文本,再生成文本向量,无法直接生成图片向量。因此无法实现“文字检索图片”“图片检索文字”以及图文统一向量空间检索。

Please describe the solution you suggest

建议增加多模态向量模型能力:

  • 在模型配置中标识文本、图片或图文多模态输入能力;
  • 向量化任务支持将图片文件传递给 Embedding 模型,而不仅是 List[str]
  • 查询侧支持文本、图片和图文混合输入;
  • 向量存储和索引记录模型、维度及模态信息,避免与现有文本向量混用;
  • 保持现有纯文本 Embedding 和已有知识库的兼容性。
Additional Information

MaxKB v2.10.5-lts 的 PGVector 入库和查询均调用 embed_query(text) / embed_documents(List[str]),当前模型抽象没有图片输入通道。

コントリビューションガイド

コントリビューションガイドを開く

はじめの一歩

  1. issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
  2. 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
  3. リポジトリをフォークし、ブランチを切って変更します。
  4. issue 番号を参照したプルリクエストを送ります。

調査の方向性

まず、embed_query(text) と embed_documents(List[str]) を呼び出す PGVector の取り込みおよびクエリのエントリポイントを追跡し、次にモデル抽象化がサポートする入力型を調べます。既存のテキスト埋め込みを維持しながら、画像入力と混合テキスト画像入力、モデルメタデータ、次元数、モダリティ情報をどのように表現するかを定義します。互換性のある取り込みおよび検索パスが要求されたモダリティをサポートし、互換性のないベクトルを混在させないことが完了の条件です。

索引モデルが issue の本文から書いたものです。

評価

技術スタック
python
領域
backend, databases, machine-learning
issue の種類
機能追加
難易度
5/5
見積もり時間
1週間以上
活発さ
活発
明瞭さ
説明が足りない
初心者へのやさしさ
30/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。