[Feature] 支持 qwen3-vl-embedding 等多模态向量模型的图文检索
Dieses Issue hat noch niemand übernommen.
- Vorherrschende Sprache
- Python
- Sterne
- 22.8k
- Forks
- 3.2k
- Ø Merge
- 45 Min.
- Gemergte PRs (30 T.)
- 270
Beschreibung
MaxKB Version
2.10.5
Please describe your needs or suggestions for improvements
当前 MaxKB 的知识库向量化和检索流程只支持纯文本 Embedding,无法使用 qwen3-vl-embedding 等多模态向量模型进行图片向量化和图文跨模态检索。
在配置多模态向量模型后,图片内容仍只能先经过 OCR 或视觉模型转换为文本,再生成文本向量,无法直接生成图片向量。因此无法实现“文字检索图片”“图片检索文字”以及图文统一向量空间检索。
Please describe the solution you suggest
建议增加多模态向量模型能力:
- 在模型配置中标识文本、图片或图文多模态输入能力;
- 向量化任务支持将图片文件传递给 Embedding 模型,而不仅是
List[str]; - 查询侧支持文本、图片和图文混合输入;
- 向量存储和索引记录模型、维度及模态信息,避免与现有文本向量混用;
- 保持现有纯文本 Embedding 和已有知识库的兼容性。
Additional Information
MaxKB v2.10.5-lts 的 PGVector 入库和查询均调用 embed_query(text) / embed_documents(List[str]),当前模型抽象没有图片输入通道。
Beitragsleitfaden
Erste Schritte
- Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
- Forke das Repository und arbeite in einem Branch.
- Öffne einen Pull Request, der die Issue-Nummer nennt.
Rechercherichtung
Beginne damit, die PGVector-Einstiegspunkte für Ingestion und Abfragen nachzuverfolgen, die embed_query(text) und embed_documents(List[str]) aufrufen, und untersuche anschließend die unterstützten Eingabetypen der Modellabstraktion. Lege fest, wie Bild- und gemischte Text-Bild-Eingaben, Modellmetadaten, Dimensionen und Informationen zur Modalität dargestellt werden, während bestehende Texteambeddings erhalten bleiben. Als abgeschlossen gilt die Änderung, wenn kompatible Ingestion- und Retrieval-Pfade die angeforderten Modalitäten unterstützen, ohne inkompatible Vektoren zu vermischen.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python
- Bereich
- backend, databases, machine-learning
- Issue-Typ
- Feature
- Schwierigkeit
- 5/5
- Geschätzter Aufwand
- Über eine Woche
- Aktivitätsstatus
- Aktiv
- Klarheit
- Muss geklärt werden
- Anfängerfreundlichkeit
- 30/100