[Feature] 支持 qwen3-vl-embedding 等多模态向量模型的图文检索
Nessuno ha ancora preso questa issue.
- Lingua principale
- Python
- Stelle
- 22.8k
- Fork
- 3.2k
- Merge medio
- 45m
- PR unite (30g)
- 270
Descrizione
MaxKB Version
2.10.5
Please describe your needs or suggestions for improvements
当前 MaxKB 的知识库向量化和检索流程只支持纯文本 Embedding,无法使用 qwen3-vl-embedding 等多模态向量模型进行图片向量化和图文跨模态检索。
在配置多模态向量模型后,图片内容仍只能先经过 OCR 或视觉模型转换为文本,再生成文本向量,无法直接生成图片向量。因此无法实现“文字检索图片”“图片检索文字”以及图文统一向量空间检索。
Please describe the solution you suggest
建议增加多模态向量模型能力:
- 在模型配置中标识文本、图片或图文多模态输入能力;
- 向量化任务支持将图片文件传递给 Embedding 模型,而不仅是
List[str]; - 查询侧支持文本、图片和图文混合输入;
- 向量存储和索引记录模型、维度及模态信息,避免与现有文本向量混用;
- 保持现有纯文本 Embedding 和已有知识库的兼容性。
Additional Information
MaxKB v2.10.5-lts 的 PGVector 入库和查询均调用 embed_query(text) / embed_documents(List[str]),当前模型抽象没有图片输入通道。
Guida per i contributori
Apri la guida per i contributori
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Direzione di ricerca
Inizia tracciando i punti di ingresso di ingestion e query di PGVector che chiamano embed_query(text) e embed_documents(List[str]), quindi esamina i tipi di input supportati dall’astrazione del modello. Definisci come vengono rappresentati gli input di immagini e gli input misti testo-immagine, i metadati del modello, le dimensioni e le informazioni sulla modalità, preservando gli embedding di testo esistenti. Il lavoro è completato quando i percorsi compatibili di ingestion e retrieval supportano le modalità richieste senza mescolare vettori incompatibili.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python
- Ambito
- backend, databases, machine-learning
- Tipo di issue
- Funzionalità
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Stato di attività
- Attiva
- Chiarezza
- Da chiarire
- Idoneità per principianti
- 30/100