agentscope-ai / agentscope-ai/QwenPaw

[Feature]: 支持独立视觉模型配置(Visual Model Fallback)

Aperta
#4,992 4 commenti 3 reazioni 1 assegnatario Rivendicata da @yuanxs21 Vedi su GitHub
enhancement
Lingua principale
Python
Stelle
34.9k
Fork
3.1k
Merge medio
1g 15h
PR unite (30g)
225

Descrizione

## 功能建议

当前 QwenPaw 的图片/视频处理完全依赖主模型的多模态能力。如果主模型不支持视觉输入(如 LongCat-2.0-Preview),图片就无法被理解。

## 建议方案

增加一个独立的视觉模型配置项(如 `visual_model`),当主模型不支持多模态时,自动调用视觉模型对图片进行描述/转述,然后将文本结果交给主模型继续处理。

## 使用场景

- 用户主模型为纯文本模型(如 deepseek-v4-flash),但偶尔需要处理图片
- 用户不想为了视觉能力而更换主模型
- 类似"视觉中转站"的概念:图片 → 视觉模型转文字 → 主模型处理

## 配置示例(建议)

在 `agent.json` 中:

{
"active_model": {
"provider_id": "deepseek",
"model": "deepseek-v4-flash"
},
"visual_model": {
"provider_id": "zhipu-cn",
"model": "glm-4v-flash"
}
}

## 预期行为

1. 收到图片时,先检测主模型是否支持多模态
2. 如果支持,直接发给主模型(现有行为不变)
3. 如果不支持,自动调用 `visual_model` 对图片进行描述
4. 将视觉模型的文本输出作为上下文,交给主模型继续处理

## 参考

类似功能在 Open WebUI 和其他 LLM 客户端中已有实现。

Guida per i contributori

Apri la guida per i contributori

Valutazione

Questa issue non è ancora stata valutata.

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.