agentscope-ai / agentscope-ai/QwenPaw
[Feature]: 支持独立视觉模型配置(Visual Model Fallback)
- Lingua principale
- Python
- Stelle
- 34.9k
- Fork
- 3.1k
- Merge medio
- 1g 15h
- PR unite (30g)
- 225
Descrizione
## 功能建议
当前 QwenPaw 的图片/视频处理完全依赖主模型的多模态能力。如果主模型不支持视觉输入(如 LongCat-2.0-Preview),图片就无法被理解。
## 建议方案
增加一个独立的视觉模型配置项(如 `visual_model`),当主模型不支持多模态时,自动调用视觉模型对图片进行描述/转述,然后将文本结果交给主模型继续处理。
## 使用场景
- 用户主模型为纯文本模型(如 deepseek-v4-flash),但偶尔需要处理图片
- 用户不想为了视觉能力而更换主模型
- 类似"视觉中转站"的概念:图片 → 视觉模型转文字 → 主模型处理
## 配置示例(建议)
在 `agent.json` 中:
{
"active_model": {
"provider_id": "deepseek",
"model": "deepseek-v4-flash"
},
"visual_model": {
"provider_id": "zhipu-cn",
"model": "glm-4v-flash"
}
}
## 预期行为
1. 收到图片时,先检测主模型是否支持多模态
2. 如果支持,直接发给主模型(现有行为不变)
3. 如果不支持,自动调用 `visual_model` 对图片进行描述
4. 将视觉模型的文本输出作为上下文,交给主模型继续处理
## 参考
类似功能在 Open WebUI 和其他 LLM 客户端中已有实现。
Guida per i contributori
Apri la guida per i contributori
Valutazione
Questa issue non è ancora stata valutata.