agentscope-ai / agentscope-ai/QwenPaw
[Feature]: 纯文本模型支持图片自动转文字描述(vision fallback)
未关闭
enhancement
- 主要语言
- Python
- 星标
- 34.9k
- 派生
- 3.1k
- 平均合并
- 1 天 15 小时
- 30 天内合并 PR
- 225
描述
## 功能请求
当用户配置了纯文本模型(如 `qwen-max`、`QwenPaw-Flash`)时,如果用户上传图片,当前系统会直接报错或忽略。
**期望行为**:
- 检测到当前模型不支持多模态 + 用户上传了图片
- 自动调用备用的视觉模型(如 `qwen-vl-max`、`gpt-4o`)生成图片描述
- 将描述文本注入到对话上下文中
- 纯文本模型基于描述继续对话
**参考实现**:
类似 qclaw / codex 的处理流程:
1. 保存图片到磁盘
2. 调用视觉模型生成文字描述
3. 描述注入上下文
4. 纯文本模型基于描述回复
**配置建议**:
在 `agent.json` 中增加配置项:
```json
{
"multimodal_fallback": {
"enabled": true,
"vision_provider": "dashscope",
"vision_model": "qwen-vl-max"
}
}
使用场景:
用户主要使用本地小模型(如 QwenPaw-Flash 系列)节省成本或只使用纯文本模型
偶尔需要处理图片时,自动调用云端视觉模型
不需要用户手动切换模型
贡献指南
评估
这个 Issue 还没有评估数据。