agentscope-ai / agentscope-ai/QwenPaw

[Feature]: 纯文本模型支持图片自动转文字描述(vision fallback)

未关闭
#5,615 1 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看
enhancement
主要语言
Python
星标
34.9k
派生
3.1k
平均合并
1 天 15 小时
30 天内合并 PR
225

描述

## 功能请求

当用户配置了纯文本模型(如 `qwen-max`、`QwenPaw-Flash`)时,如果用户上传图片,当前系统会直接报错或忽略。

**期望行为**:
- 检测到当前模型不支持多模态 + 用户上传了图片
- 自动调用备用的视觉模型(如 `qwen-vl-max`、`gpt-4o`)生成图片描述
- 将描述文本注入到对话上下文中
- 纯文本模型基于描述继续对话

**参考实现**:
类似 qclaw / codex 的处理流程:
1. 保存图片到磁盘
2. 调用视觉模型生成文字描述
3. 描述注入上下文
4. 纯文本模型基于描述回复

**配置建议**:
在 `agent.json` 中增加配置项:
```json
{
"multimodal_fallback": {
"enabled": true,
"vision_provider": "dashscope",
"vision_model": "qwen-vl-max"
}
}

使用场景:

用户主要使用本地小模型(如 QwenPaw-Flash 系列)节省成本或只使用纯文本模型
偶尔需要处理图片时,自动调用云端视觉模型
不需要用户手动切换模型

贡献指南

打开贡献指南

评估

这个 Issue 还没有评估数据。

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。