agentscope-ai / agentscope-ai/QwenPaw
[Feature Request] 免费多模态路由:发图/视频/语音时自动切换视觉模型,像豆包一样无需手动干预
- Vorherrschende Sprache
- Python
- Sterne
- 34.9k
- Forks
- 3.1k
- Ø Merge
- 1 T. 15 Std.
- Gemergte PRs (30 T.)
- 225
Beschreibung
## 需求描述
目前 QwenPaw 的模型是固定配置的,用户发图片/视频/语音时需要手动切换视觉模型,使用体验割裂。
希望实现:**用户发什么类型的内容,系统自动调用对应的免费模型处理,无需手动切换。**
## 期望功能
| 用户行为 | 自动调用的免费模型 | 说明 |
|---------|-----------------|------|
| 发图片 | 免费视觉模型(如 Gemma 3N / Qwen-VL) | 看图理解 |
| 发视频 | 免费视频理解模型 | 视频内容分析 |
| 发语音 | 免费语音识别模型 | 语音转文字后再理解 |
| 让 AI 生图 | 免费图生图模型 | Stable Diffusion 等 |
| 让 AI 生视频 | 免费视频生成模型 | 如 Wan 等 |
## 为什么重要
- **豆包、ChatGPT App** 已经做到发图自动识别、语音自动转文字,用户零学习成本
- **免费用户** 不想绑定付费 API,希望有免费的多模态支持
- 目前 QwenPaw 需要用户手动理解"什么时候该切换模型",体验差
## 技术可行性
- QwenPaw 已支持多 Provider 配置,完全可以做一个**自动路由层**
- 视觉模型识别 → 结果 → 切回文字模型,两阶段处理,逻辑不复杂
- NVIDIA NIM / 阿里云百炼都有免费额度的模型可用
- 也可以做成**插件系统**,让社区贡献免费模型对接
## 优先级建议
建议先做 **图片自动识别**(最常用),作为 MVP,后续扩展到视频、语音。
---
**QwenPaw version:** 1.1.8
Beitragsleitfaden
Bewertung
Dieses Issue wurde noch nicht bewertet.