agentscope-ai / agentscope-ai/QwenPaw

[Feature Request] 免费多模态路由:发图/视频/语音时自动切换视觉模型,像豆包一样无需手动干预

Offen
#4,539 3 Kommentare 2 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Python
Sterne
34.9k
Forks
3.1k
Ø Merge
1 T. 15 Std.
Gemergte PRs (30 T.)
225

Beschreibung

## 需求描述

目前 QwenPaw 的模型是固定配置的,用户发图片/视频/语音时需要手动切换视觉模型,使用体验割裂。

希望实现:**用户发什么类型的内容,系统自动调用对应的免费模型处理,无需手动切换。**

## 期望功能

| 用户行为 | 自动调用的免费模型 | 说明 |
|---------|-----------------|------|
| 发图片 | 免费视觉模型(如 Gemma 3N / Qwen-VL) | 看图理解 |
| 发视频 | 免费视频理解模型 | 视频内容分析 |
| 发语音 | 免费语音识别模型 | 语音转文字后再理解 |
| 让 AI 生图 | 免费图生图模型 | Stable Diffusion 等 |
| 让 AI 生视频 | 免费视频生成模型 | 如 Wan 等 |

## 为什么重要

- **豆包、ChatGPT App** 已经做到发图自动识别、语音自动转文字,用户零学习成本
- **免费用户** 不想绑定付费 API,希望有免费的多模态支持
- 目前 QwenPaw 需要用户手动理解"什么时候该切换模型",体验差

## 技术可行性

- QwenPaw 已支持多 Provider 配置,完全可以做一个**自动路由层**
- 视觉模型识别 → 结果 → 切回文字模型,两阶段处理,逻辑不复杂
- NVIDIA NIM / 阿里云百炼都有免费额度的模型可用
- 也可以做成**插件系统**,让社区贡献免费模型对接

## 优先级建议

建议先做 **图片自动识别**(最常用),作为 MVP,后续扩展到视频、语音。

---

**QwenPaw version:** 1.1.8

Beitragsleitfaden

Beitragsleitfaden öffnen

Bewertung

Dieses Issue wurde noch nicht bewertet.

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.