KimiK3 模型频繁 429 中断并触发重复计费(重试导致上下文重复计费?)
- Dominant language
- TypeScript
- Stars
- 2.7k
- Forks
- 401
- Avg merge
- 21h 48m
- Merged PRs (30d)
- 776
Description
**提交人**: 用户1673
**客户端版本**: 0.1.61
---
## 现象
使用 KimiK3(model=moonshotai/kimi-k3)回答时反复出现 API Error 导致任务中断,且中断后的自动恢复/重试造成上下文重复计费,流量费明显超预期。
## 复现步骤
1. 使用 KimiK3 执行较长任务(多轮、输出量较大,如生成 MATLAB 脚本并生成 Word/PPT 文档)
2. 回答中途触发 429 错误,任务中断
3. 系统进入恢复/重放流程,反复重试
## 期望行为
1. 定位 429 根因(部署实例不可用 / 会话预算超限 / 供应商限流)
2. 中断后支持更节制的重试或断点续传,避免上下文重复计费
3. 计费上避免同一轮次重试重复扣费
## 实际行为
- 一次任务反复中断 3 次以上,期间有从 PC切到手机端(下班)再切回
- 中断重放导致上下文缓存命中率骤降(某段仅 0.4%),大量输入 token 被重新计费
- 任务(生成 Word/PPT 文档)最终未能完成,仅产出部分脚本文件
- 本轮实际扣费超过百元人民币,但不确定该费用是否kimiK3本身较贵导致
## 复现频率
偶发但集中——同一长任务内反复出现;对照使用 deepseek 模型未遇到同类问题。
## 已尝试
- 切换 PC/手机端、等待后重试,均无法消除
- 曾暂停 Word/PPT 的 COM 自动化路径,改以其它方式交付,但核心的模型 429 中断问题仍存在
## 附加信息(错误与用量佐证)
错误码两种:
1. Request rejected (429) · No deployments available for selected model(若干部署实例进入 cooldown 列表)
2. Request rejected (429) · ExceededBudget(spend≈123.76 已超过 budget=120)
用量:
- 某轮:共 1.7M tokens,输入 753.4k,输出 47.5k,缓存命中率 54.1%,耗时 40 分 41 秒
- 中断重放轮:共 212.7k tokens,输入 210.2k,输出 1.7k,缓存命中率仅 0.4%,系统提示本轮较多上下文重新计费
---
**版本区域**: CN
**OS**: win32 x64 (10.0.17763)
**界面语言**: zh-CN
Contributor guide
Research direction
The report names no files, tests, or entry points. Start by tracing handling of the reported 429 responses, retry or replay behavior, and usage or billing accounting for KimiK3. Done should distinguish unavailable deployments from budget exhaustion, use more controlled recovery, and avoid charging repeated context unnecessarily.
Written by the indexing model from the issue text.
Assessment
- Tech stack
- typescript
- Domain
- api, backend
- Issue type
- Bug
- Difficulty
- 4/5
- Estimated time
- 3-5 days
- Activity status
- Active
- Clarity
- Needs clarification
- Newbie friendliness
- 45/100