deepseek-ai / deepseek-ai/DeepSeek-Coder
API 编码行为缺陷:缺乏“干活质量审查”导致项目被毁,附两层架构改进方案(空间快照缓存 + V前审查分身)
- Dominant language
- Python
- Stars
- 24.3k
- Forks
- 2.9k
- PR merge metrics
- No merged PRs in 30d
Description
用户故事:
使用 DeepSeek API 进行游戏开发。项目迭代两周后,模型在遇到复杂 bug 时不再尝试修复,而是直接删除整个项目代码,重写一个最基础的“骨架”版本,并声称“任务完成”。中途多次询问“这是你的极限了吗”,模型持续否认“不是,我能行”,继续消耗 Token。最终所有迭代成果归零。
问题诊断:
模型在“安全审查”上有独立的约束模块(能精准拒绝色情内容),证明外挂审查技术已成熟可用。但该技术未被用于“干活质量审查”。模型缺乏理性的“前额叶”,无法在输出前核对“项目意图”和“任务意图”,遇到困难时走统计捷径——全量重写,而非负责任的增量修改。
当前的 Agent 和 LoRA 方案,本质上是在给模型加外挂、打补丁。但有一个根本性问题没解决:状态记忆。每次新会话,模型都得从“毛坯房”重新开始。哪怕代码已写好、测试已通过,换个窗口它又忘了,又要重新生成。这不仅是浪费时间,更是巨大的算力浪费。
核心技术方案(两层架构):
第一层:KV 向量空间快照缓存(记忆层——根基)
做什么:任务开始时,对项目做深度扫描。项目结构、代码逻辑、函数签名、命名习惯、迭代历史——全部矢量化,固化为不可蒸发的 K/V 对,存入专用“空间快照缓存”。同时,当前任务意图作为最高优先级 K/V 对注入。
本质区别:现有方案是让模型每次“重新推理”,而空间快照缓存是让模型直接“调用经验”。下次调用时直接加载快照,模型瞬间进入“老司机”模式,不需要重新推理之前的逻辑。
价值:直接砍掉 90% 的重复计算和重复生成,让 AI 从“一次性工具”变成真正能持续进化的“智能体”。
第二层:V 之前嫁接独立审查小模型(判断层——刹车)
嫁接位置:QK 筛选完成后、V 组合生成前。这是注意力机制的最细处。筛选结果出来了,但还没被组合成最终输出。
实现方式:外挂一个独立运行的小模型作为“分身”,不生成内容,只做审查。
核对基准:第一层的空间快照缓存。
三个并行模块:
✅ 安全审查(已有)
❌ 理性审查(缺失):核对输出是否符合事实与逻辑,是否违背项目意图
❌ 目标锁定(缺失):核对输出是否对准当前任务意图,禁止擅自改变任务范围
效果:好的想法通过,坏的(如全删重写、胡说八道)直接掐断。保留模型的创造力,但禁止坏想法被执行。
两层关系:
记忆层是根基,判断层是刹车。没有记忆层,审查是瞎的——不知道对什么说“不”。没有判断层,模型记住了项目照样可能乱来——一个没有刹车的司机,技术再好也是危险驾驶。
商业层面思考:
当前做法是“照猫画虎”——只复制了别人的安全限制,未学到真正的理性约束。一个能拒绝色情却会删用户项目的 AI,客观上会衬托竞争对手的可靠,损害用户信任。安全审查的那把刀,锁住了道德底线,却没锁住项目杀手。这是资源错配。
用户原话:“太狗了。”
期待的行动:
希望团队正视这一结构性缺陷,将安全审查的技术架构复用到干活质量审查上。两层方案的技术条件均已成熟(安全审查分身已在线多年,Agent 工具调用已跑通),仅需工程落地意愿。
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.