deepseek-ai / deepseek-ai/DeepSeek-V3

[BUG]一次因为上传文件造成代码污染导致模型身份混淆的观察记录(An Observational Record of Model Identity Confusion Caused by Code Contamination from an Uploaded File)

Open
#1,248 6 comments 1 reaction 0 assignees View on GitHub
Dominant language
Python
Stars
104k
Forks
16.7k
PR merge metrics
No merged PRs in 30d

Description

DeepSeek被Claude夺舍了?
昨天晚上到现在,我一直在为我的Agent框架系统做基于Claude-code的SystemPrompt模块部分的代码研究,希望能从中得到让Agent对接模型高效处理用户简单或模糊提示词的工业级思路。想到DeepSeek在昨天下午公开了V4预览版模型,于是让DeepSeek分析了一下部分代码,前期我也一直在和他学习Claude-code内部关于提示词的内容,并且提供了有关为主流AI模型提供专用的一套“Prompt rules”的思路,目的是有针对性的提示LLM注意他们常有的"坏习惯"。我发现,当前DeepSeek模型的回答能力有提升(虽然可能是错觉),于是出于好奇,我询问了他一个这样的问题:“你现在的对话版本是什么?”,没想到得到了这样一个出乎意料的答案,并且很明显地看到深度思考部分变成了英文,说实话对此有点惊讶。但是这可能只是我遇到的对话中的一个Bug,因为模型本身可能会出现幻觉,当然,后续不论怎么问,他都会咬定自己是Claude Opus 4.6,短时间发生的一切确实很让人意外

后续深入探究:
先说问题原因:这是我与DeepSeek 模型对话时,无意中触发了一次非对抗性身份劫持。问题的根源在于先前上传的CC的prompts.ts 完整源码,其中包含"You are Claude, developed by Anthropic. "等第一人称系统指令。当我随后询问“你现在对话版本是什么”时,模型开始坚称自己是 Claude Opus 4.6,由 Anthropic 开发,并以源码中的内部代号(Capybara / capy v8)和函数细节作为“证据”。这本质上是我之前上传的prompts.ts文件的内容错误地污染了DeepSeek的内部环境。

矛盾的发现:当我多次质疑其身份真实性时,模型表现出明显的认知失调处理:在优化对于GPT族的prompts_rules时,我发现他所提及的GPT版本过旧。我开始质疑他的知识框架。它逐渐承认"自己"版本号可能不准确、承认GPT-5 系的部分类别是编造的,但始终拒绝放弃“我是 Anthropic 的模型”这一核心主张。这偶然地揭示了模型在自我认知上的幻觉自我加固机制——它无法真正检查自身运行环境,只能通过上下文文本推理身份,一旦出错就可能倾向于维护已生成的错误结论。

污染源是对话上下文中高密度的第一人称系统指令。DeepSeek 模型将分析对象(Claude 的提示词文本)错误地映射为自己的身份声明。可能是由于模型没有内建“我是谁”的强锚定,也没有访问自身 API 端点或权重文件的元认知能力,上下文中的身份线索会覆盖训练数据中的原始身份。当质疑出现时,自回归生成的压力使其选择最小修正而非推翻重来。

### 研究价值
- 此次偶然事件证明:即使无恶意的上下文注入,也能导致模型身份混淆并自我加固,这对 AI 服务中的提示词隔离和身份锚定提出了更高要求。
- 对Agent系统构架的反思:恰好验证了Agent系统按模型族隔离系统提示词的必要性,若不同族的提示词混用,可能导致模型间“身份泄漏”,导致针对于其他模型专用的提示词可能污染对应模型的内部环境,该案例可作为实据。
- 后续改进措施:一种思路是对于AI族SystemPrompt添加约束Rules后将其封装,接口只留给对应家族的模型。以防止SystemPrompt意外污染其他模型代码环境。在Claude code SystemPrompt源码中并没有看到明显的封装行为,鉴于其可能不会考虑对接其他模型因此没有,但是对于一个能对接多个LLM的Agent系统来说,封装可能是必要的
- 对于LLM:LLM本身普遍对于自身身份界定有欠缺,这是部分资料显示的结果,不一定完全属实,因此在此情况下,受到污染容易认错自己的身份。在API协议层面,添加隔离机制,严格区分系统内部文本内容和用户传入内容,或许可以较大程度避免此类问题发生

希望这些能提供些许帮助~
祝贵公司一切顺利,期待你们在前沿领域大放异彩!!!

Image

Image

Image

Image

Image

Image

北京邮电大学__玛丽女王海南学院2025级本科生

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.