open-compass / open-compass/opencompass
[Feature] 集成 ThinkCheck 作为 OpenCompass 的“推理健康度”评估维度
Open
@bittersweet1999 is already working on this.
Since Jun 8, 2026.
- Dominant language
- Python
- Stars
- 7.5k
- Forks
- 869
- Avg merge
- 17h 52m
- Merged PRs (30d)
- 13
Description
Describe the feature
问题:OpenCompass 缺少对推理过程“健康度”的量化评估
OpenCompass 在评估模型“正确性”(准确率、F1、BLEU)方面已经非常成熟,但模型可能在答对题目的同时,其推理链中存在概念漂移、逻辑矛盾或论证质量衰减。目前缺少一个与“正确性”完全正交的“推理健康度”评估维度。
我们做了什么
ThinkCheck 是一个基于晶脉哲学四重公理构建的 AI 推理质量评估引擎,通过 U/D/A/H 四维模型对文本进行深层语义诊断:
- U(统一性):概念在文本中的语义一致性
- D(发展性):新信息的价值和逻辑流动的连续性
- A(对抗性):矛盾在关系网络中的累积张力(不是二值分类器)
- H(和谐度):加权综合评分 H = λᵤ·U + λᴅ·D - λₐ·A
社区验证
本工具已在 DeepSeek 社区通过严格技术审查:
- @icophy 提出的构造效度批评已在 v9 中通过彻底“去词库化”重构解决,他公开表示“I accept the theoretical reframe”
- @qingkong66 提到将 ThinkCheck 收录进六月度社区文摘
- @fkyah3 的语言漂移实验与 ThinkCheck 形成互补验证
集成方案
在 OpenCompass 的 Evaluator 基类中增加一个可选的 ThinkCheckEvaluator 子类。当评测配置中启用该评估器时,每次模型输出在被“正确性评估”之前,先经过 ThinkCheck 的 U/D/A/H 四维扫描,结果作为独立的指标列出现在评测报告中。
- 零侵入:无需修改 OpenCompass 核心评测逻辑
- 两种接入方式:ThinkCheck 提供 Python SDK 和 RESTful API
- 完全本地运行:评估过程不调用任何外部 API,数据不出本机
- 协议兼容:Apache 2.0
关键验证数据
| 测试案例 | U值 | D值 | A值 | H值 | 说明 |
|---|---|---|---|---|---|
| 纯语义矛盾 | 0.1667 | 0.5165 | 0.2500 | 0.2233 | 旧版A=0.0000,现已修复 |
| 法律文书矛盾 | 0.2000 | 0.7600 | 0.9991 | 0.1842 | 6条矛盾边全部可追溯 |
| e租宝案长文本 | 0.2567 | 0.9764 | 0.9998 | 0.1076 | 3000字长文本,63步采样零超时 |
后续路径
本提案仅作为技术讨论的起点,不附带代码提交。若社区认可此方向,我们可以提供详细的 API 文档和技术支持。代码实现可由我们后续提交 PR,或由社区开发者基于此架构完成。
Will you implement it?
- I would like to implement this feature and create a PR!
Contributor guide
No contributing guide indexed for this repository
First steps
- Read the whole issue, then the project's contributing guide.
- Comment on the issue to say you are picking it up — it saves two people doing the same work.
- Fork the repository and make your change on a branch.
- Open a pull request that references the issue number.
Assessment
This issue has not been assessed yet.