AgoraIO-Extensions / AgoraIO-Extensions/agent-infra
feat(platform): deliver authorized evaluation and quality analysis
- Dominant language
- TypeScript
- Stars
- 0
- Forks
- 0
- Avg merge
- 8h 51m
- Merged PRs (30d)
- 99
Description
本票由 [M1 交付汇合](https://github.com/AgoraIO-Extensions/agent-infra/issues/150) 已确认的新增范围建立,当前为 `needs-triage` 的实施契约候选,不进入既有冻结执行 snapshot。主责:LichKing-2234;执行方式、资源窗口与 Start/Target 尚未确定。开始实现前须完成候选权威文档的跨系统对齐、适用评审与合入,回读全部原生依赖,并在本票确认执行准入。文档票关闭不单独授予执行权限。
## Problem
模型配置连通性和任务运行成功不能评估回答质量及 Agent 效果。M1 需要固定授权数据集的基线/候选实验、三类评分、独立复核和可解释分析,并独立统计线上主动反馈。
## Scope
- 在现有 Platform Core/Store/API/Web 管理数据集/样本/判定标准版本、实验及每例 Execution 引用;复用 #442 唯一 ObjectStorage Adapter 和文件存储边界,独立 Eval 用途/对象授权由本票实现,不用普通会话文件权限替代。不另建存储 Adapter、Runtime Eval 状态、任务调度器或评测微服务。
- 基线/候选使用同一获准版本样本,复用任务受理/查询/取消/恢复和当前主体、Agent/Connection 授权;记录实际模型、配置、模板/镜像、数据/评分器及工具环境版本,条件差异明确,不赋予 Owner 锁定生产旧模板的能力。
- 实现确定性规则、人工评价及获准模型评分,保存依据、来源及评分模型;提供逐例/任务类对比、失败样本、独立人工复核、历史及新版本再跑。评分重试不重跑业务任务。
- 统计质量、任务效果、已确认耗时/可得用量、分母、覆盖、缺失/不适用/错误,分开执行失败与评分故障。使用者仅对本人任务主动反馈有用/无用及分类,按实际模型/配置/时间汇总数量和反馈率,与离线评分独立展示。
- 数据、输出及评分理由走独立 Eval 用途和对象授权;线上正文不自动导入,真实材料须有用途授权并脱敏,评分端点也须获准。读取/投递前重验,撤权/保留/删除按部署政策执行;原会话访问权、Owner/责任人或 Worker 身份不能替代授权。
- 工具使用受控测试账号/环境/响应,不自动重放线上写操作。四模板真实验证;自定义仅按已验证能力接入,self-managed 声明不自动获得 Eval。
- 本票负责 Eval 数据授权、管理、实验、评分、复核的必要事务审计及查询/页面投影增量;复用公共查询入口和实际事实,不把 Eval 内容写入审计/遥测,也不增加计费、预算、配额或供应商管理。
## Acceptance criteria
- [ ] **AC-1:** 授权用户可版本化创建/导入样本与判定标准,用同一版本运行基线/候选,记录实际执行和完整版本信息;修改后新版本再跑且历史结论保留。
- [ ] **AC-2:** 确定性规则、人工和模型评分均可追溯并查看依据,支持独立人工复核;评分器失败/重试与业务任务执行分开,不能自动重跑任务制造新结果。
- [ ] **AC-3:** 页面/API 可查看实验历史、汇总、任务类和逐例对比及获授权失败样本;分母、已评分/缺失/错误/不适用和可比覆盖明确,任务正常结束或工具 HTTP 成功不单独判定质量通过。
- [ ] **AC-4:** 线上反馈只关联本人任务,展示反馈率及按实际模型/配置/时间的分布;未反馈不视为认可,线上反馈不混入离线通过率。
- [ ] **AC-5:** 每次实际投递与内容读取校验当前 Agent 使用权和独立 Eval 用途/对象权限;未授权导入、跨主体/数据集/实验、Owner/责任人或 Worker 越权及数据撤权/删除后的访问均被拒绝。
- [ ] **AC-6:** 实际四模板使用包含回答和受控工具样本的固定集完成两组模型/配置实验、评分/复核及再次运行;记录真实耗时和可得用量,缺失如实标记,工具环境差异可见且没有自动线上写操作重放。
- [ ] **AC-7:** 实验任务取消/恢复复用原任务与 Session;自定义按验证能力开放,self-managed 不因声明进入 Eval,模板对比不改变生产升级策略。
- [ ] **AC-8:** 数据/评分理由作为受控业务内容保存,管理/授权/实验/评分/复核元数据可从统一审计入口查询;必要审计失败不返回虚假成功,正文/附件/思考/证明/凭证不进入遥测或审计。
## Validation
- 对照 PRD §§7.3、13–16,工程 Spec §18.4/19 与 Runtime HLD §8.6;逐一核对实际版本、用途授权、评分和反馈分母。
- 以固定合成及获准真实样本执行真实 API/Worker/RuntimeHost 与四模板基线/候选实验,记录源代码、镜像、模型/配置、数据/评分器版本、逐例引用与结果;Fake 分数、预置成功或截屏不代替真实执行。
- 覆盖任务失败、评分端点失败、评分重试、人工复核冲突、数据/Agent 撤权、删除、工具环境差异、缺失用量与跨主体查询;证明评分故障不重放业务任务、测试不写线上资源。
- 运行浏览器/契约/Store/任务与审计消费集成、脱敏及用途隔离负向验证;执行 AGENTS.md 完整仓库检查与当前提交独立双轴评审。
## Blocked by
- #484
- #442
## Authority
- 产品输入:[平台 PRD 候选](https://github.com/AgoraIO-Extensions/agent-infra/blob/2eb2762b889a27372c259039d27279cf646c5b1e/docs/prd/PRD-agent-platform-M1.md)。
- 工程输入:[工程 Spec 候选](https://github.com/AgoraIO-Extensions/agent-infra/blob/7f3b2083d44191ab4b280d7eb8222d7785937b8e/docs/architecture/SPEC-agent-infra-M1-engineering-architecture.md)、[Runtime HLD 候选](https://github.com/AgoraIO-Extensions/agent-infra/blob/5da6fff274ffc7a7ee36ae3ebd61d6100ccc9571/docs/architecture/HLD-agent-runtime-M1.md)。
- 上述固定版本用于评审和追溯;实施前消费合入后的权威版本,差额在本票复核,不能用历史候选覆盖新结论。
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.