AgoraIO-Extensions / AgoraIO-Extensions/agent-infra

feat(platform): deliver authorized evaluation and quality analysis

Đang mở
#485 1 bình luận 0 reaction 1 người được giao Được @LichKing-2234 nhận Xem trên GitHub
needs-triage
Ngôn ngữ chính
TypeScript
Star
0
Fork
0
Merge trung bình
8 giờ 51 phút
Pull request đã merge (30 ngày)
99

Mô tả

本票由 [M1 交付汇合](https://github.com/AgoraIO-Extensions/agent-infra/issues/150) 已确认的新增范围建立,当前为 `needs-triage` 的实施契约候选,不进入既有冻结执行 snapshot。主责:LichKing-2234;执行方式、资源窗口与 Start/Target 尚未确定。开始实现前须完成候选权威文档的跨系统对齐、适用评审与合入,回读全部原生依赖,并在本票确认执行准入。文档票关闭不单独授予执行权限。

## Problem

模型配置连通性和任务运行成功不能评估回答质量及 Agent 效果。M1 需要固定授权数据集的基线/候选实验、三类评分、独立复核和可解释分析,并独立统计线上主动反馈。

## Scope

- 在现有 Platform Core/Store/API/Web 管理数据集/样本/判定标准版本、实验及每例 Execution 引用;复用 #442 唯一 ObjectStorage Adapter 和文件存储边界,独立 Eval 用途/对象授权由本票实现,不用普通会话文件权限替代。不另建存储 Adapter、Runtime Eval 状态、任务调度器或评测微服务。
- 基线/候选使用同一获准版本样本,复用任务受理/查询/取消/恢复和当前主体、Agent/Connection 授权;记录实际模型、配置、模板/镜像、数据/评分器及工具环境版本,条件差异明确,不赋予 Owner 锁定生产旧模板的能力。
- 实现确定性规则、人工评价及获准模型评分,保存依据、来源及评分模型;提供逐例/任务类对比、失败样本、独立人工复核、历史及新版本再跑。评分重试不重跑业务任务。
- 统计质量、任务效果、已确认耗时/可得用量、分母、覆盖、缺失/不适用/错误,分开执行失败与评分故障。使用者仅对本人任务主动反馈有用/无用及分类,按实际模型/配置/时间汇总数量和反馈率,与离线评分独立展示。
- 数据、输出及评分理由走独立 Eval 用途和对象授权;线上正文不自动导入,真实材料须有用途授权并脱敏,评分端点也须获准。读取/投递前重验,撤权/保留/删除按部署政策执行;原会话访问权、Owner/责任人或 Worker 身份不能替代授权。
- 工具使用受控测试账号/环境/响应,不自动重放线上写操作。四模板真实验证;自定义仅按已验证能力接入,self-managed 声明不自动获得 Eval。
- 本票负责 Eval 数据授权、管理、实验、评分、复核的必要事务审计及查询/页面投影增量;复用公共查询入口和实际事实,不把 Eval 内容写入审计/遥测,也不增加计费、预算、配额或供应商管理。

## Acceptance criteria

- [ ] **AC-1:** 授权用户可版本化创建/导入样本与判定标准,用同一版本运行基线/候选,记录实际执行和完整版本信息;修改后新版本再跑且历史结论保留。
- [ ] **AC-2:** 确定性规则、人工和模型评分均可追溯并查看依据,支持独立人工复核;评分器失败/重试与业务任务执行分开,不能自动重跑任务制造新结果。
- [ ] **AC-3:** 页面/API 可查看实验历史、汇总、任务类和逐例对比及获授权失败样本;分母、已评分/缺失/错误/不适用和可比覆盖明确,任务正常结束或工具 HTTP 成功不单独判定质量通过。
- [ ] **AC-4:** 线上反馈只关联本人任务,展示反馈率及按实际模型/配置/时间的分布;未反馈不视为认可,线上反馈不混入离线通过率。
- [ ] **AC-5:** 每次实际投递与内容读取校验当前 Agent 使用权和独立 Eval 用途/对象权限;未授权导入、跨主体/数据集/实验、Owner/责任人或 Worker 越权及数据撤权/删除后的访问均被拒绝。
- [ ] **AC-6:** 实际四模板使用包含回答和受控工具样本的固定集完成两组模型/配置实验、评分/复核及再次运行;记录真实耗时和可得用量,缺失如实标记,工具环境差异可见且没有自动线上写操作重放。
- [ ] **AC-7:** 实验任务取消/恢复复用原任务与 Session;自定义按验证能力开放,self-managed 不因声明进入 Eval,模板对比不改变生产升级策略。
- [ ] **AC-8:** 数据/评分理由作为受控业务内容保存,管理/授权/实验/评分/复核元数据可从统一审计入口查询;必要审计失败不返回虚假成功,正文/附件/思考/证明/凭证不进入遥测或审计。

## Validation

- 对照 PRD §§7.3、13–16,工程 Spec §18.4/19 与 Runtime HLD §8.6;逐一核对实际版本、用途授权、评分和反馈分母。
- 以固定合成及获准真实样本执行真实 API/Worker/RuntimeHost 与四模板基线/候选实验,记录源代码、镜像、模型/配置、数据/评分器版本、逐例引用与结果;Fake 分数、预置成功或截屏不代替真实执行。
- 覆盖任务失败、评分端点失败、评分重试、人工复核冲突、数据/Agent 撤权、删除、工具环境差异、缺失用量与跨主体查询;证明评分故障不重放业务任务、测试不写线上资源。
- 运行浏览器/契约/Store/任务与审计消费集成、脱敏及用途隔离负向验证;执行 AGENTS.md 完整仓库检查与当前提交独立双轴评审。

## Blocked by

- #484
- #442

## Authority

- 产品输入:[平台 PRD 候选](https://github.com/AgoraIO-Extensions/agent-infra/blob/2eb2762b889a27372c259039d27279cf646c5b1e/docs/prd/PRD-agent-platform-M1.md)。
- 工程输入:[工程 Spec 候选](https://github.com/AgoraIO-Extensions/agent-infra/blob/7f3b2083d44191ab4b280d7eb8222d7785937b8e/docs/architecture/SPEC-agent-infra-M1-engineering-architecture.md)、[Runtime HLD 候选](https://github.com/AgoraIO-Extensions/agent-infra/blob/5da6fff274ffc7a7ee36ae3ebd61d6100ccc9571/docs/architecture/HLD-agent-runtime-M1.md)。
- 上述固定版本用于评审和追溯;实施前消费合入后的权威版本,差额在本票复核,不能用历史候选覆盖新结论。

Hướng dẫn đóng góp

Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này

Đánh giá

Issue này chưa được đánh giá.

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.