3.5 KiB
3.5 KiB
质量文档
给项目的每个产品领域和架构层打分,跟踪代码库随时间是变强还是变弱,回答"这个项目在变强还是变弱"。 它评的是代码库本身的质量;单次 agent 输出质量见
evaluator-rubric.md。
使用时机
- 开始会话前:读它,了解代码库当前哪里最弱,优先处理。
- 会话结束后:更新评级。
- 长期:对比不同时间点的快照,看哪些改动真正改善了代码库健康度。
- 做基准对比、清理简化、或换新 agent / 新模型时,也更新一次。
评级标准
- A:验证全部通过,结构干净,agent 能读懂,测试稳定。
- B:验证通过,基本干净,可读性或测试覆盖有少量缺口。
- C:部分可用,有已知缺口,部分代码 agent 不容易理解。
- D:不可用,或存在重大结构问题。
- N/A:尚未进入对应里程碑,不能把“未开发”误判为实现质量。
产品领域
| 领域 | 评级 | 验证状态 | Agent 可读性 | 测试稳定性 | 关键缺口 | 上次更新 |
|---|---|---|---|---|---|---|
| Harness 文档与任务治理 | A | 三条治理命令通过 | A | A | 需观察真实多轮任务是否顺畅 | 2026-08-03 |
| 摄像头接入与媒体 | N/A | M0/M1 未完成 | B(设计清楚) | N/A | 实机兼容矩阵、Sense 代码与 5 路 smoke | 2026-08-03 |
| 推理与事件契约 | C | 契约已冻结,生产者未实现 | A | N/A | Brain mapper、契约测试和硬件基准 | 2026-08-03 |
| 规则、预警与处置 | N/A | M3 未开始 | B(设计清楚) | N/A | Bell、ack/升级、投递与 UI | 2026-08-03 |
| 多租户、RBAC 与审计 | N/A | M3 未开始 | B(设计清楚) | N/A | schema、鉴权和隔离测试 | 2026-08-03 |
架构层
| 层级 | 评级 | 边界执行 | Agent 可读性 | 关键缺口 | 上次更新 |
|---|---|---|---|---|---|
| Sense / L1 接入 | N/A | 文档已定,代码未开始 | A | M0 设备矩阵、M1 骨架 | 2026-08-03 |
| Brain / L2-L3 | N/A | 文档已定,代码未开始 | A | 模型接口、判定内核、mapper | 2026-08-03 |
| Bell / L0+L4-L5 | N/A | 文档已定,代码未开始 | A | 事件、规则、预警、租户和 Web | 2026-08-03 |
| 事件契约 | B | v0.1 冻结 | A | 尚无生产者/消费者联合测试 | 2026-08-03 |
| Gitea/harness 治理 | A | 本地门禁与远端协调审计通过 | A | 首个 claim/PR 后复核完整生命周期 | 2026-08-03 |
变更历史
2026-08-03
- 变更内容:接入 harness coding 文档、上下文路由、任务协议和 Gitea 工单模板;初始化标签和首批工单。
- 提升:项目入口、架构边界、容量约束、验证和任务写路径已机器可读。
- 下降:无。
- 新发现的缺口:M0 实机矩阵、架构开放问题、精确技术版本尚未关闭。
- 已关闭的缺口:从聊天/单一长文档推进改为 Git 规格 + Gitea 实时状态;首轮远端协调审计通过。
进阶:验证 harness 是否可以简化
Harness 里的每个组件(规则、脚本、检查清单)都编码了一个假设——"模型做不到这件事"。模型变强后,这些假设可能过时。用本文档检查某个组件是否还有必要:
- 拍一份本文档快照。
- 移除一个 harness 组件。
- 跑一轮基准任务。
- 再拍一份快照。
- 对比——评级没降,说明那个组件多余,可以去掉;降了,就恢复。