Files
cmbuyer/docs/quality-document.md

66 lines
3.7 KiB
Markdown

# 质量文档
> 给项目的每个产品领域和架构层打分,跟踪代码库随时间是变强还是变弱,回答"这个项目在变强还是变弱"。
> 它评的是**代码库本身的质量**;单次 agent 输出质量见 [`evaluator-rubric.md`](evaluator-rubric.md)。
## 使用时机
- **开始会话前**:读它,了解代码库当前哪里最弱,优先处理。
- **会话结束后**:更新评级。
- **长期**:对比不同时间点的快照,看哪些改动真正改善了代码库健康度。
- 做基准对比、清理简化、或换新 agent / 新模型时,也更新一次。
## 评级标准
- **A**:验证全部通过,结构干净,agent 能读懂,测试稳定。
- **B**:验证通过,基本干净,可读性或测试覆盖有少量缺口。
- **C**:部分可用,有已知缺口,部分代码 agent 不容易理解。
- **D**:不可用,或存在重大结构问题。
---
## 产品领域
| 领域 | 评级 | 验证状态 | Agent 可读性 | 测试稳定性 | 关键缺口 | 上次更新 |
|------|------|---------|-------------|-----------|---------|---------|
| web 建单与人工决策 | C | HTML 原型自动检查通过 | 高 | 无生产代码 | 原型待人工确认,SSR 未实现 | 2026-08-03 |
| desk 真机试选与下单 | D | HTML 原型自动检查通过;真机未取证 | 高 | 无生产代码 | T-103 单价节点与页面判据未取证 | 2026-08-03 |
| 提交围栏与结果调和 | C | 协议已定义 | 高 | 无代码 | T-208 / T-401 未实现 | 2026-08-03 |
| 任务数据与持久化 | C | 模型已定义 | 高 | 无代码 | schema / migration / 状态测试未实现 | 2026-08-03 |
| 身份与鉴权 | C | 合约已定义 | 高 | 无代码 | 管理会话与设备凭据未实现 | 2026-08-03 |
## 架构层
| 层级 | 评级 | 边界执行 | Agent 可读性 | 关键缺口 | 上次更新 |
|------|------|---------|-------------|---------|---------|
| web SSR 页面 | C | 原型已实现待人审 | 高 | Go 实现未开始 | 2026-08-03 |
| desk PySide6 / 执行器 | D | 原型已实现待人审;红线明确 | 高 | 骨架与真机取证未开始 | 2026-08-03 |
| web API / 状态机 | C | 围栏协议已补齐 | 高 | 未实现、未测试 | 2026-08-03 |
| SQLite 数据层 | C | 核心实体已定义 | 高 | 迁移、约束和并发测试未实现 | 2026-08-03 |
| 拼多多 / ADB 适配 | D | 必须先取证 | 高 | 无本项目真机事实 | 2026-08-03 |
## 变更历史
### 2026-08-03
- 变更内容:完成文档级全栈复核;补齐 dry-run、提交前服务端围栏、点击后调和与 App 版本
fail-closed;把网页端 / 桌面端原型前置为 T-005 / T-006。
- 提升:API 与资金安全状态机不再只依赖点击后的客户端回报;生产 UI 有人工确认门槛。
- 下降:无。
- 新发现的缺口:尚无生产代码和真机证据;网页与桌面原型待生成。
- 已关闭的缺口:移除不存在的治理脚本 / `progress.md` 引用,替换质量文档占位领域。
- 后续进展:T-005 / T-006 已并行产出 6 个自包含 HTML;独立复核通过脚本、自包含、
375 / 768 / 1024 / 1440 响应式、控制台 / 网络与高风险状态检查,现等待人工设计确认。
---
## 进阶:验证 harness 是否可以简化
Harness 里的每个组件(规则、脚本、检查清单)都编码了一个假设——"模型做不到这件事"。模型变强后,这些假设可能过时。用本文档检查某个组件是否还有必要:
1. 拍一份本文档快照。
2. 移除一个 harness 组件。
3. 跑一轮基准任务。
4. 再拍一份快照。
5. 对比——评级没降,说明那个组件多余,可以去掉;降了,就恢复。