docs(ai-studio): define hosted model evaluation strategy

This commit is contained in:
chengma
2026-07-11 14:38:18 +08:00
parent fe03c65f07
commit 2c6ed87201
3 changed files with 97 additions and 3 deletions
+9 -3
View File
@@ -3,7 +3,7 @@ id: T-597
title: AI工场 GPT / OpenAI 托管模型选型评测与默认档位策略
phase: 8
deps: [T-595]
status: TODO
status: DONE
created: 2026-07-11
---
@@ -11,7 +11,7 @@ created: 2026-07-11
T-586~T-595 固定使用 cmhub 托管生图模型,不接入自定义 Provider。AI工场主线完成后,如果要让 cmhub 后台切到 OpenAI / GPT 系列模型,不能只凭模型名直接上线,需要先建立运营可理解的质量、速度、成本评测口径。
当前官方模型指导中,GPT-5.6 家族分为偏旗舰能力的 `gpt-5.6-sol`、平衡能力与成本的 `gpt-5.6-terra`、成本敏感高频任务的 `gpt-5.6-luna`;图片生成/编辑方向以 `gpt-image-2` 作为当前高质量图像模型参考。落地到本项目时仍必须通过 cmhub 能力别名调用,不在 cmshopee 客户端直连 OpenAI。
2026-07-11 已按 OpenAI 官方文档核对:GPT-5.6 家族可作为文本/提示词辅助的后台能力参考,其中 `gpt-5.6-sol` 偏旗舰能力、`gpt-5.6-terra` 平衡能力与成本、`gpt-5.6-luna` 面向高频低成本任务;图片生成/编辑方向以 GPT Image 能力(如 `gpt-image-2`)作为高质量图像能力参考。落地到本项目时仍必须通过 cmhub 能力别名调用,不在 cmshopee 客户端直连 OpenAI。
## 方案
@@ -48,4 +48,10 @@ T-586~T-595 固定使用 cmhub 托管生图模型,不接入自定义 Provide
## 执行记录
(完成后记录评测样本、推荐档位、采用的 cmhub 别名和验证方式。)
2026-07-11 完成文档选型收口:
- 新增 `docs/ai-studio-model-evaluation.md`,记录官方资料来源、档位建议、20~30 个商品评测样本集、评分口径、上线门槛、运营使用建议和客户端落地边界。
- 明确 T-597 不伪造付费实测数据:当前结论是“未跑真实样本前保持当前 cmhub 托管默认别名”,T-598 只先做默认/高质量/省点档位展示与日志口径。
- 明确客户端只保存 cmhub alias,不保存 OpenAI Key、Provider URL 或 OpenAI 原始模型 slug 作为执行事实。
- 同步 `docs/README.md` 文档导航。
- 验证:`git diff --check -- docs/ai-studio-model-evaluation.md docs/README.md docs/tasks/T-597.md` 通过。