Files
cmshoppe/docs/tasks/T-597.md
T

58 lines
3.9 KiB
Markdown
Raw Normal View History

---
id: T-597
title: AI工场 GPT / OpenAI 托管模型选型评测与默认档位策略
phase: 8
deps: [T-595]
status: DONE
created: 2026-07-11
---
## 问题 / 背景
T-586~T-595 固定使用 cmhub 托管生图模型,不接入自定义 Provider。AI工场主线完成后,如果要让 cmhub 后台切到 OpenAI / GPT 系列模型,不能只凭模型名直接上线,需要先建立运营可理解的质量、速度、成本评测口径。
2026-07-11 已按 OpenAI 官方文档核对:GPT-5.6 家族可作为文本/提示词辅助的后台能力参考,其中 `gpt-5.6-sol` 偏旗舰能力、`gpt-5.6-terra` 平衡能力与成本、`gpt-5.6-luna` 面向高频低成本任务;图片生成/编辑方向以 GPT Image 能力(如 `gpt-image-2`)作为高质量图像能力参考。落地到本项目时仍必须通过 cmhub 能力别名调用,不在 cmshopee 客户端直连 OpenAI。
## 方案
- 建立 AI工场模型评测样本集:至少覆盖 20~30 个真实商品,包含服饰/生活用品/美妆/小物、白底主图、场景图、细节图和文字较多的旧图。
- 评测拆成两类:
- 文本/提示词辅助:商品图精修提示词改写、标题/卖点辅助、失败原因解释,优先评估 `gpt-5.6-terra`;高质量复核评估 `gpt-5.6-sol`;大批量低成本辅助评估 `gpt-5.6-luna`。
- 图片生成/编辑:主图/详情图候选生成,优先评估 cmhub 提供的 `gpt-image-2` 或等价托管图像别名;保留当前 cmhub 默认图像模型作为对照组。
- 评估指标用运营能理解的口径:商品主体保真、可商用感、少幻觉、文字不乱写、背景干净、主图合规、详情图信息清晰、一次通过率、平均耗时、单图成本。
- 输出推荐档位:
- 默认:平衡档,用于日常批量。
- 高质量:用于重点商品或失败重试。
- 省点:用于低价值 SKU 或大批量初稿。
- 推荐结果只写成 cmhub 别名策略,不把 OpenAI API Key 或直连 Provider 写进 cmshopee 配置。
## 验收要点
- 形成 `docs/` 下的评测记录或选型说明,列出样本、模型档位、质量结论、耗时、成本和最终推荐。
- 明确普通产品默认仍走 cmhub 托管别名;cmshopee 只保存 `title_alias/image_alias`,不保存 OpenAI 模型 slug 作为执行事实。
- 能回答运营问题:什么时候用默认档、什么时候用高质量档、什么时候用省点档,以及失败重试是否值得换档。
- 不需要真实接入 BYOK,不改 ⑤设置页,不改 AI工场代码;本任务可以只做评测与文档。
- 自动化验证只需 `git diff --check`;若评测脚本另建,必须使用假 Key 或外部环境变量,不提交凭证。
## 边界(不改什么)
- 不实现 BYOK、自定义 Provider、API Key UI 或 direct 直连。
- 不修改 T-586~T-595 的 cmhub 托管主线。
- 不把模型定价写死进代码;价格以 cmhub `/models` 返回和实际扣点为准。
- 不用单个商品样本直接决定默认模型。
## 参考资料
- OpenAI 模型选择指导:`https://developers.openai.com/api/docs/guides/latest-model`
- OpenAI 图片生成指导:`https://developers.openai.com/api/docs/guides/image-generation`
## 执行记录
2026-07-11 完成文档选型收口:
- 新增 `docs/ai-studio-model-evaluation.md`,记录官方资料来源、档位建议、20~30 个商品评测样本集、评分口径、上线门槛、运营使用建议和客户端落地边界。
- 明确 T-597 不伪造付费实测数据:当前结论是“未跑真实样本前保持当前 cmhub 托管默认别名”,T-598 只先做默认/高质量/省点档位展示与日志口径。
- 明确客户端只保存 cmhub alias,不保存 OpenAI Key、Provider URL 或 OpenAI 原始模型 slug 作为执行事实。
- 同步 `docs/README.md` 文档导航。
- 验证:`git diff --check -- docs/ai-studio-model-evaluation.md docs/README.md docs/tasks/T-597.md` 通过。