Files
cmshoppe/docs/tasks/T-597.md
T

52 lines
3.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
id: T-597
title: AI工场 GPT / OpenAI 托管模型选型评测与默认档位策略
phase: 8
deps: [T-595]
status: TODO
created: 2026-07-11
---
## 问题 / 背景
T-586~T-595 固定使用 cmhub 托管生图模型,不接入自定义 Provider。AI工场主线完成后,如果要让 cmhub 后台切到 OpenAI / GPT 系列模型,不能只凭模型名直接上线,需要先建立运营可理解的质量、速度、成本评测口径。
当前官方模型指导中,GPT-5.6 家族分为偏旗舰能力的 `gpt-5.6-sol`、平衡能力与成本的 `gpt-5.6-terra`、成本敏感高频任务的 `gpt-5.6-luna`;图片生成/编辑方向以 `gpt-image-2` 作为当前高质量图像模型参考。落地到本项目时仍必须通过 cmhub 能力别名调用,不在 cmshopee 客户端直连 OpenAI。
## 方案
- 建立 AI工场模型评测样本集:至少覆盖 20~30 个真实商品,包含服饰/生活用品/美妆/小物、白底主图、场景图、细节图和文字较多的旧图。
- 评测拆成两类:
- 文本/提示词辅助:商品图精修提示词改写、标题/卖点辅助、失败原因解释,优先评估 `gpt-5.6-terra`;高质量复核评估 `gpt-5.6-sol`;大批量低成本辅助评估 `gpt-5.6-luna`。
- 图片生成/编辑:主图/详情图候选生成,优先评估 cmhub 提供的 `gpt-image-2` 或等价托管图像别名;保留当前 cmhub 默认图像模型作为对照组。
- 评估指标用运营能理解的口径:商品主体保真、可商用感、少幻觉、文字不乱写、背景干净、主图合规、详情图信息清晰、一次通过率、平均耗时、单图成本。
- 输出推荐档位:
- 默认:平衡档,用于日常批量。
- 高质量:用于重点商品或失败重试。
- 省点:用于低价值 SKU 或大批量初稿。
- 推荐结果只写成 cmhub 别名策略,不把 OpenAI API Key 或直连 Provider 写进 cmshopee 配置。
## 验收要点
- 形成 `docs/` 下的评测记录或选型说明,列出样本、模型档位、质量结论、耗时、成本和最终推荐。
- 明确普通产品默认仍走 cmhub 托管别名;cmshopee 只保存 `title_alias/image_alias`,不保存 OpenAI 模型 slug 作为执行事实。
- 能回答运营问题:什么时候用默认档、什么时候用高质量档、什么时候用省点档,以及失败重试是否值得换档。
- 不需要真实接入 BYOK,不改 ⑤设置页,不改 AI工场代码;本任务可以只做评测与文档。
- 自动化验证只需 `git diff --check`;若评测脚本另建,必须使用假 Key 或外部环境变量,不提交凭证。
## 边界(不改什么)
- 不实现 BYOK、自定义 Provider、API Key UI 或 direct 直连。
- 不修改 T-586~T-595 的 cmhub 托管主线。
- 不把模型定价写死进代码;价格以 cmhub `/models` 返回和实际扣点为准。
- 不用单个商品样本直接决定默认模型。
## 参考资料
- OpenAI 模型选择指导:`https://developers.openai.com/api/docs/guides/latest-model`
- OpenAI 图片生成指导:`https://developers.openai.com/api/docs/guides/image-generation`
## 执行记录
(完成后记录评测样本、推荐档位、采用的 cmhub 别名和验证方式。)