--- id: T-597 title: AI工场 GPT / OpenAI 托管模型选型评测与默认档位策略 phase: 8 deps: [T-595] status: DONE created: 2026-07-11 --- ## 问题 / 背景 T-586~T-595 固定使用 cmhub 托管生图模型,不接入自定义 Provider。AI工场主线完成后,如果要让 cmhub 后台切到 OpenAI / GPT 系列模型,不能只凭模型名直接上线,需要先建立运营可理解的质量、速度、成本评测口径。 2026-07-11 已按 OpenAI 官方文档核对:GPT-5.6 家族可作为文本/提示词辅助的后台能力参考,其中 `gpt-5.6-sol` 偏旗舰能力、`gpt-5.6-terra` 平衡能力与成本、`gpt-5.6-luna` 面向高频低成本任务;图片生成/编辑方向以 GPT Image 能力(如 `gpt-image-2`)作为高质量图像能力参考。落地到本项目时仍必须通过 cmhub 能力别名调用,不在 cmshopee 客户端直连 OpenAI。 ## 方案 - 建立 AI工场模型评测样本集:至少覆盖 20~30 个真实商品,包含服饰/生活用品/美妆/小物、白底主图、场景图、细节图和文字较多的旧图。 - 评测拆成两类: - 文本/提示词辅助:商品图精修提示词改写、标题/卖点辅助、失败原因解释,优先评估 `gpt-5.6-terra`;高质量复核评估 `gpt-5.6-sol`;大批量低成本辅助评估 `gpt-5.6-luna`。 - 图片生成/编辑:主图/详情图候选生成,优先评估 cmhub 提供的 `gpt-image-2` 或等价托管图像别名;保留当前 cmhub 默认图像模型作为对照组。 - 评估指标用运营能理解的口径:商品主体保真、可商用感、少幻觉、文字不乱写、背景干净、主图合规、详情图信息清晰、一次通过率、平均耗时、单图成本。 - 输出推荐档位: - 默认:平衡档,用于日常批量。 - 高质量:用于重点商品或失败重试。 - 省点:用于低价值 SKU 或大批量初稿。 - 推荐结果只写成 cmhub 别名策略,不把 OpenAI API Key 或直连 Provider 写进 cmshopee 配置。 ## 验收要点 - 形成 `docs/` 下的评测记录或选型说明,列出样本、模型档位、质量结论、耗时、成本和最终推荐。 - 明确普通产品默认仍走 cmhub 托管别名;cmshopee 只保存 `title_alias/image_alias`,不保存 OpenAI 模型 slug 作为执行事实。 - 能回答运营问题:什么时候用默认档、什么时候用高质量档、什么时候用省点档,以及失败重试是否值得换档。 - 不需要真实接入 BYOK,不改 ⑤设置页,不改 AI工场代码;本任务可以只做评测与文档。 - 自动化验证只需 `git diff --check`;若评测脚本另建,必须使用假 Key 或外部环境变量,不提交凭证。 ## 边界(不改什么) - 不实现 BYOK、自定义 Provider、API Key UI 或 direct 直连。 - 不修改 T-586~T-595 的 cmhub 托管主线。 - 不把模型定价写死进代码;价格以 cmhub `/models` 返回和实际扣点为准。 - 不用单个商品样本直接决定默认模型。 ## 参考资料 - OpenAI 模型选择指导:`https://developers.openai.com/api/docs/guides/latest-model` - OpenAI 图片生成指导:`https://developers.openai.com/api/docs/guides/image-generation` ## 执行记录 2026-07-11 完成文档选型收口: - 新增 `docs/ai-studio-model-evaluation.md`,记录官方资料来源、档位建议、20~30 个商品评测样本集、评分口径、上线门槛、运营使用建议和客户端落地边界。 - 明确 T-597 不伪造付费实测数据:当前结论是“未跑真实样本前保持当前 cmhub 托管默认别名”,T-598 只先做默认/高质量/省点档位展示与日志口径。 - 明确客户端只保存 cmhub alias,不保存 OpenAI Key、Provider URL 或 OpenAI 原始模型 slug 作为执行事实。 - 同步 `docs/README.md` 文档导航。 - 验证:`git diff --check -- docs/ai-studio-model-evaluation.md docs/README.md docs/tasks/T-597.md` 通过。