Files
cmshoppe/docs/tasks/T-597.md
T

3.2 KiB
Raw Blame History

id, title, phase, deps, status, created
id title phase deps status created
T-597 AI工场 GPT / OpenAI 托管模型选型评测与默认档位策略 8
T-595
TODO 2026-07-11

问题 / 背景

T-586~T-595 固定使用 cmhub 托管生图模型,不接入自定义 Provider。AI工场主线完成后,如果要让 cmhub 后台切到 OpenAI / GPT 系列模型,不能只凭模型名直接上线,需要先建立运营可理解的质量、速度、成本评测口径。

当前官方模型指导中,GPT-5.6 家族分为偏旗舰能力的 gpt-5.6-sol、平衡能力与成本的 gpt-5.6-terra、成本敏感高频任务的 gpt-5.6-luna;图片生成/编辑方向以 gpt-image-2 作为当前高质量图像模型参考。落地到本项目时仍必须通过 cmhub 能力别名调用,不在 cmshopee 客户端直连 OpenAI。

方案

  • 建立 AI工场模型评测样本集:至少覆盖 20~30 个真实商品,包含服饰/生活用品/美妆/小物、白底主图、场景图、细节图和文字较多的旧图。
  • 评测拆成两类:
    • 文本/提示词辅助:商品图精修提示词改写、标题/卖点辅助、失败原因解释,优先评估 gpt-5.6-terra;高质量复核评估 gpt-5.6-sol;大批量低成本辅助评估 gpt-5.6-luna。
    • 图片生成/编辑:主图/详情图候选生成,优先评估 cmhub 提供的 gpt-image-2 或等价托管图像别名;保留当前 cmhub 默认图像模型作为对照组。
  • 评估指标用运营能理解的口径:商品主体保真、可商用感、少幻觉、文字不乱写、背景干净、主图合规、详情图信息清晰、一次通过率、平均耗时、单图成本。
  • 输出推荐档位:
    • 默认:平衡档,用于日常批量。
    • 高质量:用于重点商品或失败重试。
    • 省点:用于低价值 SKU 或大批量初稿。
  • 推荐结果只写成 cmhub 别名策略,不把 OpenAI API Key 或直连 Provider 写进 cmshopee 配置。

验收要点

  • 形成 docs/ 下的评测记录或选型说明,列出样本、模型档位、质量结论、耗时、成本和最终推荐。
  • 明确普通产品默认仍走 cmhub 托管别名;cmshopee 只保存 title_alias/image_alias,不保存 OpenAI 模型 slug 作为执行事实。
  • 能回答运营问题:什么时候用默认档、什么时候用高质量档、什么时候用省点档,以及失败重试是否值得换档。
  • 不需要真实接入 BYOK,不改 ⑤设置页,不改 AI工场代码;本任务可以只做评测与文档。
  • 自动化验证只需 git diff --check;若评测脚本另建,必须使用假 Key 或外部环境变量,不提交凭证。

边界(不改什么)

  • 不实现 BYOK、自定义 Provider、API Key UI 或 direct 直连。
  • 不修改 T-586~T-595 的 cmhub 托管主线。
  • 不把模型定价写死进代码;价格以 cmhub /models 返回和实际扣点为准。
  • 不用单个商品样本直接决定默认模型。

参考资料

  • OpenAI 模型选择指导:https://developers.openai.com/api/docs/guides/latest-model
  • OpenAI 图片生成指导:https://developers.openai.com/api/docs/guides/image-generation

执行记录

(完成后记录评测样本、推荐档位、采用的 cmhub 别名和验证方式。)