Files
cmshoppe/docs/ai-studio-model-evaluation.md

7.1 KiB
Raw Permalink Blame History

AI工场托管模型评测与默认档位策略

任务来源:T-597。本文是 AI工场从“cmhub 当前默认托管模型”评估切换到 OpenAI / GPT 系列托管能力时的选型说明与评测模板。本文不代表已经执行付费真实样本测试;真实结论必须由运营样本跑数后补充。

资料来源

  • OpenAI Model guidance:https://developers.openai.com/api/docs/guides/latest-model
  • OpenAI Image generation:https://developers.openai.com/api/docs/guides/image-generation
  • 核对日期:2026-07-11

官方文档当前把 GPT-5.6 家族分成 gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna,分别对应旗舰能力、能力与成本平衡、高频低成本任务;gpt-5.6 alias 指向 gpt-5.6-sol。图片方向可参考 GPT Image 能力,尤其 gpt-image-2,但落地到本项目时仍由 cmhub 暴露能力别名,客户端不得保存 OpenAI 原始 Key 或把 OpenAI slug 当执行事实。

产品原则

  • 普通用户只看到“cmhub 托管模型 / 默认档 / 高质量档 / 省点档 / 扣点成本”,不暴露 Provider URL、OpenAI API Key、上游接口路径或内部请求体。
  • cmshopee 客户端只保存 cmhub 返回的 title_alias / image_alias,不把 gpt-5.6-*、gpt-image-* 写成强执行配置。
  • 默认档必须以真实商品样本的一次通过率、平均耗时、P95 耗时和扣点成本决定;未跑样本前不得因为模型名更强就替换默认。
  • 图片生成是高成本能力,推荐默认走“平衡档”,重点商品/失败重试才用“高质量档”,低价值 SKU 初稿才用“省点档”。

推荐档位

档位 文本/提示词辅助建议 图片生成/编辑建议 使用场景 默认策略
默认档 cmhub 平衡文本别名,后台可映射 gpt-5.6-terra 或等价能力 cmhub 平衡图像别名,后台可映射 gpt-image-2 或当前稳定图像能力 日常批量主图/详情图候选、提示词改写、标题/卖点辅助 真实样本通过率不低于当前默认模型且扣点可接受后,才设为默认
高质量档 cmhub 高质量文本别名,后台可映射 gpt-5.6-sol 或等价能力 cmhub 高质量图像别名,优先用于重点商品、复杂背景、失败重试 高毛利 SKU、广告款、默认档失败后重试 不作为全局默认,避免成本失控
省点档 cmhub 省点文本别名,后台可映射 gpt-5.6-luna 或等价能力 cmhub 省点图像别名,只用于低价值 SKU 初稿或批量探索 大批量草稿、运营快速预览 不建议直接作为最终主图默认档

评测样本集

真实评测建议建立 STUDIO-EVAL-YYYYMMDD 样本包,至少 20~30 个商品,覆盖以下类型。样本文件和真实商品图属于业务数据,不提交 Git。

样本组 数量 商品类型 旧图特征 重点观察
A 5 服饰/配件 模特图、材质细节、颜色差异明显 主体保真、颜色不漂、服饰结构不乱
B 5 生活用品 白底主图、多个小件组合 主体数量不变、边缘干净、白底合规
C 5 美妆/个护 包装文字、瓶身反光、细节图 不乱写品牌/文字、包装比例稳定
D 5 小物/工具 尺寸小、部件多、背景杂 细节不丢、构图清楚、可商用感
E 5 详情图/信息图 文字多、说明块多、版式复杂 文字处理是否可接受,是否需要转人工
F 5 失败回归样本 当前模型曾失败或效果差 新档位是否显著改善

评分口径

每张候选图按 1~5 分打分,4 分以上才算“一次通过”。标题/提示词辅助按“可直接使用 / 需轻改 / 不可用”记录。

指标 说明 权重
商品主体保真 主体形状、数量、颜色、关键细节是否保持 25%
商用感 是否像可上线主图/详情图,光影、背景、清晰度是否专业 20%
主图合规 白底/构图/主体占比/无多余元素是否符合运营要求 15%
少幻觉 不添加不存在的配件、文字、Logo 或错误卖点 15%
文字稳定 包装文字、详情图文字是否可接受;文字多的图允许标记需人工 10%
耗时 平均耗时、P95 耗时,是否影响批量生产节奏 10%
成本 单图扣点、一次通过成本、失败重试成本 5%

上线门槛

  • 默认档候选的一次通过率必须不低于当前 cmhub 默认图像模型;若提升小于 5%,不建议仅因模型名切换默认。
  • 平均耗时不超过当前默认模型 20%,P95 耗时不超过运营可接受阈值;超出时只放高质量档或重点商品档。
  • 单图扣点上涨时,必须用“一次通过成本”判断:如果质量提升减少重试,才可接受更高单次成本。
  • 文本辅助默认优先平衡档;高质量档只用于复杂商品、失败原因分析、重点 SKU 复核。
  • gpt-image-2 或等价高质量图像别名如果文字/包装稳定性仍不满足详情图要求,详情图文字密集场景必须保留人工复核。

当前建议

在没有真实样本跑数前,AI工场默认仍保持当前 cmhub 托管图像别名,不直接切换。T-598 可以先把 UI 和日志口径收口成“默认 / 高质量 / 省点”档位提示,并继续以 cmhub /models 返回的别名、展示名、能力标签和扣点作为真实执行依据。

建议第一轮真实评测结果这样填写:

日期 样本包 cmhub 别名 后台能力 一次通过率 平均耗时 P95耗时 平均扣点 结论
待补 STUDIO-EVAL-YYYYMMDD 当前默认图像别名 当前 cmhub 默认 待补 待补 待补 待补 对照组
待补 STUDIO-EVAL-YYYYMMDD 平衡图像别名 GPT Image 等价能力 待补 待补 待补 待补 候选默认档
待补 STUDIO-EVAL-YYYYMMDD 高质量图像别名 GPT Image 高质量能力 待补 待补 待补 待补 重点商品/重试
待补 STUDIO-EVAL-YYYYMMDD 省点图像别名 低成本图像能力 待补 待补 待补 待补 初稿/低价值 SKU

给运营的用法说明

  • 默认档:日常批量先用它,目标是“成本可控、稳定可用”。
  • 高质量档:用于重点商品、默认档失败后的第二次生成、复杂背景或需要更强保真的商品。
  • 省点档:用于低价值 SKU、灵感草稿或大批量初筛;上线前仍要人工看图。
  • 失败重试是否换档:如果失败原因是主体变形、文字乱、构图不合规,优先换高质量档;如果失败原因是网络、下载、上游任务超时,不应换模型,应继续查询或重试原任务。

客户端落地边界

  • T-598 只做档位展示和日志口径,不新增 BYOK、自定义 Provider 或 OpenAI Key UI。
  • cmhub 后台可以调整档位对应的真实模型;客户端不需要发版即可承接。
  • 日志只写“cmhub 托管高质量档 / 扣点 / call_id / task_id”等业务可读字段,不写上游接口路径、Authorization、OpenAI API Key、完整 prompt 或请求体。