docs: add T-619 vision task and image edit script

This commit is contained in:
QiuSW
2026-07-16 11:38:17 +08:00
parent 2887966625
commit 0ea65d4df4
6 changed files with 111 additions and 4 deletions
+15
View File
@@ -1898,3 +1898,18 @@
- 测试期仍保留 allauth `account.EmailAddress` 条件唯一约束在 MySQL 上不可创建的既有 `models.W036` 警告。
- 部署提醒:
- 代码部署后需要在生产 admin 补齐当前 Windows 发布版本的 `size_bytes`,并验证 `GET /api/v1/client/releases/latest?platform=windows` 返回正整数 `release.size_bytes`。
## 2026-07-16 文档登记:T-619 多张图片理解并返回文字
- 状态:TODO(仅任务登记,未改代码或数据库)。
- 背景:现有对外能力只有生成标题与生成图片;标题接口虽然可带单张图片,但返回语义固定为标题,不能作为通用的单图 / 多图理解接口。当前 Provider 已有部分 `vision` 能力声明,但生成核心、序列化器和公开操作类型仍只支持单个图片输入与 `title` / `image`。
- 文档变更:
- `docs/06-tasks.md`:新增 T-619「多张图片理解并返回文字」,状态为 TODO,并登记 M15。
- `docs/current-state.md` / `docs/00-ai-start-here.md`:把 T-619 设为下一项可领取任务,并明确当前尚未实现。
- 方案口径:
- 新增独立 `vision` 操作与建议默认别名 `vision-standard`,不复用标题别名,不向调用方暴露具体上游模型。
- 新增同步 `POST /api/v1/analyze/images`;请求使用有序 `images` 列表,每项二选一提供 `image_url` 或 `image_base64`,返回普通文字 `text`。
- 第一版按一次请求固定扣点,并通过 `VISION_MAX_IMAGES=8`、`VISION_MAX_IMAGE_BYTES=10485760`、`VISION_MAX_TOTAL_BYTES=33554432` 限制图片数量、单图大小和总大小;只审核 prompt,不声称已做图片内容审核。
- 多图上游调用必须扩展既有 Provider 和 T-613 共享生成 core;图片 URL 必须复用现有 SSRF 防护,失败复用计费层幂等退点。
- 本任务不包含流式、异步 vision task、OCR 专用接口或结构化 JSON 输出;OCR、商品识别和图片对比先通过 prompt 表达。
- 验证:`./init.ps1` 通过,Python 3.12.3,依赖已满足,`manage.py check` 0 issues;任务登记完成后继续执行文档 diff 检查。