docs: add T-619 vision task and image edit script
This commit is contained in:
+15
@@ -1898,3 +1898,18 @@
|
||||
- 测试期仍保留 allauth `account.EmailAddress` 条件唯一约束在 MySQL 上不可创建的既有 `models.W036` 警告。
|
||||
- 部署提醒:
|
||||
- 代码部署后需要在生产 admin 补齐当前 Windows 发布版本的 `size_bytes`,并验证 `GET /api/v1/client/releases/latest?platform=windows` 返回正整数 `release.size_bytes`。
|
||||
|
||||
## 2026-07-16 文档登记:T-619 多张图片理解并返回文字
|
||||
|
||||
- 状态:TODO(仅任务登记,未改代码或数据库)。
|
||||
- 背景:现有对外能力只有生成标题与生成图片;标题接口虽然可带单张图片,但返回语义固定为标题,不能作为通用的单图 / 多图理解接口。当前 Provider 已有部分 `vision` 能力声明,但生成核心、序列化器和公开操作类型仍只支持单个图片输入与 `title` / `image`。
|
||||
- 文档变更:
|
||||
- `docs/06-tasks.md`:新增 T-619「多张图片理解并返回文字」,状态为 TODO,并登记 M15。
|
||||
- `docs/current-state.md` / `docs/00-ai-start-here.md`:把 T-619 设为下一项可领取任务,并明确当前尚未实现。
|
||||
- 方案口径:
|
||||
- 新增独立 `vision` 操作与建议默认别名 `vision-standard`,不复用标题别名,不向调用方暴露具体上游模型。
|
||||
- 新增同步 `POST /api/v1/analyze/images`;请求使用有序 `images` 列表,每项二选一提供 `image_url` 或 `image_base64`,返回普通文字 `text`。
|
||||
- 第一版按一次请求固定扣点,并通过 `VISION_MAX_IMAGES=8`、`VISION_MAX_IMAGE_BYTES=10485760`、`VISION_MAX_TOTAL_BYTES=33554432` 限制图片数量、单图大小和总大小;只审核 prompt,不声称已做图片内容审核。
|
||||
- 多图上游调用必须扩展既有 Provider 和 T-613 共享生成 core;图片 URL 必须复用现有 SSRF 防护,失败复用计费层幂等退点。
|
||||
- 本任务不包含流式、异步 vision task、OCR 专用接口或结构化 JSON 输出;OCR、商品识别和图片对比先通过 prompt 表达。
|
||||
- 验证:`./init.ps1` 通过,Python 3.12.3,依赖已满足,`manage.py check` 0 issues;任务登记完成后继续执行文档 diff 检查。
|
||||
|
||||
Reference in New Issue
Block a user