Files
cmautobuy/admin/repository/pdd.go
T

414 lines
15 KiB
Go
Raw Normal View History

2026-08-07 10:27:39 +08:00
package repository
import (
"database/sql"
"fmt"
2026-08-07 11:27:06 +08:00
"strings"
"time"
2026-08-07 10:27:39 +08:00
"cmautobuy/admin/model"
)
2026-08-07 11:27:06 +08:00
// pddColumns 是所有查询共用的列清单。
// 写成常量是为了让下面几个查询的列顺序和 scanPddProduct 永远对得上——
// 改列的时候只改这一处,改漏了会 Scan 到错的字段上,而且不报错。
const pddColumns = `id, goods_id, url, title, skus_json,
collect_status, collect_msg, artifact_ref, collected_at,
deleted_at, created_at, updated_at`
// rowScanner 让 *sql.Row 和 *sql.Rows 都能喂给 scanPddProduct。
type rowScanner interface {
Scan(dest ...any) error
}
// scanPddProduct 按 pddColumns 的顺序读一行。
func scanPddProduct(s rowScanner, extra ...any) (*model.PddProduct, error) {
var p model.PddProduct
var title, skus, msg, artifact, collectedAt, deletedAt sql.NullString
dest := []any{
&p.ID, &p.GoodsID, &p.URL, &title, &skus,
&p.CollectStatus, &msg, &artifact, &collectedAt,
&deletedAt, &p.CreatedAt, &p.UpdatedAt,
}
dest = append(dest, extra...)
if err := s.Scan(dest...); err != nil {
return nil, err
}
p.Title = title.String
p.SkusJSON = skus.String
p.CollectMsg = msg.String
p.ArtifactRef = artifact.String
p.CollectedAt = collectedAt.String
p.DeletedAt = deletedAt.String
return &p, nil
}
2026-08-07 10:27:39 +08:00
// EnsurePddProduct 保证 goods_id 对应的 PDD 商品存在,返回它。
//
// 操作员在货运单或蝦皮商品上填 PDD 链接、点保存时调它。三种情况:
//
// 没有这条记录 -> 新建,状态 pending(待采集)
// 有且未删除 -> 直接返回,不动它(保留已有的采集结果)
// 有但已软删除 -> **复活**:清空 deleted_at,状态置回 pending
//
// 复活是必要的:goods_id 上有 UNIQUE 约束,软删除的行还占着那个值,
// 不复活就会插入冲突,操作员会看到一个莫名其妙的错误。
func EnsurePddProduct(q Execer, goodsID, url string) (*model.PddProduct, error) {
if goodsID == "" {
return nil, fmt.Errorf("goods_id 不能为空")
}
if url == "" {
return nil, fmt.Errorf("url 不能为空")
}
existing, err := GetPddProductByGoodsID(q, goodsID)
if err != nil {
return nil, err
}
now := model.NowISO()
if existing == nil {
res, err := q.Exec(`
INSERT INTO pdd_products (goods_id, url, collect_status, created_at, updated_at)
VALUES (?, ?, 'pending', ?, ?)`,
goodsID, url, now, now)
if err != nil {
return nil, fmt.Errorf("新建 PDD 商品 %s 失败: %w", goodsID, err)
}
id, _ := res.LastInsertId()
return &model.PddProduct{
ID: id, GoodsID: goodsID, URL: url,
CollectStatus: model.CollectPending,
CreatedAt: now, UpdatedAt: now,
}, nil
}
if existing.IsDeleted() {
// 复活:清掉删除标记,状态回到待采集。
// 采集结果一并清空——记录被删过一次,旧数据不能再当成有效的用。
2026-08-07 11:27:06 +08:00
//
// title 也要清:它是**采集回来的**(SetCollectResult 写的),
// 属于采集结果的一部分。留着的话状态显示"未采集"、标题却有值,
// 操作员会以为已经采过了。
2026-08-07 10:27:39 +08:00
_, err := q.Exec(`
UPDATE pdd_products
SET deleted_at = NULL, url = ?, collect_status = 'pending',
2026-08-07 11:27:06 +08:00
title = NULL, skus_json = NULL, collect_msg = NULL,
artifact_ref = NULL, collected_at = NULL, updated_at = ?
2026-08-07 10:27:39 +08:00
WHERE goods_id = ?`,
url, now, goodsID)
if err != nil {
return nil, fmt.Errorf("复活 PDD 商品 %s 失败: %w", goodsID, err)
}
return GetPddProductByGoodsID(q, goodsID)
}
// 已存在且有效:链接可能写法不同(带不带参数),更新一下原文,
// 但**不碰采集结果和状态** —— 同一个商品不必因为换了个链接写法就重采。
if existing.URL != url {
if _, err := q.Exec(
`UPDATE pdd_products SET url = ?, updated_at = ? WHERE goods_id = ?`,
url, now, goodsID); err != nil {
return nil, fmt.Errorf("更新 PDD 商品 %s 链接失败: %w", goodsID, err)
}
existing.URL = url
}
return existing, nil
}
// GetPddProductByGoodsID 按 goods_id 查,**包括已软删除的**。
//
// 之所以连删除的也查出来,是因为 EnsurePddProduct 要靠它判断该不该复活。
// 给界面用的查询请用 ListPddProducts,那个会过滤掉已删除的。
func GetPddProductByGoodsID(q Execer, goodsID string) (*model.PddProduct, error) {
2026-08-07 11:27:06 +08:00
p, err := scanPddProduct(q.QueryRow(
`SELECT `+pddColumns+` FROM pdd_products WHERE goods_id = ?`, goodsID))
2026-08-07 10:27:39 +08:00
if err == sql.ErrNoRows {
return nil, nil
}
if err != nil {
return nil, fmt.Errorf("查询 PDD 商品 %s 失败: %w", goodsID, err)
}
2026-08-07 11:27:06 +08:00
return p, nil
}
2026-08-07 10:27:39 +08:00
2026-08-07 11:27:06 +08:00
// GetPddProductByID 按主键查一条,**已软删除的查不到**。
//
// 弹窗用的是这个,不是 GetPddProductByGoodsID —— 后者连删掉的也返回,
// 那是给 EnsurePddProduct 判断复活用的,不能拿来渲染界面。
func GetPddProductByID(q Execer, id int64) (*model.PddProduct, error) {
p, err := scanPddProduct(q.QueryRow(
`SELECT `+pddColumns+`
FROM pdd_products WHERE id = ? AND deleted_at IS NULL`, id))
if err == sql.ErrNoRows {
return nil, nil
}
if err != nil {
return nil, fmt.Errorf("查询 PDD 商品 #%d 失败: %w", id, err)
}
return p, nil
}
// PddProductRow 是列表页要的一行:商品本身,外加数据库算好的规格数。
type PddProductRow struct {
model.PddProduct
// SkuCount 是 skus_json 里的规格条数。
// **-1 表示"还没有采集结果"**,和"采到 0 个规格"是两回事:
// 前者显示 —,后者是采集出了问题,要显示 0 让操作员看见。
SkuCount int
}
// 规格数交给 SQLite 算,不要把整个 skus_json 读进 Go 再数——
// 列表页几十上百行,每行都反序列化一遍纯属浪费。
//
// json_valid 那层判断不能省:skus_json 万一存进了坏数据,
// json_array_length 会让**整条查询报错**,页面直接打不开。
const pddSkuCountExpr = `
CASE WHEN skus_json IS NULL OR skus_json = '' OR NOT json_valid(skus_json)
THEN -1
ELSE COALESCE(json_array_length(skus_json, '$.skus'), -1)
END`
// ListPddProducts 查列表。keyword 匹配 goods_id 或链接,status 为空表示不筛选。
//
// 只返回未删除的。软删除的记录还在库里(sku_mappings 指着它),
// 但界面上不该看见。
func ListPddProducts(q Execer, keyword string, status model.CollectStatus) ([]PddProductRow, error) {
sqlText := `SELECT ` + pddColumns + `,` + pddSkuCountExpr + `
FROM pdd_products
WHERE deleted_at IS NULL`
var args []any
if keyword = strings.TrimSpace(keyword); keyword != "" {
// ESCAPE 不能省:操作员搜 "_" 时,LIKE 会把它当"任意一个字符",
// 结果是全部行都命中,看着像搜索坏了。
pattern := "%" + escapeLike(keyword) + "%"
sqlText += ` AND (goods_id LIKE ? ESCAPE '\' OR url LIKE ? ESCAPE '\')`
args = append(args, pattern, pattern)
}
if status != "" {
sqlText += ` AND collect_status = ?`
args = append(args, string(status))
}
// 刚动过的排前面,操作员点完"创建采集任务"一眼能看到结果
sqlText += ` ORDER BY updated_at DESC, id DESC`
rows, err := q.Query(sqlText, args...)
if err != nil {
return nil, fmt.Errorf("查询 PDD 商品列表失败: %w", err)
}
defer rows.Close()
list := make([]PddProductRow, 0, 16)
for rows.Next() {
var r PddProductRow
p, err := scanPddProduct(rows, &r.SkuCount)
if err != nil {
return nil, fmt.Errorf("读取 PDD 商品列表失败: %w", err)
}
r.PddProduct = *p
list = append(list, r)
}
return list, rows.Err()
}
// escapeLike 把 LIKE 的三个特殊字符转义掉,配合 ESCAPE '\' 使用。
// 反斜杠必须第一个换,否则会把后面刚加的反斜杠又转义一遍。
func escapeLike(s string) string {
s = strings.ReplaceAll(s, `\`, `\\`)
s = strings.ReplaceAll(s, `%`, `\%`)
s = strings.ReplaceAll(s, `_`, `\_`)
return s
}
// CountPddProductsByStatus 统计各采集状态各有多少条,供底部状态条显示。
//
// 统计的是**全部未删除记录**,不受当前筛选影响——
// 状态条是全局概览,"总共还有几个没采"这个数不该跟着筛选变。
func CountPddProductsByStatus(q Execer) (map[model.CollectStatus]int, error) {
rows, err := q.Query(`
SELECT collect_status, COUNT(*)
FROM pdd_products
WHERE deleted_at IS NULL
GROUP BY collect_status`)
if err != nil {
return nil, fmt.Errorf("统计 PDD 商品状态失败: %w", err)
}
defer rows.Close()
counts := map[model.CollectStatus]int{}
for rows.Next() {
var status string
var n int
if err := rows.Scan(&status, &n); err != nil {
return nil, err
}
counts[model.CollectStatus(status)] = n
}
return counts, rows.Err()
}
// UpdatePddProductURL 只改链接原文,不动采集结果和状态。
//
// 调用方必须先确认新链接解析出来的 goods_id 和这条记录的一致,
// 见 service.UpdatePddProductURL 的说明。
func UpdatePddProductURL(q Execer, id int64, url string) error {
if url == "" {
return fmt.Errorf("url 不能为空")
}
res, err := q.Exec(`
UPDATE pdd_products SET url = ?, updated_at = ?
WHERE id = ? AND deleted_at IS NULL`,
url, model.NowISO(), id)
if err != nil {
return fmt.Errorf("更新 PDD 商品 #%d 链接失败: %w", id, err)
}
if n, _ := res.RowsAffected(); n == 0 {
return fmt.Errorf("PDD 商品 #%d 不存在或已被删除", id)
}
return nil
}
// SoftDeletePddProducts 批量软删除,返回实际删掉的条数。
//
// 已经删过的不会重复计数(WHERE 里带了 deleted_at IS NULL),
// 所以返回值就是"这次真正消失的行数",可以直接报给操作员。
func SoftDeletePddProducts(q Execer, goodsIDs []string) (int64, error) {
if len(goodsIDs) == 0 {
return 0, nil
}
// 占位符按数量生成,值仍然是参数化传入,不存在注入
placeholders := strings.TrimSuffix(strings.Repeat("?,", len(goodsIDs)), ",")
now := model.NowISO()
args := make([]any, 0, len(goodsIDs)+2)
args = append(args, now, now)
for _, id := range goodsIDs {
args = append(args, id)
}
res, err := q.Exec(`
UPDATE pdd_products SET deleted_at = ?, updated_at = ?
WHERE goods_id IN (`+placeholders+`) AND deleted_at IS NULL`, args...)
if err != nil {
return 0, fmt.Errorf("批量删除 PDD 商品失败: %w", err)
}
return res.RowsAffected()
2026-08-07 10:27:39 +08:00
}
// SetCollectResult 保存采集回来的 PDD 商品数据。
//
// `[必须]` 按 **PDD 的 goods_id** 定位,不是蝦皮的。采集的对象是 PDD 商品。
//
// title 由调用方从采集结果里取出来传进来,用于人工核对"采的是不是要的那个商品"。
func SetCollectResult(q Execer, pddGoodsID, title, skusJSON string) error {
if pddGoodsID == "" {
return fmt.Errorf("pdd goods_id 不能为空")
}
now := model.NowISO()
res, err := q.Exec(`
UPDATE pdd_products
SET skus_json = ?, title = ?, collect_status = 'collected',
collect_msg = NULL, collected_at = ?, updated_at = ?
WHERE goods_id = ? AND deleted_at IS NULL`,
skusJSON, title, now, now, pddGoodsID)
if err != nil {
return fmt.Errorf("保存 PDD 商品 %s 的采集结果失败: %w", pddGoodsID, err)
}
// 影响 0 行说明这个商品不存在或已被删除。
// 不当错误处理——结果照样在 tasks.result_data 里留了痕,不会丢。
if n, _ := res.RowsAffected(); n == 0 {
return nil
}
return nil
}
// SetCollectFailed 标记采集失败,并记下原因和诊断产物位置。
//
// 错误信息要能在界面上看见,否则操作员不知道为什么采不到。
// artifactRef 可以为空;有值时形如 client-001:artifacts/PDD-0001/attempt-xxx/,
// 告诉操作员去哪台客户端的哪个目录捞截图和控件树。
func SetCollectFailed(q Execer, pddGoodsID, msg, artifactRef string) error {
if pddGoodsID == "" {
return fmt.Errorf("pdd goods_id 不能为空")
}
now := model.NowISO()
_, err := q.Exec(`
UPDATE pdd_products
SET collect_status = 'failed', collect_msg = ?, artifact_ref = ?,
updated_at = ?
WHERE goods_id = ? AND deleted_at IS NULL`,
msg, artifactRef, now, pddGoodsID)
if err != nil {
return fmt.Errorf("标记 PDD 商品 %s 采集失败出错: %w", pddGoodsID, err)
}
return nil
}
// MarkCollecting 把商品置为"采集中"。创建采集任务时调。
//
// 允许发起采集的状态:
// - pending / failed —— 没有任务在跑;
// - collecting **且已经超时**(`updated_at` 早于 `now - model.CollectStaleAfter`)
// —— 客户端离线、崩溃或任务被删都会让一个 collecting 卡住不动,
// 这些是常态不是异常,界面上必须有出口,见 #24。
//
// `[必须]` 超时判定在**读取的这一刻现算**(直接拼进这条 UPDATE 的 WHERE 里),
// 不是靠后台协程定期把超时的状态改回 pending。本项目已经在并发上栽过两次
// (PRAGMA 没作用到连接池、`BEGIN DEFERRED` 死锁),能不引入并发就不引入——
// 现算没有调度、没有窗口期,天然不会有"扫到一半客户端正好提交了结果"这种竞态。
//
// `[必须]` 用**字符串比较** `updated_at < ?`,不解析成 time.Time 再比。
// 这是安全的,但依赖 model.NowISO() 永远产出定宽 UTC 格式,见那里的注释。
//
// `[已知取舍]` 超时后允许重新建任务,但**老任务还留在队列里**,
// 客户端上线后可能把新旧两个任务都领走,同一个商品被采两次。
// 这是可以接受的:采集是只读操作,没有任何副作用,后一次的结果覆盖前一次,
// 数据仍然正确。**不要看到"可能采两次"就加锁或加租约去"修"它**
// ——租约和心跳是被明确移除过的设计,见 docs/client/00-glossary.md
// 「为什么没有租约和心跳」一节;这条取舍详见 docs/admin/03-data-model.md §4.1。
//
// 返回 false 表示当前状态不允许发起采集(真的在采集且没超时、已采集、
// 或商品不存在/已删除),调用方应跳过并把原因告诉操作员。
2026-08-07 10:27:39 +08:00
func MarkCollecting(q Execer, pddGoodsID string) (bool, error) {
now := time.Now()
nowISO := now.UTC().Format(model.TimeLayout)
staleBefore := now.Add(-model.CollectStaleAfter).UTC().Format(model.TimeLayout)
2026-08-07 10:27:39 +08:00
res, err := q.Exec(`
UPDATE pdd_products
SET collect_status = 'collecting', updated_at = ?
WHERE goods_id = ? AND deleted_at IS NULL
AND ( collect_status IN ('pending', 'failed')
OR (collect_status = 'collecting' AND updated_at < ?) )`,
nowISO, pddGoodsID, staleBefore)
2026-08-07 10:27:39 +08:00
if err != nil {
return false, fmt.Errorf("标记 PDD 商品 %s 采集中失败: %w", pddGoodsID, err)
}
n, err := res.RowsAffected()
if err != nil {
return false, err
}
return n == 1, nil
}
// SoftDeletePddProduct 软删除。
//
// 不硬删是因为 sku_mappings 指向它,硬删会把人工攒了很久的匹配成果一起带走。
// 删除后界面上不再显示,但记录和映射都还在;
// 操作员重新填同一个链接时会被 EnsurePddProduct 复活。
func SoftDeletePddProduct(q Execer, pddGoodsID string) error {
now := model.NowISO()
_, err := q.Exec(
`UPDATE pdd_products SET deleted_at = ?, updated_at = ? WHERE goods_id = ?`,
now, now, pddGoodsID)
if err != nil {
return fmt.Errorf("删除 PDD 商品 %s 失败: %w", pddGoodsID, err)
}
return nil
}