Skip to content

提高目标作品文案选择准确性 - #5

Merged
Change3333 merged 3 commits into
mainfrom
agent/improve-extraction-accuracy
Jul 30, 2026
Merged

Change3333 merged 3 commits into
mainfrom
agent/improve-extraction-accuracy

Conversation

@Change3333

@Change3333 Change3333 commented Jul 30, 2026

Copy link
Copy Markdown
Owner

做了什么

  • 从视频、图文路径和常见查询参数中识别目标作品 ID
  • 优先选择 ID 匹配的作品文案,其次选择 aweme_detail / item_detail 等作品主体数据,最后才使用通用最长文本兜底
  • 为目标 JSON、作品主体、DOM 选择器、Meta、页面长文本和标题设置明确可信度,防止较长的评论或推荐内容覆盖目标文案
  • 将垃圾占位符改为精确匹配,避免误杀包含“抖音”“原创音乐”“网络错误”等正常词语的合法文案
  • 清理行内多余空格,同时保留作品描述中的段落换行
  • 对短链连接、读取失败和 5xx 增加有限退避重试;不重试风控 429
  • 新增 13 项提取选择、清理、作品 ID 和短链重试测试;连同安全测试共 24 项

为什么需要

旧逻辑会递归收集响应中的所有 desc 并选择最长文本。响应同时包含评论、推荐作品或其他页面数据时,长度并不代表它属于当前作品;此外,使用包含匹配过滤“抖音”等词会把正常文案误判为占位符。短链请求只尝试一次,也会放大瞬时网络波动。

用户影响

  • 降低提取到评论或推荐作品文案的概率
  • 合法文案不再因为包含常见词而被直接丢弃
  • 复制结果保留原文段落
  • 短暂连接故障或抖音 5xx 时自动有限重试

分支验证

python -m unittest discover -s tests -v
Ran 24 tests
OK
  • Python AST 解析通过
  • 嵌入式 JavaScript 语法检查通过
  • 敏感信息模式扫描通过

发布候选集成验证

在仅本地的发布候选分支中按 PR #1 → PR #4 → PR #5 顺序合并:

  • 三次合并均无冲突
  • 合并后的 27 项测试全部通过
  • 真实 Edge 浏览器冒烟测试通过
  • 已验证页面标题、CSP 与安全响应头
  • 已验证“一键复制”实际写入剪贴板并保留段落
  • 已验证空 JSON 请求返回 HTTP 400

集成演练还发现并修复了“页面加载中”占位符兼容问题。

合并顺序

这是一个堆叠草稿 PR,基于安全 PR #4。应先合并 PR #1,再合并 PR #4;随后将本 PR 的 base 改为 main、同步最新主分支并让 GitHub Actions 运行。

@Change3333
Change3333 changed the base branch from agent/harden-public-endpoint to main July 30, 2026 04:51
@Change3333
Change3333 marked this pull request as ready for review July 30, 2026 04:52
@Change3333
Change3333 merged commit bbcaa9c into main Jul 30, 2026
2 checks passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant