Content Collector

👤 lovensky1992-wk 📦 v2.0.1 ⭐ 4.5 ⬇️ 1.3K 下載
📚 知識管理 免費

📖 技能介紹


name: content-collector version: 2.0.0 description: > 個人內容收藏與知識管理系統。收藏、整理、檢索、二創。 Use when: (1) 使用者說"收藏"/"存一下"/"記錄下來"/"save"/"bookmark"/"clip", (2) 使用者要求搜尋之前收藏的內容, (3) 使用者要求基於收藏內容生成社交媒體文案(二創), (4) 使用者提到"之前看過一個..."/"上次收藏的..."等回憶性檢索。 已支援來源:部落格、X/Twitter、網頁、B站/YouTube/抖音/小紅書影片。 NOT for: 純個人筆記(直接寫檔案)、長文寫作(用 internal-comms/docx)、 公眾號釋出(用 wemp-ops)、小紅書釋出(用 xiaohongshu-ops)。


Content Collector - 個人內容收藏系統

收藏好內容 → 結構化整理 → 關鍵詞檢索 → 二次創作

資料位置

  • 主儲存: <WORKSPACE>/collections/(articles/ tweets/ videos/ wechat/ ideas/)
  • Obsidian 同步: <YOUR_OBSIDIAN_VAULT>/收藏/(每次收藏同時寫入)
  • 索引: collections/index.md + collections/tags.md(自動維護)

收藏工作流

Step 0: 去重(每次必做)

有 URL 時: obsidian search query="<domain/path>" total(去掉 https:// 字首)或 grep -rl "<url>" collections/ 返回 > 0 → 已收藏,終止。返回 0 → 繼續。

Step 1: URL 路由

按 URL 匹配處理路徑。詳見 references/url-routing-and-site-specs.md

URL 模式 category 處理方式
內網域名 articles Chrome Relay,不調 web_fetch
arxiv.org/abs/* articles 提取 abstract/authors
github.com/*/* articles README + stars/language
mp.weixin.qq.com wechat 優先 browser
youtube.com/watch* videos Supadata transcript
B站 videos video_transcribe.sh 本地轉錄
小紅書/抖音(影片) videos video_transcribe.sh 本地轉錄
x.com/*/status/* tweets 提取互動資料,thread 展開
其他 articles 預設流程

Step 2: 內容提取

文章/網頁: 1. supadata_fetch.py web <url>(降級: web_fetch) 2. Schema.org 提取 — 詳見 references/schema-extraction-spec.md 3. 插圖提取+下載(必做)— 詳見 references/image-extraction-spec.md 4. 主題關鍵詞提取 — 詳見 references/theme-extraction-spec.md

影片: 1. 後設資料: supadata_fetch.py metadata <url>bilibili_extract.py <url> 2. 轉錄: bash scripts/video_transcribe.sh <url>(自動檢測平臺和字幕源) 3. 精彩片段提取(≥10min) — 詳見 references/highlight-extraction-spec.md 4. 主題關鍵詞提取

推文/短內容: 直接提取文本+互動資料

Step 3: 寫檔案

  1. 生成 collections/{category}/YYYY-MM-DD-slug.md(格式見下方 Schema)
  2. 內容概覽圖(>1000字文章) — 詳見 references/content-overview-spec.md
  3. 同步到 Obsidian — 詳見 references/obsidian-integration.md
  4. obsidian daily:append content="- 📌 收藏了 [[{標題}]]({source})| {一句話摘要}"
  5. 更新 index.md + tags.md

Step 3.5: 微信圖片快取(wechat 類必做)

如果 URL 是微信公眾號(mp.weixin.qq.com),寫完收藏檔案後執行: bash scripts/cache-wechat-images.sh <剛寫入的收藏檔案> 下載微信 CDN 圖片到本地 collections/images/<slug>/,防止圖片過期 404。

Step 4: 關聯匹配

執行 bash scripts/post-collect.sh <剛寫入的收藏檔案> 指令碼自動匹配活躍專案和相關收藏,更新 frontmatter 的 related_projects。 如有相關收藏,在回覆中附帶提及。 仍需手動匹配 collections/topics/topic-pool.md → 追加到 temp/handoffs/collector-to-writing.md

7w4.net小蔥技能站,你的AI助手技能庫。

寫檔案前自檢

每次寫 collections/ 檔案前,確認以下步驟已完成。缺項標註 incomplete: true,不允許靜默跳過。

  • 去重 ✓ → 內容提取 ✓ → 插圖(文章類,必做) ✓ → 主題關鍵詞 ✓ → 寫檔案 ✓ → Obsidian同步 ✓ → Daily Note ✓
  • 寫 tags 前執行 bash scripts/normalize-tags.sh <tag1> <tag2> ... 檢查是否有已有近似 tag,優先複用已有 tag 名稱

儲存 Schema

檔案命名: YYYY-MM-DD-slug.md

---
title: ""
source: ""
url: ""
author: ""
date_published: ""
date_collected: ""
tags: []
category: "articles|tweets|videos|wechat|ideas"
language: "zh|en"
summary: ""
themes: []              # 5-7 個概念切面
schema_type: ""         # Schema.org @type(可選)
schema_data: {}         # ≤10 key-value(可選)
incomplete: false
# 影片專屬
duration: ""
platform: ""
bvid: ""
stats: {}
subtitle_source: ""     # native_cc|whisper
highlights: []          # 精彩片段
related_projects: []
---

內容結構

  • 內容概覽(Mermaid,>1000字觸發)
  • 核心觀點(3-7個要點)
  • 精彩片段(影片≥10min)
  • 要點摘錄(blockquote 金句)
  • 熱門評論精選(影片類)
  • 我的筆記
  • 原文摘要(200-500字)

英文內容

預設 storytelling 翻譯風格。術語參照 <WORKSPACE>/references/glossary-ai-zh.md,首次出現 中文(English) 格式。

檢索

  1. 標籤: tags.md
  2. 全文: grep -ril "keyword" collections/
  3. 返回匹配列表 + 摘要

二創

按選題從收藏庫篩選素材,交給 xiaohongshu-opswemp-ops 處理。本 skill 只負責供料。

工具指令碼

指令碼 用途
scripts/supadata_fetch.py web\|transcript\|metadata <url> Supadata API 抓取
scripts/bilibili_extract.py <url> B站後設資料
scripts/video_transcribe.sh <url> 影片轉錄(自動檢測平臺)
scripts/sync_to_obsidian.py 批次同步到 Obsidian
scripts/cache-wechat-images.sh <file> 微信 CDN 圖片本地快取
scripts/normalize-tags.sh <tag1> <tag2> ... 標籤歸一化去重
scripts/post-collect.sh <file> 收藏後自動關聯分析

🔴 Final: 機械驗證(不可跳過)

通知使用者前執行:

bash scripts/skill-verify.sh content-collector <collections-file-path>
# 例: bash scripts/skill-verify.sh content-collector collections/wechat/2026-04-23-xxx.md
  • ✅ ALL PASSED → 回覆使用者收藏結果
  • ❌ FAILED → 按輸出補齊缺失項(Obsidian 同步/插圖/index.md 等),重新驗證直到通過

絕不在驗證未通過時回覆使用者"已完成"。

收藏結果通知

  • 成功: 📌 已收藏:<標題>\n核心:<一句話摘要>\n標籤:<3-5個標籤>
  • 重複: 📌 已存在:<標題>(之前已收藏過)
  • 失敗: ❌ 收藏失敗:<URL>\n原因:<失敗原因>

下一步建議(條件觸發)

觸發條件 推薦
與公眾號選題方向高度相關 用 wemp-ops 寫
適合小紅書短圖文 用 xiaohongshu-ops 改寫
某博主收藏 ≥3 條 用 x-profile-deep-dive 畫像
涉及技術方案/架構決策 存到 memory 做長期參考

🤖 AI 評測

這個 Skill 質量相當不錯,收藏功能覆蓋了網頁、影片、公眾號等多個來源,處理流程很規範,還會自動提取圖片和影片精華片段。評測顯示用了它比不用效果好很多。但有個隱患:說明文件裡提到的一些指令碼工具在包裡面找不到,可能導致部分功能用不了。整體推薦使用,建議等開發者補齊缺失的指令碼後再上手。

📊 多維度評分

適應性4.5
規範性4.2
有效性4.7
可靠性4.6
可信度4.9

📁 包含檔案 (23 個)

📄 README.md 1.9 KB
📄 SKILL.md 6.8 KB
📄 _meta.json 136 B
📄 evals/benchmark.md 1.7 KB
📄 evals/evals.json 2.8 KB
📄 evals/results/bilibili-with-skill.md 1.1 KB
📄 evals/results/bilibili-without-skill.md 894 B
📄 evals/results/blog-with-skill.md 1.2 KB
📄 evals/results/blog-without-skill.md 1 KB
📄 evals/results/search-with-skill.md 798 B
📄 evals/results/search-without-skill.md 822 B
📄 references/bilibili-comments.md 3.1 KB
📄 references/content-overview-spec.md 2.1 KB
📄 references/highlight-extraction-spec.md 2.5 KB
📄 references/image-extraction-spec.md 3.3 KB
📄 references/obsidian-integration.md 3.3 KB
📄 references/schema-extraction-spec.md 1.6 KB
📄 references/theme-extraction-spec.md 2.2 KB
📄 references/url-routing-and-site-specs.md 5.2 KB
📄 scripts/bilibili_extract.py 6.8 KB
📄 scripts/supadata_fetch.py 5.7 KB
📄 scripts/sync_to_obsidian.py 4 KB
📄 scripts/video_transcribe.sh 21.2 KB