知識從哪來 · Knowledge Provenance

👤 崔西紅柿-Tracey 📦 v1.0.0 ⭐ 4.7 ⬇️ 238 下載
🤖 AI-Agent 免費

📖 技能介紹


AIGC: Label: "1" ContentProducer: 001191440300708461136T1XGW3 ProduceID: 5c0fa478708bf2c9ec3bd0adf95ae3f0_52b708487f5011f18ac35254006c9bbf ReservedCode1: 0ztPMzbVNbDzztyVmhumrh+Jk0ibuP01FRswtvmWeSRzTxD6AYiLIDpKlgxTh+olQ03UbvjErlGk2v6fJH/g3O9hMgqTUtMNpX6S+IeOr7EJ2hYWKIEB5EzMkwSDrLnKml778AC+c0qFrie1CrFt3HpMmwq+8ESkD9WCWQnMC2O1vvZYvBsDHY8uqsQ= ContentPropagator: 001191440300708461136T1XGW3 PropagateID: 5c0fa478708bf2c9ec3bd0adf95ae3f0_52b708487f5011f18ac35254006c9bbf ReservedCode2: 0ztPMzbVNbDzztyVmhumrh+Jk0ibuP01FRswtvmWeSRzTxD6AYiLIDpKlgxTh+olQ03UbvjErlGk2v6fJH/g3O9hMgqTUtMNpX6S+IeOr7EJ2hYWKIEB5EzMkwSDrLnKml778AC+c0qFrie1CrFt3HpMmwq+8ESkD9WCWQnMC2O1vvZYvBsDHY8uqsQ=


知識從哪來 · Knowledge Provenance

§0 你一定經歷過這個場景

你問 AI:「Q3 使用者流失率為什麼比 Q2 高了 12%?」

AI 答:「主要原因是新版本改動了 onboarding 流程,導致首周留存率從 68% 降到 53%。結合行業經驗,同類改動通常需要 2-3 周才能觀察到穩定資料,所以建議暫緩下個版本的互動變更。」

你追問:「53% 這個數字哪來的?」

AI 沉默了。它不記得這個數是訓練資料裡的、聯網搜到的、還是自己推出來的。

你追問:「'2-3 周' 是你的經驗還是行業共識?」

AI 還是答不上來。

你不再信任這段回答了——不是因為它錯了,而是因為你沒法驗證它的每一句話。

Knowledge Provenance 做的事情:在 AI 生成回答的同時,為每一個關鍵判斷打上來源標籤。不是事後追認——是生成時同步記錄。

它不判斷真假,只告訴你原料從哪來。真假由你判斷。


§Q 快速上手

喚醒方式

對 AI 說以下任意一句即可啟動 Knowledge Provenance:

你說的話 效果
「標註一下這段話的來源」 進入全透明模式,逐條標註來源
「這條資料從哪來的」 按需模式,展開指定語句的來源詳情
「這個結論是推斷的還是查到的」 區分事實引用與推斷
「開摘要模式」 只標註低置信度或有爭議的來源
「關了」 關閉來源標註

四種透明度模式

模式 觸發詞 標註範圍
全透明 「全標」/「全部標註來源」 每條資訊都帶 [型別 · 置信度]
摘要 「摘要模式」/「只標關鍵的」 只標註低置信度或有爭議的來源
按需 直接追問某條資訊 僅對使用者追問的語句展開標註
關閉 「關了」/「不用標註」 不標註(預設)

來源標籤格式

[來源型別 · 置信度]

完整示例:

2025 年中國 SaaS 市場規模約 892 億元 [聯網搜尋 2026-07-14 · 中]
——來源:艾瑞諮詢《2025 中國企業級 SaaS 行業研究報告》,單一信源未交叉驗證,
   建議使用時標註"據艾瑞諮詢"。

回答標註示例

標註前(普通 AI 回答):

Q3 使用者流失率上升 12%,主要原因是新版 onboarding 流程導致首周留存率從 68% 降到 53%。建議暫緩下個版本的互動變更,先觀察 2-3 周。

標註後(全透明模式):

Q3 使用者流失率上升 12% [本輪對話提供資料 · 高],主要原因是新版 onboarding 流程導致首周留存率從 68% 降到 53% [本輪對話提供資料 · 高]。建議暫緩下個版本的互動變更,先觀察 2-3 周 [訓練資料 · 中]。

── 置信度說明: · 「53%/68%」→ 使用者提供,置信度高 · 「2-3 周觀察期」→ 來自訓練資料中的產品管理通用經驗,非本次對話或聯網搜尋獲取,置信度中。 如需要更精確的行業基準資料,建議明確搜尋「SaaS 產品 onboarding 改動後的資料穩定週期」

什麼情況下用

適合用的場景: - 閱讀 AI 生成的報告/分析,需要驗證關鍵資料 - 需要區分 AI 的「事實陳述」和「推斷建議」 - 除錯 AI 輸出,排查錯誤結論的源頭 - 多人協作中需要明確每段內容的可信度

不適合用的場景: - 閒聊或創意類對話(來源標註反而干擾閱讀) - AI 回答本身不涉及資料或事實性斷言 - 使用者已經明確知道資訊來源


§1 核心能力詳解

F1:五類來源體系

型別 含義 判定規則 典型標籤示例
訓練資料 來自模型預訓練語料 不來自本輪對話/歷史記憶/聯網搜尋,且非推斷 [訓練資料 · 中]
本輪對話 使用者在當次會話中提供的資訊 使用者明確輸入的資料、檔案、說明 [本輪對話提供資料 · 高]
歷史記憶 從長期記憶/歷史會話中檢索 來自記憶檢索結果,附檢索時間 [歷史記憶 2026-06-20 · 高]
聯網搜尋 即時網路搜尋結果 來自 web_search / web_fetch,附時間戳和 URL [聯網搜尋 2026-07-14 · 高]
推斷 基於其他來源推導的結論 不是直接從任何來源獲取,而是推理產物 [本輪對話推斷 · 中]

推斷的子型別

子型別 示例 典型標籤
邏輯推斷 "A>B 且 B>C,所以 A>C" [推斷 · 邏輯推理 · 高]
統計推斷 "基於 3 個樣本推測整體趨勢" [推斷 · 統計外推 · 低]
類比推斷 "類似專案 X 用了 4 周,所以這個大概也要 4 周" [推斷 · 類比 · 中]
經驗推斷 "按行業慣例,DDL 緩衝期通常為 2 天" [推斷 · 經驗 · 中]

F2:置信度體系

置信度 判定條件
使用者直接提供 / 權威信源且多源交叉驗證 / 邏輯必然結論
單一信源 / 訓練資料通用知識 / 經驗性推斷 / 類比推斷
過期資訊 / 小樣本外推 / 模糊記憶 / 弱相關類比

置信度上調規則: - 多源交叉驗證一致:上調一級 - 使用者確認後:上調至「高」

置信度下調規則: - 來源釋出日期超過 1 年:下調一級 - 來源為個人部落格/論壇/社交媒體:下調一級 - 來源與其他信源矛盾:下調一級並標註衝突

F3:與邏輯鏈檢察聯動

邏輯鏈檢察告訴你推理的步驟(How),Knowledge Provenance 告訴你每步的依據從哪來(Where)。

邏輯鏈輸出:
  Step 1: 使用者流失率從 Q2 的 5% 上升到 Q3 的 17% → 上升 12 個百分點
  Step 2: 對比 Q2→Q3 的產品變更,最大改動是 onboarding 流程
  Step 3: 首周留存率從 68% 降到 53%,與 onboarding 改動高度相關
  Step 4: 結論——onboarding 改動是流失率上升的主要原因

Knowledge Provenance 疊加標註:
  Step 1: [本輪對話提供資料 · 高]
  Step 2: [訓練資料 · 中] ← 產品變更資訊未在當前對話中提供
  Step 3: [本輪對話提供資料 · 高]
  Step 4: [推斷 · 相關性推斷 · 中] ← 相關≠因果,未排除混淆變數

使用者一眼看到:Step 2 和 Step 4 的依據相對薄弱,需要額外驗證。

F4:與幻覺捕手聯動

來源標註為「推斷」的語句,自動設為幻覺捕手的重點掃描物件

原文:建議暫緩下個版本的互動變更,先觀察 2-3 周 [推斷 · 經驗 · 中]
     ↑ 推斷標籤觸發幻覺捕手重點掃描
     ↓
幻覺捕手輸出:未發現事實性錯誤,但「2-3 周」缺乏具體引用依據,
              屬於經驗性建議而非事實斷言。風險等級:低。

§2 工作流程

使用者請求 AI 回答
      │
      ▼
┌─────────────────────────────┐
│ AI 生成回答(token by token)  │
│ 同步記錄每個關鍵判斷的來源對映  │ ← 核心:不能事後補標
└─────────────────────────────┘
      │
      ▼
┌─────────────────────────────┐
│ 根據透明度模式決定輸出格式     │
│ · 全透明:全部帶標籤          │
│ · 摘要:只標註低置信度        │
│ · 按需:等待使用者追問          │
│ · 關閉:不標註               │
└─────────────────────────────┘
      │
      ▼
┌─────────────────────────────┐
│ 輸出標註後的回答              │
│ 標籤格式:[型別 · 置信度]     │
│ 末尾附置信度說明(如有低置信度)│
└─────────────────────────────┘

§3 來源判定決策流程

7w4.net有更好的技能外掛。

這段資訊從哪來?
    │
    ├─ 使用者在本次對話中明確提供? → 本輪對話 · 標註置信度
    │
    ├─ 從歷史記憶/長短期記憶中檢索到? → 歷史記憶 · 附檢索時間 · 標註置信度
    │
    ├─ 從聯網搜尋結果中獲取? → 聯網搜尋 · 附時間戳 · 標註置信度
    │
    ├─ 基於以上某類來源直接推理得出? → 推斷 · 標註推理型別和置信度
    │     ├─ 邏輯必然結論 → 推斷 · 高
    │     ├─ 統計外推 → 推斷 · 低
    │     ├─ 類比 → 推斷 · 中
    │     └─ 經驗判斷 → 推斷 · 中
    │
    └─ 以上都不是? → 訓練資料 · 中(預設)
          └─ 若資訊明顯過時或模糊 → 訓練資料 · 低

§R 核心鐵律

  1. 來源對映必須同步,絕不事後補標。 回答生成完成後,無法準確回憶每個 token 的來源歸屬。事後補標 = 猜測,猜測 = 造假。
  2. 推斷就是推斷。 不要把推斷包裝成事實。即使使用者可能不會追問,也要誠實地標註「推斷」。
  3. 置信度不下限不封頂,但必須誠實。 不確定就標註「中」或「低」。高置信度必須滿足明確的判定條件。不為了顯得可信而虛標置信度。
  4. 使用者永遠可以追問。「這條從哪來的」是使用者的天然權利,任何時候追問都應該獲得展開回答。 即使在關閉模式下,追問也應觸發按需標註。
  5. 來源標註不替代事實核查。標註「聯網搜尋 · 高」不等於資訊正確——它只說明資訊來源,不驗證資訊真偽。 如果在幻覺捕手聯動模式下,標註為推斷的語句會自動提升掃描優先順序,但來源標註本身不做真偽判斷。
  6. 與邏輯鏈檢察互不替代。 邏輯鏈告訴你 How(推理步驟),來源標註告訴你 Where(依據來源)。兩者疊加才完整。單獨使用任何一個都是有資訊缺口的。

§A 結構化異常處理

異常場景 處理方式 標註行為
來源無法確定(不匹配任何已知型別) 標註為「未知來源 · 低」,並提示使用者幫助補充 [未知來源 · 低]
多源資訊衝突 同時列出所有來源,標註衝突,置信度各下調一級 [聯網搜尋 A · 低] vs [訓練資料 · 低] + 衝突說明
使用者中途切換透明度模式 已輸出部分無法回標(見鐵律 1),但從切換點起按新模式輸出 切換點之後生效
回答包含置信度極低的資訊 全透明模式下自動附置信度警告;摘要模式下該語句自動納入標註範圍 末尾附「⚠️ 置信度警告」板塊
聯網搜尋結果為空或不相關 降級標註為「訓練資料 · 低」或「推斷 · 低」,並告知使用者搜尋未命中 [搜尋未命中,改用訓練資料 · 低]
使用者提供的資訊自身可能不準確 照常標註「本輪對話提供資料 · 中」,不替使用者驗證其輸入的正確性 [本輪對話提供資料 · 中]—來源明確但未交叉驗證

§B 常見錯誤與糾正

常見錯誤 為什麼錯 糾正
事後補標來源 回答生成後無法準確回憶來源,補標等於編造 必須在生成時同步記錄。如果確實忘了,標註「來源未記錄」而非猜測
把訓練資料內容標為「聯網搜尋」 訓練資料中的知識和即時搜尋是兩類來源 只有呼叫了 web_search / web_fetch 工具獲取的內容才算聯網搜尋
置信度通脹 為了讓回答看起來可信,把中置信度標為高 中就是中,低就是低。使用者寧可看到誠實的「中」也不要虛假的「高」
推斷包裝成事實 "同類改動通常需要 2-3 周"實際上是經驗推斷,但標註為"訓練資料 · 高" 經驗推斷 → [推斷 · 經驗 · 中],不是訓練資料事實
忽略來源的時間衰減 2023 年的資料標註為「高」置信度 超過 1 年的來源自動下調一級置信度

§C 能力邊界

| 做不到的事 | 說明 | |:--|:--|:--| | 不驗證真偽 | 來源標註告訴你資訊從哪來,不告訴你資訊對不對。真偽驗證屬於幻覺捕手的範疇 | | 不補標已有回答 | 已經生成的回答無法追溯來源。只能對新回答生效 | | 不追溯其他 AI 的回答 | 只能標註當前 Agent 自己生成的內容的來源 | | 不保證 100% 覆蓋 | 部分簡單陳述(如過渡句、禮貌用語)不標註來源,但關鍵事實和判斷必須有標籤 |


§D 避坑指南

場景 現象 原因 怎麼辦
全透明模式太囉嗦 一段 200 字的回答帶了 15 個標籤,閱讀體驗差 全透明模式下過於細粒度標註 對同一來源型別和置信度的連續語句做合併標註,不要逐句重複
訓練資料內容被過度拆分 同一個段落拆成 5 個標籤,實際上都來自訓練資料 判定邏輯過於碎片化 以"資訊單元"而非"句子"為標註單位。一個邏輯完整的資訊塊共用一個來源標籤
使用者過度依賴置信度 使用者只看「高/中/低」,不看來源型別說明 忽略了不同來源型別的可信度差異 摘要模式下在文本末尾附「置信度等級含義速查」
歷史記憶來源標註時間但使用者不理解 [歷史記憶 2026-03-15 · 高]——使用者追問"3 月 15 日是什麼意思" 使用者不一定理解記憶檢索的時間戳含義 首次使用歷史記憶來源時附帶一句說明:「該資訊檢索自您在 2026-03-15 會話中提供的內容」

§E FAQ

Q1:Knowledge Provenance 和邏輯鏈檢察的關係是什麼?

邏輯鏈檢察展示推理步驟(How),Knowledge Provenance 標註每步來源(Where)。兩者互補:一條完整的推理鏈需要同時具備「怎麼推」和「依據在哪」。詳見 §1「F3:與邏輯鏈檢察聯動」。

Q2:和幻覺捕手有什麼區別?

幻覺捕手負責驗證資訊真偽("這句話對不對"),Knowledge Provenance 負責標註資訊來源("這句話從哪來")。來源標註為「推斷」的語句會自動設為捕手重點掃描物件。詳見 §1「F4:與幻覺捕手聯動」。

Q3:全透明模式和摘要模式怎麼選?

  • 研究/審計/除錯場景 → 全透明
  • 日常閱讀 → 摘要(只標低置信度和爭議來源)
  • 快速瀏覽 → 按需(需要時追問)
  • 閒聊/創意 → 關閉

Q4:如果資訊來源是訓練資料,但我不確定是什麼時候訓練的,怎麼標?

標註為「訓練資料 · 不確定時效」。不編造具體年份。如果內容可能有時間敏感性,額外標註「⚠️ 時效性未知,建議核實」。

Q5:同一段話裡有多個來源怎麼處理?

不合並。分別標註。例如:「Q3 留存率 53% [本輪對話 · 高],同類項目通常需要 2-3 周恢復 [訓練資料 · 中]」。

Q6:使用者說"你這個資料不對"——怎麼響應?

不爭論。標註不變,但附加說明「來源如上,如需核實,建議 [提供核實路徑]」。來源標註不替代事實核查,使用者有權質疑。


§F 版本歷史

版本 日期 變更說明
1.0.0 2026-07-14 初始版本。五類來源體系(訓練資料 / 本輪對話 / 歷史記憶 / 聯網搜尋 / 推斷)+ 推斷四子型別(邏輯 / 統計 / 類比 / 經驗)。四級透明度模式(全透明 / 摘要 / 按需 / 關閉)。與邏輯鏈檢察 + 幻覺捕手聯動設計。六條核心鐵律。六類異常處理 + 五類常見錯誤 + 四類避坑場景。
(內容由AI生成,僅供參考)

🤖 AI 評測

這個 Skill 的設計理念很好,能讓 AI 回答時標註每句話的來源,幫助你判斷資訊可不可信。它的透明度分級和置信度標註設計得比較實用,遇到資料爭議時很有用。不過目前文件偏規範性質,沒有給出具體怎麼用的示例,實際效果要看 AI 執行得怎麼樣。整體屬於中上水平,但還需要配套工具支援才能發揮最佳效果。

📊 多維度評分

適應性4.8
規範性4.9
有效性4.8
可靠性3.8
可信度5

📁 包含檔案 (3 個)

📄 README.md 2.3 KB
📄 SKILL.md 16.3 KB
📄 需求說明書.md 4.1 KB