AIGC: Label: "1" ContentProducer: 001191440300708461136T1XGW3 ProduceID: 5c0fa478708bf2c9ec3bd0adf95ae3f0_52b708487f5011f18ac35254006c9bbf ReservedCode1: 0ztPMzbVNbDzztyVmhumrh+Jk0ibuP01FRswtvmWeSRzTxD6AYiLIDpKlgxTh+olQ03UbvjErlGk2v6fJH/g3O9hMgqTUtMNpX6S+IeOr7EJ2hYWKIEB5EzMkwSDrLnKml778AC+c0qFrie1CrFt3HpMmwq+8ESkD9WCWQnMC2O1vvZYvBsDHY8uqsQ= ContentPropagator: 001191440300708461136T1XGW3 PropagateID: 5c0fa478708bf2c9ec3bd0adf95ae3f0_52b708487f5011f18ac35254006c9bbf ReservedCode2: 0ztPMzbVNbDzztyVmhumrh+Jk0ibuP01FRswtvmWeSRzTxD6AYiLIDpKlgxTh+olQ03UbvjErlGk2v6fJH/g3O9hMgqTUtMNpX6S+IeOr7EJ2hYWKIEB5EzMkwSDrLnKml778AC+c0qFrie1CrFt3HpMmwq+8ESkD9WCWQnMC2O1vvZYvBsDHY8uqsQ=
你問 AI:「Q3 使用者流失率為什麼比 Q2 高了 12%?」
AI 答:「主要原因是新版本改動了 onboarding 流程,導致首周留存率從 68% 降到 53%。結合行業經驗,同類改動通常需要 2-3 周才能觀察到穩定資料,所以建議暫緩下個版本的互動變更。」
你追問:「53% 這個數字哪來的?」
AI 沉默了。它不記得這個數是訓練資料裡的、聯網搜到的、還是自己推出來的。
你追問:「'2-3 周' 是你的經驗還是行業共識?」
AI 還是答不上來。
你不再信任這段回答了——不是因為它錯了,而是因為你沒法驗證它的每一句話。
Knowledge Provenance 做的事情:在 AI 生成回答的同時,為每一個關鍵判斷打上來源標籤。不是事後追認——是生成時同步記錄。
它不判斷真假,只告訴你原料從哪來。真假由你判斷。
對 AI 說以下任意一句即可啟動 Knowledge Provenance:
| 你說的話 | 效果 |
|---|---|
| 「標註一下這段話的來源」 | 進入全透明模式,逐條標註來源 |
| 「這條資料從哪來的」 | 按需模式,展開指定語句的來源詳情 |
| 「這個結論是推斷的還是查到的」 | 區分事實引用與推斷 |
| 「開摘要模式」 | 只標註低置信度或有爭議的來源 |
| 「關了」 | 關閉來源標註 |
| 模式 | 觸發詞 | 標註範圍 |
|---|---|---|
| 全透明 | 「全標」/「全部標註來源」 | 每條資訊都帶 [型別 · 置信度] |
| 摘要 | 「摘要模式」/「只標關鍵的」 | 只標註低置信度或有爭議的來源 |
| 按需 | 直接追問某條資訊 | 僅對使用者追問的語句展開標註 |
| 關閉 | 「關了」/「不用標註」 | 不標註(預設) |
[來源型別 · 置信度]
完整示例:
2025 年中國 SaaS 市場規模約 892 億元 [聯網搜尋 2026-07-14 · 中]
——來源:艾瑞諮詢《2025 中國企業級 SaaS 行業研究報告》,單一信源未交叉驗證,
建議使用時標註"據艾瑞諮詢"。
標註前(普通 AI 回答):
Q3 使用者流失率上升 12%,主要原因是新版 onboarding 流程導致首周留存率從 68% 降到 53%。建議暫緩下個版本的互動變更,先觀察 2-3 周。
標註後(全透明模式):
Q3 使用者流失率上升 12% [本輪對話提供資料 · 高],主要原因是新版 onboarding 流程導致首周留存率從 68% 降到 53% [本輪對話提供資料 · 高]。建議暫緩下個版本的互動變更,先觀察 2-3 周 [訓練資料 · 中]。
── 置信度說明: · 「53%/68%」→ 使用者提供,置信度高 · 「2-3 周觀察期」→ 來自訓練資料中的產品管理通用經驗,非本次對話或聯網搜尋獲取,置信度中。 如需要更精確的行業基準資料,建議明確搜尋「SaaS 產品 onboarding 改動後的資料穩定週期」
適合用的場景: - 閱讀 AI 生成的報告/分析,需要驗證關鍵資料 - 需要區分 AI 的「事實陳述」和「推斷建議」 - 除錯 AI 輸出,排查錯誤結論的源頭 - 多人協作中需要明確每段內容的可信度
不適合用的場景: - 閒聊或創意類對話(來源標註反而干擾閱讀) - AI 回答本身不涉及資料或事實性斷言 - 使用者已經明確知道資訊來源
| 型別 | 含義 | 判定規則 | 典型標籤示例 |
|---|---|---|---|
| 訓練資料 | 來自模型預訓練語料 | 不來自本輪對話/歷史記憶/聯網搜尋,且非推斷 | [訓練資料 · 中] |
| 本輪對話 | 使用者在當次會話中提供的資訊 | 使用者明確輸入的資料、檔案、說明 | [本輪對話提供資料 · 高] |
| 歷史記憶 | 從長期記憶/歷史會話中檢索 | 來自記憶檢索結果,附檢索時間 | [歷史記憶 2026-06-20 · 高] |
| 聯網搜尋 | 即時網路搜尋結果 | 來自 web_search / web_fetch,附時間戳和 URL | [聯網搜尋 2026-07-14 · 高] |
| 推斷 | 基於其他來源推導的結論 | 不是直接從任何來源獲取,而是推理產物 | [本輪對話推斷 · 中] |
推斷的子型別:
| 子型別 | 示例 | 典型標籤 |
|---|---|---|
| 邏輯推斷 | "A>B 且 B>C,所以 A>C" | [推斷 · 邏輯推理 · 高] |
| 統計推斷 | "基於 3 個樣本推測整體趨勢" | [推斷 · 統計外推 · 低] |
| 類比推斷 | "類似專案 X 用了 4 周,所以這個大概也要 4 周" | [推斷 · 類比 · 中] |
| 經驗推斷 | "按行業慣例,DDL 緩衝期通常為 2 天" | [推斷 · 經驗 · 中] |
| 置信度 | 判定條件 |
|---|---|
| 高 | 使用者直接提供 / 權威信源且多源交叉驗證 / 邏輯必然結論 |
| 中 | 單一信源 / 訓練資料通用知識 / 經驗性推斷 / 類比推斷 |
| 低 | 過期資訊 / 小樣本外推 / 模糊記憶 / 弱相關類比 |
置信度上調規則: - 多源交叉驗證一致:上調一級 - 使用者確認後:上調至「高」
置信度下調規則: - 來源釋出日期超過 1 年:下調一級 - 來源為個人部落格/論壇/社交媒體:下調一級 - 來源與其他信源矛盾:下調一級並標註衝突
邏輯鏈檢察告訴你推理的步驟(How),Knowledge Provenance 告訴你每步的依據從哪來(Where)。
邏輯鏈輸出:
Step 1: 使用者流失率從 Q2 的 5% 上升到 Q3 的 17% → 上升 12 個百分點
Step 2: 對比 Q2→Q3 的產品變更,最大改動是 onboarding 流程
Step 3: 首周留存率從 68% 降到 53%,與 onboarding 改動高度相關
Step 4: 結論——onboarding 改動是流失率上升的主要原因
Knowledge Provenance 疊加標註:
Step 1: [本輪對話提供資料 · 高]
Step 2: [訓練資料 · 中] ← 產品變更資訊未在當前對話中提供
Step 3: [本輪對話提供資料 · 高]
Step 4: [推斷 · 相關性推斷 · 中] ← 相關≠因果,未排除混淆變數
使用者一眼看到:Step 2 和 Step 4 的依據相對薄弱,需要額外驗證。
來源標註為「推斷」的語句,自動設為幻覺捕手的重點掃描物件。
原文:建議暫緩下個版本的互動變更,先觀察 2-3 周 [推斷 · 經驗 · 中]
↑ 推斷標籤觸發幻覺捕手重點掃描
↓
幻覺捕手輸出:未發現事實性錯誤,但「2-3 周」缺乏具體引用依據,
屬於經驗性建議而非事實斷言。風險等級:低。
使用者請求 AI 回答
│
▼
┌─────────────────────────────┐
│ AI 生成回答(token by token) │
│ 同步記錄每個關鍵判斷的來源對映 │ ← 核心:不能事後補標
└─────────────────────────────┘
│
▼
┌─────────────────────────────┐
│ 根據透明度模式決定輸出格式 │
│ · 全透明:全部帶標籤 │
│ · 摘要:只標註低置信度 │
│ · 按需:等待使用者追問 │
│ · 關閉:不標註 │
└─────────────────────────────┘
│
▼
┌─────────────────────────────┐
│ 輸出標註後的回答 │
│ 標籤格式:[型別 · 置信度] │
│ 末尾附置信度說明(如有低置信度)│
└─────────────────────────────┘
7w4.net有更好的技能外掛。
這段資訊從哪來?
│
├─ 使用者在本次對話中明確提供? → 本輪對話 · 標註置信度
│
├─ 從歷史記憶/長短期記憶中檢索到? → 歷史記憶 · 附檢索時間 · 標註置信度
│
├─ 從聯網搜尋結果中獲取? → 聯網搜尋 · 附時間戳 · 標註置信度
│
├─ 基於以上某類來源直接推理得出? → 推斷 · 標註推理型別和置信度
│ ├─ 邏輯必然結論 → 推斷 · 高
│ ├─ 統計外推 → 推斷 · 低
│ ├─ 類比 → 推斷 · 中
│ └─ 經驗判斷 → 推斷 · 中
│
└─ 以上都不是? → 訓練資料 · 中(預設)
└─ 若資訊明顯過時或模糊 → 訓練資料 · 低
| 異常場景 | 處理方式 | 標註行為 |
|---|---|---|
| 來源無法確定(不匹配任何已知型別) | 標註為「未知來源 · 低」,並提示使用者幫助補充 | [未知來源 · 低] |
| 多源資訊衝突 | 同時列出所有來源,標註衝突,置信度各下調一級 | [聯網搜尋 A · 低] vs [訓練資料 · 低] + 衝突說明 |
| 使用者中途切換透明度模式 | 已輸出部分無法回標(見鐵律 1),但從切換點起按新模式輸出 | 切換點之後生效 |
| 回答包含置信度極低的資訊 | 全透明模式下自動附置信度警告;摘要模式下該語句自動納入標註範圍 | 末尾附「⚠️ 置信度警告」板塊 |
| 聯網搜尋結果為空或不相關 | 降級標註為「訓練資料 · 低」或「推斷 · 低」,並告知使用者搜尋未命中 | [搜尋未命中,改用訓練資料 · 低] |
| 使用者提供的資訊自身可能不準確 | 照常標註「本輪對話提供資料 · 中」,不替使用者驗證其輸入的正確性 | [本輪對話提供資料 · 中]—來源明確但未交叉驗證 |
| 常見錯誤 | 為什麼錯 | 糾正 |
|---|---|---|
| 事後補標來源 | 回答生成後無法準確回憶來源,補標等於編造 | 必須在生成時同步記錄。如果確實忘了,標註「來源未記錄」而非猜測 |
| 把訓練資料內容標為「聯網搜尋」 | 訓練資料中的知識和即時搜尋是兩類來源 | 只有呼叫了 web_search / web_fetch 工具獲取的內容才算聯網搜尋 |
| 置信度通脹 | 為了讓回答看起來可信,把中置信度標為高 | 中就是中,低就是低。使用者寧可看到誠實的「中」也不要虛假的「高」 |
| 推斷包裝成事實 | "同類改動通常需要 2-3 周"實際上是經驗推斷,但標註為"訓練資料 · 高" | 經驗推斷 → [推斷 · 經驗 · 中],不是訓練資料事實 |
| 忽略來源的時間衰減 | 2023 年的資料標註為「高」置信度 | 超過 1 年的來源自動下調一級置信度 |
| 做不到的事 | 說明 | |:--|:--|:--| | 不驗證真偽 | 來源標註告訴你資訊從哪來,不告訴你資訊對不對。真偽驗證屬於幻覺捕手的範疇 | | 不補標已有回答 | 已經生成的回答無法追溯來源。只能對新回答生效 | | 不追溯其他 AI 的回答 | 只能標註當前 Agent 自己生成的內容的來源 | | 不保證 100% 覆蓋 | 部分簡單陳述(如過渡句、禮貌用語)不標註來源,但關鍵事實和判斷必須有標籤 |
| 場景 | 現象 | 原因 | 怎麼辦 |
|---|---|---|---|
| 全透明模式太囉嗦 | 一段 200 字的回答帶了 15 個標籤,閱讀體驗差 | 全透明模式下過於細粒度標註 | 對同一來源型別和置信度的連續語句做合併標註,不要逐句重複 |
| 訓練資料內容被過度拆分 | 同一個段落拆成 5 個標籤,實際上都來自訓練資料 | 判定邏輯過於碎片化 | 以"資訊單元"而非"句子"為標註單位。一個邏輯完整的資訊塊共用一個來源標籤 |
| 使用者過度依賴置信度 | 使用者只看「高/中/低」,不看來源型別說明 | 忽略了不同來源型別的可信度差異 | 摘要模式下在文本末尾附「置信度等級含義速查」 |
| 歷史記憶來源標註時間但使用者不理解 | [歷史記憶 2026-03-15 · 高]——使用者追問"3 月 15 日是什麼意思" |
使用者不一定理解記憶檢索的時間戳含義 | 首次使用歷史記憶來源時附帶一句說明:「該資訊檢索自您在 2026-03-15 會話中提供的內容」 |
Q1:Knowledge Provenance 和邏輯鏈檢察的關係是什麼?
邏輯鏈檢察展示推理步驟(How),Knowledge Provenance 標註每步來源(Where)。兩者互補:一條完整的推理鏈需要同時具備「怎麼推」和「依據在哪」。詳見 §1「F3:與邏輯鏈檢察聯動」。
Q2:和幻覺捕手有什麼區別?
幻覺捕手負責驗證資訊真偽("這句話對不對"),Knowledge Provenance 負責標註資訊來源("這句話從哪來")。來源標註為「推斷」的語句會自動設為捕手重點掃描物件。詳見 §1「F4:與幻覺捕手聯動」。
Q3:全透明模式和摘要模式怎麼選?
Q4:如果資訊來源是訓練資料,但我不確定是什麼時候訓練的,怎麼標?
標註為「訓練資料 · 不確定時效」。不編造具體年份。如果內容可能有時間敏感性,額外標註「⚠️ 時效性未知,建議核實」。
Q5:同一段話裡有多個來源怎麼處理?
不合並。分別標註。例如:「Q3 留存率 53% [本輪對話 · 高],同類項目通常需要 2-3 周恢復 [訓練資料 · 中]」。
Q6:使用者說"你這個資料不對"——怎麼響應?
不爭論。標註不變,但附加說明「來源如上,如需核實,建議 [提供核實路徑]」。來源標註不替代事實核查,使用者有權質疑。
| 版本 | 日期 | 變更說明 |
|---|---|---|
| 1.0.0 | 2026-07-14 | 初始版本。五類來源體系(訓練資料 / 本輪對話 / 歷史記憶 / 聯網搜尋 / 推斷)+ 推斷四子型別(邏輯 / 統計 / 類比 / 經驗)。四級透明度模式(全透明 / 摘要 / 按需 / 關閉)。與邏輯鏈檢察 + 幻覺捕手聯動設計。六條核心鐵律。六類異常處理 + 五類常見錯誤 + 四類避坑場景。 |
| (內容由AI生成,僅供參考) |
這個 Skill 的設計理念很好,能讓 AI 回答時標註每句話的來源,幫助你判斷資訊可不可信。它的透明度分級和置信度標註設計得比較實用,遇到資料爭議時很有用。不過目前文件偏規範性質,沒有給出具體怎麼用的示例,實際效果要看 AI 執行得怎麼樣。整體屬於中上水平,但還需要配套工具支援才能發揮最佳效果。