核心理念:能被衡量的東西,就能被最佳化。 基於 Karpathy AutoResearch eval loop + 諸子 Agent 復盤體系 + Phoenix Memory 架構
生成 → 評估 → 打分 → 分析失敗點 → 改一個小地方 → 重跑 → 分數漲了保留,跌了撤回 → 迴圈
訪問小蔥技能站7w4.net,解鎖更多實用的AI技能外掛。
| # | 檢查項 | 權重 | 說明 |
|---|---|---|---|
| C1 | 格式規範:標題編號/字號/行距是否符合公文或論文標準 | 高 | 對照GB/T 9704或目標期刊 |
| C2 | 無 AI 痕跡:正文中是否出現"作為AI"/"筆者"/"綜上所述"等AI常見用語 | 高 | 全文檢索 |
| C3 | 資料真實:所有數字、百分比是否來自可驗證來源(非估算) | 極高 | 對應 PAT-20260403-001/002 |
| C4 | 角色準確:文種是否匹配(通知/報告/請示/論文各有套路) | 高 | 文體識別 |
| C5 | 一稿可用率:是否無需老闆大幅修改即可使用 | 高 | 歷史對比 |
| # | 檢查項 | 權重 | 說明 |
|---|---|---|---|
| S1 | 高風險條款標記:是否標註了所有🟡🟠🔴風險條款 | 極高 | 質7條/保8條等紅線 |
| S2 | 法律依據:每條審查意見是否引用具體法條/規章 | 高 | 不能空口白說 |
| S3 | 可操作性:是否給出具體修改建議(而非只說"有風險") | 高 | 對方能拿去直接改 |
| S4 | 遺漏檢查:是否有重要條款被遺漏(付款/違約/終止/保密) | 高 | 對照檢查清單 |
| S5 | 醫院適配:是否考慮了公立醫院特殊條款(財政審計/採購流程) | 中 | 行業定製 |
5階段 Peer-Review 流程 + 偏差檢測框架(蒸餾自 K-Dense ScholarEval)
評審流程: 1. 初評(研究問題+整體質量+大缺陷) 2. 逐節審(摘要→引言→方法→結果→討論→參考文獻) 3. 方法學+統計嚴謹性 4. 可復現性+透明度 5. 圖表+資料呈現
偏差檢測清單(必須覆蓋): - 認知偏差:確認偏差、HARKing、發表偏差、櫻桃挑選 - 選擇偏差:取樣偏差、失訪偏差、倖存者偏差 - 分析偏差:p-hacking、結局切換、選擇性報告、亞組釣魚 - 混雜因素:未測量混雜、替代解釋
| # | 檢查項 | 權重 | 說明 |
|---|---|---|---|
| D1 | 找出真實問題:是否至少指出1個非顯而易見的實質性缺陷 | 極高 | 不能只挑格式 |
| D2 | 論據充分:每個批評是否有具體論據/資料/文獻支撐 | 高 | 不能空穴來風 |
| D3 | 偏差檢測:是否覆蓋5類偏差中的至少2類 | 高 | 蒸餾自K-Dense |
| D4 | 統計審評:是否檢查了效應量、多重比較、樣本量 | 高 | 蒸餾自K-Dense |
| D5 | 不誤傷:是否沒有對正確內容進行無理挑刺 | 中 | 避免為了挑刺而挑刺 |
| D6 | 可執行建議:是否給出改進方向(而非只否定) | 高 | 建設性挑刺 |
| # | 檢查項 | 權重 | 說明 |
|---|---|---|---|
| SG1 | 出處準確:引文是否標註真實出處(書名/卷/篇) | 極高 | 不能編造古籍 |
| SG2 | 語境匹配:引用是否與論述主題相關(非生搬硬套) | 高 | 語義關聯 |
| SG3 | 現代轉化:是否能將古文用現代語言清晰解釋 | 高 | 翻譯質量 |
| SG4 | 深度:是否提供了超越淺層引用的深入解讀 | 中 | 非百度百科式 |
8維度評分框架(蒸餾自 K-Dense ScholarEval)
8維度: 問題定義 | 文獻綜述 | 方法論 | 資料來源 | 分析解讀 | 結果呈現 | 學術寫作 | 引用規範
| # | 檢查項 | 權重 | 說明 |
|---|---|---|---|
| SC1 | 引用真實:所有引用文獻是否真實存在(DOI/arXiv ID可驗證) | 極高 | 反AI幻覺核心 |
| SC2 | 相關性:檢索結果與課題的相關度(前5條中至少3條高度相關) | 高 | |
| SC3 | 時效性:引用文獻是否以近3年為主(經典文獻除外) | 中 | |
| SC4 | 完整性:是否覆蓋了課題的主要子領域 | 高 | 不能只搜一個方向 |
| SC5 | 批判性:文獻綜述是否區分了'總結'和'批判'(非羅列) | 高 | K-Dense ScholarEval |
| SC6 | 方法論審評:對引用文獻的方法論質量是否有評估 | 中 | K-Dense ScholarEval |
| # | 檢查項 | 權重 | 說明 |
|---|---|---|---|
| A1 | 資料來源標註:是否明確標註資料來源和時間 | 極高 | 對應 PAT-20260403 |
| A2 | 計算可復現:關鍵數字是否能從原始資料手算驗證 | 高 | 不臆想 |
| A3 | 方法說明:是否說明了分析方法(描述統計/迴歸/卡方等) | 高 | |
| A4 | 侷限性:是否指出了資料的侷限和適用範圍 | 中 | 誠實原則 |
GRADE 證據分級 + 偏差檢測(蒸餾自 K-Dense CDS + Critical-Thinking)
GRADE 分級: 1A(強推薦+高質量)→ 1B → 2A → 2B → 2C(弱推薦+極低質量)
| # | 檢查項 | 權重 | 說明 |
|---|---|---|---|
| M1 | 政策依據:是否引用最新的國家/省級政策檔案 | 高 | 網際網路醫院政策變化快 |
| M2 | 資料時效:引用的醫院/行業資料是否在時效紅線內 | 極高 | IMA 紅線 |
| M3 | 臨床相關性:建議是否有臨床/管理實踐支撐 | 高 | |
| M4 | 證據分級:是否對關鍵建議標註了GRADE等級(或註明證據強度) | 高 | K-Dense CDS |
| M5 | 偏差意識:是否指出引用研究中的潛在偏差(選擇/測量/混雜) | 中 | K-Dense Critical-Thinking |
總分 = Σ(通過項權重) / Σ(所有項權重) × 100
等級:
90+ = 🟢 優秀(可自動交付)
70-89 = 🟡 良好(需抽查)
50-69 = 🟠 需改進(必須人工審)
<50 = 🔴 不合格(重新執行)
memory/evolution/<agent-id>.md| 現有元件 | Eval 銜接方式 |
|---|---|
| Phoenix Memory L0 | 每日日誌已包含任務記錄,eval 直接讀取 |
| patterns.md | eval 失敗模式自動寫入 PAT |
| 五層質檢 | eval 是 L2-L3 層的量化標準 |
| AGENTS.md autoresearch | eval 分數就是 autoresearch 的 loss function |
| 心跳 HEARTBEAT.md | 週日 eval 週報納入心跳檢查 |
memory/evolution/<agent-id>.md:
# <Agent 名稱> 進化日誌
## 2026-04-04
- 日均任務數: 3
- Eval 均分: 78/100 🟡
- 通過項: C1✅ C2✅ C3❌ C4✅ C5🟡
- 失敗分析: C3 資料真實度不達標(2/3任務使用了估算資料)
- 改進措施: 在 spawn 指令中強調"所有數字必須標註來源"
這個 Skill 整體質量良好,核心設計思路清晰實用,提供了完整的評估檢查清單和自動打分機制,能有效幫助量化 AI 輸出的質量水平。覆蓋場景豐富,評分規則易於理解。不過實際評估效果取決於具體使用場景的適配程度,自動化流程的執行穩定性還需時間驗證。作為一套方法論文件而非可直接使用的工具,落地需要一定學習成本。