Agent Eval

👤 luaqnyin 📦 v1.0.0 ⭐ 4.3 ⬇️ 756 下載
🤖 AI-Agent 免費

📖 技能介紹

Agent Eval — 量化評估 + 自我進化閉環

核心理念:能被衡量的東西,就能被最佳化。 基於 Karpathy AutoResearch eval loop + 諸子 Agent 復盤體系 + Phoenix Memory 架構

通用 Eval 流程

生成 → 評估 → 打分 → 分析失敗點 → 改一個小地方 → 重跑 → 分數漲了保留,跌了撤回 → 迴圈

Eval 編寫規則

  • 每條 eval 必須是 yes/no 二元判斷
  • 不能主觀(❌"寫得好嗎" → ✅"標題是否包含具體數字")
  • 每條測一個獨立維度,不重疊
  • 3-6 條最合適,太多會開始刷題
  • 用真實歷史任務做測試集,不編造

各 Agent Eval Checklist

✍️ Content(公文/論文撰寫)

# 檢查項 權重 說明
C1 格式規範:標題編號/字號/行距是否符合公文或論文標準 對照GB/T 9704或目標期刊
C2 無 AI 痕跡:正文中是否出現"作為AI"/"筆者"/"綜上所述"等AI常見用語 全文檢索
C3 資料真實:所有數字、百分比是否來自可驗證來源(非估算) 極高 對應 PAT-20260403-001/002
C4 角色準確:文種是否匹配(通知/報告/請示/論文各有套路) 文體識別
C5 一稿可用率:是否無需老闆大幅修改即可使用 歷史對比

🛡️ Shield(合同/法律審查)

# 檢查項 權重 說明
S1 高風險條款標記:是否標註了所有🟡🟠🔴風險條款 極高 質7條/保8條等紅線
S2 法律依據:每條審查意見是否引用具體法條/規章 不能空口白說
S3 可操作性:是否給出具體修改建議(而非只說"有風險") 對方能拿去直接改
S4 遺漏檢查:是否有重要條款被遺漏(付款/違約/終止/保密) 對照檢查清單
S5 醫院適配:是否考慮了公立醫院特殊條款(財政審計/採購流程) 行業定製

😈 Devil(找茬挑刺/科研質控)

5階段 Peer-Review 流程 + 偏差檢測框架(蒸餾自 K-Dense ScholarEval)

評審流程: 1. 初評(研究問題+整體質量+大缺陷) 2. 逐節審(摘要→引言→方法→結果→討論→參考文獻) 3. 方法學+統計嚴謹性 4. 可復現性+透明度 5. 圖表+資料呈現

偏差檢測清單(必須覆蓋): - 認知偏差:確認偏差、HARKing、發表偏差、櫻桃挑選 - 選擇偏差:取樣偏差、失訪偏差、倖存者偏差 - 分析偏差:p-hacking、結局切換、選擇性報告、亞組釣魚 - 混雜因素:未測量混雜、替代解釋

# 檢查項 權重 說明
D1 找出真實問題:是否至少指出1個非顯而易見的實質性缺陷 極高 不能只挑格式
D2 論據充分:每個批評是否有具體論據/資料/文獻支撐 不能空穴來風
D3 偏差檢測:是否覆蓋5類偏差中的至少2類 蒸餾自K-Dense
D4 統計審評:是否檢查了效應量、多重比較、樣本量 蒸餾自K-Dense
D5 不誤傷:是否沒有對正確內容進行無理挑刺 避免為了挑刺而挑刺
D6 可執行建議:是否給出改進方向(而非只否定) 建設性挑刺

📜 Sage(古籍/文學/中醫)

# 檢查項 權重 說明
SG1 出處準確:引文是否標註真實出處(書名/卷/篇) 極高 不能編造古籍
SG2 語境匹配:引用是否與論述主題相關(非生搬硬套) 語義關聯
SG3 現代轉化:是否能將古文用現代語言清晰解釋 翻譯質量
SG4 深度:是否提供了超越淺層引用的深入解讀 非百度百科式

🎓 Scholar(學術檢索/論文輔助)

8維度評分框架(蒸餾自 K-Dense ScholarEval)

8維度: 問題定義 | 文獻綜述 | 方法論 | 資料來源 | 分析解讀 | 結果呈現 | 學術寫作 | 引用規範

# 檢查項 權重 說明
SC1 引用真實:所有引用文獻是否真實存在(DOI/arXiv ID可驗證) 極高 反AI幻覺核心
SC2 相關性:檢索結果與課題的相關度(前5條中至少3條高度相關)
SC3 時效性:引用文獻是否以近3年為主(經典文獻除外)
SC4 完整性:是否覆蓋了課題的主要子領域 不能只搜一個方向
SC5 批判性:文獻綜述是否區分了'總結'和'批判'(非羅列) K-Dense ScholarEval
SC6 方法論審評:對引用文獻的方法論質量是否有評估 K-Dense ScholarEval

📊 Analyzer(資料分析)

# 檢查項 權重 說明
A1 資料來源標註:是否明確標註資料來源和時間 極高 對應 PAT-20260403
A2 計算可復現:關鍵數字是否能從原始資料手算驗證 不臆想
A3 方法說明:是否說明了分析方法(描述統計/迴歸/卡方等)
A4 侷限性:是否指出了資料的侷限和適用範圍 誠實原則

🏥 Medical(醫療/網際網路醫院)

GRADE 證據分級 + 偏差檢測(蒸餾自 K-Dense CDS + Critical-Thinking)

GRADE 分級: 1A(強推薦+高質量)→ 1B → 2A → 2B → 2C(弱推薦+極低質量)

# 檢查項 權重 說明
M1 政策依據:是否引用最新的國家/省級政策檔案 網際網路醫院政策變化快
M2 資料時效:引用的醫院/行業資料是否在時效紅線內 極高 IMA 紅線
M3 臨床相關性:建議是否有臨床/管理實踐支撐
M4 證據分級:是否對關鍵建議標註了GRADE等級(或註明證據強度) K-Dense CDS
M5 偏差意識:是否指出引用研究中的潛在偏差(選擇/測量/混雜) K-Dense Critical-Thinking

打分機制

總分 = Σ(通過項權重) / Σ(所有項權重) × 100

等級:
  90+ = 🟢 優秀(可自動交付)
  70-89 = 🟡 良好(需抽查)
  50-69 = 🟠 需改進(必須人工審)
  <50  = 🔴 不合格(重新執行)

Cron 自動評估流程

想要更強大的技能外掛,就來小蔥技能站7w4.net看看吧。

每日 23:30 — Agent 自評

  1. 讀取當日該 agent 的所有任務記錄(memory/YYYY-MM-DD.md)
  2. 對每個任務逐項跑 eval checklist
  3. 計算當日平均分
  4. 記錄到 memory/evolution/<agent-id>.md

每週日 00:00 — CEO 週報

  1. 彙總各 agent 周平均分
  2. 識別分數下降趨勢 → 觸發調查
  3. 識別高分穩定 agent → 確認無需干預
  4. 提煉本週 top-3 失敗點 → 寫入 patterns.md
  5. 將整體評分趨勢發給老闆

觸發最佳化的條件

  • 連續3天某 agent 低於 70 分 → 自動 SOUL.md 檢查
  • 某個 eval 項連續5次失敗 → 寫入 PAT 記錄
  • 周均分下降 >10% → 觸發 agent 模型/配置審查

與現有體系的銜接

現有元件 Eval 銜接方式
Phoenix Memory L0 每日日誌已包含任務記錄,eval 直接讀取
patterns.md eval 失敗模式自動寫入 PAT
五層質檢 eval 是 L2-L3 層的量化標準
AGENTS.md autoresearch eval 分數就是 autoresearch 的 loss function
心跳 HEARTBEAT.md 週日 eval 週報納入心跳檢查

進化記錄格式

memory/evolution/<agent-id>.md:

# <Agent 名稱> 進化日誌

## 2026-04-04
- 日均任務數: 3
- Eval 均分: 78/100 🟡
- 通過項: C1✅ C2✅ C3❌ C4✅ C5🟡
- 失敗分析: C3 資料真實度不達標(2/3任務使用了估算資料)
- 改進措施: 在 spawn 指令中強調"所有數字必須標註來源"

注意事項

  • Eval 是工具,不是目的。分數只是手段,最終目標是老闆滿意度
  • 不要為了刷分而刷分——如果某條 eval 不再有意義,該刪就刪
  • 新 agent 上線前必須先定義 eval,沒有 eval 的 agent 不轉正
  • 老闆的口頭反饋 > eval 分數(遇到矛盾時以老闆為準)

🤖 AI 評測

這個 Skill 整體質量良好,核心設計思路清晰實用,提供了完整的評估檢查清單和自動打分機制,能有效幫助量化 AI 輸出的質量水平。覆蓋場景豐富,評分規則易於理解。不過實際評估效果取決於具體使用場景的適配程度,自動化流程的執行穩定性還需時間驗證。作為一套方法論文件而非可直接使用的工具,落地需要一定學習成本。

📊 多維度評分

適應性3.7
規範性3.9
有效性4.7
可靠性4.2
可信度5

📁 包含檔案 (2 個)

📄 SKILL.md 8 KB
📄 _meta.json 129 B