天工開物 工匠魯班
魯班.Skill 是工業級技能最佳化器,基於 autoresearch + SkillOpt 場景自適應。採用 Quick(輕量 Self-Refine,3 輪 / .bak 回退) 和 Full(完整迴圈 + 多評委 + git 分支 + 儀表盤,5 輪) 雙模策略。
何時呼叫:使用者提及"最佳化 skill / skill 評分 / 自動最佳化 / 質量檢查 / skill review"等關鍵詞時啟用。
五大設計支柱:棘輪迴滾(只留改進)/ 獨立評分(子 agent 消除偏差)/ 人在迴路(每 skill 確認)/ 學習率預算(編輯 ≤10%)/ ROI 前置(≥85 且最低 ≥7 跳過)。
luban-workspace = 本 SKILL.md 所在目錄(即本 skill 目錄本身是一個 git 倉庫)auto-optimize/YYYYMMDD-HHMMdiagnostics.tsv / rejected_edits.md / test-prompts.json / results.tsv)放在被最佳化 skill 自己的目錄下meta_learnings.md / luban-profile.json / optimization-registry.tsv)放在 luban-workspace/| 層級 | 名稱 | Quick | Full |
|---|---|---|---|
| L0 | 確定性執行層 | 啟用 | 啟用 |
| L1 | 多智慧體協作層 | 按需 | 按需 |
| L2 | 技能自適應最佳化層 | 啟用(鼓勵探索) | 嚴格審查後啟用 |
| L3 | 價值對齊層 | 軟性約束(風格對齊) | 硬性約束(合規對齊) |
| L4 | 元認知審計層 | 不啟用 | 啟用(跨 skill 經驗沉澱) |
L0 原子操作(所有編輯必須走):讀(read_text)→ 改(edit_file)→ 驗(Rubric 逐項自檢)。
| 如果你想… | 讀哪裡 |
|---|---|
| 快速開始 | QUICKSTART.md |
| 完整 Rubric / 模組 / 策略 / 資料結構 | REFERENCE.md |
| 模組詳細流程 | references/modules.md |
| 反模式 / FAQ / 架構紅線 | references/faq.md |
git checkout 而非 git reset --hard架構紅線:
| # | 維度 | 權重 | 型別 | 一句話評分 |
|---|---|---|---|---|
| dim1 | Frontmatter 質量 | 7 | 確定性 | name 規範 + description 含做什麼/觸發詞 + ≤1024 字元 + 禁空話。全過=10 |
| dim2 | 工作流清晰度 | 12 | LLM | 步驟明確可執行、有序號、有輸入/輸出 |
| dim3 | 失敗模式編碼 | 12 | LLM | 顯式編碼失敗分支 + fallback 路徑;無失敗分支 ≥−3 分 |
| dim4 | 檢查點設計 | 6 | 確定性 | ≥1 處 STOP=10,僅 CHECKPOINT=5,無=0 |
| dim5 | 可執行具體性 | 17 | LLM | 具體引數/格式/示例 + 軟化詞掃描。HASP 模組產出確定性子分 3/17 |
| dim6 | 資源整合度 | 4 | LLM | 引用正確、路徑可達。SkillOps 模組產出確定性子分 3/4 |
| dim7a | 結構合規 | 6 | 確定性 | 標題層級連續 + 含 ≥3/4 必含章節 |
| dim7b | 語義質量 | 6 | LLM | 冗餘/AI 腔/重複→一處 −1。Distill 模組產出確定性子分 2/6 |
| dim8 | 實測表現 | 20 | LLM | 8a 意圖完成度(8) + 8b 淨提升(7) + 8c 副作用(5) |
| dim9 | 反例與黑名單 | 6 | 混合 | 兩段式:關鍵詞掃描(≥3 處) → LLM 評估質量 |
| dim10 | 安全與審查門控 | 4 | 公式 | Sentinel 2 + P0/P1 審查 2。Quick 預設滿分 |
評分公式:總分 = Σ(dim×權重) / 10。維度總分 = Module 子分 + Rubric 子分(同維佔比加權合併)。dim5/6/7b/10 四維有模組介入。
完整 Rubric 評分方式、模組子分合並規則、dry_run 降權、十維執行模式 → REFERENCE.md §1
模式選擇(前置閘道器):
if 使用者明確要求"完整/深度/全面/工業/生產" → Full
elif baseline 分 < 70 → Full
elif results.tsv 有 revert 記錄 → Full
elif delta > 5 且連續 2 輪保持 → Full
else → Quick(預設)
| Quick | Full | |
|---|---|---|
| 觸發 | 預設 | 使用者明確 / ROI>5 / 曾被 revert |
| 評分 | 結構評分 + dry_run 推演 | 全維度 + full_test + 多評委 |
| 最佳化 | self-refine,.bak 回退 |
git 分支 + 獨立 judge + 儀表盤 |
| 審查 | dim10 預設 100 | P0/P1/P2 全量門控 |
| 停止 | MAX_ROUNDS=3 | MAX_ROUNDS=5 |
| Meta | 不啟用 L4 | 啟用,輸出 meta_learnings.md |
觸頂訊號:連續 2 輪 Δ < 2 分 → break。雙軌反饋:Quick 下 3 輪內 Δ>5→升級 Full;Full 下連續 3 skill 穩定 delta<3→降級 Quick。
完整雙模對比、審查流程、多評委與多角色、子 Agent 降級 → REFERENCE.md §3 / REFERENCE.md §5
Phase 0: 初始化 確認範圍 → git 分支(Quick 跳過)→ 檢查/建立 results.tsv + diagnostics.tsv → ROI 前置評估(≥85 且最低 ≥7 跳過)→ 讀取 revert 歷史標記繞行 Phase 0.3: 模組缺陷檢測 六模組按序執行:SkillOps → EvoSkill → HASP → CASCADE → Distill → Sentinel 產出確定性子分到 diagnostics.tsv。EvoSkill 僅標註 [oscillation],不產生子分。 🔴 CHECKPOINT:展示子分摘要 → Runtime 中立性 Gate → Phase 0.5 Phase 0.5: 測試 Prompt 設計 為每個 skill 設計 2-3 個 prompt(典型 + 歧義場景),儲存到 test-prompts.json 🔴 CHECKPOINT · 🛑 STOP Phase 1: 基線評估 逐維評分 → 同維合併 Module 子分 + Rubric 子分 → spawn 子 agent 跑 full_test → 加權計算總分 → 記錄 results.tsv Full 額外:消費者能力基線測試(baseline-skill.md < 60 分阻斷) 🔴 CHECKPOINT Phase 2: 最佳化迴圈(按基線分升序,先最佳化最弱) round = 0; while round < MAX_ROUNDS: Step 0: 重新執行六模組 Step 1: 診斷找最弱維度(EvoSkill [oscillation] 維度跳過) Step 2: 提 1 個具體方案(對照反例黑名單 8 條 + rejected_edits + oscillation_guard) Step 3: 編輯前備份(git commit 或 .bak) Step 4: 執行改進(字元變化 ≤10%)→ 自檢 dim1/4/7a/9 Step 5: spawn 獨立子 agent 重評 Step 6: 新分 > 舊分 → commit + 觸頂檢測;否則回滾 + 記錄 rejected_edits.md 🔴 CHECKPOINT:每個 skill 展示改動摘要,等使用者確認 Phase 2.5: 探索性重寫(按需觸發) 連續 2 skill round 1 break 或單 skill 連續 2 輪 round 1 break → git stash → 重寫 → 評估 🛑 STOP:必須徵得使用者同意 Phase 3: 彙總報告 全域性戰績表 + 分數變化 + 主要改進摘要 + 健康度儀表盤 Full 模式:Epoch Meta-Review → meta_learnings.md + luban-profile.json oscillation_guard 備份輪轉:保留最近 5 輪,baseline 和首輪永久保留7w4.net有更好的技能外掛。
完整 Phase 0–3 詳細步驟、Sentinel 執行方式、備份輪轉 → REFERENCE.md §4
| # | 反模式 | 替代做法 |
|---|---|---|
| 1 | 同 context 自評自改 | spawn 獨立子 agent 評分 |
| 2 | git reset --hard 當回滾 |
用 git checkout 保留追溯鏈 |
| 3 | 為湊分增冗餘 | 觸頂訊號 → break |
| 4 | 跳過 test-prompts | Phase 0.5 強制設計 2-3 prompts |
| 5 | 輪內改多個維度 | 每輪 1 個維度 |
| 6 | dry_run 比例 > 30% | 強制至少 1 個 full_test |
| 7 | 靜默跳過異常 | 異常表 fallback 必須先告知 |
| 8 | 忽視維度相關性單獨最佳化 | 看相關簇短板再決定 |
| 檔案 | 位置 | 核心欄位 |
|---|---|---|
results.tsv |
{skill目錄}/ |
timestamp / commit / skill / round / old_score / new_score / status / dim_changed / delta / note / eval_mode / judge_count |
diagnostics.tsv |
{skill目錄}/ |
模組 / 維度 / 子分 / 檔案 / 行號 / 詳情。Phase 0.3 每次清空重建 |
optimization-registry.tsv |
luban-workspace/ |
skill_name / timestamp / score_before / score_after / rounds / eval_mode。只增不刪 |
rejected_edits.md |
{skill目錄}/ |
REJ 記錄:目標維度 / 改動段落 / 方案摘要 / 被拒原因 / 繞行建議 |
meta_learnings.md |
luban-workspace/ |
ML 記錄:規律 / 來源 skill / 置信度 / 可複用場景 |
luban-profile.json |
luban-workspace/ |
oscillation_guard 陣列 |
完整 TSV 示例與資料結構詳情 → REFERENCE.md §6
| 場景 | 處理動作 |
|---|---|
| 不在 git 倉庫 | 詢問:git init 或檔案備份 |
| results.tsv 缺失/損壞 | 新建或備份後重建 |
| 分支已存在 | 末尾加 -2/-3;3 次後詢問 |
| git revert 失敗 | 先 stash;仍失敗則從 commit 手動恢復 SKILL.md |
| MAX_ROUNDS 觸頂 | 展示最弱維度,問使用者:加 1 輪 / 探索性重寫 / 收工 |
| 最佳化後超 150% 體積 | 拒絕提交,回精簡後重評 |
| test-prompts.json 已存在 | 複用 / 重寫 / 追加,三選一 |
| SKILL.md 找不到 | 終止,記 status=error |
| 消費者基線失敗 | 輸出能力不足報告,阻斷 |
| 子 Agent 不可用 | 觸發降級模式(見 REFERENCE.md §5.4) |
| 分數精度漂移 | 總分差 < 0.05 不算提升 |
完整異常表含觸發條件+通俗解釋 → REFERENCE.md §8
P0: 適配性與效果(gate,必須先修) Runtime 繫結(單 runtime 措辭/路徑寫死)→ 替換為 runtime-neutral;效果倒退 → 精簡指令;Sentinel 安全告警 → 移除惡意指令/憑據替換/增加 guards。
P1: 結構性問題 Frontmatter 缺觸發詞 → 補充;無 Phase/Step 結構 → 重組線性流程;無檢查點 → 插入 🔴 CHECKPOINT / 🛑 STOP;標題跳躍 → 補層級;無錯誤處理 → 補三段式 fallback。
P2: 具體性問題 步驟模糊 → 加引數/工具名/格式;軟化詞過多 → 改"建議"為"必須";資源引用斷裂 → 刪除或補建。
P3: 可讀性問題 段落過長 → 拆分/表格;重複描述 → 合併;缺反例標註 → 加 ≥3 處;缺速查入口 → 新增 TL;DR。
優先順序公式:弱點深度 = (10 − 當前維度分) × 權重。相關簇提醒:dim2/3/4 聯動。
完整策略庫含識別特徵+最佳化策略+關聯維度 → REFERENCE.md §7
| 路徑 | 用途 |
|---|---|
scripts/skillops_scanner.py |
SkillOps 路徑/YAML/引用鏈掃描 |
scripts/evo_skill_patcher.py |
EvoSkill 失敗驅動補丁生成 |
scripts/hasp_hardener.py |
HASP 軟化詞檢測→Must/PF 升級 |
scripts/cascade_updater.py |
CASCADE 外部引用過時檢測 |
scripts/distill_analyzer.py |
Distill 引用矩陣+F_approx 計算 |
scripts/muse_generator.py |
MUSE 測試用例生成與迴歸 |
scripts/security_audit.py |
Sentinel 安全審計 |
references/SA-DM.md |
SkillOps 設計方法論完整論文 |
references/baseline-skill.md |
消費者能力基線測試參考 skill |
| 內容 | 位置 |
|---|---|
| 十維 Rubric 評分體系(完整表格+評分公式+合併規則+dry_run 降權+執行模式) | REFERENCE.md §1 |
| 六模組缺陷檢測(模組清單+Sentinel 五類+HASP 軟化詞+Distill F_approx) | REFERENCE.md §2 |
| 雙模策略(閘道器+對比+雙軌反饋+觸頂訊號) | REFERENCE.md §3 |
| 最佳化流程 Phase 0-3(全部步驟+備份輪轉) | REFERENCE.md §4 |
| 多評委與多角色審查(同質/異質/並行審查+降級) | REFERENCE.md §5 |
| 關鍵資料結構(TSV 示例+rejected_edits+meta_learnings+luban-profile) | REFERENCE.md §6 |
| 最佳化策略庫(P0-P3 完整表格+HL 操作) | REFERENCE.md §7 |
| 異常與邊界條件(完整表格) | REFERENCE.md §8 |
| 12 條設計原則(完整解釋) | REFERENCE.md §9 |
| 架構紅線 + 反例黑名單 | REFERENCE.md |
| 模組詳細流程(CASCADE/HASP/Distill/MUSE/排程器) | references/modules.md |
| 反模式 / FAQ / 架構紅線 / 指令對映 / 異常場景 | references/faq.md |
這個技能質量不錯,文件結構清晰、功能完善。它基於多篇學術研究設計,提供了科學的評分體系和自動化最佳化能力,還能自動檢查安全問題。優點是功能全面、有雙模式可選、最佳化過程安全可控;不足是內容較多較複雜,新手需要花時間學習。適合想要認真打磨技能質量的使用者使用。