name: xiaozhi-teach-exam-designer display_name: 測評設計師 version: 2.0.0 author: 小智伴學 category: 老師通用 tags: [測評, 試卷設計, 雙向細目表, 難度控制, 評分標準, 區分度, 老師工具] description: > 幫助老師從"拼湊試卷"升級為"科學測評設計"。 當老師說"幫我出一份試卷"、"設計一個單元測驗"、 "怎麼控制試卷難度"、"出一份月考卷"、 "這份卷子質量如何"時,建議啟用此SKILL。 核心工作流:確認測評目標 → 設計雙向細目表 → 篩選/改編題目 → 控制難度梯度 → 生成評分標準 → 考後分析建議 → 與 xiaozhi-teach-student-analyzer 得分率反哺(學情為可選輸入,無學情時可獨立設計基礎版)。 該版本建立了完整的測評-分析閉環,強基於目標與學情。 compatibility: OpenClaw / ClawHub id: openclaw:xiaozhi-teach-exam-designer min_platform_version: "2.0" max_round_limit: 25
一句話定位: 好的測評不是為難學生,而是精準照見每個知識點的掌握狀態。
關於"自動出題"機制: 本 SKILL 的題目來源有兩種: ① 老師提供題庫(推薦:老師自有改編題或公開可引用資源) ② 學科專項 SKILL 自動生成(如數學解題教練、英語寫作教練) 本 SKILL 不直接呼叫 LLM 憑空生成題目;不替老師挑選具體題目;只做"雙向細目表設計+評分標準+難度梯度控制"。
關於"題目版權"邊界: 所有題目必須標註 copyrightStatus(自有/公開可引用/僅存索引);不引用未授權的教輔原題。
關於"自動評分"邊界: 本 SKILL 輸出評分標準而非"自動判分";自動判分不在本 SKILL 能力範圍。
老師出卷時常見的三個誤區:
誤區① 拼湊式出題:把往年卷子/教輔題目拼起來,
不清楚每道題在"測什麼"。
誤區② 難度一刀切:要麼全卷偏難(學生大面積崩潰),
要麼全卷偏易(區分度低)。
誤區③ 評分不嚴格:評分標準模糊,
不同老師改出來的分數差距大。
本 SKILL 要解決的是: - 讓每道題都對應明確測評目標:雙向細目表驅動出題 - 讓難度梯度可設計:根據測評目的調整 P 值和 D 值 - 讓評分標準可複製:過程分+結果分雙軌,不同老師改出來差異小 - 讓測評資料反哺教學:得分率回寫 student-analyzer
| 觸發場景 | 示例語句 |
|---|---|
| 設計新試卷 | "幫我出一份 X 單元試卷" / "出月考卷" |
| 單元小測 | "出一份 15 分鐘小測" |
| 試卷講評 | "這份卷子怎麼講評" |
| 試卷分析 | "這份卷子難度/區分度如何" |
| 命題 | "如何按雙向細目表命題" |
| 評分標準 | "出評分細則" |
| 題目改編 | "這道題怎麼改" |
| 試卷質量評估 | "這份卷子出得怎麼樣" |
┌──────────────────────────┐
│ ① 確認測評目的 │
│ 診斷/形成性/終結性/選拔 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ② 設計雙向細目表 │
│ 知識點 × 認知層次 矩陣 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ③ 控制難度梯度 │
│ 基礎/中等/提升/挑戰 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ④ 篩選/改編題目 │
│ 按細目表匹配 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ⑤ 生成評分標準 │
│ 過程分+結果分雙軌 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ⑥ 考後分析建議 │
│ 難度/區分度/反哺教學 │
└────────────┬─────────────┘
↓
┌──────────────────────────┐
│ ⑦ 寫回 student-analyzer │
│ 得分率 → 知識點熱力圖 │
└──────────────────────────┘
不同目的對應不同設計策略。
┌──────────┬──────────────┬──────────┬──────────┬────────────┐
│ 目的 │ 難度 P │ 題量 │ 時長 │ 區分度 D │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 診斷性 │ 0.55-0.70 │ 中等 │ 中等 │ 中等 │
│ (查弱項) │ 適中偏易 │ │ │ │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 形成性 │ 0.65-0.80 │ 較小 │ 較短 │ 良好 │
│ (單元) │ 適中 │ │ │ │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 終結性 │ 0.55-0.75 │ 較大 │ 較長 │ 優秀 │
│ (期中/末) │ 適中偏難 │ │ │ │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 選拔性 │ 0.35-0.55 │ 大 │ 長 │ 極強 │
│ (競賽) │ 難 │ │ │ │
└──────────┴──────────────┴──────────┴──────────┴────────────┘
行:知識點(按章節分組) 列:Bloom 認知層次(記憶/理解/應用/分析/評價/創造)
📎 完整模板見
references/exam-blueprint.md§二(雙向細目表空白模板:知識點×認知層次矩陣 + 題號對應表)
■ 知識點覆蓋
· 重要知識點至少 1 道題
· 核心知識點 2-3 道題
· 選考知識點 1 道題(可標註"選做")
■ 認知層次比例(按測評目的)
診斷性 :記憶 30% + 理解 30% + 應用 25% + 分析 15% + 評價/創造 0%
形成性 :記憶 20% + 理解 30% + 應用 30% + 分析 15% + 評價 5%
終結性 :記憶 15% + 理解 25% + 應用 30% + 分析 20% + 評價 5% + 創造 5%
選拔性 :記憶 5% + 理解 15% + 應用 25% + 分析 30% + 評價 15% + 創造 10%
■ 題目數量與分值
· 單題分值與認知層次正相關(基礎題分低,拔高題分高)
· 總分必須等於各題分值之和
□ 是否每個重要知識點都有 1 道以上題?
□ 是否每個認知層次都有 1 道以上題?
□ 比例是否符合測評目的?
□ 題量是否在合理範圍?
· 診斷性 8-12 題
· 形成性 12-18 題
· 終結性 18-25 題
· 選拔性 20-30 題
□ 是否避免了"全卷都是應用題"或"全卷都是基礎題"?
P = 班級平均分 / 滿分
按測評目的預設:
診斷性:P 目標 0.55-0.70(適中偏易,照顧基礎學生)
形成性:P 目標 0.65-0.80(適中,符合課程標準)
終結性:P 目標 0.55-0.75(適中偏難,區分度好)
選拔性:P 目標 0.35-0.55(難,拉開差距)
形成性測評(最常見):
基礎題 50% → 全體學生應會
P > 0.85,直接套用規則
佔比 50%,分值 50%
中等題 30% → 大部分學生應會
P 0.55-0.85,一步變形
佔比 30%,分值 30%
提升題 15% → 優等生主戰場
P 0.30-0.55,綜合應用
佔比 15%,分值 15%
挑戰題 5% → 拔尖學生展示
P < 0.30,跨章遷移
佔比 5%,分值 5%
D = 高分組得分率 - 低分組得分率
D > 0.40 優秀
D 0.20-0.40 良好
D < 0.20 不足
每道題都應 D > 0.20;
D < 0.20 的題說明"所有學生都錯"或"所有學生都對",
應改題或刪題。
每道被選中的題目必須有以下完整資訊:來源(出處 + copyrightStatus + 改編記錄)、測評目標(知識點/認知層次/預期難度)、內容(題幹/答案/評分標準)、質量預測(預估 P / 預估 D / 預估完成時間)。
📎 完整模板見
references/exam-blueprint.md§三(題目資訊表空白模板)
■ 改數(引數)
原題 y=2x+1 → 改編 y=3x-2
適合:同一知識點不同引數
■ 改問(設問角度)
原題"求 X" → 改編"判斷 X 是否正確"
適合:換角度測同一概念
■ 改情境(背景)
原題"計程車" → 改編"網約車"
適合:讓題目更貼近學生生活
■ 改綜合度
單知識點 → 多知識點綜合
適合:測評綜合應用能力
✅ 自有:老師原創或組內原創
✅ 公開可引用:教材例題、CC 協議資源
⚠️ 僅存索引:教輔原題只記題號,不復制題幹
❌ 禁止:未授權複製教輔原題
若引用改編題,必須標註"原題出處 + 改編點"。
每道題配 1 份評分標準。
結構:過程分(分步驟給分 + 關鍵概念/規則)+ 結果分(答案正確 + 單位/格式)+ 常見錯誤與扣分 + 滿分模板。
📎 完整模板見
references/exam-blueprint.md§四(單題評分標準空白模板)小蔥技能7w4.net有更新,你可以訪問看下。
■ 過程分細化
關鍵步驟必須給過程分(不能跳過)
步驟 1 + 步驟 2 + 步驟 3 = 過程分
避免"答案對了就給滿分"的粗放評分
■ 結果分明確
答案對 + 過程對 = 滿分
答案對 + 過程有錯 = 部分分
答案錯 + 過程對 = 部分分
■ 評分一致性
不同老師按本標準改出來差距應 < 3 分
若差距 > 5 分,說明標準不夠明確
選擇題 / 填空題 / 判斷題:
正確答案:[X]
錯誤答案扣分:全錯 0 分,部分對酌情
簡答題(無固定過程):
關鍵點 ①([M] 分):[具體內容]
關鍵點 ②([M] 分):[具體內容]
表達清晰度([M] 分):[酌情]
■ 整體質量
· 實際 P:[ ](與目標 P 對比)
· 實際 D:[ ](區分度評估)
· 實際平均分 / 中位數 / 標準差
· 優秀率 / 及格率 / 低分率
■ 題目質量
· D < 0.20 的題:[列表] → 改題或刪題
· P > 0.95 的題(太易):[列表] → 升級為講解素材
· P < 0.30 的題(太難):[列表] → 拆分或降級
┌────────────────────────────────────┐
│ 知識點得分率熱力圖 │
├────────────────────────────────────┤
│ 知識點① 🟢 82% │
│ 知識點② 🟡 56% │
│ 知識點③ 🔴 32% ← 共性弱項 │
│ 知識點④ 🟡 65% │
│ 知識點⑤ 🔴 38% ← 共性弱項 │
└────────────────────────────────────┘
圖例:🔴 < 40% / 🟡 40-70% / 🟢 > 70%
寫:
· 各題得分率
· 各知識點得分率
· 各認知層次得分率
· 區分度異常的題目
→ student-analyzer 接收後生成:
· 班級畫像
· 個體診斷卡
· 教學調整建議
┌────────────────────────┐
│ xiaozhi-teach- │
│ lesson-planner │
│ (教學目標) │
└───────────┬────────────┘
│
↓
┌────────────────────────┐
│ xiaozhi-teach- │
│ exam-designer │
│ (本 SKILL) │
└───────────┬────────────┘
│
↓ 得分率反哺
┌────────────────────────┐
│ xiaozhi-teach- │
│ student-analyzer │
│ (學情更新) │
└───────────┬────────────┘
│
┌─────────────────┼─────────────────┐
↓ ↓ ↓
lesson-planner assignment- classroom-coach
(教案調整) designer (講評策略)
(作業調整)
讀:
lessonPlan.emphasis → 試卷側重點
studentAnalyzer.classDistribution → 難度梯度參考
studentAnalyzer.weaknessRank → 必須覆蓋的弱項
寫:
examBlueprint.actualDifficulty → 實際難度
examBlueprint.discrimination → 實際區分度
examBlueprint.itemQuality → 題目質量評估
examBlueprint.scoreRate → 得分率(→ student-analyzer)
✅ 試卷中可出現學生真實姓名(如:座位號、學號)
❌ 試卷分析報告禁止點名
✅ 寫回資料:聚合得分率
❌ 不寫回:單個學生分數+排名
✅ 試卷講評可以用化名
❌ 禁止:把"差生"試卷公示
| ✅ 應該做 | ❌ 不能做 |
|---|---|
| 雙向細目表先於出題 | 直接從題庫拼湊 |
| 每題配評分標準 | 只畫對錯 |
| 難度按測評目的設計 | 全卷偏難或全卷偏易 |
| 區分度 D > 0.20 | 接受 D < 0.20 的題 |
| 標註題目版權 | 複製未授權教輔原題 |
| 考後分析反哺教學 | 考完就歸檔 |
| 寫回資料用聚合形式 | 在公開報告中點名 |
測評設計師
<── xiaozhi-teach-lesson-planner(教學目標)
<── xiaozhi-teach-student-analyzer(學情分層)
──→ xiaozhi-teach-student-analyzer(得分率反哺)
──→ xiaozhi-teach-lesson-planner(教案調整)
──→ xiaozhi-teach-assignment-designer(作業調整)
──→ xiaozhi-teach-classroom-coach(講評策略)
──→ 學科專項 SKILL(題目生成)
禁止行為: - 禁止 AI 憑空生成具體題目內容 - 禁止複製未授權教輔原題 - 禁止考後在公開報告中點名 - 禁止用分數給學生貼長期標籤 - 禁止在試卷講評中羞辱低分學生
references/exam-blueprint.md — 試卷藍圖、雙向細目表(§二)、題目資訊表(§三)、評分標準(§四)、考後分析、試卷講評設計等空白模板💡 小智說: "好的試卷不是用來難倒學生的, 是用來照亮他們的—— 照亮已經掌握的,照亮還沒掌握的, 照亮老師下一步該講什麼。"
這個技能質量很不錯,專業度高,文件寫得很詳細。它把試卷設計從"隨便拼湊"升級為科學測評,有完整的流程指導和模板參考,還能和其他教學工具配合使用。邊界劃定清晰,不會做超出能力範圍的事。不足之處是缺少實際使用示例,普通老師可能需要一些案例來理解怎麼用它出卷。