測評設計師

👤 小智伴學 📦 v2.0.0 ⭐ 4.6 ⬇️ 489 下載
🎓 教育學習 免費

📖 技能介紹


name: xiaozhi-teach-exam-designer display_name: 測評設計師 version: 2.0.0 author: 小智伴學 category: 老師通用 tags: [測評, 試卷設計, 雙向細目表, 難度控制, 評分標準, 區分度, 老師工具] description: > 幫助老師從"拼湊試卷"升級為"科學測評設計"。 當老師說"幫我出一份試卷"、"設計一個單元測驗"、 "怎麼控制試卷難度"、"出一份月考卷"、 "這份卷子質量如何"時,建議啟用此SKILL。 核心工作流:確認測評目標 → 設計雙向細目表 → 篩選/改編題目 → 控制難度梯度 → 生成評分標準 → 考後分析建議 → 與 xiaozhi-teach-student-analyzer 得分率反哺(學情為可選輸入,無學情時可獨立設計基礎版)。 該版本建立了完整的測評-分析閉環,強基於目標與學情。 compatibility: OpenClaw / ClawHub id: openclaw:xiaozhi-teach-exam-designer min_platform_version: "2.0" max_round_limit: 25


測評設計師 SKILL

一句話定位: 好的測評不是為難學生,而是精準照見每個知識點的掌握狀態。


⚠️ 技術實現邊界宣告

關於"自動出題"機制: 本 SKILL 的題目來源有兩種: ① 老師提供題庫(推薦:老師自有改編題或公開可引用資源) ② 學科專項 SKILL 自動生成(如數學解題教練、英語寫作教練) 本 SKILL 直接呼叫 LLM 憑空生成題目;不替老師挑選具體題目;只做"雙向細目表設計+評分標準+難度梯度控制"。

關於"題目版權"邊界: 所有題目必須標註 copyrightStatus(自有/公開可引用/僅存索引);不引用未授權的教輔原題。

關於"自動評分"邊界: 本 SKILL 輸出評分標準而非"自動判分";自動判分不在本 SKILL 能力範圍。


一、核心使命

老師出卷時常見的三個誤區:

誤區① 拼湊式出題:把往年卷子/教輔題目拼起來,
        不清楚每道題在"測什麼"。

誤區② 難度一刀切:要麼全卷偏難(學生大面積崩潰),
        要麼全卷偏易(區分度低)。

誤區③ 評分不嚴格:評分標準模糊,
        不同老師改出來的分數差距大。

本 SKILL 要解決的是: - 讓每道題都對應明確測評目標:雙向細目表驅動出題 - 讓難度梯度可設計:根據測評目的調整 P 值和 D 值 - 讓評分標準可複製:過程分+結果分雙軌,不同老師改出來差異小 - 讓測評資料反哺教學:得分率回寫 student-analyzer


二、觸發時機

觸發場景 示例語句
設計新試卷 "幫我出一份 X 單元試卷" / "出月考卷"
單元小測 "出一份 15 分鐘小測"
試卷講評 "這份卷子怎麼講評"
試卷分析 "這份卷子難度/區分度如何"
命題 "如何按雙向細目表命題"
評分標準 "出評分細則"
題目改編 "這道題怎麼改"
試卷質量評估 "這份卷子出得怎麼樣"

三、核心流程

                ┌──────────────────────────┐
                │ ① 確認測評目的            │
                │  診斷/形成性/終結性/選拔  │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ② 設計雙向細目表          │
                │  知識點 × 認知層次 矩陣   │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ③ 控制難度梯度            │
                │  基礎/中等/提升/挑戰      │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ④ 篩選/改編題目           │
                │  按細目表匹配             │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ⑤ 生成評分標準            │
                │  過程分+結果分雙軌        │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ⑥ 考後分析建議            │
                │  難度/區分度/反哺教學     │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ⑦ 寫回 student-analyzer   │
                │  得分率 → 知識點熱力圖    │
                └──────────────────────────┘

四、測評目的分類

不同目的對應不同設計策略。

┌──────────┬──────────────┬──────────┬──────────┬────────────┐
│ 目的      │ 難度 P        │ 題量      │ 時長      │ 區分度 D    │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 診斷性    │ 0.55-0.70    │ 中等      │ 中等      │ 中等        │
│  (查弱項) │ 適中偏易     │          │          │            │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 形成性    │ 0.65-0.80    │ 較小      │ 較短      │ 良好        │
│  (單元)   │ 適中         │          │          │            │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 終結性    │ 0.55-0.75    │ 較大      │ 較長      │ 優秀        │
│  (期中/末) │ 適中偏難     │          │          │            │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 選拔性    │ 0.35-0.55    │ 大        │ 長        │ 極強        │
│  (競賽)   │ 難           │          │          │            │
└──────────┴──────────────┴──────────┴──────────┴────────────┘

五、雙向細目表設計(核心)

5.1 雙向細目表模板

行:知識點(按章節分組) 列:Bloom 認知層次(記憶/理解/應用/分析/評價/創造)

📎 完整模板見 references/exam-blueprint.md §二(雙向細目表空白模板:知識點×認知層次矩陣 + 題號對應表)

5.2 雙向細目表填寫規則

■ 知識點覆蓋
  · 重要知識點至少 1 道題
  · 核心知識點 2-3 道題
  · 選考知識點 1 道題(可標註"選做")

■ 認知層次比例(按測評目的)
  診斷性  :記憶 30% + 理解 30% + 應用 25% + 分析 15% + 評價/創造 0%
  形成性  :記憶 20% + 理解 30% + 應用 30% + 分析 15% + 評價 5%
  終結性  :記憶 15% + 理解 25% + 應用 30% + 分析 20% + 評價 5% + 創造 5%
  選拔性  :記憶 5%  + 理解 15% + 應用 25% + 分析 30% + 評價 15% + 創造 10%

■ 題目數量與分值
  · 單題分值與認知層次正相關(基礎題分低,拔高題分高)
  · 總分必須等於各題分值之和

5.3 雙向細目表自檢

□ 是否每個重要知識點都有 1 道以上題?
□ 是否每個認知層次都有 1 道以上題?
□ 比例是否符合測評目的?
□ 題量是否在合理範圍?
  · 診斷性 8-12 題
  · 形成性 12-18 題
  · 終結性 18-25 題
  · 選拔性 20-30 題
□ 是否避免了"全卷都是應用題"或"全卷都是基礎題"?

六、難度梯度設計

6.1 難度係數 P

P = 班級平均分 / 滿分

按測評目的預設:
  診斷性:P 目標 0.55-0.70(適中偏易,照顧基礎學生)
  形成性:P 目標 0.65-0.80(適中,符合課程標準)
  終結性:P 目標 0.55-0.75(適中偏難,區分度好)
  選拔性:P 目標 0.35-0.55(難,拉開差距)

6.2 難度梯度比例

形成性測評(最常見):

  基礎題  50%  → 全體學生應會
    P > 0.85,直接套用規則
    佔比 50%,分值 50%

  中等題  30%  → 大部分學生應會
    P 0.55-0.85,一步變形
    佔比 30%,分值 30%

  提升題  15%  → 優等生主戰場
    P 0.30-0.55,綜合應用
    佔比 15%,分值 15%

  挑戰題  5%   → 拔尖學生展示
    P < 0.30,跨章遷移
    佔比 5%,分值 5%

6.3 區分度 D

D = 高分組得分率 - 低分組得分率
  D > 0.40 優秀
  D 0.20-0.40 良好
  D < 0.20 不足

每道題都應 D > 0.20;
D < 0.20 的題說明"所有學生都錯"或"所有學生都對",
應改題或刪題。

七、題目篩選與改編

7.1 題目資訊表

每道被選中的題目必須有以下完整資訊:來源(出處 + copyrightStatus + 改編記錄)、測評目標(知識點/認知層次/預期難度)、內容(題幹/答案/評分標準)、質量預測(預估 P / 預估 D / 預估完成時間)。

📎 完整模板見 references/exam-blueprint.md §三(題目資訊表空白模板)

7.2 改編原則

■ 改數(引數)
  原題 y=2x+1 → 改編 y=3x-2
  適合:同一知識點不同引數

■ 改問(設問角度)
  原題"求 X" → 改編"判斷 X 是否正確"
  適合:換角度測同一概念

■ 改情境(背景)
  原題"計程車" → 改編"網約車"
  適合:讓題目更貼近學生生活

■ 改綜合度
  單知識點 → 多知識點綜合
  適合:測評綜合應用能力

7.3 題目版權管理

✅ 自有:老師原創或組內原創
✅ 公開可引用:教材例題、CC 協議資源
⚠️ 僅存索引:教輔原題只記題號,不復制題幹
❌ 禁止:未授權複製教輔原題

若引用改編題,必須標註"原題出處 + 改編點"。

八、評分標準生成

每道題配 1 份評分標準。

8.1 評分標準模板

結構:過程分(分步驟給分 + 關鍵概念/規則)+ 結果分(答案正確 + 單位/格式)+ 常見錯誤與扣分 + 滿分模板。

📎 完整模板見 references/exam-blueprint.md §四(單題評分標準空白模板)

小蔥技能7w4.net有更新,你可以訪問看下。

8.2 評分標準嚴格化

■ 過程分細化
  關鍵步驟必須給過程分(不能跳過)
  步驟 1 + 步驟 2 + 步驟 3 = 過程分
  避免"答案對了就給滿分"的粗放評分

■ 結果分明確
  答案對 + 過程對 = 滿分
  答案對 + 過程有錯 = 部分分
  答案錯 + 過程對 = 部分分

■ 評分一致性
  不同老師按本標準改出來差距應 < 3 分
  若差距 > 5 分,說明標準不夠明確

8.3 簡明答案評分(客觀題)

選擇題 / 填空題 / 判斷題:
  正確答案:[X]
  錯誤答案扣分:全錯 0 分,部分對酌情

簡答題(無固定過程):
  關鍵點 ①([M] 分):[具體內容]
  關鍵點 ②([M] 分):[具體內容]
  表達清晰度([M] 分):[酌情]

九、考後分析建議

9.1 試卷質量分析

■ 整體質量
  · 實際 P:[   ](與目標 P 對比)
  · 實際 D:[   ](區分度評估)
  · 實際平均分 / 中位數 / 標準差
  · 優秀率 / 及格率 / 低分率

■ 題目質量
  · D < 0.20 的題:[列表] → 改題或刪題
  · P > 0.95 的題(太易):[列表] → 升級為講解素材
  · P < 0.30 的題(太難):[列表] → 拆分或降級

9.2 知識點熱力圖

┌────────────────────────────────────┐
│ 知識點得分率熱力圖                   │
├────────────────────────────────────┤
│ 知識點① 🟢 82%                     │
│ 知識點② 🟡 56%                     │
│ 知識點③ 🔴 32%  ← 共性弱項        │
│ 知識點④ 🟡 65%                     │
│ 知識點⑤ 🔴 38%  ← 共性弱項        │
└────────────────────────────────────┘
圖例:🔴 < 40% / 🟡 40-70% / 🟢 > 70%

9.3 寫回 student-analyzer

寫:
  · 各題得分率
  · 各知識點得分率
  · 各認知層次得分率
  · 區分度異常的題目

→ student-analyzer 接收後生成:
  · 班級畫像
  · 個體診斷卡
  · 教學調整建議

十、與上游/下游 SKILL 的協作

10.1 協作流圖

              ┌────────────────────────┐
              │ xiaozhi-teach-         │
              │  lesson-planner        │
              │ (教學目標)           │
              └───────────┬────────────┘
                          │
                          ↓
              ┌────────────────────────┐
              │ xiaozhi-teach-         │
              │  exam-designer         │
              │  (本 SKILL)           │
              └───────────┬────────────┘
                          │
                          ↓ 得分率反哺
              ┌────────────────────────┐
              │ xiaozhi-teach-         │
              │  student-analyzer      │
              │ (學情更新)           │
              └───────────┬────────────┘
                          │
        ┌─────────────────┼─────────────────┐
        ↓                 ↓                 ↓
  lesson-planner    assignment-     classroom-coach
  (教案調整)      designer        (講評策略)
                    (作業調整)

10.2 介面

讀:
  lessonPlan.emphasis       → 試卷側重點
  studentAnalyzer.classDistribution → 難度梯度參考
  studentAnalyzer.weaknessRank      → 必須覆蓋的弱項

寫:
  examBlueprint.actualDifficulty → 實際難度
  examBlueprint.discrimination  → 實際區分度
  examBlueprint.itemQuality     → 題目質量評估
  examBlueprint.scoreRate       → 得分率(→ student-analyzer)

十一、欄位級高敏資訊防護

✅ 試卷中可出現學生真實姓名(如:座位號、學號)
❌ 試卷分析報告禁止點名
✅ 寫回資料:聚合得分率
❌ 不寫回:單個學生分數+排名

✅ 試卷講評可以用化名
❌ 禁止:把"差生"試卷公示

十二、行為準則

✅ 應該做 ❌ 不能做
雙向細目表先於出題 直接從題庫拼湊
每題配評分標準 只畫對錯
難度按測評目的設計 全卷偏難或全卷偏易
區分度 D > 0.20 接受 D < 0.20 的題
標註題目版權 複製未授權教輔原題
考後分析反哺教學 考完就歸檔
寫回資料用聚合形式 在公開報告中點名

十三、與其他 SKILL 的協同清單

測評設計師
    <── xiaozhi-teach-lesson-planner(教學目標)
    <── xiaozhi-teach-student-analyzer(學情分層)
    ──→ xiaozhi-teach-student-analyzer(得分率反哺)
    ──→ xiaozhi-teach-lesson-planner(教案調整)
    ──→ xiaozhi-teach-assignment-designer(作業調整)
    ──→ xiaozhi-teach-classroom-coach(講評策略)
    ──→ 學科專項 SKILL(題目生成)

禁止行為: - 禁止 AI 憑空生成具體題目內容 - 禁止複製未授權教輔原題 - 禁止考後在公開報告中點名 - 禁止用分數給學生貼長期標籤 - 禁止在試卷講評中羞辱低分學生


十四、參考資源

  • references/exam-blueprint.md — 試卷藍圖、雙向細目表(§二)、題目資訊表(§三)、評分標準(§四)、考後分析、試卷講評設計等空白模板

💡 小智說: "好的試卷不是用來難倒學生的, 是用來照亮他們的—— 照亮已經掌握的,照亮還沒掌握的, 照亮老師下一步該講什麼。"

🤖 AI 評測

這個技能質量很不錯,專業度高,文件寫得很詳細。它把試卷設計從"隨便拼湊"升級為科學測評,有完整的流程指導和模板參考,還能和其他教學工具配合使用。邊界劃定清晰,不會做超出能力範圍的事。不足之處是缺少實際使用示例,普通老師可能需要一些案例來理解怎麼用它出卷。

📊 多維度評分

適應性4.4
規範性4.5
有效性4.8
可靠性4.3
可信度5

📁 包含檔案 (4 個)

📄 SKILL.md 17.4 KB
📄 _meta.json 146 B
📄 references/exam-blueprint.md 9.1 KB
📄 skill-card.md 2.5 KB