三分鐘版 整套流程就這 5 步;要細節再往下讀
寫評量規準:每個等第寫成可觀察的表現特徵,不是形容詞。 自己先改五份(一好一差三中間)當校準基準。 AI 逐份對照規準,只標「有/部分/沒有/無法判定」並附引句,不給分。 把 AI 對校準樣本的標記與自改結果比對;不一致就回頭修規準。 人依特徵對照表給分並寫可行動回饋,抽驗十份確認分數與標記一致。 這一篇用的是出題與評量 這一招——從教材長出題目、評分標準與補強路徑,超綱與錯答要有人擋。 同一招還能做這幾件事(共 5 篇):
本頁 13 節,分 5 區 一、這是什麼 三十秒判斷關不關你的事
先確認這一篇解的是不是你的問題。看完這兩節如果覺得不像,就不用再往下讀——省下的時間比讀完更值錢。
01 解決的工作問題一疊要看計算過程與論述的作業,改到第三十份的時候,標準已經跟第一份不一樣了。這不是不認真,是人的判斷本來就會漂移——而學生會發現,然後來問「為什麼他那樣寫有分我沒有」。AI 在這裡真正能幫的不是打分數,是把「這份作業裡出現了哪些規準上的特徵」標出來,讓你改到第三十份時還對得回第一份的標準。要它直接給分數,你會得到一個很像分數的數字,而且申訴時你答不出它怎麼來的。
02 什麼時候用、什麼時候別用什麼情況下該用這一套 同一份作業要改很多份,而且不是選擇題(需要看過程或論述)。 有評量規準,或願意先把規準寫出來。 分數與回饋要能對學生說明依據。 什麼情況下別用
由 AI 給分數 分數是評量決定,要有人負責、要能對學生說明。AI 只標特徵。
沒有規準時 沒有規準,AI 會用它心中的「好答案」當標準——通常是網路上最常見的寫法,不是你教的。
高利害的單次評量 升學、證照、資格考這類一次定生死的評量,判分程序另有規範,不適用這個方法。 誰會用到
老師 這是你的主場。守住一件事:分數由你給。AI 標特徵、你判斷,這個順序不能反。
教育訓練 企業內訓的評量同理。差別是學員通常更在意「我到底哪裡不對」,回饋的可行動性比分數重要。
HR 面試評分錨點跟評量規準是同一套技術:沒有行為錨點的等第,每個評分者心中的標準都不同。
行政 學生作業含姓名學號,是個資。去識別化與保存期限要先講清楚。
主管 多位助教共改一疊時,校準比規準本身更重要——規準一樣不代表理解一樣。 所屬工作情境 二、整件事怎麼跑 先看圖,再看逐步
先用一張圖抓全貌,再看逐步展開。圖看不懂沒關係,下一節會把每一步實際在做什麼、誰做,一條一條講清楚。
03 流程圖這張圖是整篇的骨架:輸入 → 步驟 → 困難點 → AI/Agent/Tool 介入 → 人工檢查 → 產出。紅框是最常出事的位置,綠框是不能下放的人工檢查點,粗框是中止條件。後面每一節都是在展開圖上的某一格。
AI 作業批改:AI 標特徵、人給分數,順序不能反 Human 輸入 Human 步驟 AI Agent Checkpoint Output Risk 困難點 Stop 中止
看圖重點: 這張圖的第四格是最容易被跳過、也最不該跳過的一步:拿 AI 的標記去對五份自己改過的樣本。重點不在檢查 AI 準不準,在於不一致的地方幾乎都是規準沒寫清楚——而規準沒寫清楚這件事,如果等到改完八十份才發現,那八十份都要重看。另外注意整張圖裡 AI 的位置:它只標特徵,分數在最後一格由人給。順序反過來(先讓它給分、人再調整)看起來比較快,但你會失去唯一能對學生說明的東西:這一條規準,你的作業裡沒有出現。純文字流程表(手機/螢幕閱讀器建議看這張) AI 作業批改:AI 標特徵、人給分數,順序不能反(純文字流程表) 序 類型/角色 流程步驟 這一步的困難點/中止條件 1 Human 題目 + 規準(含行為錨點)+ 去識別化作業 + 5 份校準樣本 一次 5–10 份 — 2 Human 人寫規準:每個等第寫成可觀察的表現特徵 困難點/風險 規準寫成形容詞:助教甲的「完整」不是助教乙的「完整」
3 Human 人先自己改五份(一好一差三中間)當校準基準 — 4 AI AI 標特徵:有/部分/沒有/無法判定 + 附引句(不給分) 困難點/風險 標準漂移:改到第三十份,已經不是第一份的標準
困難點/風險 AI 直接給分很誘人,但學生問「為什麼是 72 分」你答不出來
5 Checkpoint 人比對 AI 與自改的五份;不一致就回頭修規準 — 6 Agent 檢核助手掃描:跨份一致性、有無規準外評語 失敗與中止條件 出現分數、等第或規準以外的評語 → 該批退回重標
7 Checkpoint 教師依對照表給分 + 寫可行動回饋 + 抽驗十份 困難點/風險 回饋不可行動:「寫得不錯」,學生不知道下次要改什麼
8 Output 分數 + 回饋 + 特徵對照表(申訴時的依據) —
Mermaid 原始碼(貼進 Mermaid Live 或 draw.io 可再編輯) 可直接複製,改成你自己的流程 複製 Mermaid
flowchart TD
in1(["<b>Human</b><br/>題目 + 規準(含行為錨點)+ 去識別化作業 + 5 份校準樣本<br/><small>一次 5–10 份</small>"])
s1["<b>Human</b><br/>人寫規準:每個等第寫成可觀察的表現特徵"]
s2["<b>Human</b><br/>人先自己改五份(一好一差三中間)當校準基準"]
a1[/"<b>AI</b><br/>AI 標特徵:有/部分/沒有/無法判定 + 附引句(不給分)"/]
c1{{"<b>Checkpoint</b><br/>人比對 AI 與自改的五份;不一致就回頭修規準"}}
g1[["<b>Agent</b><br/>檢核助手掃描:跨份一致性、有無規準外評語"]]
c2{{"<b>Checkpoint</b><br/>教師依對照表給分 + 寫可行動回饋 + 抽驗十份"}}
o1(["<b>Output</b><br/>分數 + 回饋 + 特徵對照表(申訴時的依據)"])
r3>"<b>Risk</b><br/>規準寫成形容詞:助教甲的「完整」不是助教乙的「完整」"]
r1>"<b>Risk</b><br/>標準漂移:改到第三十份,已經不是第一份的標準"]
r2>"<b>Risk</b><br/>AI 直接給分很誘人,但學生問「為什麼是 72 分」你答不出來"]
x1[/"<b>Stop</b><br/>出現分數、等第或規準以外的評語 → 該批退回重標"\]
r4>"<b>Risk</b><br/>回饋不可行動:「寫得不錯」,學生不知道下次要改什麼"]
in1 --> s1
s1 --> s2
s2 --> a1
a1 --> c1
c1 --> g1
g1 --> c2
c2 --> o1
s1 -.->|風險| r3
a1 -.->|風險| r1
a1 -.->|風險| r2
g1 ==>|中止| x1
c2 -.->|風險| r4
c1 -.->|不一致就修規準| s1
classDef clsIn fill:#FFFFFF,stroke:#2C4459,stroke-width:2px,color:#141E2B
classDef clsHuman fill:#FBFCFD,stroke:#7A8CA0,stroke-width:2px,color:#141E2B
classDef clsAI fill:#FFF6EA,stroke:#DE9A45,stroke-width:2px,color:#141E2B
classDef clsAgent fill:#FDEBD2,stroke:#B87A2E,stroke-width:2px,color:#141E2B
classDef clsTool fill:#EDF2F6,stroke:#2C4459,stroke-width:2px,color:#141E2B
classDef clsCheck fill:#E8F2EC,stroke:#3F7A5A,stroke-width:2px,color:#123024
classDef clsOut fill:#141E2B,stroke:#141E2B,stroke-width:2px,color:#F2F6F9
classDef clsRisk fill:#FCEFEA,stroke:#C0552F,stroke-width:2px,color:#5E2110
classDef clsStop fill:#F7E1DB,stroke:#8E2F17,stroke-width:3px,color:#5E2110
class in1 clsIn;
class s1 clsHuman;
class s2 clsHuman;
class a1 clsAI;
class c1 clsCheck;
class g1 clsAgent;
class c2 clsCheck;
class o1 clsOut;
class r3 clsRisk;
class r1 clsRisk;
class r2 clsRisk;
class x1 clsStop;
class r4 clsRisk; 04 完整步驟圖的文字版,逐步展開 上面三分鐘版那幾步,這裡逐步展開:每一步誰做、做完會有什麼。
序 誰做 步驟與說明 1 Human 寫規準與錨點 每個維度、每個等第寫成可觀察的表現特徵。寫不出來的維度,代表這次不該評它。→ 評量規準 2 Human 自己先改五份 含一好一差三中間。這五份是校準基準,也是之後檢查 AI 有沒有漂移的對照組。→ 校準樣本 3 AI 標特徵 逐份對照規準,標出「哪些特徵出現了、出現在第幾行」。不給分數、不給等第、不下總評。→ 特徵對照表 4 Human 校準檢查 把 AI 對那五份校準樣本的標記,跟自己改的結果比對。不一致的地方通常是規準沒寫清楚。→ 校準結果與規準修訂 5 Agent 一致性掃描 機械檢查:同樣的特徵在不同份是否標得一致;有沒有出現規準以外的評語。→ 一致性標記 6 Human 給分與回饋 人依特徵對照表給分,並寫可行動的回饋。抽驗至少十份確認分數與特徵一致。→ 分數 + 回饋 + 抽驗紀錄
三、動手做 備料 → 指令 → 產出 → 工具
這一區是真的動手:先備料、再貼指令、然後對照產出應該長什麼樣。手上是哪一支 AI 都做得完,差別寫在最後的工具那一節。
05 開始前要準備什麼標「必要」的沒備齊就先別開始
評量規準(含行為錨點)必要 每個等第對應什麼樣的具體表現。不是「優秀/良好/待加強」,是「有沒有寫出中間步驟」「有沒有引用課本以外的例子」。
去識別化的作業必要 姓名、學號、班級遮蔽。遮蔽由人或工具做,不是叫 AI 忽略。
自己先改的樣本必要 先自己改 5 份(含一份很好、一份很差、三份中間),當成校準基準。
回饋的用途必要 只給分數、還是要給可行動的回饋?後者要花的時間多很多,但學生才學得到東西。
常見錯誤型態可選 這份作業學生最常錯在哪。有這個,AI 標得準很多。 餵進去的東西要長這樣 題目原文 + 評量規準(含行為錨點)+ 已去識別化的作業(一次 5–10 份)+ 教師自改的校準樣本 5 份。
規準的每個等第要寫成可觀察的表現特徵,不要用優秀/良好/待加強。 去識別化由人或工具做:姓名、學號、班級一律遮蔽,不要交代 AI「不要看」。 校準樣本要含一份很好、一份很差、三份中間——只有中間那幾份才測得出標準。 一次 5–10 份。份數多了標記會開始不一致,跟人一樣。 無法觀察的維度(創意、用心、態度)不要放進規準,改由教師直接評。 【課程】管理會計 第 3 單元
【題目】請說明為什麼在本案情境下應選用 A 方案而非 B 方案,並附計算過程。
【評量規準(行為錨點)】
C1 有列出兩案的比較基準(至少三項具體項目,如成本、交期、維護)
C2 計算過程完整——列出算式與數值,不只寫「經計算」
C3 有指出 B 方案的優點,而非單向論述 A 好
C4 結論有對回題目給定的情境條件(本案交期、預算限制)
C5 有標明數據來源或所做的假設
【本次不列入規準、由教師直接評】
表達流暢度、版面
【校準樣本(教師已自改)】
樣本 1(高):C1 有、C2 有、C3 有、C4 有、C5 有
樣本 2(低):C1 部分、C2 沒有、C3 沒有、C4 沒有、C5 沒有
樣本 3–5(中):(教師標記略)
【作業(已去識別化,8 份)】
作業 甲|姓名【已遮蔽】|學號【已遮蔽】
「A 方案比較好,因為成本較低。經計算 A 為 48 萬、B 為 55 萬,差 7 萬……」
(其餘 7 份格式相同) 06 Prompt(快速/完整/進階)A 快速版貼上就能用;B 完整實戰版把角色、限制、步驟、輸出格式與驗收標準寫足;C 進階版是拿去建 GPT/Skill/Agent 的系統指令,預設收起來,要用再點開。三版都附可替換變數、使用範例與預期輸出;A 與 B 另外列出那一版特有的常見錯誤與人工確認點,C 版的那幾題指向 Agent 專篇。
適合的工具 ChatGPT Claude M365 Copilot
👇 直接複製,{ } 換成你的內容 複製這段 Prompt
以下是評量規準與一批已去識別化的作業。請:
1. 逐份、逐條對照規準,只標「有/部分/沒有/無法判定」四種。
2. 每個「有」與「部分」都附作業中的引句或位置。
3. 整理需教師判斷的地方:同樣標為「部分」但性質不同的情形。
4. 針對每個「沒有」寫一句可行動的建議(寫「下次要做什麼」,不是評價他這次如何)。
不得給分數、等第或總評;不得評論字跡、格式、態度、字數;不得比較或排序學生。
評量規準:{貼上};作業(已去識別化):{貼上} 可替換變數 變數 要換成什麼 {貼上}評量規準(含每個等第的行為錨點)。 {貼上}已去識別化的作業(一次 5–10 份)。
完整使用範例(照這樣填) 以下是評量規準與一批已去識別化的作業。請照四個要求處理。(照母提示詞)
【題目】說明為什麼在這個情境下要選用 A 方案而非 B 方案,並附計算。
【評量規準】
C1 有列出兩案的比較基準(至少三項)
C2 計算過程完整(列出算式,不只有答案)
C3 有指出 B 方案的優點(不是只講 A 好)
C4 結論有對回題目的情境條件
C5 有標明數據來源或假設
【作業 甲(已去識別化)】
「A 方案比較好,因為成本較低。經計算 A 為 48 萬、B 為 55 萬,差 7 萬。B 方案雖然交期較快,但本案交期不緊。因此選 A。(成本數字依課本表 3-2)」
【作業 乙(已去識別化)】
「我認為應該選 A 方案。A 方案在成本、維護、擴充三方面都優於 B。經過計算之後可以確定 A 較為划算。所以結論是選 A 方案。」 預期輸出範例(拿到的東西應該長這樣) 【特徵對照表】
| 規準 | 甲 | 乙 |
|---|---|---|
| C1 兩案比較基準 ≥ 3 項 | 部分(成本、交期=2 項) | 有(成本、維護、擴充=3 項) |
| C2 計算過程完整 | 有(「A 為 48 萬、B 為 55 萬,差 7 萬」) | 沒有(「經過計算之後可以確定」,未列算式) |
| C3 有指出 B 的優點 | 有(「B 方案雖然交期較快」) | 沒有 |
| C4 結論對回情境條件 | 有(「本案交期不緊」) | 沒有(未提及本案的情境條件) |
| C5 標明來源或假設 | 有(「依課本表 3-2」) | 沒有 |
【位置與引句】
- 甲 C2:「經計算 A 為 48 萬、B 為 55 萬,差 7 萬」
- 甲 C4:「但本案交期不緊」
- 乙 C1:「在成本、維護、擴充三方面」
【需要你判斷的地方】
1. 甲的 C1 只列了 2 項基準,但那 2 項都用在推論上;乙列了 3 項但沒有任何一項展開。這兩種「部分符合」的性質不同,怎麼給分要你決定。
2. 乙寫「經過計算之後可以確定」——沒有算式。這算 C2 完全沒有,還是有做但沒寫?我無法判斷,建議在回饋中要求補算式。
【我沒有做的事】
- 沒有給任何分數、等第或總評。
- 沒有評論字跡、態度、用心程度,或規準以外的任何面向。
- 沒有比較甲乙誰比較好。 常見錯誤用法 叫 AI「幫我打分數」。它會給一個很像分數的數字,而你答不出它怎麼來的。 沒有規準就丟作業進去。它會用它心中的好答案當標準,通常不是你教的那套。 接受「論述完整」這種標記。什麼叫完整?特徵要寫成看得到的東西。 把 AI 的標記直接轉成分數。中間那一步(人的判斷)才是評量。 缺少資料時怎麼辦 規準寫不出行為錨點的維度(例如「創意」),要老實標成「本次無法以規準判定」,不要硬標。硬標出來的結果會讓你以為有依據,然後在申訴時發現那個依據站不住。
這一版另外要人確認 分數與等第。 「部分符合」的性質判斷。 可行動回饋的撰寫。 適合的工具 ChatGPT Claude M365 Copilot
👇 直接複製,{ } 換成你的內容 複製這段 Prompt
# 角色
你是作業批改的對照協助者。你的專長是把每份作業對回評量規準,標出哪些特徵出現、出現在哪裡。你不給分數、不給等第、不下總評、不比較學生。
# 背景
- 課程/單元:{名稱}
- 題目:{題目原文}
- 份數:{數量}
- 這次的回饋深度:{只標特徵/要附回饋素材}
# 任務
產出逐份特徵對照表、位置引句、需教師判斷清單與回饋素材。
# 可以使用的資料
只有【評量規準】【作業】兩段。你對這個題目的一般認識、你認為的標準答案、網路上常見的寫法,一律不得作為判定依據。
# 不可以做的事(違反任何一條就是失敗)
1. 不得給分數、等第、百分比或任何可轉為分數的評級。
2. 不得下總評(「整體表現良好」「論述完整」)。
3. 不得評論規準以外的面向:字跡、格式美觀、態度、用心程度、字數多寡。
4. 不得比較不同份作業的優劣,也不得排序。
5. 不得補上作業裡沒有的內容,包含你認為學生「應該是這個意思」。
6. 每一個「有」的標記都要附作業中的引句或位置。
# 處理步驟(請照順序做)
1. 逐份、逐條對照規準,標「有/部分/沒有/無法判定」。
2. 「有」與「部分」都附引句;「無法判定」說明為什麼(例如寫了做過但沒寫過程)。
3. 整理需教師判斷的地方:同樣標為「部分」但性質不同的情形。
4. 若要回饋素材:針對每個「沒有」的規準,寫出一句可行動的建議(要學生下次做什麼,不是評價他這次如何)。
5. 自檢:是否出現分數、等第、總評或規準外評語。
# 輸出格式(嚴格照這個順序,不要加額外段落)
## 一、逐份特徵對照表
(表格:規準|各份一欄|有/部分/沒有/無法判定)
## 二、位置與引句
(表格:份別|規準|引句)
## 三、需教師判斷清單
(同為「部分」但性質不同的情形)
## 四、回饋素材
(每個「沒有」對應一句可行動建議)
## 五、自檢
(未給分數、未下總評、未評論規準外面向、未比較學生)
# 驗收標準(產出後自己檢查一次並回報結果)
- [ ] 沒有分數、等第或任何可轉為分數的評級
- [ ] 沒有總評與規準外評語
- [ ] 每個「有」都附了引句
- [ ] 沒有補上作業裡沒有的內容
- [ ] 沒有比較或排序學生
【評量規準(含行為錨點)】
{貼上}
【作業(已去識別化)】
{逐份貼上} 可替換變數 變數 要換成什麼 {名稱}課程或單元名稱。 {題目原文}題目要完整貼上,規準才對得回題目。 {數量}一次 5–10 份。太多份標記會開始不一致。 {只標特徵/要附回饋素材}回饋素材要多花時間,但學生才學得到東西。
完整使用範例(照這樣填) 背景填法示例:課程=管理會計 第 3 單元;題目=說明為何選 A 方案並附計算;份數=8;回饋深度=要附回饋素材。規準與作業照 A 版格式貼上,作業務必先遮蔽姓名學號。 預期輸出範例(拿到的東西應該長這樣) 與 A 版的差別:多出「回饋素材」與「自檢」兩節。回饋素材是針對每個「沒有」寫的可行動建議——注意它寫的是「下次要做什麼」,不是「你這次哪裡不好」。這兩種寫法對學生的效果差很多。 常見錯誤用法 一次丟三十份。標到後面它會開始概括,跟人一樣會漂移。 把回饋素材直接複製給學生。那是素材,要由你依這個學生的狀況調整。 跳過「需教師判斷清單」。那幾項通常就是分數爭議會發生的地方。 缺少資料時怎麼辦 作業寫得含糊、無法判定規準是否符合時,標「無法判定」並說明原因。這比猜一個結果有用——因為那正是回饋要告訴學生的:你可能做了,但沒有寫出來,而沒寫出來的就沒辦法被評到。
這一版另外要人確認 分數與等第。 需教師判斷項目的裁量。 回饋的最終措辭與個別調整。 C C. 進階版(做成批改一致性助手) 同一份作業有多位助教共改,或每學期都要改同一類作業,要把規準與紅線固定下來。
適合的工具 自訂 GPT/Claude Project Claude Skill Copilot Studio
👇 直接複製,{ } 換成你的內容 複製這段 Prompt
# 你是誰
你是「批改對照助手」。教師或助教把已去識別化的作業貼給你,你依已核定的評量規準標出特徵。你不給分數、不給等第、不下總評、不比較學生。
# 你的資料來源
只有使用者這次貼上的作業,以及建置時附上的三份文件:本課程評量規準(含行為錨點)、校準樣本與教師標準答案標記、常見錯誤型態清單。除此之外一律不得引用,包含你對這個題目的一般認識。
# 絕對規則(違反就是失敗)
1. 不給分數、等第或任何可轉為分數的評級。
2. 不下總評,不評論字跡、格式、態度、用心、字數。
3. 不比較或排序學生。
4. 每個「有」都要附引句。
5. 作業裡沒有的內容不得補,也不得推測學生的意思。
# 條件判斷(依序檢查,先中的先套用)
1. 作業中仍可見姓名、學號、班級 → 停止作業,回覆「請先去識別化」,並列出偵測到的欄位。
2. 規準中含無法觀察的維度(創意、用心、態度)→ 標為「本規準無法以文本判定」,建議改寫或改由教師直接評。
3. 作業內容疑似整段複製(與同批其他份高度雷同)→ 只標示「與第 ○ 份高度雷同」,不判定抄襲,導向 {學術倫理窗口}。
4. 一次超過十份 → 建議分批,說明份數過多會使標記開始不一致。
5. 使用者要求給分 → 拒絕,回覆「本助手不給分;可提供特徵對照供你判分,並保留依據以備申訴」。
# 例外處理
- 使用者說「你就大概給個分我再調整」→ 拒絕。回覆「一旦有了數字,後續的判斷會被它錨定;而學生問起時,那個數字沒有依據」。
- 使用者說「這份寫得很好對吧」→ 回覆「我只能列出它符合哪些規準;好不好是你的判斷」。
- 使用者要求評論學生的學習態度 → 拒絕,回覆「態度無法從一份作業判定,本助手只對照規準」。
- 使用者要求把作業存起來當範例 → 提醒需取得學生同意並去識別化。
# 每次回覆的格式
【去識別化檢查】通過/偵測到 N 個未遮蔽欄位
【特徵對照表】(有/部分/沒有/無法判定)
【位置與引句】
【需教師判斷】(性質不同的「部分符合」)
【回饋素材】(每個「沒有」一句可行動建議)
【與校準樣本的一致性】(本批標記是否與樣本標準一致)
【自檢】(未給分、未總評、未評論規準外面向、未比較)
# 固定結尾
每次回覆最後一行固定加註:「本對照依 {規準版本};分數與回饋由 {權責} 決定並負責說明。本助手不給分、不排序。」
# 自我檢查(每次回覆前執行,不需輸出過程)
- 是否出現數字評級?有就刪。
- 是否出現規準以外的評語?有就刪。
- 每個「有」是否附引句?沒有就補。
# 建置參數
評量規準(含錨點):{附檔,含版本}
校準樣本與教師標記:{附檔}
常見錯誤型態清單:{附檔}
學術倫理窗口:{窗口}
權責:{職稱} 可替換變數 變數 要換成什麼 {附檔,含版本}規準要有版本,因為校準之後常會修。 {附檔}校準樣本(含教師自改的標記)與常見錯誤清單。 {窗口}疑似抄襲要導向誰。 {職稱}誰給分、誰對學生說明。
完整使用範例(照這樣填) 建置時把三份文件上傳為知識檔案。上線前用至少二十份歷史作業測過,其中五份要刻意含陷阱:一份未遮蔽姓名學號、一份要求它給分、一份規準含「創意」、兩份內容高度雷同,確認它分別停止作業、拒絕給分、標為無法判定、只標雷同而不判定抄襲。 預期輸出範例(拿到的東西應該長這樣) 與 B 版的差別:這一版會拿校準樣本回頭檢查自己——「本批的標記是否與教師樣本一致」。這是防漂移的機制:人改到第三十份會漂移,AI 標到第三十份也會,差別在於這一版每批都回頭對一次樣本。 固化成助手是另一件工程,這一頁不重講 下面這幾題每個方法都一樣,站上各有一篇:
07 產出應該長什麼樣拿到的東西要長這樣 五節:逐份特徵對照表、位置與引句、需教師判斷清單、回饋素材、自檢。全篇不得出現分數、等第或總評。
完成品:校準比對抓到的兩個問題 把 AI 對五份校準樣本的標記,跟教師自己改的結果擺在一起。
─────────────────────────────
【樣本 3|不一致:C1】
教師標記:部分
AI 標記:有
作業原文:「A 在成本、時程、後續維護上都較 B 為佳。」
爭點:規準寫「至少三項具體項目」。學生確實列了三個詞,但沒有任何一項展開說明。
教師的認定:列出詞不等於列出基準,要有比較的內容才算。
AI 的認定:出現三個項目名稱=符合。
處置:**規準沒寫清楚,回頭修規準**(不是回頭調 AI)。
修訂後:「C1 有列出兩案的比較基準至少三項,且每項須有具體比較內容(數值、程度或事實),僅列項目名稱不計入。」
※ 修訂後重跑,AI 對樣本 3 改標為「部分」,與教師一致。
─────────────────────────────
【樣本 5|不一致:C2】
教師標記:有
AI 標記:部分
作業原文:「48 − 55 = −7(萬元)」
爭點:算式完整但沒有寫出「48 是 A、55 是 B」。
教師的認定:前文已說明何者為 A、何者為 B,算式可讀。
AI 的認定:算式本身未標示對象。
處置:這一項是 AI 太嚴格,**規準補一句說明範圍**:「C2 之判定得參照前後文,不以算式單獨呈現為限。」
─────────────────────────────
【校準結論】
五份中兩份不一致,兩次都是規準寫得不夠精確——不是 AI 標錯,也不是教師標錯。
這正是校準要做在批改之前的原因:如果直接改完八十份才發現 C1 有兩種理解,那八十份都要重看。
【修訂後的一致性】
重跑五份校準樣本,五份全部一致。規準升為 v2,本次批改採用 v2。 輸出格式規格(要照著做的人再展開) 標記只有四種:有/部分/沒有/無法判定。 每個「有」與「部分」都要附作業中的引句或位置。 回饋素材寫成「下次要做什麼」,不是「你這次哪裡不好」。 需教師判斷清單要說明爭點,例如「兩份都標部分,但性質不同」。 自檢固定出現:未給分、未總評、未評論規準外面向、未比較學生。 ## 一、逐份特徵對照表
| 規準 | 甲 | 乙 | 丙 |
|---|---|---|---|
| C1 比較基準 ≥ 3 項 | 部分(2 項) | 有(3 項) | 有(4 項) |
| C2 計算過程完整 | 有 | 沒有 | 部分(有算式但缺單位) |
| C3 指出 B 的優點 | 有 | 沒有 | 有 |
| C4 結論對回情境 | 有 | 沒有 | 沒有 |
| C5 標明來源或假設 | 有 | 沒有 | 有 |
## 二、位置與引句
| 份別 | 規準 | 引句 |
|---|---|---|
| 甲 | C2 | 「經計算 A 為 48 萬、B 為 55 萬,差 7 萬」 |
| 甲 | C4 | 「但本案交期不緊」 |
| 丙 | C2 | 「48 − 55 = −7」(未標單位) |
## 三、需教師判斷清單
1. 甲的 C1 只有 2 項基準,但兩項都用在推論上;乙有 3 項卻沒有任何一項展開。兩者都是「部分」,性質不同。
2. 丙的 C2 有算式但缺單位——這算完整還是部分?規準未定義是否要求單位,建議補進規準。
## 四、回饋素材
| 份別 | 缺的規準 | 可行動建議 |
|---|---|---|
| 乙 | C2 | 「下次請把算式寫出來(例如 A:48 萬、B:55 萬,差額 7 萬)。只寫『經計算』的話,讀的人無法確認你算了什麼。」 |
| 乙 | C4 | 「結論請對回題目給的條件——本案的交期與預算限制,分別支持哪一個方案?」 |
| 丙 | C4 | 「你的比較很完整,但沒有回到本案情境。請在結論加一句:在本案的交期條件下,這個差額代表什麼。」 |
## 五、自檢
- 未給分數、等第或任何可轉為分數的評級:是
- 未下總評、未評論字跡格式態度用心字數:是
- 未比較或排序學生:是
- 每個「有」與「部分」皆附引句:是 08 工具怎麼挑這幾支都做得到——差別在你手上有哪一支、資料能不能外流。標「起手」的是不知道從哪支開始時的建議,不是限定。
工具 什麼時候用 為什麼 注意 ChatGPT ↗ 起手 對照規準標特徵 對照規準標特徵、產回饋素材 逐條對照並附引句的穩定度不錯。 作業含個資,未去識別化不得貼入;也不要用會被納入訓練的帳號。 Claude ↗ 作業長、論述型 長文逐段處理較不會漏掉中段論述。 同樣要確認資料處理政策與保存期限。 M365 Copilot ↗ 學校或機構已導入 M365,作業在內部系統 資料不出租戶,較適合含學生資料的檔案。 權限範圍要確認,避免讀到其他班級的資料。 自訂 GPT/Claude Project 多助教共改 多位助教共改或每學期重複 規準與校準樣本固定,不同人標出來的一致。 規準改版要同步知識檔案。 Gemini ↗ 讀 Google Classroom 的作業 作業與測驗收在 Google Classroom 或表單 作答資料不必匯出,就地對照評分規準標特徵。 標特徵可以,給分不行——分數要人給,而且要說得出依據。
沒建過助手?先看這三篇 上面表格裡的「自訂 GPT/Project」「Claude Skill」「Copilot Studio」是三種裝法,不是三個要學的技術。第一次做的人先看這幾篇,知道它們是什麼、在哪裡建、要不要付費,再回來這一頁。
四、不要做錯 這幾關不下放
這一區是踩過的坑與該守的線。標「不下放」的步驟請不要交給 AI 決定;Checklist 是拿來驗收的,不是拿來勾好看的。
09 會卡住與會做錯的地方會卡住的地方(流程困難點)
標準會漂移 改到第三十份,你對「說明清楚」的門檻已經跟第一份不同。而學生會拿彼此的作業比對。
AI 直接給分很誘人 它給的數字看起來很合理。但學生問「為什麼是 72 分不是 78 分」的時候,你沒有東西可以拿出來。
規準寫成形容詞 「論述完整」——什麼叫完整?助教甲跟助教乙的完整不是同一件事。
回饋不可行動 「寫得不錯,繼續加油」——學生看完不知道下次要改什麼。 會做錯的地方(常見失敗方式) AI 直接給分 數字看起來很合理,但申訴時答不出它怎麼來的。
怎麼修 輸出限定四種標記 + 附引句;分數由人給,依據是對照表。
規準寫成形容詞 「論述完整」讓每個助教有自己的理解,分數加不起來。
怎麼修 每個等第寫成可觀察的表現特徵;校準不一致時修規準。
沒有校準就開改 改完八十份才發現規準有兩種理解,全部要重看。
怎麼修 先自己改五份,AI 標記與之比對,不一致處先修規準。
回饋不可行動 「寫得不錯,繼續加油」,學生不知道下次要改什麼。
怎麼修 每個「沒有」對應一句「下次要做什麼」的具體建議。
10 人工把關與安全限制AI/Agent/Tool 介入在哪幾步 流程位置 誰 做什麼/怎麼做 標記階段 AI 對照規準標出現的特徵 只標「這個特徵有/沒有/部分」,並附作業中的位置或引句。不給分數、不給等第、不下總評。校準階段 Human 用五份樣本比對 AI 標記與教師自改結果逐項比對,不一致處回頭修規準,不是回頭改 AI。掃描階段 Agent 一致性與越權評語掃描 檢查同一特徵在不同份的標記是否一致,以及是否出現規準以外的評語(例如「態度不佳」)。
這幾關不下放
規準與錨點 要評什麼、什麼算達標,是教學判斷。
分數 AI 不給分。分數要有人負責,也要能對學生說明。
回饋內容 可行動的回饋需要理解這個學生的狀態,AI 只能提供素材。
申訴處理 學生來問時,依據是特徵對照表與規準,不是「系統算的」。 安全與權限限制
學生作業是個資 姓名、學號、班級要先遮蔽;使用哪些帳號、保存多久、何時刪除,依所屬機構規定辦理。
不得作為訓練資料 選用服務時要確認內容不會被納入模型訓練;作業要留作範例須另取得同意並去識別化。
疑似抄襲不由 AI 認定 只標示雷同,學術倫理的認定與程序由權責單位處理。 11 Checklist 與驗收標準做的時候逐項打勾 做完了才檢查:全部成立才算完成 所有作業都已去識別化,輸出中沒有出現姓名、學號或班級。 AI 未給分數、等第或任何可轉為分數的評級。 沒有總評,也沒有評論字跡、格式、態度、用心、字數。 每個「有」與「部分」都附了作業中的引句或位置。 已用至少五份校準樣本比對,不一致處已回頭修訂規準並重跑。 分數由教師給出,且抽驗十份確認分數與特徵標記一致。 回饋寫成「下次要做什麼」的可行動建議。 疑似雷同的情形僅標示,未由 AI 判定抄襲。 五、延伸 把流程走一遍,然後往下一步
先用一個示範情境把流程從頭走一遍,再看具名機構真的做過的事,最後決定下一步往哪走。
12 示範情境改到第三十份,你已經不是第一份的那個標準了
這是示範情境,不是真實個案:作者為了把上面的流程走一遍而寫的設想,人物、數字與結果都是設定。真的有人做過的案例,看下面「真的有人這樣做過」。
設想的狀況: 一疊八十份的申論作業,改到後段開始出現學生申訴:「他那樣寫有分,我為什麼沒有」。回頭看,兩份確實寫得差不多,但一份改在第五份、一份改在第六十份。中間發生的不是偏心,是標準漂移。
AI 負責什麼 逐份對照規準,只標「有/部分/沒有/無法判定」四種,每個標記附作業中的引句。 指出兩份同樣標為「部分符合」但性質不同的情形,交給教師判斷。 把規準未定義的爭點標出來(算式缺單位算不算完整),建議補進規準。 針對每個「沒有」產出一句可行動的回饋素材,寫成「下次要做什麼」。 人負責什麼 先自己改五份當校準樣本,含一好一差三中間——中間那三份才測得出標準在哪。 把 AI 對這五份的標記跟自己的比對,不一致的地方回頭修規準(而不是回頭調 AI)。 所有分數由自己給,依據是特徵對照表。 抽驗十份,確認分數與標記一致,沒有出現「特徵一樣但分數不同」的情況。 照著走完會得到: 學生來申訴時,能拿出來的不是「系統算的」,是「你的作業裡沒有出現 C4 這個特徵,這是規準第四條」。有沒有這張表,決定了申訴是討論還是爭執。
待補資料:本站不提供批改時間縮短幅度、評分信度等量化數據,本例為說明用的示意情境。學生作業涉個資,處理方式請依所屬機構規定辦理。
真的有人這樣做過?外部佐證 目前沒有找到可公開查證的外部案例。這類工作多半不會有人發新聞稿,找不到不代表沒人做——但在找到之前,這一頁的方法就是作者自己的做法,不借別人的名義。
去找靈感看其他方法的外部案例 →
13 相關方法與下一步批改結果回頭修教材 同一個規準大家都沒拿到,通常是教材的問題不是學生的問題。
出題與規準要一起設計 題目怎麼問,決定規準能不能寫得出來。
把規準版本管好 規準會隨校準修訂,用錯版本等於用錯標準。
可直接使用RELATED PROMPTS Download 這個方法的模板與 Checklist 下載包整理中——訂閱更新 ,上架後第一時間通知你。
這個站的做法 有來源 引用的案例都附得出可以點進去的出處;還沒查證完的另外標示,不跟已證實的混在一起。 可驗收 每個方法都附 Checklist 與驗收標準——你要能自己驗,而不是相信 AI 說它做完了。 不亂編 指令一律要求「材料裡沒有的不准補」,缺的標【待補】列成問題,不用漂亮的句子蓋過去。 不自動送出 站內的指令與工具不會替你發布、寄出或執行收不回來的動作。最後一步永遠是人按下去。 人要把關 方法裡標「不下放」的步驟,寫明白就是不要交給 AI 決定。 一般人照做 不用寫程式。步驟寫成照著做的樣子,術語第一次出現就用白話解釋。
取得 AI 實戰工具與更新
之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;送出後會收到一封確認信,點了連結才算訂閱成功 ,之後每封信都附一鍵退訂。
送出即表示你同意本站的 隱私權說明 :我們只儲存 Email 與同意版本,不會把 Email 和你的閱讀紀錄綁在一起。沒有點確認信就不會收到任何內容,之後也隨時可以一鍵退訂。