2026年8月15日 星期六

AI輔助自我調節與精熟學習循環

生成式AI可以快速解釋知識、回答問題、產生題目及提供回饋。然而,學生「得到答案」或「當下答對」,不代表已真正學會。學習者也可能因AI解釋得十分流暢,誤以為自己已充分理解,形成「看懂等於學會」的錯覺。

因此,AI輔助自學不應只是:

學生提問 → AI提供答案。

比較完整的模式應包含:

目標設定 → 能力診斷 → 學習者先嘗試 → AI提供適應性支援 → 刻意練習 → 回饋與反思 → 無支架檢核 → 延宕與遷移驗證 → 外部驗證與持續調整。

我將此模式稱為:

AI輔助自我調節與精熟學習循環

英文名稱為:

AI-Supported Self-Regulated Mastery Learning Cycle

這個循環的目的,不是讓AI替學習者完成任務,而是協助學習者:

  1. 了解自己需要學會什麼;

  2. 確認目前能力與目標之間的差距;

  3. 透過適當的練習與回饋修正問題;

  4. 最後在沒有AI支架的情況下,仍能獨立完成任務。

圖1 AI輔助自我調節與精熟學習循環(四個Phase與九個Stage

AI依據學習目標、學習者表現、信心及可能的錯誤原因,提供適量的scaffolding與formative feedback。學習者通過無支架Stage-Gate後,再接受延宕、遷移及真實任務驗證;驗證結果則用於更新後續學習策略,形成持續校準的閉環。

圖中的實線箭頭呈現主要學習循環;由Phase 4向Phase 1–3延伸的淡色虛線,表示外部校準並非只能在最後進行。當AI無法提出充分依據、學習者持續未達標,或任務涉及高風險判斷時,任何Stage均可提前啟動外部驗證或轉介。

本文提出的是一套整合Self-Regulated Learning、Mastery Learning、Deliberate Practice、Retrieval Practice、Scaffolding、Metacognitive Calibration與Transfer of Learning等概念的初步conceptual framework。各項組成具有相關理論與研究基礎,但整體「四個Phase/九個Stage」模式的feasibility與effectiveness,仍需進一步透過實證研究驗證。

若只想快速了解本架構,可閱讀圖1、四個Phase總覽及九個Stage總表;若要實際應用於教學或自學,可繼續閱讀後續的錯誤分析、Stage-Gate、風險分級及操作Prompt。


一、四個Phase與九個Stage

本架構包含四個Phase:「目標與診斷」、「嘗試與精進」、「獨立與遷移」及「外部校準」。四個Phase與九個Stage的對應如下:

表1 四個Phase與九個Stage之對應
Phase Stage 核心問題
Phase 1:目標與診斷 1–2 要學會什麼?目前差距在哪裡?
Phase 2:嘗試與精進 3–6 為何出錯?需要什麼支援與練習?
Phase 3:獨立與遷移 7–8 沒有AI後,能否維持並應用?
Phase 4:外部校準 9 AI與自我判斷是否可信?

九個Stage的具體任務如下:

表2 九個Stage的主要任務、AI協助與學習者責任
Stage 主要任務 AI可以提供的協助 學習者的責任
1. 界定目標與標準 確認需要學會的knowledge、skills及attitudes 整理學習目標、rubric、範例及常見錯誤 理解目標,確認何種表現才算達標
2. 基線能力與信心評估 評估先備知識、目前能力及自我判斷 產生診斷題,分析答案、理由及信心 先作答,說明理由並評估信心
3. 學習者先嘗試 在AI講解前先完成任務 暫不提供完整答案,以問題引導思考 提出自己的答案、推理及困難
4. 錯誤機制分析與支架配置 推測錯誤原因及所需協助程度 蒐集表現證據,提供提示、範例或任務拆解 使用必要支架修正理解,而非直接抄錄答案
5. 刻意練習與依表現證據的回饋 針對弱點進行反覆且有目的的練習 依rubric指出具體證據、優缺點及修改方式 根據回饋修正並再次練習
6. 自我解釋、反思與校準 將錯誤轉化為下一次可使用的判斷規則 引導結構化反思,比較信心與實際表現 說明錯誤原因、修正原則及下一步
7. 無支架Stage-Gate 確認能否獨立完成新的平行任務 提供parallel forms,不給提示或答案 在沒有AI協助下完成任務並說明理由
8. 延宕、遷移與真實任務 檢查所學能否保留並應用於新情境 安排延宕測驗、跨情境案例及模擬任務 將所學遷移至不同問題或臨床情境
9. 外部驗證、更新或轉介 確認AI與自我判斷是否可信 整合外部效標並標示不確定性 與教材、文獻、教師或真實表現比對

九個Stage與Self-Regulated Learning的對應

本架構可與Self-Regulated Learning的三個主要歷程相互對照:

  • Forethought:目標設定、標準確認、基線評估及信心判斷;

  • Performance:先嘗試、支架配置、刻意練習、自我監控及策略使用;

  • Self-reflection:錯誤歸因、表現校準、外部驗證及策略更新。


二、為什麼一定要「先嘗試,後支援」?

如果學生一開始就要求AI提供完整解釋或答案,可能產生熟悉感,卻未必形成能自行提取與應用的知識。

因此,AI教練應先要求學生:

  • 用自己的話解釋概念;

  • 提出初步答案;

  • 說明判斷理由;

  • 評估答案信心;

  • 指出最不確定的部分。

例如,與其直接問AI「什麼是standard deviation?」,可以改成:

請先讓我用自己的話解釋standard deviation,並舉一個OT評估分數的例子。請不要立刻告訴我答案;先用Socratic Questioning檢查我的理解,再根據我的錯誤提供最少且必要的提示。

這樣才能觀察學習者真正理解多少,而不是只確認學習者能否看懂AI的解釋。


三、一個微型案例:解讀RCT研究結果

任務

OT學生需要完整解讀一篇RCT主要結果的statistical significance、effect size、precision及clinical importance。

表3 以解讀RCT研究結果為例的九個Stage學習活動
Stage 學習活動示例
1. 界定目標 能整合解釋effect estimate、95% CI、p value及clinical importance。
2. 基線評估 學生先判斷研究結果是否具有統計與臨床意義,並報告自己的信心程度。
3. 先嘗試 學生在AI提供解釋前,先以自己的話解讀表格及主要研究結果。
4. 錯誤分析 發現學生僅依p value判斷介入「有效」,未整合effect estimate、95% CI、clinical importance及研究限制。
5. 支架與練習 AI先以提示問題引導學生整合各項資訊,不直接公布完整答案;再針對未理解的部分安排練習。
6. 反思與校準 學生修正原本的解釋,說明錯誤原因,並形成可重複使用的研究結果判讀規則。
7. 無支架檢核 學生在沒有AI提示下,獨立解讀另一篇RCT的主要研究結果,並說明判斷理由。
8. 延宕與遷移 一週後解讀不同疾病、研究主題或介入領域的研究結果,確認是否能保留並遷移所學。
9. 外部驗證 將學生的解讀與原始論文、教師評分、rubric及正確的統計判讀原則進行比對。

實際的Stage-Gate通過標準

例如:

在沒有AI提示下,學生須正確解讀另一篇RCT的主要結果,並依序說明effect estimate、95% CI、p value及clinical importance;不得將statistical significance直接等同於clinical importance。

如此,案例便不只是活動流程,也示範如何將抽象的mastery轉化為observable performance criteria。


四、AI應先蒐集證據,再推測可能的錯誤原因

相同的錯誤答案,背後原因可能完全不同。因此,AI不應對所有錯誤都提供相同的解釋。

表4 可能的錯誤類型與適合的AI介入方式
可能的錯誤類型 適合的AI介入
知識不足 提供核心概念與最少必要教材,協助學習者補足完成任務所需的基礎知識。
存在錯誤概念 使用反例、概念比較及conceptual conflict,引導學習者察覺原有理解與證據之間的不一致。
知道但提取失敗 安排retrieval practice及spaced practice,增加學習者主動提取與延宕後再次提取的機會。
判斷規則不清楚 協助建立decision rule或checklist,將抽象原則轉化為可以重複執行的判斷步驟。
只會原題、無法遷移 提供表面特徵不同但核心原理相同的新案例,檢查學習者能否辨識並應用相同原則。
程序遺漏或粗心 使用流程提示及self-check checklist,要求學習者在提交答案前逐項確認必要步驟。
過度自信 比較主觀信心與客觀表現,並要求學習者提出支持答案的具體證據。
過度依賴AI 逐步撤除scaffolding,增加無AI提示的任務,確認學習者能否獨立完成。
AI無法提出充分依據 明確標示不確定性與缺少的資訊,停止作出確定判斷,並轉介教師、專家或其他可信來源。

AI對錯誤原因的判斷應被視為需要後續驗證的假設,而不是確定的診斷。

因此,AI的核心角色不是「快速給答案」,而是:

分析學習表現、形成錯誤原因假設、選擇適當支架、安排針對性練習,並在適當時機撤除支架。


五、自我檢核不能只有答對率

較完整的自我檢核,至少應包含四種證據:

表5 自我檢核的四種證據
檢核面向 核心問題
表現 我是否答對問題,或依照預定標準完成任務?
理由 我能否說明為何作出這項判斷,而不只是猜對答案?
信心 我對答案有多大信心?我的信心程度是否符合實際表現?
獨立性 沒有AI提示、範例或即時修正時,我是否仍能獨立完成?

每次重要練習後,可以固定記錄:

  1. 我的答案或實際表現;

  2. 我的判斷理由;

  3. 我的信心程度(0–100分);

  4. AI的評分及其具體證據;

  5. 我真正或可能的錯誤類型;

  6. 下一次遇到類似任務時,我要先檢查什麼。

其中第六項特別重要,因為它能將一次錯誤轉化為未來可以遷移的decision rule。

每次作答後,學習者可將0–100分的信心與答案正確性、理由品質及無支架表現比較:

  • 高信心但表現錯誤:可能存在過度自信或較穩固的錯誤概念;

  • 低信心但表現正確:可能需要增加retrieval practice及應用練習;

  • 高信心且表現正確:仍須經由無支架、延宕及遷移任務確認;

  • 低信心且表現錯誤:通常需要補充核心知識與較明確的scaffolding。


六、Stage-Gating:不是一次答對就算精熟

Stage-Gating是指:學習者必須符合預先設定的標準,才能進入下一階段。

單次測驗答對80%,不足以證明已經精熟。較嚴謹的通過標準可以包含:

  • 知識測驗達到預定門檻;

  • 關鍵安全題全部答對;

  • 能用自己的話說明理由;

  • 能辨識常見錯誤;

  • 能應用於未見過的新案例;

  • 在沒有AI提示下仍能完成;

  • 延宕一段時間後仍能維持表現;

  • 自我信心與客觀表現沒有明顯落差。

通過標準可分為三類:

表6 Stage-Gate的三類通過標準
標準類型 判定重點與範例
必要門檻 總分達到預先設定的標準;關鍵安全題必須全部正確。
品質條件 判斷理由合理且具有證據支持;沒有重大概念錯誤或關鍵資訊遺漏。
獨立性條件 在沒有AI提示、範例或即時修正的情況下完成任務,並能處理未見過的新案例。

進一步的操作模板如下:

學習者須在無AI提示下,於兩個parallel tasks中達到預定rubric標準;關鍵安全項目須全部通過,並能說明主要判斷理由,才可進入延宕與遷移階段。

「80%」只能作為示例,不是普遍適用的mastery標準。實際門檻應依任務內容、風險程度及錯誤後果設定。涉及病人安全的項目通常屬於non-compensatory criteria,不能由其他項目的高分抵銷。

如果未達標,系統不應只重複原題,而應回到錯誤分析,重新選擇練習方式及支架強度。

支架配置的執行順序

AI可以依下列順序,從最低程度的協助開始:

  1. 要求學習者重新檢查;

  2. 提出Socratic question;

  3. 指出錯誤可能出現的範圍;

  4. 提供部分提示或decision rule;

  5. 提供worked example;

  6. 最後才提供完整解釋。

基本原則是:

AI應從最低層級的有效支援開始;只有在學習者仍無法進展時,才提高支架強度。


七、需要兩種不同速度的循環

AI輔助學習可區分為「快速學習循環」與「慢速驗證循環」。

表7 快速學習循環與慢速驗證循環之比較
循環 執行頻率 主要功能
快速學習循環 每題或每次練習 即時分析學習表現,提供提示、形成性回饋與修正機會。
慢速驗證循環 數日、數週或課程結束後 檢查學習內容的延宕保留、跨情境遷移、獨立性及真實任務表現。

AI可以頻繁執行快速循環,但學習者是否真正形成穩定能力,應由慢速驗證循環判定。

在AI提示下當下答對,不等於學會;經過一段時間後,面對新的問題,在沒有AI協助時仍能正確完成,才比較接近真正的能力。

何時結束或改變循環?

可能有三種情況:

  • 達標:進入延宕與遷移驗證;

  • 部分達標:縮小弱點範圍後繼續練習;

  • 持續未達標或AI無法提出充分依據:轉介教師、同儕、專家或其他可信教材。

因此,Stage 9的外部驗證與轉介應視為所有Stage均可啟動的安全出口,而不只是循環的最後一步。


八、精熟學習的判定

本循環所稱的「精熟表現」,不只是能回答正確答案,而是同時具備:

正確性 × 可解釋性 × 遷移性 × 獨立性 × 維持性

這裡的乘號是概念性表示,意指五個面向相互依賴,並非實際的數學計分公式。任一關鍵面向明顯不足,均不宜直接判定為精熟。

也就是說,學習者需要:

  • 知道正確內容;

  • 能說明判斷理由;

  • 能應用於不同情境;

  • 沒有AI協助時仍能完成;

  • 經過一段時間後仍能維持。

精熟程度可進一步區分為:

  • Stage 7通過——初步精熟(provisional mastery):證明學習者當下可以無支架獨立完成;

  • Stage 8通過——可維持且可遷移的精熟(retained and transferable mastery):證明能力可以延宕保留、跨情境遷移或應用於真實任務;

  • 最終精熟判定:應至少納入Stage 8的結果,必要時再由外部效標、教師或專家確認。


九、AI評分不等於最終能力判定

AI適合提供頻繁且低成本的formative feedback,但仍可能出現:

  • 評分標準不一致;

  • 過度肯定學習者;

  • 誤解語境或任務要求;

  • 提供看似具體但缺乏充分依據的回饋;

  • 對高風險臨床判斷提出錯誤建議。

因此,AI評估結果應盡量附上:

  1. 使用的rubric或判準;

  2. 支持評分的具體表現證據;

  3. 尚未取得的必要資訊;

  4. 評估的不確定性;

  5. 是否需要教師或專家覆核。

安全性與任務風險分級

表8 任務風險分級、AI角色與最終判定方式
任務風險 AI適合的角色 最終判定
低風險 題目生成、基礎知識練習、即時提示及形成性回饋。 可主要由AI協助,但學習者仍應保留基本查證責任。
中風險 學術寫作、案例推理、技能模擬,以及依rubric提供初步評分與回饋。 採用AI、明確rubric及抽樣人工覆核;重要結果仍需人工確認。
高風險 臨床決策、病人安全、資格認證、summative assessment及其他可能造成重大後果的任務。 必須由教師、合格專家或具正式權責者作出最終判定;AI只能提供輔助資訊。

此分級可以避免將AI形成性評量直接當成summative assessment、專業認證或clinical decision-making的唯一依據。


十、讀者可直接使用的Prompt

我要學習【填入主題或技能】。請依照「AI輔助自我調節與精熟學習循環」帶領我:

  1. 先和我確認具體的學習目標與達標標準;

  2. 使用診斷題評估我的答案、理由及信心;

  3. 在我先作答前,不要提供完整答案;

  4. 請根據我的實際表現,提出一至兩項可能的錯誤原因假設,不要把推測當成確定診斷;

  5. 從最低程度的提示開始,只有在我仍無法進展時才增加支架;

  6. 依rubric及我的具體表現證據,指出優點、問題及修改方法;

  7. 要求我說明錯誤原因,並形成下一次可以使用的判斷規則;

  8. 最後使用未見過的parallel task進行無提示檢核;

  9. 協助我規劃數日後的延宕測驗及不同情境的遷移任務;

  10. 若內容涉及高風險判斷、資訊不足或你無法提出充分依據,請明確標示不確定性,並建議適當的外部查證方式。

請一次只進行一個步驟,不要一次公布完整答案及所有後續題目。

備註:真正的延宕測驗不能在同一次對話立即完成,必須在數日或數週後重新進行;若AI系統無法主動提醒,學習者應自行設定日期或行事曆提醒。


十一、理論基礎與延伸閱讀

理論與學習原理對照

表9 架構成分與主要學習理論或學習原理之對應
架構成分 主要理論或學習原理
目標設定、學習監控與反思 Self-Regulated Learning
先嘗試與無支架測驗 Retrieval Practice
根據學習表現配置適量協助 Scaffolding
隨能力進展逐步撤除提示 Fading
針對具體弱點進行反覆練習 Deliberate Practice
達到預定標準後進入下一階段 Mastery Learning
經過一段時間後進行延宕測驗 Retention
將所學應用於新案例及真實任務 Transfer of Learning
比較主觀信心與客觀表現 Metacognitive Calibration

主要概念中英對照

  • 評分規準(rubric)

  • 平行任務或平行測驗(parallel tasks/parallel forms)

  • 階段通過關卡(Stage-Gate)

  • 判斷規則(decision rule)

  • 支架(scaffolding)

  • 支架逐步撤除(scaffolding fading)

  • 提取練習(retrieval practice)

  • 間隔練習(spaced practice)

  • 初步精熟(provisional mastery)

  • 可維持且可遷移的精熟(retained and transferable mastery)

  • 後設認知校準(metacognitive calibration)

代表性文獻

Bjork, R. A., Dunlosky, J., & Kornell, N. (2013). Self-regulated learning: Beliefs, techniques, and illusions. Annual Review of Psychology, 64, 417–444. https://doi.org/10.1146/annurev-psych-113011-143823

Dunlosky, J., Rawson, K. A., Marsh, E. J., Nathan, M. J., & Willingham, D. T. (2013). Improving students’ learning with effective learning techniques: Promising directions from cognitive and educational psychology. Psychological Science in the Public Interest, 14(1), 4–58. https://doi.org/10.1177/1529100612453266

Ericsson, K. A., Krampe, R. T., & Tesch-Römer, C. (1993). The role of deliberate practice in the acquisition of expert performance. Psychological Review, 100(3), 363–406. https://doi.org/10.1037/0033-295X.100.3.363

McGaghie, W. C. (2015). Mastery learning: It is time for medical education to join the 21st century. Academic Medicine, 90(11), 1438–1441. https://doi.org/10.1097/ACM.0000000000000911

Pan, S. C., & Rickard, T. C. (2018). Transfer of test-enhanced learning: Meta-analytic review and synthesis. Psychological Bulletin, 144(7), 710–756. https://doi.org/10.1037/bul0000151

Roediger, H. L., III, & Karpicke, J. D. (2006). Test-enhanced learning: Taking memory tests improves long-term retention. Psychological Science, 17(3), 249–255. https://doi.org/10.1111/j.1467-9280.2006.01693.x

van de Pol, J., Volman, M., & Beishuizen, J. (2010). Scaffolding in teacher–student interaction: A decade of research. Educational Psychology Review, 22, 271–296. https://doi.org/10.1007/s10648-010-9127-6

Zimmerman, B. J. (2002). Becoming a self-regulated learner: An overview. Theory Into Practice, 41(2), 64–70. https://doi.org/10.1207/s15430421tip4102_2


十二、結語

生成式AI最有價值的教育角色,不是成為無所不答的「答案機」,而是成為能適時提問、分析錯誤、配置支架、提供回饋及安排再練習的「學習教練」。

但是,AI不應成為唯一的能力判定者。學習是否真正發生,仍需透過無支架表現、延宕保留、跨情境遷移、外部標準及真實任務加以驗證。

因此,較理想的AI輔助自學模式是:

學習者先思考與嘗試,AI依據實際表現推測可能的錯誤原因,並提供適量支援;支援再逐步撤除,最後由學習者以獨立、可維持且可遷移的表現,證明自己真正學會。

這樣的AI,才不只是幫助學生「完成這一次任務」,而是協助學生逐步發展「下一次能夠自己完成」的能力。


相關貼文



ChatGPT Work 幫忙整理這個 blog

 若用一句話概括,這個 Blog 是:

一位職能治療學者從psychometrics與神經復健研究出發,逐步擴展至研究人才培育、臨床技能教育與生成式AI應用的17年公開學術工作誌。

它同時具有四種功能:

  1. Research notebook:保存尚在形成中的研究問題與方法構想。
  2. Teaching archive:累積可供學生、研究助理及年輕研究者使用的教材。
  3. Mentoring record:呈現您對研究訓練、能力發展與學術生涯的長期觀點。
  4. Intellectual autobiography:記錄研究專長由psychometrics、CAT、AI,到virtual patient與AI Agent的演變。



最值得注意的是:

主軸其實沒有因AI出現而中斷。近年的生成式AI研究,仍延續早期一貫關注的問題——如何建立可信的評估、如何提升學習者能力、如何提供有效回饋,以及如何將研究成果轉化為臨床與教學可使用的方法。

2026年7月27日 星期一

準備演講的流程與修改: Codex 應用

7月26日的演講(主題:AI 浪潮中 OT 教師之教學與學習策略),我跟 Codex 協作,約準備一個月

Q1: [請依據時間序還有整個工作流程,綜合說明這個專案的工作流程。重點即可]

Q2: [請依據上述流程,給予建議,以利後續更有效能。]

Q3: [請將你建議的流程,設計成 skill 以便後續(全域)應用]

--------------------------------------------------------------------

Q1: [請依據時間序還有整個工作流程,綜合說明這個專案的工作流程。重點即可]

Codex: 這個專案不是單純製作簡報,而是「需求盤點 → 實證搜尋 → 教學策略設計 → 案例整合 → 簡報驗證」的完整流程。

  1. 6/22|確認需求

    • 盤點生成式 AI/Agent 在 OT 教學與研究的應用。
    • 設計問卷與 Google Form,了解教師使用情形、需求與顧慮。
  2. 6/26|確認對象

    • 依會議名單整理參與教師與聯絡資料,建立聽眾/學員輪廓及後續資料傳遞管道。
  3. 6/29–6/30|建立簡報主架構

    • 製作初稿、Slido 互動題與逐頁講稿。
    • 依 50 分鐘演講時間及聽眾特性反覆調整。
    • 主軸由「介紹 Agent」轉為:
      學生如何使用 AI → 教師如何重設作業與評量 → AI/Agent 如何支援教師工作。
  4. 7/14–7/15|建立實證基礎

    • 系統性搜尋 PubMed、ERIC,共整理 2,891 筆資料。
    • 篩選出 105 篇核心實證研究,完成全文蒐集、分類與證據矩陣。
    • 將研究整理成可供簡報使用的主題與應用場景。
  5. 7/22–7/24|針對核心問題補強證據

    • 補充 AI 對作業效度、評量公平與偵測偏誤的研究。
    • 更新 2025–2026 年學生 AI 使用與學習成效資料。
    • 將複雜研究結果轉成教師可採用的作業、回饋及評量策略。
  6. 7/23–7/25|加入 OT 實作案例

    • 將研究重新整理成七類應用場景。
    • 分析自己的四篇 GPT 應用研究,形成由簡到繁的技術路徑:
      提示工程 → Custom GPT → 虛擬病人/考官 → 語音臨床工作流程。
  7. 7/26|最終整合與品質檢查

    • 審閱原本 68 張簡報,將現場主線精簡為 29 張。
    • 另保留 37 張研究、技術與資源備查資料,最終共 67 張。
    • 統一視覺、頁碼、術語、引用與風險表述,並完成逐頁渲染及版面檢查。正式版從第 30 張起進入補充資料:AI浪潮中OT教師之教學與學習策略_統一修訂版.pptx (投影片 30)

一句話概括:

先了解教師與學生面臨的 AI 教學問題,再以文獻和 OT 實作案例建立策略,最後轉化成可現場講授、可課後查閱的完整簡報。

詳細歷程保存在 [chronicle.md](D:\\Dropbox\\2026\\演講\\學會7月26日\\chronicle.md)。

------------------------------------------------------------------------

Q2: [請依據上述流程,給予建議,以利後續更有效能。]

Codex: 建議優先改善以下幾點:
  1. 先凍結演講規格再開始製作

    • 先確定聽眾、時間、三個核心訊息與預計張數。
    • 例如:50 分鐘、核心 25–29 張、其餘全部進附錄。
    • 可避免後期由 Agent 主題改成教學策略時大量重做。
  2. 文獻工作採兩層制

    • 第一層:先找 8–12 篇關鍵研究,足以支撐演講。
    • 第二層:完整系統性搜尋另作研究報告或長期資料庫。
    • 不必每次為一場演講重新處理數千篇文獻。
  3. 建立單一「證據—簡報對照表」

    • 每項主張記錄:研究結果、證據強度、引用來源、使用頁次及更新日期。
    • 後續修改簡報時,可直接追蹤來源,減少反覆查證。
  4. 將內容模組化

    • 固定分成:學生學習、作業與評量、教師工作流、GPT 研究案例、OSCE 案例、課後資源。
    • 未來只需重新排列或抽換模組,不必整份重做。
  5. 一開始就分開三種產出

    • 現場核心簡報。
    • 備查附錄。
    • 學員課後講義/資源包。
    • 可避免研究清單、網址、操作細節擠入現場主線。
  6. 簡化版本與資料夾管理

    • 只保留一份明確的「目前正式版」。
    • 舊版統一移至 archive,測試檔放 tmp,正式產出放 outputs/final
    • 檔名標示日期與修改目的,避免大量 v2finalrevised 混用。
  7. 設定固定品質關卡

    • 大綱確認 → 證據確認 → 內容確認 → 視覺與時間確認 → 示範與資安確認。
    • 每次交付前自動檢查頁碼、字級、溢出、引用、講者備註及連結。
    • 額外確認 QR code、帳號權限、HTTPS 與個資風險。
  8. 保留演講後的回饋循環

    • 蒐集 Slido、提問與問卷結果。
    • 記錄哪些頁面最有反應、哪些內容過難或未講完。
    • 回饋直接更新至模組庫,成為下一場演講的起點。

建議的精簡標準流程是:

需求與聽眾定義 → 核心證據搜尋 → 三訊息大綱 → 模組化製作 → 核心/附錄分流 → 時間與視覺驗證 → 演講回饋更新

其中最值得立即落實的三項是:先鎖定主軸、建立證據對照表、從第一天就分開核心簡報與附錄。

------------------------------------------------------------------------

Q3: [請依據上述流程,給予建議,以利後續更有效能。]

Codex: 我會使用 skill-creator,把剛才的建議轉成可重複執行的全域工作流程 skill;內容會包含適用情境、決策關卡、標準資料結構、證據管理、簡報/講義分流,以及交付前 QA。完成後會先驗證 skill 結構,再安裝到全域 skills 目錄。



---------------------------------------
以下列出部分相關圖示(都是 Codex 繪製)












2026年7月14日 星期二

Codex 高效文獻檢索與彙整

拆成 8 個連續 prompts+3 個人工確認關卡

圖:以檢索「課程大綱之評量表」為檢索標的(研究問題),Codex所建議之執行流程
(可製成 Skill,以供後續使用)

 ### Prompt 1:建立研究規格

我要研究的問題是:【填入研究問題】

請先建立可執行的文獻檢索規格,不要開始大量下載。請提出:

1. 研究主題的操作型定義;

2. 主要概念詞群及同義詞;

3. 建議納入的資料庫與選擇理由;

4. 日期、語言及文獻類型範圍;

5. 明確的納入與排除條件;

6. 可用於測試召回率的 seed papers;

7. 各資料庫專屬檢索式;

8. 標準化輸出欄位;

9. 去重複文獻的規則;

10. 停止搜尋的條件;

11. 預計產出的檔案。

請特別標示需要研究者確認的決策,不要自行決定研究範圍。

---

### Prompt 2:小量試搜與檢索式診斷

請依已核准的研究規格進行小量試搜。

每個資料庫先取得前 30–50 筆題名與摘要,並回報:

1. 完整檢索式;

2. 資料庫命中總數;

3. 明顯相關、疑似相關及明顯誤查的數量;

4. 是否找到指定的 seed papers;

5. 五種主要誤查模式;

6. 可能遺漏的同義詞或主題詞;

7. 建議修正後的檢索式;

8. 檢索結果可能過寬或過窄的原因。

尚未通過研究者確認前,不要進行正式批次下載。

---

### Prompt 3:各資料庫正式下載

請依核准的檢索式,從【資料庫名稱】正式取得文獻資料,最多【數量】筆。

請優先使用官方 API 或可公開驗證的匯出方式,並保存:

1. raw:原始 JSON、XML或資料庫匯出檔;

2. standardized:統一欄位的 CSV;

3. readable:題名、作者、年份、來源、網址與摘要的閱讀版;

4. search metadata:檢索式、檢索日期、資料庫命中數及下載方式。


標準欄位至少包含:

database、database_id、doi、title、authors、publication_date、year、source、publication_type、url、abstract、keywords、query_id、retrieval_date。

完成後請驗證並回報:

- 資料庫命中數與實際下載數;

- 缺少摘要及 DOI 的數量;

- 年份範圍;

- API 分頁是否完整;

- 是否因筆數上限而截斷;

- 欄位缺漏或異常紀錄。

不要進行跨資料庫去重,也不要替研究者做最終納入決定。

---


### Prompt 4:整併與去重

請匯入所有資料庫的標準化 CSV,不得修改或覆寫原始資料。

依下列順序交叉去重:

1. 標準化 DOI;

2. PMID、ERIC ID、OpenAlex ID或其他外部識別碼;

3. 正規化題名;

4. 作者、年份及題名相似度僅用於標記疑似重複,不得自動刪除。

同一文獻若出現在不同資料庫:

- 保留資料較完整的紀錄;

- 合併所有資料庫來源;

- 補足 DOI、摘要、作者及關鍵詞;

- 保留每筆合併與刪除的理由。


請輸出:

- combined_deduplicated.csv;

- duplicates_removed.csv;

- possible_duplicates_for_review.csv;

- deduplication_report.md。


報告各庫原始筆數、庫內重複、跨庫重複、最終唯一筆數及待人工確認數。

---

### Prompt 5:兩階段相關性篩選

請依題名、摘要與關鍵詞進行高召回初篩,將每筆文獻標記為:

- 高相關;

- 中相關;

- 低相關;

- 資訊不足。

每筆必須提供:

- relevance_label;

- reason;

- matched_concepts;

- 建議下一步。

再將高相關及中相關文獻分類為:

- 工具發展;

- 信效度驗證;

- 既有工具應用;

- 自建內容分析;

- 背景或概念研究。

不要永久刪除低相關紀錄。請另外輸出需要人工判斷的候選清單與明確排除理由。

---

### Prompt 6:固定欄位證據抽取

只針對研究者核准納入的文獻進行證據抽取。

每篇至少抽取:

- 完整書目;

- 工具名稱;

- 工具類型及成熟度;

- 發展、驗證或應用研究;

- 使用場域與對象;

- 構面及題數;

- 評分方式;

- 樣本;

- 內容效度;

- 評分者間信度;

- 內部一致性;

- 因素結構;

- 效標或預測效度;

- 主要結果;

- 限制;

- 工具取得位置;

- DOI或穩定網址;

- 證據原句、頁碼或表格位置;

- reviewer_confidence。


摘要或全文未提供的資訊,一律填寫「未報告」,不可自行推測。資料不足時標記「需全文確認」。

---


### Prompt 7:建立工具家族並綜合報告

請先依原始工具來源、構面、題項及引用關係建立 tool family。

將同一工具的下列版本連結在一起:

- 原始版本;

- 簡版;

- 改編版;

- 翻譯版;

- 驗證研究;

- 應用研究。

不要只因文章中的名稱不同,就判定為不同工具。

請產出:

1. 工具家族比較表;

2. 工具目的、構面、評分及適用情境;

3. 證據成熟度與限制;

4. 工具發展、驗證及應用文獻的區分;

5. APA第7版參考文獻;

6. 完整檢索與去重方法;

7. 結果摘要;

8. 研究限制與待全文確認事項。

每項工具及重要結論都必須能回連至少一篇文獻來源。

---


### Prompt 8:最終稽核

請對所有檢索、去重、篩選、證據抽取及綜合結果進行最終稽核,不要只潤飾文字。

請檢查:

1. 各階段筆數是否前後一致;

2. 是否仍有 DOI或題名重複;

3. 納入與排除理由是否符合 protocol;

4. 每項工具敘述是否有來源;

5. 信效度資訊是否被過度推論;

6. 摘要不足是否明確標示;

7. 工具別名是否被錯分為不同工具;

8. APA資料與 DOI是否一致;

9. 方法段落是否足以重現檢索;

10. 結論是否超出文獻證據。

請將問題分成「必須修正、建議修正、需研究者判斷」,並列出具體位置與修改建議。

-----

以上絕大多數內容/流程都是 Codex 的建議.... 個人之前的檢索策略實在卑微!!

2026年7月12日 星期日

雙知識—調節—實證閉環框架 -- AI 時代的終身學習典範

以下是我最近反思:退休前究竟能做出什麼學術成果的想法。我與 Codex 協作,提出以下終身學習模式:

英文名稱:Dual-Knowledge Regulation and Real-World Validation Framework 

中文簡稱:雙知識調節實證框架(或學習典範)

 

圖:雙知識—調節—實證閉環框架。領域/任務知識與學習者/自我知識共同構成調節決策的認知基礎;自我調節與適應性決策引擎透過目標設定、差距診斷、策略配置及歷程監測,產生個人化學習行動。介入效果再由真實世界中的學習成效、保留與遷移、可用性、公平性及安全性加以驗證,並將所得證據回饋至知識系統與調節引擎,形成持續更新的閉環

-----------------------------------------------------------

以下說明此模式之核心概念與各重點組成:

一、核心概念

「雙知識—調節—實證閉環框架」主張:有效的智慧學習系統必須同時掌握「要學什麼」與「學習者目前如何學」。擁有正確的學科內容,或只依靠一般性的人工智慧生成能力,皆不足。AI時代的學習者可透過一個持續運作的調節引擎,把兩套知識(「領域/任務知識系統」與「學習者/自我知識系統」)轉化為適合當下學習者的目標、策略、提示、任務與回饋,最後再以真實世界中的學習表現、遷移能力及持續使用結果,檢驗這些調節是否真正有效。

因此,整體架構由四個彼此連結的部分組成(圖):

1. 領域/任務知識系統 (圖之左上)

2. 學習者/自我知識系統(圖之左下)

3. 自我調節引擎(圖中)

4. 真實世界驗證與回饋迴路(圖右與迴圈)

 

其基本邏輯可表示為:

「領域/任務知識 × 學習者/自我知識」 →「 調節決策」  「個人化學習行動 」 「真實世界結果 」 「知識與策略更新」

這不是一條只執行一次的線性流程,而是一個持續校正、反覆學習的閉環系統。

 

 二、第一套知識:領域/任務知識系統

 第一套知識是「領域/任務知識」,回答的是:

 - 學習者需要學會什麼?

- 正確、完整且符合專業標準的內容是什麼?

- 一項任務包含哪些子能力?

- 不同知識或技能之間有何先後與依存關係?

- 什麼表現才算達到標準?

 

這套知識不只是教材內容或事實資料庫,而應包括至少五個層次:

 1. 概念知識:核心概念、原理、定義與理論關係。

2. 程序知識:完成任務所需的步驟、方法與操作順序。

3. 條件知識:何時應使用某項知識或策略,以及何時不適用。

4. 錯誤知識:常見迷思、典型錯誤及其可能成因。

5. 評量知識:表現標準、評分規準及精熟程度的判定方式。

 

在醫學教育中,它可能包括疾病知識、臨床推理規則、病史詢問架構、溝通技巧及評量規準;在一般教育中,則可能包括課程概念圖、能力指標、題目難度與先備知識關係。

領域知識系統的價值,在於確保人工智慧的教學建議有專業依據,避免系統只生成「看似合理」但缺乏學科結構、教育順序或評量標準的回答。

 

 三、第二套知識:學習者/自我知識系統

 第二套知識是「學習者/自我知識」,回答的是:

 - 這位學習者目前知道什麼、尚未知道什麼?

- 他如何理解自己的能力?

- 他使用哪些學習策略?

- 他是否能正確監測自己的理解與表現?

- 什麼情境會促進或阻礙他的學習?

 

這套知識應同時包含可觀察的學習資料與學習者對自己的認識,主要涵蓋:

1. 先備知識與能力狀態:目前的知識、技能與錯誤概念。

2. 目標狀態:短期目標、長期目標及個人優先順序。

3. 策略特徵:偏好的學習方法,以及策略使用是否有效。

4. 後設認知狀態:信心、理解判斷及自我評估的準確程度。

5. 動機與情意狀態:興趣、自我效能、焦慮、挫折與投入程度。

6. 情境與資源限制:可用時間、學習環境、設備、協助與現實負荷。

7. 歷程資料:過去的選擇、練習頻率、錯誤型態、回饋反應與進步軌跡。

 

這套知識的重點不是替學習者貼上固定標籤,而是建立一個可以隨學習歷程持續更新的「動態學習者模型」。

 尤其重要的是,自我知識不一定正確。學習者可能高估自己的能力,也可能因缺乏信心而低估自己。因此,系統必須比較「主觀自我判斷」與「客觀表現證據」,辨識兩者之間的落差。這種校準能力,正是自我調節學習能否有效發生的關鍵。

 

 四、一個調節引擎:自我調節與適應性決策核心

 兩套知識本身不會自動產生良好學習。必須有一個調節引擎,持續比較「任務要求」與「學習者狀態」,並決定下一步應採取什麼行動。

 

正式名稱可稱為:自我調節與適應性決策引擎 」Self-Regulation and Adaptive Decision Engine  (SRADE)

 此引擎不是單純的推薦器,而是一個循環性的決策機制,包括四個核心功能。

  1. 目標設定與差距診斷

 系統先根據領域標準與學習者現況,判斷:

 - 目標能力是什麼?

- 當前表現與目標之間有多大差距?

- 差距來自知識不足、策略不當、監測失準,還是動機與情境因素?

- 哪一項差距最值得優先處理?

 

因此,相同的錯誤不一定得到相同介入。例如,學生答錯可能是因為不知道、誤解、粗心、過度自信,或無法在情境中提取既有知識;不同原因需要不同調節方式。

 

 2. 策略選擇與支架配置

 引擎依據差距診斷,選擇適合的學習策略,例如:

 - 提供概念解釋;

- 安排提取練習;

- 降低或提高任務難度;

- 提供範例、提示或部分步驟;

- 要求學習者解釋推理;

- 引導反思錯誤原因;

- 建議分散練習或交錯練習;

- 在適當時機撤除支架;

- 將問題轉介教師或專業人員。

 

這裡的個人化不是迎合偏好,而是根據學習需要選擇最可能有效的策略。

 

 3. 過程監測與即時調整

 在學習進行中,引擎持續蒐集表現、信心、反應時間、錯誤型態、策略選擇與投入程度等訊號,判斷:

 - 學習者是否理解?

- 提供的支架是否過多或不足?

- 任務是否太難、太簡單或缺乏挑戰?

- 學習者是否正在形成對人工智慧的依賴?

- 是否需要改變策略、提示強度或學習節奏?

 

調節引擎因此不是固定地「給答案」,而是控制何時提示、提示多少、何時要求自主作答,以及何時促進反思。

 

 4. 結果反思與模型更新

 任務完成後,引擎比較預期與實際結果,更新:

 - 對學習者能力的估計;

- 對其自我評估準確度的判斷;

- 不同策略對該學習者的有效性;

- 任務難度與先備知識的關係;

- 下一輪學習目標與介入方式。

 

因此,系統不只幫助學習者學習,也必須學會「如何更好地幫助這位學習者學習」。

 

 五、真實世界驗證:從技術正確走向教育有效

 框架的最後一部分是「真實世界驗證」。其核心主張是:人工智慧在測驗、模擬情境或控制實驗中表現良好,不代表它在真實教育環境中必然有效。

 真實世界驗證至少需要回答四個層次的問題。

  1. 技術有效性

 系統提供的內容是否正確、穩定、安全且可解釋? 

學習者模型是否能合理估計能力與狀態? 

調節引擎是否按照預定規則運作?

 

 2. 學習有效性

 使用系統後,學習者是否真正進步?應評估:

 - 知識與技能的獲得;

- 延宕保留;

- 跨情境遷移;

- 問題解決與臨床推理;

- 自我監測與自我評估的準確度;

- 獨立完成任務的能力。

 

 3. 情境有效性

 系統能否在真實課程、臨床訓練或自主學習中被持續使用?需要考慮:

 - 教師與學生是否願意採用;

- 是否增加額外負擔;

- 是否能融入既有教學流程;

- 不同能力、背景與資源條件的學習者是否都能受益;

- 成效是否會隨時間、課程或使用方式而改變。

 

 4. 系統與倫理有效性

 系統是否產生非預期後果,例如:

 - 過度依賴人工智慧;

- 深層思考與自主判斷下降;

- 錯誤資訊被放大;

- 隱私與資料安全風險;

- 演算法偏差與教育不平等;

- 教師專業判斷被不當取代。

 

因此,真實世界驗證不只驗證「有沒有提高分數」,也要檢驗「在什麼人、什麼情境、透過什麼機制、付出什麼代價,產生何種短期與長期效果」。

 

 六、閉環的意義

 真實世界驗證不是整個系統的終點,而是下一輪調節的起點。

 真實使用所產生的資料,應回饋至三個位置:

 1. 更新領域/任務知識:修正任務難度、錯誤分類與能力結構。

2. 更新學習者/自我知識:提高對能力、策略與情境差異的掌握。

3. 更新調節引擎:辨識哪些介入對哪些學習者、在何種條件下有效。

 

因此,框架形成一個持續演化的循環:

 理解任務 理解學習者 選擇介入 監測反應 驗證成效 更新知識與決策

 真正的智慧不只在於系統能回答問題,而在於它能根據證據知道:何時應提供協助、應提供多少協助、何時應撤除協助,以及如何判斷協助是否真的改善了學習。

 

 七、理論主張

 本框架提出五項核心主張:

 1. 雙知識必要性主張  

   缺少領域知識,個人化可能失去專業正確性;缺少學習者知識,專業內容則難以轉化為適切教學。

 2. 調節中介主張 

   兩套知識不會直接產生成效,其效果必須透過目標設定、策略選擇、監測與調整等調節行動實現。

 3. 動態校準主張 

   個人化不能建立在固定標籤上,必須依學習歷程持續校準學習者模型與介入策略。

4. 真實成效主張 

   技術準確度、使用滿意度或短期測驗進步,都不能單獨證明教育有效性;必須觀察保留、遷移、自主性及真實任務表現。

 5. 閉環學習主張 

   真實世界資料不只是研究結果,也是更新知識系統與調節規則的必要來源。

 

 八、相較於一般AI個人化學習的特色

 一般人工智慧學習系統常採取「輸入問題—生成回答」的單次互動模式;本框架則將人工智慧重新定位為一個受到領域標準、學習者狀態、調節原則與實證結果共同約束的學習支持系統。

 其核心差異在於:

 - 從「內容生成」提升為「雙知識整合」;

- 從「回答問題」提升為「調節學習歷程」;

- 從「依偏好推薦」提升為「依能力差距與學習機制介入」;

- 從「一次性成效」提升為「持續校準的閉環」;

- 從「測試環境表現」提升為「真實世界教育價值」。

 

 九、正式定義

 「雙知識—調節—實證閉環框架」是指一種以領域/任務知識與學習者/自我知識為雙重認知基礎,透過自我調節與適應性決策引擎進行目標設定、差距診斷、策略配置、歷程監測及動態調整,並以真實教育情境中的學習成效、遷移表現、持續使用、公平性與安全性加以驗證,再將所得證據回饋至知識模型與調節規則的循環式智慧學習架構。

 簡言之,這個框架所追求的不是:

 AI知道很多,所以能教。」

 而是:

 AI同時理解學習內容與學習者,能依證據調節學習,並且其價值已在真實世界中得到驗證。」


-----------------------------------

以下是修改版:


 雙知識—共同調節—分層實證閉環框架(完整修正版論述)

 

 一、框架定位

「雙知識—共同調節—分層實證閉環框架」旨在說明學習者如何在專業學習中,理解任務要求與自己的能力狀態,運用AI提供的任務、提示、回饋與支架,與教師或同儕共同選擇及調整學習策略,並逐步發展在沒有AI協助時仍能獨立完成任務的能力。

框架以領域/任務知識與帶有不確定性的學習者模型為雙重知識基礎,但學習者不是被動接受系統安排的對象,而是參與目標設定、檢視自我判斷、選擇策略、提出疑問及決定何時尋求協助的主體AI的角色是協助辨識學習差距並提供適切支持,教師/同儕則負責引導反思、覆核重要判斷及處理高風險情境。學習是否真正發生,不能只看當下分數或使用感受,而要檢查學習者能否在一段時間後保留所學、運用於新情境,並在真實場域中安全且適切地完成任務。

從學習者的角度而言,本框架所稱「閉環」是持續進行「嘗試—取得回饋—反思—調整—再驗證」的過程。由於單次表現可能受到學習/題目難度、提示程度、疲勞、焦慮或偶發失誤影響,未必能代表學習者的穩定能力,系統應累積多次且跨情境的作答與學習行為資料,並與外部標準、真實任務表現及教師判斷交叉驗證;只有在能力或學習需求的變化呈現一致趨勢後,才調整後續任務、提示與支持方式。如此可使個人化調整建立在較可靠的證據上,同時讓學習者有機會理解系統判斷、檢視自己的學習變化,並參與後續學習路徑的決定。

學習歷程產生的資料,必須先與外部標準及真實表現比較,並在必要時由教師或同儕審查,確認資料足以反映學習者的實際能力,也未因情境差異、模型漂移或群體偏誤而造成錯誤判斷,才可用來調整後續任務與支持方式。若證據不足、AI判斷與學習者實際表現不一致,或出現公平、安全與隱私疑慮,學習者應有權知道其原因、提出異議、要求人工覆核,並選擇限制或停止自動調整;系統也應維持原設定、停止更新或回復先前版本,以保障學習者的自主性與安全。

 

 二、雙知識基礎

  (一)領域/任務知識

 領域/任務知識是完成特定專業任務所需的概念、程序、適用條件與評量規準。它不僅回答「正確答案是什麼」,也界定「在何種條件下,應採取何種程序,以及如何判定表現品質」。在醫療或其他高風險專業教育中,這套知識應由課程目標、實證指引、專家共識、標準化評量及真實任務要求共同界定,避免AI僅依語言流暢度或表面相似性產生教學內容。

  (二)學習者模型

 學習者模型是系統根據多源證據形成的暫時性狀態估計,包括能力狀態、策略歷程、動機與情境,以及估計本身的不確定性。它不是對學習者的固定標籤,也不等同學習者的自我認知。模型輸入可包括作答結果、錯誤類型、反應時間、提示需求、策略使用、求助行為與情意資料;每項推論均應標示資料來源、更新時間與可信程度,避免把短期波動誤判為穩定能力。

  (三)校準差距

 框架將自我估計、系統估計與外部表現明確分開。三者之間的差距是調節的重要依據:自我估計高於外部表現,可能代表過度自信;系統估計偏離外部表現,可能代表模型誤判、資料不足或情境改變。校準差距不宜只用自陳量表判定,應搭配標準化測驗、無支架任務、專家評分或其他外部效標。差距過大時,首先應補充評量或啟動人工審查,而不是直接提高或降低任務難度。

 

 三、AI素養與治理:橫向必要條件

 AI素養與治理不是第三套學科知識,而是橫跨整個閉環的使用條件,至少包括理解AI限制、查證輸出、公平與隱私保護,以及人工接管。學習者須能辨識AI可能生成錯誤、過度肯定或不適用於當前情境的內容;教師與機構則須界定資料可否進入系統、哪些建議可以自動執行、哪些決策必須由人類覆核。

 在低風險練習中,AI可以提供較高程度的即時調整;在臨床推理、資格判定或真實病人相關任務中,AI應定位為決策支援,而非獨立裁決者。人工接管不是系統失敗後才啟動的補救措施,而是設計之初便應納入的正常治理路徑。

 

 四、人—AI—教師共同調節

 修正版以「共同調節」取代原先較容易被解讀為AI單獨運作的「自我調節與適應性決策引擎」。共同調節包含四個循環階段:

1. 目標設定:依課程目標、任務標準、學習者需求與風險層級設定可觀察目標。

2. 差距診斷:比較目前表現、學習者自我估計、系統估計與外部規準,並保留不確定性。

3. 策略配置:決定任務難度、案例變異、提示、回饋、支架、反思或教師介入。

4. 歷程監測:持續觀察表現、策略、求助、情意與安全訊號,判定維持、調整或停止。

 共同調節的關鍵不在增加決策次數,而在預先界定決策權與門檻。例如,學習者可以選擇練習目標與求助方式;AI可以在核准範圍內調整提示與案例難度;教師負責覆核高風險推論、能力判定與例外處理。當資料不足、模型不確定性過高、表現突然惡化或出現安全疑慮時,應暫停自動調整並轉由教師或督導判斷。

 

 五、個人化學習行動與支架撤除

 共同調節的輸出是可觀察的個人化學習行動,包括任務、提示、回饋、支架與反思。個人化並非讓每位學習者獲得完全不同的內容,而是依相同能力標準調整通往目標的路徑、支持程度與練習順序。

 框架特別加入「逐步撤除支架」。提示與即時回饋可能改善當下表現,卻也可能造成提示依賴,使學習者在沒有AI時無法獨立完成任務。因此,支架應隨能力形成逐步減少,並以無提示或無AI條件下的表現確認學習是否真正內化。若撤除支架後表現明顯下降,系統應重新診斷知識缺口或策略問題,而不能把有支架時的高分視為能力已形成。

 

 六、分層實證驗證

 框架不以單次滿意度、使用意願或模擬內成績作為充分成效證據,而將驗證分為下列層級:

 - 學習層:知識、技能、策略與校準是否改善。

- 保持層:介入效果在數日、數週或更長時間後是否仍存在。

- 遷移層:能否應用於未見過的相似案例、結構不同的新情境及真實任務。

- 實施層:系統是否可用、可接受、可持續採用,並具有合理的時間、成本與教師負擔。

- 治理層:不同群體的效能是否公平,是否出現錯誤、傷害、偏誤、隱私或安全事件。

- 終極結果層:在適用情境下,是否改善真實工作品質、臨床表現或病人相關結果。

 這些結果不應合併成單一「成效」指標。使用者覺得系統方便,不代表學習有效;模擬表現提升,也不代表能遠遷移至真實場域。研究設計至少應同時包含即時表現、延宕保持與新情境遷移,若主張臨床或工作價值,則須另有真實任務或外部效標。

 

 七、品質閘門與證據更新

 驗證資料回饋前須通過三類品質閘門:

1. 外部基準:結果是否與標準化評量、專家評分或真實任務表現一致。

2. 人工審查:高風險、異常或低可信度推論是否經教師、督導或治理人員覆核。

3. 漂移與公平稽核:資料分布、模型效能及不同群體誤差是否發生不合理變化。

 只有通過品質閘門的證據,才可更新學習者模型與調節策略。未通過時的合理反應包括補充資料、維持原模型、限制使用範圍、暫停自動化、停止更新或回復先前版本。此設計可降低錯誤推論自我強化、模型把偏誤當成學習規律,以及短期表現取代長期學習的風險。

 

 八、時間尺度

 閉環需區分不同時間尺度:

 > 即時表現 延宕保持 新情境遷移 真實場域

 秒或分鐘級的提示調整,可改善單一任務表現;

日或週級資料可用於判斷保持與策略變化;

月級或課程級資料才較適合評估能力發展;

真實場域證據則用於檢查學習是否能跨越情境邊界。

不同時間尺度應使用不同更新速度,避免把一次答錯、情緒波動或單次高分立即寫入長期能力模型。

 

 九、適用邊界

 本框架最適合具有下列特徵的AI輔助專業學習情境:任務及品質標準可被明確描述、學習過程可重複觀察、可取得外部效標,且能安排延宕或遷移評量。對於開放性極高、評量標準高度爭議或真實錯誤可能造成重大傷害的任務,應降低自動調節程度,增加教師與專家參與。

 框架本身是依現有文獻所提出的理論整合,尚不能宣稱已有單一研究完整驗證所有構件及路徑。因此,較適當的論述是「相關研究分別支持雙知識、共同調節、適應性練習、學習遷移與外部驗證的必要性」,而不是「既有研究已證實本完整閉環有效」。

 

 十、可檢驗命題

 為使框架可以被研究與否證,可提出以下命題:

 1. 同時使用領域/任務知識與帶有不確定性的學習者模型,應比只依一般生成式AI輸出的設計產生更好的無支架表現與遷移。

2. 將自我估計、系統估計與外部表現納入共同調節,應改善校準並降低過度自信與不當依賴AI

3. 人—AI—教師共同調節的效果,將受到AI素養、任務風險、教師覆核品質及決策權配置所調節。

4. 逐步撤除支架的設計,可能降低即時表現,但應改善延宕保持、獨立作業與新情境遷移。

5. 模擬內成效只有在通過延宕、遷移及外部效標驗證後,才足以預測真實任務表現。

6. 品質閘門可降低模型漂移、群體誤差與錯誤回饋自我強化,但可能增加教師負擔與實施成本。

 

 十一、建議使用的精簡核心敘述

 「雙知識—共同調節—分層實證閉環框架」以領域/任務知識與帶有不確定性的學習者模型為雙重基礎,並藉由比較自我估計、系統估計與外部表現辨識校準差距。在AI素養與治理的橫向約束下,學習者、AI與教師依預設決策權共同完成目標設定、差距診斷、策略配置與歷程監測,形成包含任務、提示、回饋、支架及反思的個人化學習行動。其成效須依即時學習、延宕保持、近/遠遷移、真實任務、實施及公平安全結果分層驗證;新證據只有通過外部基準、人工審查及漂移/公平稽核後,才可更新學習者模型與調節策略,否則應維持、限制、停止或回復。

 

 十二、主要文獻依據

 - Leiser et al. (2023)支持將領域知識納入醫療機器學習,以改善可解釋性、資料限制與穩健性。[PubMed PMID 37925206](https://pubmed.ncbi.nlm.nih.gov/37925206/)

- Zanellati et al. (2024)說明知識追蹤及先驗知識整合,可作為動態學習者模型的技術基礎。[ERIC EJ1410564](https://eric.ed.gov/?id=EJ1410564)

- Su et al. (2025)AI素養評量整理為AI知識、倫理、情意與使用等面向,支持將AI素養納入橫向條件。[ERIC EJ1497456](https://eric.ed.gov/?id=EJ1497456)

- Badger et al. (2026)指出生成式AI可支持即時回饋與自我調節,但也存在過度依賴及批判思考下降風險。[ERIC EJ1494030](https://eric.ed.gov/?id=EJ1494030)

- Qian et al. (2026)辨識AI素養、任務規劃及教師/評量者參與等重要調節變項。[ERIC EJ1505833](https://eric.ed.gov/?id=EJ1505833)

- Jiang et al. (2026)支持生成式AI虛擬病人的適應性練習潛力,同時指出單次介入、研究異質性及缺乏長期驗證等限制。[PubMed PMID 42098926](https://pubmed.ncbi.nlm.nih.gov/42098926/)

- Shen et al. (2026)顯示AI支持訓練對知識與近遷移較有支持,但遠遷移、長期保持與真實臨床成效證據仍不足。[PubMed PMID 41935468](https://pubmed.ncbi.nlm.nih.gov/41935468/)