2026年8月26日 星期三

如何提出好問題:從發現「不懂」,到追問、驗證與形成自己的理解

 *「會問問題」一直是重要的學習能力。

過去的教育比較重視學生能不能回答問題;但在生成式 AI 可以快速提供答案的時代,真正重要的能力逐漸轉變為:

學習者能不能發現自己哪裡不懂、提出適切的問題,並判斷得到的答案是否可信?

因此,好的提問不只是把問題輸入搜尋引擎或生成式 AI,也不只是學習所謂的 prompt 技巧。提問的核心其實是:

發現自己的知識缺口,將模糊的疑惑轉化為具體、重要且可以繼續探究的問題。




 


一、為什麼「問問題」如此重要?

提問的目的,在於澄清自己尚未理解之處,尤其是重要且關鍵的部分。

如果學習者只接受教師或 AI 提供的答案,卻沒有辨認自己究竟懂了什麼、哪裡還不懂,就很容易產生「看懂等於學會」的錯覺。

真正的學習需要經歷:

接觸內容 → 嘗試理解 → 發現知識缺口 → 提出問題 → 修正理解 → 再次檢核

因此,問問題不只是取得資訊的方法,也是 metacognition 的表現。學習者需要監測自己的理解狀態,回答以下問題:

  • 我目前已經知道什麼?

  • 我真正不懂的是哪一部分?

  • 我不懂的是名詞、關係、原因、應用,還是判斷?

  • 我得到的答案是否真的解決了原來的問題?

  • 我能不能不用看資料,以自己的話解釋一次?(自我檢查!)

  • 我還有哪些不確定之處?

能提出問題,代表學習者已開始看見自己的知識邊界。

*如果自己不易發現問題/困難,可以改由生成式AI問你問題!!請他扮演專家/教練,好好拷問您!!


二、好問題不是範圍越大越好

初學者常提出範圍過大的問題,例如:

「我不懂這篇論文。」
「什麼是統計?」
「請告訴我這篇文章的重點。」
「AI 對學習有什麼影響?」

這些問題並非完全不能問,但範圍太大,回答者通常只能從頭說明,或提供概括而表面的答案。最後,學習者仍然可能不知道自己真正卡在哪裡。

好問題通常需要同時考量兩項判準:

與目前主題的相關性,以及這個問題的重要性。

因此,提問需要「抓大放小」:掌握影響理解的核心環節,不必拘泥於不影響整體理解的枝微末節。

例如,「我不懂這篇論文」可以逐步縮小為:

我不懂的是研究背景、研究方法,還是結果?

我主要不懂 Methods 中的 sampling method。

我知道作者使用 convenience sampling,但不懂這種 sampling method 可能造成哪些 selection bias。

因此,我的問題是:「本研究使用 convenience sampling,對結果的 generalizability 可能造成哪些限制?」

最後一個問題比「我不懂這篇論文」更具體,也更容易得到有用的答案。


三、先找出:我是哪一種「不懂」?

當學習者感覺「我不懂」時,可以先將知識缺口分為以下五類。

1. 名詞不懂

不知道某個詞彙或概念的定義。

例如:

「Metacognition 是什麼?」
「Minimal clinically important difference 是什麼意思?」

2. 關係不懂

知道個別概念,卻不清楚它們彼此的關係。

例如:

「Metacognition 與 curiosity 有什麼關係?」
「Reliability 與 measurement error 有什麼關係?」

3. 原因不懂

知道某個現象或結論,卻不明白為什麼。

例如:

「為什麼樣本數增加通常可以提高估計的 precision?」
「為什麼 AI 太快提供答案,反而可能降低學習深度?」

4. 應用不懂

理解概念,卻不知道如何用於新的情境。

例如:

「教師可以如何在期刊論文閱讀課程中培養學生的 metacognition?」
「這項研究結果如何應用於中風病人的職能治療?」

5. 判斷不懂

不知道應採用什麼標準評估資訊、證據或結論。

例如:

「我如何判斷作者對研究結果的解釋是否過度?」
「我如何判斷 AI 的回答是否可靠?」

這項分類的目的,是把「一整團不懂」拆成較小、較明確、可以處理的問題。






四、從模糊疑問到可探索問題

學生可以使用以下流程:

先說出不懂 → 找出哪裡不懂 → 判斷不懂的類型 → 縮小問題 → 提出具體問題 → 檢查答案 → 繼續追問

第一步:先承認「我不懂」

一開始不必要求自己立刻提出非常精準的問題。學習者可以先說:

「這一段我看不懂。」
「我不懂作者為什麼得到這個結論。」
「我不確定這個統計結果代表什麼。」

能夠察覺並說出「我不懂」,就是學習的起點。

第二步:區分已知與未知

接著問自己:

「這一部分,我已經知道什麼?」
「真正卡住的是哪一句、哪個概念或哪個推論?」

例如:

「我知道兩組的平均值不同,但不懂為什麼 p > .05 時,不能直接說兩組完全沒有差異。」

這樣的描述已經比「我不懂統計」清楚許多。

第三步:縮小問題範圍

將大問題拆成數個較小的問題,例如:

「p > .05 代表什麼?」
「未達 statistical significance 是否等於兩組相同?」
「樣本數不足是否可能造成 p > .05?」
「還需要查看 effect size 與 confidence interval 嗎?」

第四步:形成可以探究的問題

最後,將問題改寫成明確句子:

「當兩組平均值不同,但 p > .05 時,應如何結合 effect size 與 confidence interval 解釋研究結果?」

這種問題有清楚的背景、範圍與學習目的,也較容易得到深入且精確的回答。


五、向教師、同儕或 AI 提問前,最好先嘗試

提問並不是把所有思考工作交給別人。

比較好的做法是:

先做、先想、先說明自己的理解,再提出問題。

例如,不要只問:

「請解釋 construct validity。」

可以改成:

「我目前理解 construct validity 是指一項評估工具的分數是否能反映理論上欲測量的 construct,但我不清楚 convergent validity 與 known-groups validity 分別提供什麼證據。請比較兩者,並各舉一個職能治療評估的例子。」

這種問法包含三項重要資訊:

  1. 自己目前的理解;

  2. 明確的知識缺口;

  3. 希望獲得的協助方式。

這不但能讓回答者提供較適切的說明,也能保留學習者必要的認知投入。


六、向 AI 提問時,不要只要求答案

生成式 AI 的回答通常很流暢,但流暢不代表正確,更不代表學習者已經理解。

與 AI 互動時,可以採用以下幾類提問。

1. 要求拆解問題

「請將這個問題拆成三個較小、可以逐步探究的問題。」

2. 要求提供提示,而非直接給答案

「請先不要直接告訴我答案,請用三個提示引導我思考。」

3. 要求檢查自己的理解

「我目前的理解是___。請指出其中可能錯誤、不完整或過度簡化之處。」

4. 要求比較容易混淆的概念

「請比較 statistical significance、clinical significance 與 practical significance,並說明三者不可互相取代的原因。」

5. 要求舉例與反例

「請提供一個符合此概念的例子,再提供一個看似符合、實際上不符合的反例。」

6. 要求提出不同觀點

「這個結論可能建立在哪些未被說明的假設上?」
「請提出支持與反對這項解釋的理由。」
「在哪些情況下,這個結論可能不成立?」

7. 要求提供驗證方向

「我應查閱哪些原始資料、研究結果或可信來源,才能驗證這項回答?」

這樣的 AI 使用方式,是把 AI 當成探究與思考的夥伴,而不是答案販賣機。


七、不要停在第一個答案:追問才是理解深化的開始

第一個答案通常只提供基本解釋。真正的學習往往發生在後續追問。

常見的追問包括:

「可以再說得具體一點嗎?」
「可以用一個職能治療研究的例子說明嗎?」
「這個說法有哪些限制?」
「是否存在例外情況?」
「這個結論需要哪些前提才成立?」
「如果研究設計改變,結論會不會不同?」
「作者的資料真的足以支持這項結論嗎?」
「還有其他可能的解釋嗎?」

追問的目的不是讓答案越來越長,而是逐步確認:

  • 概念是否清楚;

  • 推論是否合理;

  • 證據是否充分;

  • 結論是否適用於目前情境;

  • 是否存在其他解釋。


八、得到答案後,必須進行理解檢核

「得到答案」不等於「學會」。

閱讀教師、同儕或 AI 的回答後,可以進行以下檢核。

1. 不看資料,用自己的話說明

如果無法用自己的話解釋,可能只是熟悉了答案的文字,尚未真正理解。

2. 舉出一個新的例子

如果只能重複原本的例子,可能尚未掌握概念的核心特徵。

3. 舉出反例或例外

能判斷概念在什麼情況下不成立,通常代表理解較為深入。

4. 應用於新的問題

例如,理解 selection bias 後,能否在另一篇論文中辨識可能的 selection bias?

5. 找出仍然說不清楚之處

問自己:

「哪一句看起來懂,但要我解釋時仍然說不清楚?」
「這個答案解決了原問題嗎?」
「我現在還有哪些不確定?」

最後可以用以下句型整理學習歷程:

「我原本以為___;後來我發現___;現在我仍想知道___。」

這個句型能將原先的理解、修正後的理解及下一個問題連結起來,使提問成為持續學習的循環。


九、好問題的簡要檢核表

提出問題前,可以檢查以下六點:

  1. **重要性:**這個問題是否涉及主題的核心概念?

  2. **相關性:**它是否與目前的學習目標或討論內容直接相關?

  3. **明確性:**回答者能否知道我真正不懂的是什麼?

  4. **適當範圍:**問題是否過大,或過度拘泥於細節?

  5. **可探索性:**這個問題是否可以透過說明、比較、證據或推理繼續探究?

  6. **已有嘗試:**我是否先說明自己的理解、推測或初步解決方式?

好的問題不一定很複雜。關鍵在於它能否清楚呈現知識缺口,並帶領學習者走向更深入的理解。






結語:提問不是取得答案,而是校準理解

AI 時代,「回答問題」變得非常容易,但「提出值得探究的問題」仍需要領域知識、metacognition、critical thinking 與持續練習。

真正有效的提問歷程是:

發現不懂 → 區分已知與未知 → 縮小問題 → 提出具體問題 → 取得初步答案 → 追問與挑戰 → 驗證資訊 → 形成自己的理解

因此,我們要培養的,不只是「如何問 AI」,而是一種更基本也更重要的學習能力:

知道自己哪裡不懂,知道下一個問題應該問什麼,也知道不能把別人的回答直接當成自己的理解。


相關舊文

2026年8月22日 星期六

教學表現之評量:可複核、可行動及可追蹤的形成性回饋

評分與回饋流程

本流程以「八向度、32題量表(與 Codex 協作/生成)」為核心,將逐字稿、音訊及影像分別取證後再綜合評量,最後產出可複核、可行動及可追蹤的形成性回饋。



1. 準備與界定評量範圍(使用者)

首先確認評量目的、授課情境及使用的八向度32題量表,並盤點MP4、MP3、逐字稿、PPT/教材及相關課程資料。原始影音與教材均保持唯讀,分析結果另存於輸出資料夾。

評量目的在協助教師改善教學,不直接推論學生學習成效,也不宜單獨用於教師人事評鑑/決策。

2. 證據品質檢查(Codex)

分析前先檢查:

  • 影音長度、格式及檔案版本是否一致。
  • 逐字稿是否為原始稿或精校稿。
  • 逐字稿時間碼是否與影音同步。
  • 投影片、逐字稿與錄影畫面是否相互對應。

若逐字稿與影音時間不一致,以實際影音時間為主要依據;不同步的逐字稿僅作內容索引。

3. 三種證據分別分析(Codex)

三種資料先獨立分析,不在初期混合判斷:

  • 逐字稿:分析教學目的、內容結構、術語、推理、提問及回饋語言。
  • 音訊:分析音量、響度、停頓、講述密度、節奏及問答換話。
  • 影像:分析教材同步、畫面可讀性、工具切換、互動及可觀察的非語言表現。

若講者未入鏡,眼神、姿態、手勢等項目應標示NA,不得以推測方式給低分。

4. 建立時間軸並逐項評分(Codex)

依實際影音建立五分鐘時間軸,記錄各時段的教材畫面、教學內容、提問、示範及互動活動。

接著依32題逐項記錄:

  • 0–4分或NA。
  • 直接證據來源。
  • 時間碼、逐字稿段落或教材頁碼。
  • 扣分理由。
  • 為何未採相鄰分數。
  • 證據信心:高、中或低。

同一問題原則上只在最直接的向度主要扣分,避免重複扣分。

5. 綜合判讀與形成性回饋(Codex)

完成分流評分後,再進行跨來源整合:

  • 多種證據相互一致時,提高判斷信心。
  • 證據衝突時,以實際影音及較直接證據為主。
  • 資料不足時,降低信心或標示NA。
  • 安全紅旗另行判斷,不得由其他高分抵銷。

回饋依下列順序形成:

  1. 指出值得保留的教學優點。
  2. 找出2至3項最優先改善問題。
  3. 說明問題的直接影音證據。
  4. 提供教師下一堂課可以直接採用的說法或活動。
  5. 設定成功標準、追蹤證據及再評量時間。

例如不只寫「應增加互動」,而是具體建議:「案例後停20秒,請所有學生在聊天室完成一句回答,再展示兩個匿名答案並說明判斷依據。」

6. Word輸出與品質檢查(Codex)

完整Word報告應包含:

  • 使用說明與證據限制。
  • 八向度結果總覽。
  • 逐字稿、音訊及影像個別分析。
  • 實際影音時間軸。
  • 32題完整分數、證據、扣分理由及信心。
  • NA理由與安全紅旗。
  • 教學優點及優先改善行動。
  • 改善追蹤與再評量表。

交付前需檢查題號完整性、表格結構、頁面裁切、圖片替代文字及無障礙問題,並由人工抽查低信心項目、主要扣分與安全注意事項。

整體流程的核心原則是:每個分數均能回到證據、每個扣分均有理由、每項回饋均能轉換成下一次可執行的教學行動。

最後,「使用者」確認Word報告。

2026年8月21日 星期五

agent 協助準備稿件之流程



10 步驟

Phase 1|先建立 Agent 的「工作規格」

建立固定的作者寫作原則

除了英文風格之外,最好把您的偏好具體寫成一份長期可重複使用的規則,例如:

  • academic but concise

  • 不過度使用華麗詞彙

  • 一個 paragraph 一個主要 message

  • 避免過度宣稱 causality

  • Results 不做 interpretation

  • Discussion 不重複 Results

  • 不使用 unsupported claims

  • 每一個 factual claim 必須有 citation

  • 不允許虛構 reference

  • 優先使用原始研究而非二手引用

  • 遵循 APA / Vancouver 或期刊指定格式

  • 您個人常用的句型、禁用詞、縮寫原則

也可找尋論文撰寫指引等論文或教科書。

之後,把它獨立保存為:

Writing_Guidelines.md

這是 Agent 工作流程中非常值得標準化的一環。


Phase 2|先確定「這篇 稿件 到底要說什麼」

確定研究目的、research question 與核心訊息

不只是「研究目的」而已。

最好先讓您與 Agent 共同確認五件事:

Research question → Main finding → Novelty → Interpretation → Contribution

例如最後形成一句:

This study demonstrates that X, particularly under Y condition, suggesting Z.

這一句其實是整篇論文的 central claim

這一步若沒有確定,後面 AI 很容易寫出「內容都對,但沒有故事線」的 Introduction 和 Discussion。


Phase 3|提早決定 target journal

 初步選定 1 個 target journal + 1–2 個 backup journals

 target journal 會直接影響:

  • 字數

  • abstract structure

  • article type

  • Introduction 長度

  • Discussion 長度

  • reference 數量

  • table/figure 數量

  • supplementary material

  • reporting guideline

  • terminology

  • audience

  • manuscript framing

例如同一個 psychometric study,投:

  • Archives of Physical Medicine and Rehabilitation

  • Journal of Clinical Epidemiology

  • Quality of Life Research

  • Disability and Rehabilitation

Introduction 與 Discussion 的 emphasis 很可能完全不同。

因此理想順序是:

研究目的 → 初選期刊 → 再開始 manuscript architecture

 Agent 非常適合負責整理期刊 Instructions for Authors。


Phase 4|把 Methods、Results、Tables/Figures 鎖定

完成 Methods + Results + Tables/Figures

不要從 Introduction 開始寫 paper。

因為真正決定 paper 能說什麼的是:

Methods → Results → Tables/Figures

而不是 Introduction。

Agent 在這個階段很適合做的是:

  • Methods completeness check

  • statistical terminology consistency

  • sample size 前後一致

  • variable 名稱一致

  • table 與 text 數字一致

  • decimal places 統一

  • p values、CI、effect size 格式統一

  • table/figure callout 檢查

  • abbreviation consistency

  • reporting guideline check

有一點很重要:

AI 可以協助撰寫與核對 Methods/Results,但 statistical interpretation 最好仍由作者決定。


Phase 5|建立 Evidence Base

建立 Core Reference Set + Evidence Matrix

「至少10篇」可以作為實務起點,但我不會把 10 當成主要標準。

比較重要的是涵蓋幾種類型:

  1. Problem/background

  2. Current state of knowledge

  3. Key methodology

  4. Closest previous studies

  5. Conflicting evidence

  6. Theoretical/conceptual basis

  7. Interpretation of your main findings

然後要求 Agent 建立一個表:

Claim / issueKey referenceMain findingHow it supports manuscriptSection
X is clinically importantSmith 2025Background rationaleIntroduction
Previous studies assumed…Lee 2024Knowledge gapIntroduction
Our result is consistent with…Chen 2026InterpretationDiscussion

這個 Evidence Matrix 比單純把 10–20 篇 PDF 丟給 AI 強很多。

因為它迫使 Agent 回答:

「這篇 reference 到底要拿來支持什麼?」

而不是把 references 當裝飾。


Phase 6|先做 manuscript architecture,暫時不要寫 prose

與 Agent 共同建立 Introduction 與 Discussion 大綱

要求 Agent:

先不要寫完整句子。

先做 paragraph-level outline。

例如:

Introduction

P1 — Clinical/research problem
→ Why X matters

P2 — Current knowledge
→ What previous studies have established

P3 — Knowledge gap
→ What remains unresolved

P4 — Study rationale and objective
→ Why this study is needed

Discussion 則可以:

P1 — Principal findings

P2 — Interpretation of finding 1

P3 — Interpretation of finding 2

P4 — Comparison with previous literature

P5 — Implications

P6 — Strengths and limitations

P7 — Conclusion

而且每一段最好都指定:

claim → evidence → interpretation → implication

這樣 Agent 寫出來的 paper 會比「請根據這些資料寫 Discussion」可靠很多。


Phase 7|才讓 Agent 產生完整 manuscript

依 approved outline 撰寫全文

到了這裡,我才會讓 Agent 自動化程度提高。

而且最好不是一次:

「幫我寫整篇 paper。」

而是依序:

Methods → Results → Introduction → Discussion → Conclusion → Abstract → Title

我特別建議:

Abstract 與 Title 最後才寫。

因為只有全文定稿之後,Abstract 才知道真正應該強調什麼。


Phase 8|Scientific audit

請 Agent「不要修改」,先當 reviewer 找問題

例如要求:

Do not rewrite the manuscript.
Act as a critical peer reviewer and identify:

  • unsupported claims

  • overinterpretation

  • causal language unsupported by the study design

  • inconsistencies between Methods and Results

  • discrepancies between tables and text

  • conclusions not directly supported by results

  • missing alternative explanations

這其實是 Agent 很有價值的用途。

因為:

Generation 與 Critique 最好分開。

不要讓同一個 prompt 一邊寫、一邊自行判定自己寫得很好。


Phase 9|Citation audit

每一個 citation 做 claim–source verification

Agent 應逐一檢查:

Manuscript claim

Citation

Original paper

Does the cited paper actually support this claim?

可以產生:

Manuscript claimCitationSupported?Problem
X improves YSmith 2024⚠️ Partialobservational study,不能說 improves
X has high reliabilityLee 2025ICC=.91
Previous studies consistently…Wang 2023only one population

這一步可以顯著降低 AI-assisted writing 最危險的問題之一:

citation distortion


Phase 10|Submission audit

最後才做「投稿工程」

Agent 最後檢查:

Journal compliance

  • word count

  • title length

  • abstract structure

  • keywords

  • reference style

  • tables/figures

  • supplementary files

Reporting guideline

  • CONSORT

  • STROBE

  • PRISMA

  • COSMIN

  • TRIPOD

  • CHEERS

  • 其他適用 guideline

Editorial package

  • title page

  • blinded manuscript

  • cover letter

  • highlights

  • graphical abstract

  • author contributions

  • conflict of interest

  • funding statement

  • data availability statement

  • reporting checklist

這一階段其實非常適合 Agent,因為它屬於規則明確、但人工很容易漏掉的 repetitive work


以上流程可濃縮以下架構

① Author rules

② Research question + central claim

③ Target journal

④ Methods + Results + Tables/Figures

⑤ Core literature + Evidence Matrix

⑥ Introduction/Discussion architecture

⑦ Manuscript drafting

⑧ Scientific audit

⑨ Citation audit

⑩ Journal & submission audit

其中我覺得最值得強調的是:

Agent 最有價值的地方,未必是「幫作者寫文章」,而是讓 manuscript preparation 從一次性的文字生成,變成一個可以反覆檢核的、可重現的 workflow。


還可以進一步區分「人」與「Agent」的責任

建議學生或研究者不要形成:

Human → 給資料 → AI → manuscript

而是:

Human scientific judgment → Agent execution → Human decision → Agent audit → Human approval

尤其以下幾件事,我認為最後一定屬於作者:

研究問題是否重要、研究結果應如何解釋、claim 可以做到多強、哪些 limitation 最重要、研究真正的 novelty 是什麼。

而 Agent 特別適合處理:

搜尋與整理、格式化、跨檔案核對、文獻證據映射、一致性檢查、初稿生成、反覆 revision、journal compliance 與 quality assurance。

給學生或年輕研究者,我把核心原則命名為:

「Evidence-first, outline-before-prose, audit-after-generation」

這三句幾乎就是整套 Agent-assisted manuscript writing workflow 的精髓。

2026年8月15日 星期六

AI輔助自我調節與精熟學習循環

生成式AI可以快速解釋知識、回答問題、產生題目及提供回饋。然而,學生「得到答案」或「當下答對」,不代表已真正學會。學習者也可能因AI解釋得十分流暢,誤以為自己已充分理解,形成「看懂等於學會」的錯覺。

因此,AI輔助自學不應只是:

學生提問 → AI提供答案。

比較完整的模式應包含:

目標設定 → 能力診斷 → 學習者先嘗試 → AI提供適應性支援 → 刻意練習 → 回饋與反思 → 無支架檢核 → 延宕與遷移驗證 → 外部驗證與持續調整。

我將此模式稱為:

AI輔助自我調節與精熟學習循環

英文名稱為:

AI-Supported Self-Regulated Mastery Learning Cycle

這個循環的目的,不是讓AI替學習者完成任務,而是協助學習者:

  1. 了解自己需要學會什麼;

  2. 確認目前能力與目標之間的差距;

  3. 透過適當的練習與回饋修正問題;

  4. 最後在沒有AI支架的情況下,仍能獨立完成任務。

圖1 AI輔助自我調節與精熟學習循環(四個Phase與九個Stage

AI依據學習目標、學習者表現、信心及可能的錯誤原因,提供適量的scaffolding與formative feedback。學習者通過無支架Stage-Gate後,再接受延宕、遷移及真實任務驗證;驗證結果則用於更新後續學習策略,形成持續校準的閉環。

圖中的實線箭頭呈現主要學習循環;由Phase 4向Phase 1–3延伸的淡色虛線,表示外部校準並非只能在最後進行。當AI無法提出充分依據、學習者持續未達標,或任務涉及高風險判斷時,任何Stage均可提前啟動外部驗證或轉介。

本文提出的是一套整合Self-Regulated Learning、Mastery Learning、Deliberate Practice、Retrieval Practice、Scaffolding、Metacognitive Calibration與Transfer of Learning等概念的初步conceptual framework。各項組成具有相關理論與研究基礎,但整體「四個Phase/九個Stage」模式的feasibility與effectiveness,仍需進一步透過實證研究驗證。

若只想快速了解本架構,可閱讀圖1、四個Phase總覽及九個Stage總表;若要實際應用於教學或自學,可繼續閱讀後續的錯誤分析、Stage-Gate、風險分級及操作Prompt。


一、四個Phase與九個Stage

本架構包含四個Phase:「目標與診斷」、「嘗試與精進」、「獨立與遷移」及「外部校準」。四個Phase與九個Stage的對應如下:

表1 四個Phase與九個Stage之對應
Phase Stage 核心問題
Phase 1:目標與診斷 1–2 要學會什麼?目前差距在哪裡?
Phase 2:嘗試與精進 3–6 為何出錯?需要什麼支援與練習?
Phase 3:獨立與遷移 7–8 沒有AI後,能否維持並應用?
Phase 4:外部校準 9 AI與自我判斷是否可信?

九個Stage的具體任務如下:

表2 九個Stage的主要任務、AI協助與學習者責任
Stage 主要任務 AI可以提供的協助 學習者的責任
1. 界定目標與標準 確認需要學會的knowledge、skills及attitudes 整理學習目標、rubric、範例及常見錯誤 理解目標,確認何種表現才算達標
2. 基線能力與信心評估 評估先備知識、目前能力及自我判斷 產生診斷題,分析答案、理由及信心 先作答,說明理由並評估信心
3. 學習者先嘗試 在AI講解前先完成任務 暫不提供完整答案,以問題引導思考 提出自己的答案、推理及困難
4. 錯誤機制分析與支架配置 推測錯誤原因及所需協助程度 蒐集表現證據,提供提示、範例或任務拆解 使用必要支架修正理解,而非直接抄錄答案
5. 刻意練習與依表現證據的回饋 針對弱點進行反覆且有目的的練習 依rubric指出具體證據、優缺點及修改方式 根據回饋修正並再次練習
6. 自我解釋、反思與校準 將錯誤轉化為下一次可使用的判斷規則 引導結構化反思,比較信心與實際表現 說明錯誤原因、修正原則及下一步
7. 無支架Stage-Gate 確認能否獨立完成新的平行任務 提供parallel forms,不給提示或答案 在沒有AI協助下完成任務並說明理由
8. 延宕、遷移與真實任務 檢查所學能否保留並應用於新情境 安排延宕測驗、跨情境案例及模擬任務 將所學遷移至不同問題或臨床情境
9. 外部驗證、更新或轉介 確認AI與自我判斷是否可信 整合外部效標並標示不確定性 與教材、文獻、教師或真實表現比對

九個Stage與Self-Regulated Learning的對應

本架構可與Self-Regulated Learning的三個主要歷程相互對照:

  • Forethought:目標設定、標準確認、基線評估及信心判斷;

  • Performance:先嘗試、支架配置、刻意練習、自我監控及策略使用;

  • Self-reflection:錯誤歸因、表現校準、外部驗證及策略更新。


二、為什麼一定要「先嘗試,後支援」?

如果學生一開始就要求AI提供完整解釋或答案,可能產生熟悉感,卻未必形成能自行提取與應用的知識。

因此,AI教練應先要求學生:

  • 用自己的話解釋概念;

  • 提出初步答案;

  • 說明判斷理由;

  • 評估答案信心;

  • 指出最不確定的部分。

例如,與其直接問AI「什麼是standard deviation?」,可以改成:

請先讓我用自己的話解釋standard deviation,並舉一個OT評估分數的例子。請不要立刻告訴我答案;先用Socratic Questioning檢查我的理解,再根據我的錯誤提供最少且必要的提示。

這樣才能觀察學習者真正理解多少,而不是只確認學習者能否看懂AI的解釋。


三、一個微型案例:解讀RCT研究結果

任務

OT學生需要完整解讀一篇RCT主要結果的statistical significance、effect size、precision及clinical importance。

表3 以解讀RCT研究結果為例的九個Stage學習活動
Stage 學習活動示例
1. 界定目標 能整合解釋effect estimate、95% CI、p value及clinical importance。
2. 基線評估 學生先判斷研究結果是否具有統計與臨床意義,並報告自己的信心程度。
3. 先嘗試 學生在AI提供解釋前,先以自己的話解讀表格及主要研究結果。
4. 錯誤分析 發現學生僅依p value判斷介入「有效」,未整合effect estimate、95% CI、clinical importance及研究限制。
5. 支架與練習 AI先以提示問題引導學生整合各項資訊,不直接公布完整答案;再針對未理解的部分安排練習。
6. 反思與校準 學生修正原本的解釋,說明錯誤原因,並形成可重複使用的研究結果判讀規則。
7. 無支架檢核 學生在沒有AI提示下,獨立解讀另一篇RCT的主要研究結果,並說明判斷理由。
8. 延宕與遷移 一週後解讀不同疾病、研究主題或介入領域的研究結果,確認是否能保留並遷移所學。
9. 外部驗證 將學生的解讀與原始論文、教師評分、rubric及正確的統計判讀原則進行比對。

實際的Stage-Gate通過標準

例如:

在沒有AI提示下,學生須正確解讀另一篇RCT的主要結果,並依序說明effect estimate、95% CI、p value及clinical importance;不得將statistical significance直接等同於clinical importance。

如此,案例便不只是活動流程,也示範如何將抽象的mastery轉化為observable performance criteria。


四、AI應先蒐集證據,再推測可能的錯誤原因

相同的錯誤答案,背後原因可能完全不同。因此,AI不應對所有錯誤都提供相同的解釋。

表4 可能的錯誤類型與適合的AI介入方式
可能的錯誤類型 適合的AI介入
知識不足 提供核心概念與最少必要教材,協助學習者補足完成任務所需的基礎知識。
存在錯誤概念 使用反例、概念比較及conceptual conflict,引導學習者察覺原有理解與證據之間的不一致。
知道但提取失敗 安排retrieval practice及spaced practice,增加學習者主動提取與延宕後再次提取的機會。
判斷規則不清楚 協助建立decision rule或checklist,將抽象原則轉化為可以重複執行的判斷步驟。
只會原題、無法遷移 提供表面特徵不同但核心原理相同的新案例,檢查學習者能否辨識並應用相同原則。
程序遺漏或粗心 使用流程提示及self-check checklist,要求學習者在提交答案前逐項確認必要步驟。
過度自信 比較主觀信心與客觀表現,並要求學習者提出支持答案的具體證據。
過度依賴AI 逐步撤除scaffolding,增加無AI提示的任務,確認學習者能否獨立完成。
AI無法提出充分依據 明確標示不確定性與缺少的資訊,停止作出確定判斷,並轉介教師、專家或其他可信來源。

AI對錯誤原因的判斷應被視為需要後續驗證的假設,而不是確定的診斷。

因此,AI的核心角色不是「快速給答案」,而是:

分析學習表現、形成錯誤原因假設、選擇適當支架、安排針對性練習,並在適當時機撤除支架。


五、自我檢核不能只有答對率

較完整的自我檢核,至少應包含四種證據:

表5 自我檢核的四種證據
檢核面向 核心問題
表現 我是否答對問題,或依照預定標準完成任務?
理由 我能否說明為何作出這項判斷,而不只是猜對答案?
信心 我對答案有多大信心?我的信心程度是否符合實際表現?
獨立性 沒有AI提示、範例或即時修正時,我是否仍能獨立完成?

每次重要練習後,可以固定記錄:

  1. 我的答案或實際表現;

  2. 我的判斷理由;

  3. 我的信心程度(0–100分);

  4. AI的評分及其具體證據;

  5. 我真正或可能的錯誤類型;

  6. 下一次遇到類似任務時,我要先檢查什麼。

其中第六項特別重要,因為它能將一次錯誤轉化為未來可以遷移的decision rule。

每次作答後,學習者可將0–100分的信心與答案正確性、理由品質及無支架表現比較:

  • 高信心但表現錯誤:可能存在過度自信或較穩固的錯誤概念;

  • 低信心但表現正確:可能需要增加retrieval practice及應用練習;

  • 高信心且表現正確:仍須經由無支架、延宕及遷移任務確認;

  • 低信心且表現錯誤:通常需要補充核心知識與較明確的scaffolding。


六、Stage-Gating:不是一次答對就算精熟

Stage-Gating是指:學習者必須符合預先設定的標準,才能進入下一階段。

單次測驗答對80%,不足以證明已經精熟。較嚴謹的通過標準可以包含:

  • 知識測驗達到預定門檻;

  • 關鍵安全題全部答對;

  • 能用自己的話說明理由;

  • 能辨識常見錯誤;

  • 能應用於未見過的新案例;

  • 在沒有AI提示下仍能完成;

  • 延宕一段時間後仍能維持表現;

  • 自我信心與客觀表現沒有明顯落差。

通過標準可分為三類:

表6 Stage-Gate的三類通過標準
標準類型 判定重點與範例
必要門檻 總分達到預先設定的標準;關鍵安全題必須全部正確。
品質條件 判斷理由合理且具有證據支持;沒有重大概念錯誤或關鍵資訊遺漏。
獨立性條件 在沒有AI提示、範例或即時修正的情況下完成任務,並能處理未見過的新案例。

進一步的操作模板如下:

學習者須在無AI提示下,於兩個parallel tasks中達到預定rubric標準;關鍵安全項目須全部通過,並能說明主要判斷理由,才可進入延宕與遷移階段。

「80%」只能作為示例,不是普遍適用的mastery標準。實際門檻應依任務內容、風險程度及錯誤後果設定。涉及病人安全的項目通常屬於non-compensatory criteria,不能由其他項目的高分抵銷。

如果未達標,系統不應只重複原題,而應回到錯誤分析,重新選擇練習方式及支架強度。

支架配置的執行順序

AI可以依下列順序,從最低程度的協助開始:

  1. 要求學習者重新檢查;

  2. 提出Socratic question;

  3. 指出錯誤可能出現的範圍;

  4. 提供部分提示或decision rule;

  5. 提供worked example;

  6. 最後才提供完整解釋。

基本原則是:

AI應從最低層級的有效支援開始;只有在學習者仍無法進展時,才提高支架強度。


七、需要兩種不同速度的循環

AI輔助學習可區分為「快速學習循環」與「慢速驗證循環」。

表7 快速學習循環與慢速驗證循環之比較
循環 執行頻率 主要功能
快速學習循環 每題或每次練習 即時分析學習表現,提供提示、形成性回饋與修正機會。
慢速驗證循環 數日、數週或課程結束後 檢查學習內容的延宕保留、跨情境遷移、獨立性及真實任務表現。

AI可以頻繁執行快速循環,但學習者是否真正形成穩定能力,應由慢速驗證循環判定。

在AI提示下當下答對,不等於學會;經過一段時間後,面對新的問題,在沒有AI協助時仍能正確完成,才比較接近真正的能力。

何時結束或改變循環?

可能有三種情況:

  • 達標:進入延宕與遷移驗證;

  • 部分達標:縮小弱點範圍後繼續練習;

  • 持續未達標或AI無法提出充分依據:轉介教師、同儕、專家或其他可信教材。

因此,Stage 9的外部驗證與轉介應視為所有Stage均可啟動的安全出口,而不只是循環的最後一步。


八、精熟學習的判定

本循環所稱的「精熟表現」,不只是能回答正確答案,而是同時具備:

正確性 × 可解釋性 × 遷移性 × 獨立性 × 維持性

這裡的乘號是概念性表示,意指五個面向相互依賴,並非實際的數學計分公式。任一關鍵面向明顯不足,均不宜直接判定為精熟。

也就是說,學習者需要:

  • 知道正確內容;

  • 能說明判斷理由;

  • 能應用於不同情境;

  • 沒有AI協助時仍能完成;

  • 經過一段時間後仍能維持。

精熟程度可進一步區分為:

  • Stage 7通過——初步精熟(provisional mastery):證明學習者當下可以無支架獨立完成;

  • Stage 8通過——可維持且可遷移的精熟(retained and transferable mastery):證明能力可以延宕保留、跨情境遷移或應用於真實任務;

  • 最終精熟判定:應至少納入Stage 8的結果,必要時再由外部效標、教師或專家確認。


九、AI評分不等於最終能力判定

AI適合提供頻繁且低成本的formative feedback,但仍可能出現:

  • 評分標準不一致;

  • 過度肯定學習者;

  • 誤解語境或任務要求;

  • 提供看似具體但缺乏充分依據的回饋;

  • 對高風險臨床判斷提出錯誤建議。

因此,AI評估結果應盡量附上:

  1. 使用的rubric或判準;

  2. 支持評分的具體表現證據;

  3. 尚未取得的必要資訊;

  4. 評估的不確定性;

  5. 是否需要教師或專家覆核。

安全性與任務風險分級

表8 任務風險分級、AI角色與最終判定方式
任務風險 AI適合的角色 最終判定
低風險 題目生成、基礎知識練習、即時提示及形成性回饋。 可主要由AI協助,但學習者仍應保留基本查證責任。
中風險 學術寫作、案例推理、技能模擬,以及依rubric提供初步評分與回饋。 採用AI、明確rubric及抽樣人工覆核;重要結果仍需人工確認。
高風險 臨床決策、病人安全、資格認證、summative assessment及其他可能造成重大後果的任務。 必須由教師、合格專家或具正式權責者作出最終判定;AI只能提供輔助資訊。

此分級可以避免將AI形成性評量直接當成summative assessment、專業認證或clinical decision-making的唯一依據。


十、讀者可直接使用的Prompt

我要學習【填入主題或技能】。請依照「AI輔助自我調節與精熟學習循環」帶領我:

  1. 先和我確認具體的學習目標與達標標準;

  2. 使用診斷題評估我的答案、理由及信心;

  3. 在我先作答前,不要提供完整答案;

  4. 請根據我的實際表現,提出一至兩項可能的錯誤原因假設,不要把推測當成確定診斷;

  5. 從最低程度的提示開始,只有在我仍無法進展時才增加支架;

  6. 依rubric及我的具體表現證據,指出優點、問題及修改方法;

  7. 要求我說明錯誤原因,並形成下一次可以使用的判斷規則;

  8. 最後使用未見過的parallel task進行無提示檢核;

  9. 協助我規劃數日後的延宕測驗及不同情境的遷移任務;

  10. 若內容涉及高風險判斷、資訊不足或你無法提出充分依據,請明確標示不確定性,並建議適當的外部查證方式。

請一次只進行一個步驟,不要一次公布完整答案及所有後續題目。

備註:真正的延宕測驗不能在同一次對話立即完成,必須在數日或數週後重新進行;若AI系統無法主動提醒,學習者應自行設定日期或行事曆提醒。


十一、理論基礎與延伸閱讀

理論與學習原理對照

表9 架構成分與主要學習理論或學習原理之對應
架構成分 主要理論或學習原理
目標設定、學習監控與反思 Self-Regulated Learning
先嘗試與無支架測驗 Retrieval Practice
根據學習表現配置適量協助 Scaffolding
隨能力進展逐步撤除提示 Fading
針對具體弱點進行反覆練習 Deliberate Practice
達到預定標準後進入下一階段 Mastery Learning
經過一段時間後進行延宕測驗 Retention
將所學應用於新案例及真實任務 Transfer of Learning
比較主觀信心與客觀表現 Metacognitive Calibration

主要概念中英對照

  • 評分規準(rubric)

  • 平行任務或平行測驗(parallel tasks/parallel forms)

  • 階段通過關卡(Stage-Gate)

  • 判斷規則(decision rule)

  • 支架(scaffolding)

  • 支架逐步撤除(scaffolding fading)

  • 提取練習(retrieval practice)

  • 間隔練習(spaced practice)

  • 初步精熟(provisional mastery)

  • 可維持且可遷移的精熟(retained and transferable mastery)

  • 後設認知校準(metacognitive calibration)

代表性文獻

Bjork, R. A., Dunlosky, J., & Kornell, N. (2013). Self-regulated learning: Beliefs, techniques, and illusions. Annual Review of Psychology, 64, 417–444. https://doi.org/10.1146/annurev-psych-113011-143823

Dunlosky, J., Rawson, K. A., Marsh, E. J., Nathan, M. J., & Willingham, D. T. (2013). Improving students’ learning with effective learning techniques: Promising directions from cognitive and educational psychology. Psychological Science in the Public Interest, 14(1), 4–58. https://doi.org/10.1177/1529100612453266

Ericsson, K. A., Krampe, R. T., & Tesch-Römer, C. (1993). The role of deliberate practice in the acquisition of expert performance. Psychological Review, 100(3), 363–406. https://doi.org/10.1037/0033-295X.100.3.363

McGaghie, W. C. (2015). Mastery learning: It is time for medical education to join the 21st century. Academic Medicine, 90(11), 1438–1441. https://doi.org/10.1097/ACM.0000000000000911

Pan, S. C., & Rickard, T. C. (2018). Transfer of test-enhanced learning: Meta-analytic review and synthesis. Psychological Bulletin, 144(7), 710–756. https://doi.org/10.1037/bul0000151

Roediger, H. L., III, & Karpicke, J. D. (2006). Test-enhanced learning: Taking memory tests improves long-term retention. Psychological Science, 17(3), 249–255. https://doi.org/10.1111/j.1467-9280.2006.01693.x

van de Pol, J., Volman, M., & Beishuizen, J. (2010). Scaffolding in teacher–student interaction: A decade of research. Educational Psychology Review, 22, 271–296. https://doi.org/10.1007/s10648-010-9127-6

Zimmerman, B. J. (2002). Becoming a self-regulated learner: An overview. Theory Into Practice, 41(2), 64–70. https://doi.org/10.1207/s15430421tip4102_2


十二、結語

生成式AI最有價值的教育角色,不是成為無所不答的「答案機」,而是成為能適時提問、分析錯誤、配置支架、提供回饋及安排再練習的「學習教練」。

但是,AI不應成為唯一的能力判定者。學習是否真正發生,仍需透過無支架表現、延宕保留、跨情境遷移、外部標準及真實任務加以驗證。

因此,較理想的AI輔助自學模式是:

學習者先思考與嘗試,AI依據實際表現推測可能的錯誤原因,並提供適量支援;支援再逐步撤除,最後由學習者以獨立、可維持且可遷移的表現,證明自己真正學會。

這樣的AI,才不只是幫助學生「完成這一次任務」,而是協助學生逐步發展「下一次能夠自己完成」的能力。


相關貼文



ChatGPT Work 幫忙整理這個 blog

 若用一句話概括,這個 Blog 是:

一位職能治療學者從psychometrics與神經復健研究出發,逐步擴展至研究人才培育、臨床技能教育與生成式AI應用的17年公開學術工作誌。

它同時具有四種功能:

  1. Research notebook:保存尚在形成中的研究問題與方法構想。
  2. Teaching archive:累積可供學生、研究助理及年輕研究者使用的教材。
  3. Mentoring record:呈現您對研究訓練、能力發展與學術生涯的長期觀點。
  4. Intellectual autobiography:記錄研究專長由psychometrics、CAT、AI,到virtual patient與AI Agent的演變。



最值得注意的是:

主軸其實沒有因AI出現而中斷。近年的生成式AI研究,仍延續早期一貫關注的問題——如何建立可信的評估、如何提升學習者能力、如何提供有效回饋,以及如何將研究成果轉化為臨床與教學可使用的方法。

2026年7月27日 星期一

準備演講的流程與修改: Codex 應用

7月26日的演講(主題:AI 浪潮中 OT 教師之教學與學習策略),我跟 Codex 協作,約準備一個月

Q1: [請依據時間序還有整個工作流程,綜合說明這個專案的工作流程。重點即可]

Q2: [請依據上述流程,給予建議,以利後續更有效能。]

Q3: [請將你建議的流程,設計成 skill 以便後續(全域)應用]

--------------------------------------------------------------------

Q1: [請依據時間序還有整個工作流程,綜合說明這個專案的工作流程。重點即可]

Codex: 這個專案不是單純製作簡報,而是「需求盤點 → 實證搜尋 → 教學策略設計 → 案例整合 → 簡報驗證」的完整流程。

  1. 6/22|確認需求

    • 盤點生成式 AI/Agent 在 OT 教學與研究的應用。
    • 設計問卷與 Google Form,了解教師使用情形、需求與顧慮。
  2. 6/26|確認對象

    • 依會議名單整理參與教師與聯絡資料,建立聽眾/學員輪廓及後續資料傳遞管道。
  3. 6/29–6/30|建立簡報主架構

    • 製作初稿、Slido 互動題與逐頁講稿。
    • 依 50 分鐘演講時間及聽眾特性反覆調整。
    • 主軸由「介紹 Agent」轉為:
      學生如何使用 AI → 教師如何重設作業與評量 → AI/Agent 如何支援教師工作。
  4. 7/14–7/15|建立實證基礎

    • 系統性搜尋 PubMed、ERIC,共整理 2,891 筆資料。
    • 篩選出 105 篇核心實證研究,完成全文蒐集、分類與證據矩陣。
    • 將研究整理成可供簡報使用的主題與應用場景。
  5. 7/22–7/24|針對核心問題補強證據

    • 補充 AI 對作業效度、評量公平與偵測偏誤的研究。
    • 更新 2025–2026 年學生 AI 使用與學習成效資料。
    • 將複雜研究結果轉成教師可採用的作業、回饋及評量策略。
  6. 7/23–7/25|加入 OT 實作案例

    • 將研究重新整理成七類應用場景。
    • 分析自己的四篇 GPT 應用研究,形成由簡到繁的技術路徑:
      提示工程 → Custom GPT → 虛擬病人/考官 → 語音臨床工作流程。
  7. 7/26|最終整合與品質檢查

    • 審閱原本 68 張簡報,將現場主線精簡為 29 張。
    • 另保留 37 張研究、技術與資源備查資料,最終共 67 張。
    • 統一視覺、頁碼、術語、引用與風險表述,並完成逐頁渲染及版面檢查。正式版從第 30 張起進入補充資料:AI浪潮中OT教師之教學與學習策略_統一修訂版.pptx (投影片 30)

一句話概括:

先了解教師與學生面臨的 AI 教學問題,再以文獻和 OT 實作案例建立策略,最後轉化成可現場講授、可課後查閱的完整簡報。

詳細歷程保存在 [chronicle.md](D:\\Dropbox\\2026\\演講\\學會7月26日\\chronicle.md)。

------------------------------------------------------------------------

Q2: [請依據上述流程,給予建議,以利後續更有效能。]

Codex: 建議優先改善以下幾點:
  1. 先凍結演講規格再開始製作

    • 先確定聽眾、時間、三個核心訊息與預計張數。
    • 例如:50 分鐘、核心 25–29 張、其餘全部進附錄。
    • 可避免後期由 Agent 主題改成教學策略時大量重做。
  2. 文獻工作採兩層制

    • 第一層:先找 8–12 篇關鍵研究,足以支撐演講。
    • 第二層:完整系統性搜尋另作研究報告或長期資料庫。
    • 不必每次為一場演講重新處理數千篇文獻。
  3. 建立單一「證據—簡報對照表」

    • 每項主張記錄:研究結果、證據強度、引用來源、使用頁次及更新日期。
    • 後續修改簡報時,可直接追蹤來源,減少反覆查證。
  4. 將內容模組化

    • 固定分成:學生學習、作業與評量、教師工作流、GPT 研究案例、OSCE 案例、課後資源。
    • 未來只需重新排列或抽換模組,不必整份重做。
  5. 一開始就分開三種產出

    • 現場核心簡報。
    • 備查附錄。
    • 學員課後講義/資源包。
    • 可避免研究清單、網址、操作細節擠入現場主線。
  6. 簡化版本與資料夾管理

    • 只保留一份明確的「目前正式版」。
    • 舊版統一移至 archive,測試檔放 tmp,正式產出放 outputs/final
    • 檔名標示日期與修改目的,避免大量 v2finalrevised 混用。
  7. 設定固定品質關卡

    • 大綱確認 → 證據確認 → 內容確認 → 視覺與時間確認 → 示範與資安確認。
    • 每次交付前自動檢查頁碼、字級、溢出、引用、講者備註及連結。
    • 額外確認 QR code、帳號權限、HTTPS 與個資風險。
  8. 保留演講後的回饋循環

    • 蒐集 Slido、提問與問卷結果。
    • 記錄哪些頁面最有反應、哪些內容過難或未講完。
    • 回饋直接更新至模組庫,成為下一場演講的起點。

建議的精簡標準流程是:

需求與聽眾定義 → 核心證據搜尋 → 三訊息大綱 → 模組化製作 → 核心/附錄分流 → 時間與視覺驗證 → 演講回饋更新

其中最值得立即落實的三項是:先鎖定主軸、建立證據對照表、從第一天就分開核心簡報與附錄。

------------------------------------------------------------------------

Q3: [請依據上述流程,給予建議,以利後續更有效能。]

Codex: 我會使用 skill-creator,把剛才的建議轉成可重複執行的全域工作流程 skill;內容會包含適用情境、決策關卡、標準資料結構、證據管理、簡報/講義分流,以及交付前 QA。完成後會先驗證 skill 結構,再安裝到全域 skills 目錄。



---------------------------------------
以下列出部分相關圖示(都是 Codex 繪製)












2026年7月14日 星期二

Codex 高效文獻檢索與彙整

拆成 8 個連續 prompts+3 個人工確認關卡

圖:以檢索「課程大綱之評量表」為檢索標的(研究問題),Codex所建議之執行流程
(可製成 Skill,以供後續使用)

 ### Prompt 1:建立研究規格

我要研究的問題是:【填入研究問題】

請先建立可執行的文獻檢索規格,不要開始大量下載。請提出:

1. 研究主題的操作型定義;

2. 主要概念詞群及同義詞;

3. 建議納入的資料庫與選擇理由;

4. 日期、語言及文獻類型範圍;

5. 明確的納入與排除條件;

6. 可用於測試召回率的 seed papers;

7. 各資料庫專屬檢索式;

8. 標準化輸出欄位;

9. 去重複文獻的規則;

10. 停止搜尋的條件;

11. 預計產出的檔案。

請特別標示需要研究者確認的決策,不要自行決定研究範圍。

---

### Prompt 2:小量試搜與檢索式診斷

請依已核准的研究規格進行小量試搜。

每個資料庫先取得前 30–50 筆題名與摘要,並回報:

1. 完整檢索式;

2. 資料庫命中總數;

3. 明顯相關、疑似相關及明顯誤查的數量;

4. 是否找到指定的 seed papers;

5. 五種主要誤查模式;

6. 可能遺漏的同義詞或主題詞;

7. 建議修正後的檢索式;

8. 檢索結果可能過寬或過窄的原因。

尚未通過研究者確認前,不要進行正式批次下載。

---

### Prompt 3:各資料庫正式下載

請依核准的檢索式,從【資料庫名稱】正式取得文獻資料,最多【數量】筆。

請優先使用官方 API 或可公開驗證的匯出方式,並保存:

1. raw:原始 JSON、XML或資料庫匯出檔;

2. standardized:統一欄位的 CSV;

3. readable:題名、作者、年份、來源、網址與摘要的閱讀版;

4. search metadata:檢索式、檢索日期、資料庫命中數及下載方式。


標準欄位至少包含:

database、database_id、doi、title、authors、publication_date、year、source、publication_type、url、abstract、keywords、query_id、retrieval_date。

完成後請驗證並回報:

- 資料庫命中數與實際下載數;

- 缺少摘要及 DOI 的數量;

- 年份範圍;

- API 分頁是否完整;

- 是否因筆數上限而截斷;

- 欄位缺漏或異常紀錄。

不要進行跨資料庫去重,也不要替研究者做最終納入決定。

---


### Prompt 4:整併與去重

請匯入所有資料庫的標準化 CSV,不得修改或覆寫原始資料。

依下列順序交叉去重:

1. 標準化 DOI;

2. PMID、ERIC ID、OpenAlex ID或其他外部識別碼;

3. 正規化題名;

4. 作者、年份及題名相似度僅用於標記疑似重複,不得自動刪除。

同一文獻若出現在不同資料庫:

- 保留資料較完整的紀錄;

- 合併所有資料庫來源;

- 補足 DOI、摘要、作者及關鍵詞;

- 保留每筆合併與刪除的理由。


請輸出:

- combined_deduplicated.csv;

- duplicates_removed.csv;

- possible_duplicates_for_review.csv;

- deduplication_report.md。


報告各庫原始筆數、庫內重複、跨庫重複、最終唯一筆數及待人工確認數。

---

### Prompt 5:兩階段相關性篩選

請依題名、摘要與關鍵詞進行高召回初篩,將每筆文獻標記為:

- 高相關;

- 中相關;

- 低相關;

- 資訊不足。

每筆必須提供:

- relevance_label;

- reason;

- matched_concepts;

- 建議下一步。

再將高相關及中相關文獻分類為:

- 工具發展;

- 信效度驗證;

- 既有工具應用;

- 自建內容分析;

- 背景或概念研究。

不要永久刪除低相關紀錄。請另外輸出需要人工判斷的候選清單與明確排除理由。

---

### Prompt 6:固定欄位證據抽取

只針對研究者核准納入的文獻進行證據抽取。

每篇至少抽取:

- 完整書目;

- 工具名稱;

- 工具類型及成熟度;

- 發展、驗證或應用研究;

- 使用場域與對象;

- 構面及題數;

- 評分方式;

- 樣本;

- 內容效度;

- 評分者間信度;

- 內部一致性;

- 因素結構;

- 效標或預測效度;

- 主要結果;

- 限制;

- 工具取得位置;

- DOI或穩定網址;

- 證據原句、頁碼或表格位置;

- reviewer_confidence。


摘要或全文未提供的資訊,一律填寫「未報告」,不可自行推測。資料不足時標記「需全文確認」。

---


### Prompt 7:建立工具家族並綜合報告

請先依原始工具來源、構面、題項及引用關係建立 tool family。

將同一工具的下列版本連結在一起:

- 原始版本;

- 簡版;

- 改編版;

- 翻譯版;

- 驗證研究;

- 應用研究。

不要只因文章中的名稱不同,就判定為不同工具。

請產出:

1. 工具家族比較表;

2. 工具目的、構面、評分及適用情境;

3. 證據成熟度與限制;

4. 工具發展、驗證及應用文獻的區分;

5. APA第7版參考文獻;

6. 完整檢索與去重方法;

7. 結果摘要;

8. 研究限制與待全文確認事項。

每項工具及重要結論都必須能回連至少一篇文獻來源。

---


### Prompt 8:最終稽核

請對所有檢索、去重、篩選、證據抽取及綜合結果進行最終稽核,不要只潤飾文字。

請檢查:

1. 各階段筆數是否前後一致;

2. 是否仍有 DOI或題名重複;

3. 納入與排除理由是否符合 protocol;

4. 每項工具敘述是否有來源;

5. 信效度資訊是否被過度推論;

6. 摘要不足是否明確標示;

7. 工具別名是否被錯分為不同工具;

8. APA資料與 DOI是否一致;

9. 方法段落是否足以重現檢索;

10. 結論是否超出文獻證據。

請將問題分成「必須修正、建議修正、需研究者判斷」,並列出具體位置與修改建議。

-----

以上絕大多數內容/流程都是 Codex 的建議.... 個人之前的檢索策略實在卑微!!