顯示具有 Research-研究主題-心理計量特性 標籤的文章。 顯示所有文章
顯示具有 Research-研究主題-心理計量特性 標籤的文章。 顯示所有文章

2026年8月28日 星期五

從臨床評估到AI Agent:我的AI研究旅程(2017–2026)

昨日(Aug. 27, 2026)看到 Alpha Go 10 年新聞:Alpha Go人機大戰十年後,傳奇棋士李世乭獻給人類的反思

我就讓 ChatGPT work 幫我彙整一下我研究歷程/里程碑(查詢部落格里程碑),再做彙整如下:

回顧這幾年的研究發展,我投入AI並不是從ChatGPT出現後才開始。較精確地說,2017年是構想萌芽(受到 Alpha Go 啟發),2018年是研究團隊正式投入AI的起點;2023年生成式AI興起後,則迎來第二次、也可能是影響更深遠的轉捩點。

這段歷程並不是單純追逐新科技,而是持續嘗試回答一個核心問題:

AI是否能協助我們提高臨床評估、研究、教學與學習的效能,同時維持結果的正確性、可解釋性與專業責任?

從早期的Machine Learning、short form與臨床評估與應用,到近期的LLM測量工具、GPT-based rater、虛擬病人及AI Agent,研究主軸其實始終相當一致:運用AI降低負擔、提升評估與後續應用效能,以 applied psychometrics為評估與應用之基石、以及實證驗證。


一、2017–2018年:從臨床問題出發,而不是從AI技術出發

2017年,我開始思考能否以AI解決臨床評估效能與臨床決策支援的問題。當時關注的並不是某個特定演算法,而是臨床現場長期存在的困難:

  • 評估工具眾多,臨床人員不容易選擇。

  • 完整量表施測時間過長。

  • 分數改變不一定代表病人真正進步。

  • 不同評估結果不容易整合成可行的臨床決策。

  • 大量臨床資料尚未被有效轉化為評估與治療資訊。

到了2018年,研究團隊開始定期討論AI,並提出應用AI的多年期研究計畫。我也明確將2018年稱為研究團隊的「AI元年」。

因此,如果要為這段AI旅程設定正式起點,最合適的年份是:

2016年受到 Alpha Go 啟發,2017年開始構思,2018年正式、有組織地投入。


                                           圖1:AI研究發展的重要里程碑(2017–2026)

Note: 研究發展由臨床問題構思開始,歷經傳統Machine Learning、Generative AI、教學平台化,逐步進入多模態Agent與學習理論建構。





二、2019–2022年:Machine Learning與臨床測量的結合

2019年底,協助合作者申請小兒AI計畫獲得科技部多年期支持,研究內容涵蓋發展遲緩兒童的動作、書寫、注意力及情緒評估。這項計畫除了發展AI工具,也包含研究團隊建立及AI研究人才培育。

這個階段的研究特色,是將Machine Learning與原有的臨床測量專長結合。目的並不是讓AI直接做出診斷,而是改善評估工具的效率與臨床可用性。

1. 以Machine Learning建立short form

2021年發表的A 10-item Fugl-Meyer Motor Scale Based on Machine Learning,可視為團隊第一篇正式AI代表作。

這項研究以Machine Learning將Fugl-Meyer Motor Scale縮短為10題,同時嘗試預測未施測題目的分數。它所代表的研究概念是:

評估工具縮短之後,不應只保留總分,還應盡可能保留原量表的臨床資訊與分數可解釋性。

後續再將相同概念應用於:

這些研究逐漸形成一條完整路徑:

完整量表 → Machine Learning選題 → short form → 預測未施測題目 → 驗證reliability、validity與responsiveness

2. 以Machine Learning提升臨床辨識能力

另一篇2021年的研究,運用Machine Learning改善FERD screener區辨思覺失調者與健康成人的能力。

這篇研究的意義在於:Machine Learning不只可以縮短量表,也可用於特徵擷取與分類。然而,它的定位仍應是協助screening與clinical decision support,而不是直接取代臨床診斷。


三、AI開始分析真實職能活動

AI研究的另一項重要發展,是由結構化量表資料逐漸走向真實職能活動的影像。

2023年發表於American Journal of Occupational Therapy的研究:Using Artificial Intelligence to Identify the Associations of Children’s Performance of Coloring, Origami, and Copying Activities With Visual–Motor Integration,以370位幼兒的著色、摺紙及臨摹作品照片訓練AI模型,用以預測VMI-6分數。

研究發現,摺紙與臨摹作品的組合,可解釋約39.0%至57.7%的VMI分數變異。

2025年又進一步發表Predicting Age and Visual-Motor Integration Using Origami Photographs: Deep Learning Study,使用Deep Learning分析摺紙作品照片。

這一系列研究具有相當鮮明的職能治療特色:

AI不只分析量表題目,也可以由真實活動產物中擷取與兒童發展及visual-motor integration相關的資訊。

換言之,研究方向開始由AI-assisted assessment,進一步走向AI-based occupational performance analysis






四、2023年:Generative AI帶來第二次轉捩點

2023年2月,我開始實際測試OpenAI及ChatGPT。到了3至4月,我決定正式投入Generative AI。回頭來看,這可能是職涯後期最關鍵的決定之一。

與傳統Machine Learning相比,Generative AI的影響範圍更廣。它不只可以分析既有資料,也可以:

  • 生成與修改文字。

  • 分析、彙整及比較文獻。

  • 扮演虛擬病人。

  • 依評分規準提供回饋。

  • 協助研究計畫與學術寫作。

  • 支援個別化學習。

  • 串聯不同工具與研究工作流程。

因此,研究主軸由「AI改良評估工具」,逐漸擴展為「AI如何影響研究、教學、臨床與學習」。

我在2023年ChatGPT研究回顧中曾寫道:

「2023年3~4月決定投入,這或是職涯末期最關鍵的決定。」

這並不代表放棄原有研究方向。相反地,原本累積的psychometrics、臨床評估、研究方法與教學經驗,正好成為評估Generative AI是否真正有效的基礎。


五、從評估AI工具,轉向測量AI使用者

2025年發表的Developing the Questionnaire of Self-Efficacy and Needs in Using Large-Language Model-Based AI Services,建立了Q-SNELL。

Q-SNELL用於測量使用者對八項LLM核心功能的self-efficacy與needs。研究以398位使用者進行驗證,結果支持其content validity、known-groups validity及一定程度的test–retest reliability。

這篇研究的重點,是將問題由:

「AI能做什麼?」

轉換為:

「使用者需要哪些AI功能?是否有信心正確使用這些功能?」

這也是研究方向的重要改變。AI教育不能只提供工具,也必須評估學習者的AI能力、需求、使用經驗及學習成效。

Q-SNELL因此可視為團隊第一篇正式的Generative AI psychometrics研究。


六、從ChatGPT使用走向GPT-based rater

2026年刊登於Medical TeacherDevelopment and Validation of a GPT-Based Rater for Assessing Communication Skills Using the GKCSAF,嘗試讓GPT依照Gap–Kalamazoo Communication Skills Assessment Form評估治療師與病人的訪談逐字稿。

這篇研究的重要性,不是證明GPT已經可以取代專家。事實上,研究結果顯示:

  • GPT與專家的total scores差異在部分分析中可以接受。

  • 但ICC仍然偏低。

  • domain-level agreement也相當有限。

  • 目前較適合用於low-stakes assessment與形成性回饋。

這項結果提醒我們,評估AI表現時,不能只比較平均分數,也不能因為兩組平均分數接近,就宣稱AI與專家一致。

至少還必須檢查:

  • absolute difference

  • MAE或MAE%

  • ICC

  • weighted kappa

  • measurement error

  • domain-level performance

  • responsiveness

  • 不同任務及嚴重程度下的穩定性

近期進一步發表的研究,開始比較專家與ChatGPT評分的responsiveness,也就是兩者能否偵測溝通能力訓練前後的改變。

這使研究問題由「AI能否評分」,推進至:

AI評分是否能夠穩定、有效地測量能力改變?


七、GPT開始協助evidence appraisal

2026年發表於Archives of Physical Medicine and RehabilitationDevelopment and Performance Validation of an Automated GPT-Based Evaluation Tool for the PEDro Scale,進一步讓GPT依PEDro scale評估RCT的方法品質。

研究結果顯示,GPT-based PEDro rater具有接近完整的intra-rater reliability,並與既有PEDro評分呈現moderate-to-high concurrent validity。

這項研究代表AI應用已由臨床量表及學生能力評分,延伸至:

研究方法品質評估與evidence-based practice。

未來AI可能協助處理大量RCT的初步評讀,降低systematic review及文獻評析的工作負荷。然而,這類應用仍須保留human verification,特別是涉及模糊報告、方法學判斷及高風險研究結論時。

AI在此較適合扮演的是:

可重複、有效率的初評者及研究助理,而不是擁有最終決定權的審查者。


八、2024–2026年:由單一GPT走向平台與Agent

隨著My GPTs及ChatGPT功能逐漸成熟,我開始發展虛擬病人、AI考官及多層次GPT自主學習平台(ML-GPT)

ML-GPT將學習分成三項主要功能:

  1. 虛擬病人或練習GPT。

  2. 回饋GPT。

  3. 測驗或評分GPT。

2026年發表的Developing a GPT-Based Virtual Training System for Medical Undergraduates’ History Taking in Stroke Rehabilitation,進一步整合GPT virtual patient與virtual examiner。

系統讓學生與中風虛擬病人互動,完成10項functional assessment domains的問診,再由虛擬考官自動評分與提供回饋。這代表AI研究已由單一工具進入:

互動練習 → 自動評分 → 個別化回饋 → 重複練習

到了2026年,Codex等AI Agent出現後,又可進一步整合:

  • Word與Excel資料

  • 逐字稿

  • 投影片

  • 聲音與影片

  • 評分量表

  • 文獻檢索

  • 結果報告

  • 不同AI模型及專業Skills

這使AI由「回答問題的Chatbot」,轉變為「執行多步驟任務的Agent」。

但Agent自動化程度越高,越需要清楚的任務規格、驗證程序與human checkpoints。自動化不能等同於完全授權,更不能省略專業判斷。




九、這些AI著作共同代表什麼?

回顧目前的AI研究成果,大致可以整理為以下演進:

階段代表成果核心含意
Machine Learning short formFugl-Meyer、Stroke Impact Scale、Berg Balance Scale、PANSS降低施測負擔並保留臨床資訊
Machine Learning screeningFERD screener提升臨床辨識與分類能力
Computer Vision/Deep Learning著色、摺紙與臨摹作品分析由職能活動產物推估能力
LLM使用測量Q-SNELL測量使用者的AI self-efficacy與needs
GPT-based assessmentGKCSAF rater驗證AI評分的agreement與使用界線
GPT-based evidence appraisalPEDro rater協助RCT方法品質初評
GPT learning systemVirtual patient與virtual examiner建立自主練習、評分與回饋循環
AI Agent多模態教學與研究工作流程整合多步驟任務與專業Skills

從表面上看,這些研究使用的AI技術不同;但背後其實有一個共同主軸:

AI是否能在明確的臨床、研究或教學任務中,提供具reliability、validity、responsiveness、可解釋性及適當使用界線的評估與回饋?


十、AI研究的下一階段:由工具效能走向學習理論

當AI可以提供解釋、提示、回饋、評分,甚至主動完成多步驟任務後,真正困難的問題可能不再是「AI能不能做」,而是:

  • 學習者應該在何時自己嘗試?

  • 何時才應尋求AI協助?

  • AI應提供完整答案,還是適量scaffolding?

  • 如何確認學習者真的理解,而不是只接受AI產出?

  • 如何避免AI依賴?

  • AI支持下的學習能否transfer到沒有AI的真實情境?

  • 如何以delayed testing與external validation確認學習成效?

因此,我近期開始進一步思考AI輔助self-regulated learning與mastery learning的理論架構。

核心原則是:

AI可以提供適性支持,但學習者必須保有最終主導權。

AI的角色不是盡快替學習者完成任務,而是協助學習者:

  1. 發現自己真正不理解之處。

  2. 選擇適當層次的AI支持。

  3. 回到原始資料進行驗證。

  4. 修正原有理解與策略。

  5. 在逐步撤除AI協助後獨立完成任務。

  6. 於延宕及真實情境中確認學習是否保留與遷移。





結語:AI不是另一個獨立研究題目

回頭來看,AI並不是突然加入的一個全新研究題目,而是原有研究理念的延伸。

早期的研究關心:

  • 評估結果是否可靠?

  • 量表是否有效?

  • 分數改變是否超過measurement error?

  • 評估工具能否縮短?

  • 結果能否協助臨床決策?

現在面對AI,我們仍然在問類似的問題:

  • AI產出是否可靠?

  • AI評分是否有效?

  • AI能否偵測真正的改變?

  • AI是否可以降低專業人員的負擔?

  • AI的錯誤與不確定性如何被發現?

  • 哪些任務可以交給AI,哪些仍須由人負責?

因此,我目前對AI研究的理解可以濃縮為:

AI的價值不只是產生答案,而是能否在人的監督下,提供可驗證、可解釋、可調節,並真正促進臨床決策、研究品質與學習成效的支持。

整體發展則可概括為:

臨床問題構思 → 正式AI研究 → Machine Learning與實證成果 → Generative AI轉型 → 教學平台化 → Agent自動化 → 學習理論建構

這條路仍在快速發展。接下來最值得投入的,或許不是再增加更多AI功能,而是建立更清楚的使用原則、驗證架構與學習理論,讓AI真正成為促進專業成長的工具,而不是替代思考的捷徑。

2026年7月3日 星期五

未來發展問卷,可能不必完全從零開始手寫大量題目

AI-GENIE 可以把 AI 產生的問卷題目,進一步篩成比較不重複、比較穩定、結構比較清楚的題項池;它能加速問卷早期開發,但不能取代專家判斷與完整效度驗證。



文獻: Russell-Lasalandra, L. L., Christensen, A. P., & Golino, H. (2026). Generative psychometrics via AI-GENIE: Automatic item generation and validation with network-integrated evaluation. Behavior Research Methods, 58, Article 217. https://doi.org/10.3758/s13428-026-03082-1

若以 Agent 執行,應可完!~


論文之原圖示(第一個圖是 ChatGPT 繪製)


2026年6月1日 星期一

以 NURSE 同理回應的內容藍圖,設計能共同反映同一個潛在能力的評量項目(符合 reflective model)

**發展目標**

本評量工具擬以 NURSE 架構作為內容基礎,發展並驗證一個用以評量專業人員「同理回應能力」的單向度工具。此工具的核心構念不是分別測量 Naming、Understanding、Respecting、Supporting、Exploring 五個獨立能力,而是將 NURSE 視為同理回應的內容藍圖,用來設計能共同反映同一個潛在能力的評量項目。

本工具所欲測量的潛在構念可定義為: 專業人員在覺察他人情緒線索後,能以適切、真誠、促進理解與支持的方式回應對方情緒的能力。

在 reflective measurement model 下,受評者的「同理回應能力」被視為潛在特質,而各評量項目是此潛在特質的外顯反映。因此,能力較高者理論上應較容易在多數題目中表現良好;能力較低者則較可能在多數題目中表現不足。


**理論架構**

NURSE 包含五類同理回應策略:

- **Naming**:辨認並說出對方的情緒。

- **Understanding**:表達理解,使對方感到其情緒是可以被理解的。

- **Respecting**:尊重或肯定對方的努力、價值或處境。

- **Supporting**:表達陪伴、支持與共同面對。

- **Exploring**:邀請對方進一步說明其感受、擔憂或需求。


然而,在本評量工具中,NURSE 不被設定為五個分量表,也不假設五個部分加總後形成同理心。相反地,NURSE 用於確保題目內容能涵蓋同理回應的主要表現型態,而所有項目皆應共同反映同一個潛在能力:同理回應能力。

**發展流程**

**一、構念界定**

首先需明確界定本工具測量的不是一般人格特質中的同理心,也不是態度、同情心或人際溫暖,而是專業情境中的「同理回應能力」。此能力強調受評者在面對他人情緒線索時,是否能透過語言或非語言方式做出適切回應。

因此,本工具的評量焦點應包括:

- 是否能察覺情緒線索

- 是否能回應情緒,而非只處理事實或任務

- 是否能使對方感到被理解

- 是否能提供適切支持

- 是否能促進對方進一步表達


**二、項目設計原則**

項目設計應避免直接寫成「是否會 Naming」或「是否會 Supporting」,因為這樣容易使工具變成五項技能的檢核表,較接近 formative model。

較適合的設計方式是以「同理回應能力的表現指標」撰寫項目。例如:

- 受評者能察覺對方明顯的情緒線索,並給予回應。

- 受評者能以適切語句指出對方可能的情緒。

- 受評者能將對方情緒與其處境連結起來。

- 受評者能在支持對方時避免過早安慰或空泛保證。

- 受評者能在高張力情境中仍維持同理回應。

這些項目雖可對應到 NURSE,但其共同目標都是反映同一個潛在能力。


**三、建議評量形式**

建議採用情境式表現評量,例如:

- 影片情境評分

- OSCE 或標準化病人情境

- 書面案例反應題

- 對話片段選擇題

- 開放式回應後由評分者依規準評分


若研究目的在於評量真實專業表現,影片、OSCE 或標準化病人情境會比自陳量表更適合,因為同理回應能力本質上是情境中的表現能力。


**四、可能項目設計**

可先設計一組由低難度到高難度的候選項目。以下項目皆應被視為同一個潛在能力的反映指標,而非五個分量表。

假設難度候選項目NURSE 內容來源
受評者能察覺對方明顯表達出的情緒線索,並做出回應,而不是直接轉入資訊說明或問題解決。Naming / Exploring
受評者能以簡短、自然的語句指出對方可能的情緒,例如擔心、害怕、挫折、失望或難過。Naming
低-中受評者在命名情緒時能使用試探性語氣,避免武斷判斷對方感受。Naming
受評者能把對方的情緒和其處境連結起來,表達「這樣感受是可以理解的」。Understanding
受評者的回應能讓對方感覺被理解,而不只是聽到制式安慰。Understanding
受評者能具體肯定對方已經付出的努力、承受的壓力或重視的價值。Respecting
受評者能避免空泛稱讚,而是針對對方的實際處境給予尊重與肯定。Respecting
中-高受評者能表達願意陪伴、協助或共同面對,而不讓對方覺得被單獨留下。Supporting
中-高受評者能提供支持,但不做不切實際的保證或過早安慰。Supporting
受評者能在初步同理後,邀請對方進一步說明其感受、擔心或需求。Exploring
受評者能回應複雜或混合情緒,例如同時有害怕、憤怒、失望與不確定。Naming / Understanding / Exploring
當對方以沉默、哭泣、迴避或非語言方式表達情緒時,受評者仍能辨識並適切回應。Naming / Understanding / Supporting
當對方表達憤怒或責備時,受評者能先回應其情緒與處境,而不是防衛或反駁。Understanding / Respecting / Exploring
受評者能在同理回應後保留停頓或空間,讓對方有機會繼續表達。Exploring
很高受評者能把同理回應與後續專業行動連接起來,使對方感到被理解且知道接下來可以如何一起面對。Supporting / Exploring
很高受評者能根據對方的語言、文化、角色與當下脆弱程度,調整同理回應的深度與方式。整合性 NURSE

**五、評分方式**

每個項目可採 0-4 分評分:

分數表現描述
0未回應情緒,忽略情緒線索,或直接轉入資訊說明、說服、問題解決。
1有形式上的情緒回應,但籠統、機械、不貼切,或未能真正承接對方情緒。
2能基本辨認並回應情緒,但回應較表淺或缺乏個別化。
3能具體且適切地回應對方情緒與處境,使對方感到被理解。
4能深入回應情緒,兼具理解、尊重、支持與進一步探索,並促進對方繼續表達。

若採用影片或 OSCE 評分,應建立評分者訓練手冊,並提供錨定範例,以提升評分一致性。


**六、內容效度檢驗**

初稿完成後,可邀請專家進行內容效度評估。專家可包括:

- 醫病溝通或臨床溝通教育專家

- 護理、醫學、心理或諮商領域教師

- 臨床實務工作者

- 測驗與量表發展專家


專家評估重點包括:

- 項目是否符合「同理回應能力」構念

- 項目是否能反映 NURSE 架構

- 項目是否過度偏向某一類 NURSE 技巧

- 項目是否適合專業人員情境

- 項目是否可觀察、可評分

- 項目難度是否有合理階層


可使用 CVI 或專家一致性指標篩選與修訂項目。


**七、預試與項目分析**

預試階段應蒐集受評者在多個情境或項目上的表現資料。若採表現評量,需同時檢查:

- 項目平均分數與分布

- 天花板效應與地板效應

- 項目與總分相關

- 評分者間一致性

- 項目是否能區辨不同能力程度的受評者


不適合的項目包括:

- 幾乎所有人都得高分或低分

- 與總分相關過低

- 評分者很難一致評分

- 內容太像人格態度而非實際回應能力

- 只反映特定情境知識,而非同理回應能力


**八、單向度與 reflective model 驗證**

正式施測後,需檢驗此工具是否支持單向度 reflective measurement model。

可採用以下方法:

- **探索性因素分析 EFA**:初步檢查是否主要呈現單一因素。

- **驗證性因素分析 CFA**:檢驗單因素模型配適度。

- **Rasch model 或 IRT**:檢查項目是否符合單一潛在能力模型,並估計項目難度。

- **Mokken scaling**:檢查項目是否形成單調遞增的階層量尺。

- **Many-facet Rasch model**:若涉及評分者,可同時估計受評者能力、項目難度與評分者嚴格度。


若資料顯示 NURSE 五類項目各自形成不同因素,則表示工具可能不是單向度 reflective scale,而可能較接近多向度模型或 formative 架構。此時應修訂構念定義或重新篩選項目。


**九、項目難度階層驗證**

本工具可預先假設以下難度階層:

察覺明顯情緒線索 → 命名情緒 → 理解情緒與處境 → 尊重與肯定 → 支持與陪伴 → 探索深層情緒 → 處理複雜、隱晦或高張力情緒

但此階層不能只依理論決定,必須由實證資料驗證。若 Rasch 或 IRT 分析顯示項目難度順序與理論不一致,應檢查是理論假設需調整,還是項目寫法、情境設計或評分標準造成偏差。


**十、信度與效度證據**

除單向度外,仍需建立多方面效度證據:

- **內部一致性**:例如 omega 或 alpha,但不應只依賴 alpha。

- **評分者信度**:若為表現評量,需檢查 ICC、weighted kappa 或 many-facet Rasch。

- **建構效度**:與既有同理心、醫病溝通、病人中心照護等工具有合理相關。

- **區辨效度**:與不相干構念,例如單純醫學知識測驗,相關不宜過高。

- **已知群體效度**:有溝通訓練者、資深臨床人員或高表現者應有較佳分數。

- **反應性**:若用於教育訓練,訓練前後分數應能反映能力改變。


**十一、建議結論表述**

較嚴謹的研究表述可寫成:

 本研究擬以 NURSE 同理溝通架構作為內容藍圖,發展一套評量專業人員同理回應能力的情境式評量工具。此工具不將 NURSE 視為五個獨立分量表,而是將各項目設計為同一潛在構念之反映指標,並透過因素分析、Rasch/IRT 模型與評分者信度分析,檢驗其是否符合單向度 reflective measurement model,以及項目是否呈現合理的難度階層。


簡言之,這個工具是可發展的,但核心設計原則是:**NURSE 是內容架構,不是五構面量表;真正被測量的是單一的同理回應能力。**

2026年4月21日 星期二

Generalizability theory -- 被我忽略已久的信度領域「知識」與「應用」

ChatGPT劃的!
(Prompt: 請生成圖示:簡介 Generalizability Theory,介紹它如何驗證 Reliability,以及主要的功能即可。)

至少在 20 年前就已經看到/讀過 "generalizability theory" 了。那時只是初步瞭解它的一些概念,但我一直沒有深入瞭解它,遑論應用(發表論文)。也沒又特別跟學生講!我很少看到實際應用的論文,這也是被我忽略的原因之一。但我記得很清楚之前有位碩班生,在碩論有提過!

直到大約兩個禮拜前(April, 2026),有人問我如何使用Generalizability theory (G-Theory)於EPAs資料與發表論文 。他也提供我醫學教育領域的相關應用文獻。為了回應,我才開始好好再學習,再瞭解它的概念與應用。

這也讓我打開一個之前沒有探究的領域,同時開啟我後續/更多論文發表的議題。

有興趣者再看以下 G-theory 簡介:

-----------------------------------------------------------------------------------------------

G-Theory 是一種把評量誤差拆成多個來源,並判斷評量結果是否足夠可靠(reliable)的方法(也就是 relibaility 的分析方法)。

更白話一點:

它不只是驗證「可靠不可靠」,而是驗證「到底是哪裡不可靠,以及要怎麼改進」。

可以把 G-Theory想成:

一種用來分析「評量分數到底穩不穩」的方法。

它和一般 reliability 最大的不同是:

  • 一般 reliability 常把誤差看成一整包
  • G-Theory 會把誤差拆開來看

例如,一個PGY OT 的特定臨床技能能力/分數不穩定,可能是因為:

  • 不同老師評分標準不一樣
  • 不同 EPAs 難度不同
  • 不同時間、不同場所表現不同

G-Theory 就是在回答:

分數的不穩定,主要是來自哪裡?


這是 Nano banana 劃的



最簡單的核心概念

G-Theory 主要做兩件事:

1. 找出誤差來源

例如把分數變異拆成:

  • 人本身的差異
  • 評分者差異
  • 題目或 EPA 差異
  • 時間或場所差異

2. 判斷要收集多少評量才夠

例如可以回答:

  • 需要幾位老師評分?
  • 需要幾次觀察?
  • 需要幾個 EPA
  • 這樣的評量結果夠不夠可靠?

簡單例子

如果一位 OT 今天被評得高、明天被評得低,原因可能不是能力真的差很多,而是:

  • 換了不同老師
  • 評的是不同 EPA
  • 臨床情境不同

G-Theory 可以幫您判斷:

  • 哪一種因素影響最大
  • 應該增加老師數,還是增加觀察次數

最常見的應用

G-Theory 很適合用在:

  • PGY OT EPA 評量
  • OSCE
  • 臨床技能評估
  • 口試
  • 多位老師評分的表現評量

因為這些評量通常都不是只有一個誤差來源。


一句話總結

G-Theory 是一種把「評量誤差」拆成多個來源,並判斷「評量結果/分數」是否足夠可靠的方法。

如果要再更白話一點:

它不只是問「可靠不可靠」,而是問「到底是哪裡不可靠,以及要怎麼改進」。

---------

感謝生成式 AI 能夠快速 讓我理解這些複雜的概念與應用!!

我或許會再補充如何分析以及應用?也就是會有更多的研究題材以及研究成果!!

-------------------------------------------

以下舉例說明,可能之應用(套用於已有之資料/研究):

一、原先研究之 Inter-rater Reliability 設計與結果(已發表論文:Inter- and Intrarater Reliability of the Gap-Kalamazoo Communication Skills Assessment Form Among Occupational Therapy Interns

該研究以 25 位實習生、49 位個案的 50 份訪談逐字稿為材料,由 3 位受訓評分者各自對每份逐字稿評分 2 次,兩次間隔至少 3 個月;分項以 weighted kappa、總分以 ICC 檢驗一致性。結果顯示 9 個溝通項目的 inter-rater weighted kappa 僅 .08–.30,總分 ICC=.22,屬明顯偏低;這表示單一評分者分數不宜直接用於高風險判斷。

二、若改以 G-Theory 分析,可發展的主題如下:

這份資料適合做 G-Theory,因為同一批逐字稿被多位評分者、跨兩次 sessions 重複評分,可把 transcript/intern performance 視為 object of measurement,將 rater 與 occasion/session 視為 facets,估計 rater variance、occasion variance、以及 performance×rater 的交互作用。

可發展的研究主題/目的包括:① 哪個誤差來源最大;② 單一評分者下的 generalizability / dependability 有多低;③ 若從 1 位增加到 2、3、4 位評分者,可靠度可提升多少;④ 哪些分項最需要修訂評分規準。這會比單純 ICC/kappa 更能回答「為何不一致」與「如何改進」。

2026年3月17日 星期二

van der Vleuten 的評估工具 utility評量效用公式

 當您提出一套評量工具(例如要評量學員的溝通表達),同儕一定會挑戰這個方法的科學性。您可以納入這個經典的醫學教育utility公式,證明您的評量工具是經過全面考量的。或是你想評論一項評量工具,都可以套用之。以確認「工具的科學性」。

效用(Utility):評量工具的整體價值。

Utility = Reliability * Validity * Educational impact * Acceptability * Feasibility


信度(Reliability):不同考官評分是否一致?評分是否穩定?

效度(Validity):是否真的測量到我們想測的「標的/概念/能力」?

教育影響(Educational impact):這個評量是否能驅動學員朝正確的方向學習?

接受度(Acceptability):學員與臨床教師是否認同/接受這個評量方式?

可行性(Feasibility):在繁忙的臨床工作中,這個評量是否花費太多時間與成本?

Cees P M van der Vleuten 1, Lambert W T Schuwirth. Assessing professional competence: from methods to programmes. Med Educ. 2005;39(3):309-17. doi: 10.1111/j.1365-2929.2005.02094.x.


AI 時代的專業價值重塑:推升「知識天花板」的關鍵戰役

以下是我最近的構想,再跟AI討論/潤飾的觀點!!
  • 主標題: AI 時代的專業價值重塑:推升「知識天花板」的關鍵戰役

  • 副標題: 為何醫學教育的評估與實證研究,將成為下一個藍海?


第一部分:引言(Hook & Thesis Statement)

核心論述:AI 帶來的不是學習的終結,而是「標準化能力」的貶值。真正的專業價值,正在向上轉移。

  • 破除迷思: 點出目前社會的普遍現象——人們驚嘆於 AI 在幾個月內就能讓人掌握過去需要數年累積的知識與技能(包含透過虛擬演練加速勝任能力的養成)。

  • 提出危機: 當所有人都能藉由 AI 輕易達到專業的「基準線」或「知識天花板」時,基礎技能將被高度商品化,導致薪資與價值的扁平化。

  • 破局立論: 宣告未來的核心競爭力不在於「誰學得快」,而在於「誰能突破現狀,將知識的天花板往上推升」。而這項任務,最終將回歸到具備研發能力與洞見的研究人員身上。

第二部分:從經驗主義到實證科學的必然轉向

核心論述:複雜的臨床應用不能單靠個人經驗,必須仰賴嚴謹的「測量工具」與「實證研究」。

  • 經驗的侷限: 探討在臨床應用中,將標準化知識應用於複雜個體時所面臨的挑戰。許多人誤以為這只能依靠「個人經驗」或「人際藝術」。

  • 工具的必要性: 犀利指出,沒有客觀、精準的評估工具與訪談框架,所謂的「深入了解個體」往往只是受限於樣本數與觀察視角的偏見。

  • 研究的價值: 要突破個人經驗的限制,唯一途徑是透過研發,創造出能精準捕捉個體特質的新工具以及臨床實證研究。這確立了「研究開發」與「實證醫學」在臨床實務中的最高指導地位。

第三部分:醫學教育的藍海——「評估與驗證」的巨大缺口

核心論述:相較於基礎或臨床醫學,醫學教育領域存在著極需填補的實證與評估缺口,這是 AI 介入的最佳切入點。

  • CBME 的痛點: 點出在勝任能力導向醫學教育(CBME)中,有大量的臨床知識、溝通技能、態度與執行流程需要被評估。

  • 資源的不對等: 相比於其他醫學領域,醫學教育的實證研究相對匱乏,且目前極度缺乏大量、優質、且能應對複雜情境的評估工具。

  • 虛擬考官的崛起: 帶入 AI 的應用潛力,例如利用生成式 AI 構建虛擬標準病人或虛擬考官,以解決評估人力與標準化不足的問題。

第四部分:不可取代的護城河——心理計量與「硬核驗證」

核心論述:生成 AI 工具很容易,但證明它有效卻極度困難。這份「困難」正是研究者的絕對壁壘。

  • 黑盒子危機: 批判目前的亂象——任何人都會寫提示詞生成一份評分表,但這些 AI 產出的結果在面對高風險的臨床考核時,往往缺乏公信力。

  • 驗證的地獄即是護城河: 強調要證明這些 AI 工具具備真正的信度、效度與反應性(Responsiveness),需要極其嚴謹的心理計量模型分析。

  • 人機協作的新範式: 總結未來的研究模式:將 AI 視為提升效能的引擎(處理繁瑣運算與初步生成),而研究者則全心投入於高階的「研究設計」、「假設驗證」與「實打實的苦工」中。

第五部分:結語(Call to Action)

核心論述:重申研究人員在 AI 時代的時代使命。

  • 總結全文脈絡:AI 加速了知識的普及,但也讓「評估與驗證」的價值,尤其在醫學教育領域,空前突顯。

  • 呼籲學界與實務界:不應只停留在「使用 AI」的表層,而應積極投入資源,研發並驗證新一代的醫學教育評估工具,共同推升這塊領域的知識天花板。

2026年2月14日 星期六

以 NotebookLM 建立評估工具評析:應用COSMIN checklist

相關內容詳 NotebookLM: https://reurl.cc/dq6Lpq 

以「反應性」之評析為例,上傳COSMIN checklist以及反應性相關資訊(如圖示打勾)與擬評論之論文(Comparison of responsiveness…),提示詞已建置於上傳來源(反應性論文彙整(任務1)與評析(2))。完整提示詞如下:

任務1:請彙整論文中有關[反應性/responsiveness]之概念說明、研究設計、資料分析、結果與討論章節之解釋(含結論)

任務2:請依據 COSMIN [反應性/responsiveness]checklist評析論文,請列出評析項目、評析結果、舉證說明、最後依據COSMIN相關共識,以提出改善建議。

故使用者只需於「對話視窗」輸入:請執行任務1 (或請執行任務2)即可!!

後續應用:

可再上傳其它擬評析之論文,即可繼續執行任務12

(已評析完成之論文可「刪除」或「不勾選」)


2026年2月10日 星期二

如何使用生成式AI 輔助 評論 & 發展工具

以評論言,先評論「內容效度」、再評論「信度」、「效度」、與「反應性」。

若應用 COSMIN,則已有相關檢核表!可自行應用/評論現有工具。也就可以應用生成式AI協助評論,甚至彙整!!

以發展言,先建立「內容效度」、再建立「信度」、「效度」、與「反應性」,必要時改版!!

若應用 COSMIN,則已有相關研究設計檢核表!可自行應用/發展工具。也就可以應用生成式AI協助「應用COSMIN研究設計」發展工具,甚至測試一部份心理計量特性(如內容效度)!!

Note: 建立詞彙與定義 (glossary/definition),含中英文。

2025年7月31日 星期四

影響我研究主題的關鍵人物之一

恭喜姚開屏教授獲得「師鐸獎」--這是國家級的最高榮譽!! 

姚教授的著作與論述影響/幫助我一輩子!!

1996年(當時我還是講師),我看到姚教授的建議:「紮實的基礎性研究」&「評量工具的可信度與有效性... 這類型的研究實在需先於各種治療療效的研究。」(如圖所示,我僅用兩分鐘就找到了這段建議!!)。



我最近的臨床技能研究,基本上只是「實踐」上述建議:如果我沒有嚴謹且可靠的「臨床技能評量工具」,便難以展開相關研究,無法明確地呈現學員的臨床技能優缺點//給予回饋!!


舉例而言,下列第1篇有關溝通技巧評量工具的信度驗證論文,為後續研究奠定基礎:

1. Chen TT, Wang YC, Wu TY, Chen CR, Cheng CY, Hsueh IP, Wang SP, Hsieh CL. Inter- and Intrarater Reliability of the Gap-Kalamazoo Communication Skills Assessment Form Among Occupational Therapy Interns. Am J Occup Ther. 2024 Jul 1;78(4):7804205030.

2. Chen TT, Huang YJ, Chen CR, Hsu CW, Huang SL, Hsieh CL.

Effects of Feedback and Reflection on Communication Skills Training for Occupational Therapy Students. Am J Occup Ther. 2025 Jul 1;79(4):7904205060.

3. Ju YJ, Wang YC, Lee SC, Liu CH, Lee ML, Hou CY, Yang CW, Hsieh CL. Development and validation of a GPT-based Rater for Assessing Communication Skills Using the Gap-Kalamazoo Communication Skills Assessment Form. Medical Teacher. 2025 Jul 1. Accepted for publication.

姚教授的卓見導引我30+年的學術旅程!!未來我若還能做10年的研究,仍將依循姚教授的智慧之光持續引領我前行!!

2025年7月6日 星期日

數據/稿件的起死回生!?

數據不好的研究結果,為何可以改變其命運(結果變得比較好,且發表於著名期刊):一個特例!

今年我們發表二篇論文,皆大致發現:GKCSAF displays acceptable intra-rater but poor inter-rater reliability in occupational therapy clinical scenarios.(心理&生理領域)(二篇論文皆有 inter-rater reliability 驗證,但ICC結果皆差,二文結論也如此定位--poor inter-rater reliability!我應發表>50篇類似論文了,資料分析與解釋,絕對經驗豐富!)(Note: GKCSAF 是國際著名的溝通技巧評估工具)

因為上述2論文皆有錄音/逐字稿,故我們去年提出新的研究構想:設計 ChatGPT 使用 GKCSAF 以評估逐字稿中學員的溝通技巧,再跟前述2篇論文專家 raters 的評估結果比較。

我們初稿的重點(牛肉)放在「發展 ChatGPT rater」 以及「ChatGPT評估結果跟專家評估結果無顯著差異(如 Figure 1所示:ChatGPT評估的總分大多在專家評估總分之間)」,後者我們的解釋為:代表 ChatGPT rater 或可替代專家評估。那時,我們未驗證效度.... 且ChatGPT與專家評估結果之ICC差(如同已發表論文之結論)...
Figure 1. Total scores of the ChatGPT rater (blue) and human raters (gray).

審稿後,有位審查委員認為我們既沒有驗證效度,主題就勿稱為 "validation", 另一個委員建議我們繪製下圖(各種raters 之評分總分比較) 

Figure 2. 所有 raters 之評分總分比較

Figure 2 讓我們更清楚:各raters 評分結果真的差別有限(總分皆在很窄的區間)!!若此為真(當然要相信數據,但哪一項統計指標的數據?), inter-rater reliability 真的不好嗎?且我們可否將多位專家 raters評分的平均值,當成效標,以驗證效度(concurrent validity)!? 

所以在修改稿件時,我們就增加 "mean absolute error" 以及 "mean absolute error %"二統計指標(這比是否統計顯著,可呈現更直觀的總分差異大小), 再將多位專家 評分的平均值,當成效標,驗證效度!! 我們發現GKCSAF總分在"mean absolute error" 以及 "mean absolute error %"結果不錯(inter-rater reliability & concurrent validity二驗證皆類似),所以支持 ChatGPT rater 總分的 inter-rater reliability & concurrent validity至少是 acceptable!! 我們也說明ICC因為總分差異小(如 Figure 2 所示),故可能造成ICC值被低估。

就這樣(事實上,主筆者--玉正努力了許久/被我嚴厲折磨...)稿件被 (Medical Teacher主編) 接受了!!

此稿件已成為我自認的代表性著作:Ju YJ, Wang YC, Lee SC, Liu CH, Lee ML, Hou CY, Yang CW, Hsieh CL. Development and validation of a GPT-based Rater for Assessing Communication Skills Using the Gap-Kalamazoo Communication Skills Assessment Form. Medical Teacher. 1st July, 2025. Accepted for publication. 

有興趣者可參考玉正的反思與心得

衍生的議題:如這貼文第2段所提--今年我們發表二篇論文,皆大致發現:... poor inter-rater reliability, 這解釋可能有誤阿!!已請玉正個別分析之,再思索是否寫信給主編更正解釋 或 撰寫 letter-to-editor.....以還 GKCSAF 公道!還有自我修正!!

感謝 reviewers 的評論, 讓我們成長,還有接受我們的論文!!

2024年11月22日 星期五

MID (Minimal Important Difference)與MIC (Minimal Important Change)的主要差異

 MID (Minimal Important Difference)與MIC (Minimal Important Change)的主要差異如下:

基本定義不同:

MIC指的是個人隨時間變化的最小重要閾值(threshold for a minimal within-person change over time),代表病人認為自己有重大改變的最小變化程度。

MID則是指不同群體之間的最小重要差異(difference between groups of patients),例如報告"稍有改善"的病人與報告"無改變"的病人之間的差異。

有興趣者可參考:

Minimal important change (MIC): a conceptual clarification and systematic review of MIC estimates of PROMIS measures

2023年2月11日 星期六

2/10研討會補充內容之三--我們發展的好工具--很少人用

主因有三:     

  1. 我們缺太多良好的評估工具*,從 body functions/structures, activities, participation, patient-reported outcomes ,目前的好工具(心理計量特性良好),且施測效率高,比例至多1/3。故我們發展的好工具,目前能改變的邊際效用有限,治療師/病人難以買單。不信者請針對主要診斷,個別舉例 body functions/structures, activities, participation, patient-reported outcomes各有1~3個標準化、心理計量特性良好,且施測效率高的工具?? 至少要超過一半甚至7成,才能跨過實用門檻//邊際效應才可能大增,於臨床呈現明確的評估成效(有無使用好工具之差異)。
  2. 評估工具發展費時,且非顯學,長期以來少人投入
  3. 我國OT研究人才過少,且多數評估工具(如評估participation, patient-reported outcomes之工具)皆受到文化/地域影響,若非國人自行發展,其適用性有限(或誤差大)。意即即使國外已發展出的良好評估工具,常不適用於國人。

次要原因:

心理計量學內容較多數學,一般研究生望而生畏,或興趣缺缺。

*請審視目前臨床治療師平常所用工具之標準化、心理計量特性、甚至專業溝通/瞭解之程度為何?? 也請審視OT有幾個殺手級評估工具,能夠快速/有效確認個案問題(需求)、確認影響病情/需求因素、呈現治療成效、預測預後者?
  • 快速/有效確認個案問題--就如 COVID 快篩之價值
  • 確認影響病情/需求因素--包含病因(如造成ADL失能之原因【若未掌握如何對症下藥】

成冠緯主任的部分意見如下(Feb. 12, 2023):

  1. 我覺得臨床很少使用的原因還有是他們對評估的向度不熟悉,譬如社會認知,或是他們覺得這個評估向度對於他們紀錄的呈現沒有幫助(一般要求紀錄的呈現中不會出現這些向度)【我的回應:這是忽略影響社會功能的因素//或是不唸書的結果】
       【士捷 Response: 除期許學校、繼續教育以及常規的文獻閱讀等機制能持續提供新知外,建立可行的成功模式以彰顯其益處或是另外一條思路。如能以數據佐證新工具的使用於臨床決策、效率或主要成效指標方面優於既有的常規,應能大幅提昇治療師與醫院使用新方法的動機。是以,除知道之外,如何做到(應用配套)可能是我們後續可多加努力之處。
  1. 同樣的其他專業也不見得了解我們評估這個向度的價值,譬如心理評智力測驗,其他專業和醫師就覺得這個評估很有意義【我的回應:這關乎我們是哪方面專家的議題,也是其他專業人員是否覺得評估概念(如社會認知/社會功能)是否有意義的關鍵。請參考 2/10研討會補充內容 -- 專家=概念、工具與技術之專精程度
       【士捷 Response: 若單就評估而言,易淪為「何不讓心理師來評的窘境」。然而,OT評估社會認知應有獨特意義,如社會認知影響人們對於社交情境的解讀,是以OT需要瞭解個案於解讀時遭遇困難的原因(如難以推論他人動機以至於手足無措,或知道他人動機卻不知如何回應),才能更好的決定治療目標與練習重點,如要直接訓練以提升其心智理論,或者增進其應用於日常生活的類化能力。

李書齊主任的部分意見如下(Feb. 13, 2023):
1. 職能治療臨床工作者,多只知道傳統評估工具(需與學校連結)或醫院只購買簡易、便宜的評估工具,如:褚氏三寶
       【士捷 Response: 本題可細分為知道以及取得二個層面。於知道層面,除期許學校能持續更新教學內容外,創見網站以提供最新且易於吸收的工具彙整資訊(如Stroke Engine: https://strokengine.ca/en/),甚至提供使用經驗交流與專業諮詢與回覆等,或能大幅提昇知道層面的不足。於取得層面,除選用免費工具外,積極投入工具開發以取得工具使用權,或者提出證據佐證使用該工具的必要性(如以院內研究經費進行可行性與效益檢驗),可能有助於爭取經費或院方認同,從而幫忙取得必要的評估工具。】

2. 臨床工作者對於新發展或改良之評估工具認識不足,運用範圍缺乏相關知識,致使使用率不高
       【士捷 Response: 誠然,治療師有沒有管道/途徑得知新工具是問題之一。然而,治療師使用新工具的意義不明,或許是更關鍵的議題。單純能準確評估一個以前不曾評估的新構念,並不足以做為治療師使用新工具的理由。如能連結評估結果與臨床現象與困境,使治療師能更簡單、清晰或深入地看到長期難解現象背後的關鍵,從而引導介入的方向(或至少提供配套建議,如多少分以下時可採用哪種介入模式),如此,或有助於增加治療師使用新工具的意義。】

3. 臨床使用上的普及性或方便性,影響職能治療臨床工作者使用上的意願
       【士捷 Response: 誠然,普及性或方便性(如快速、易於使用,以及易於解讀等)是影響工具使用意願的關鍵。然而,由於新型態工具的可用性通常優於傳統工具(尤其是題數多而易漏,或者需要施測者額外計分以及保存紙本評估紙者),故在控制/排除知道與取得二層面問題(題1)後,普及性或方便性或許不是最主要影響工具使用意願的原因。然而,後續我們仍會持續將使用者體驗納入考慮,持續提供高品質與兼顧普及性與方便性的評估工具。

【1&2 我的回應:我們將整理研究室評估工具,公布於網路,並接受邀請提供視訊說明/討論。】
【3 我的回應:我們的工具,基本上都是免費,歡迎使用。】