顯示具有 Research-研究主題-專業能力評估 標籤的文章。 顯示所有文章
顯示具有 Research-研究主題-專業能力評估 標籤的文章。 顯示所有文章

2026年8月28日 星期五

從臨床評估到AI Agent:我的AI研究旅程(2017–2026)

昨日(Aug. 27, 2026)看到 Alpha Go 10 年新聞:Alpha Go人機大戰十年後,傳奇棋士李世乭獻給人類的反思

我就讓 ChatGPT work 幫我彙整一下我研究歷程/里程碑(查詢部落格里程碑),再做彙整如下:

回顧這幾年的研究發展,我投入AI並不是從ChatGPT出現後才開始。較精確地說,2017年是構想萌芽(受到 Alpha Go 啟發),2018年是研究團隊正式投入AI的起點;2023年生成式AI興起後,則迎來第二次、也可能是影響更深遠的轉捩點。

這段歷程並不是單純追逐新科技,而是持續嘗試回答一個核心問題:

AI是否能協助我們提高臨床評估、研究、教學與學習的效能,同時維持結果的正確性、可解釋性與專業責任?

從早期的Machine Learning、short form與臨床評估與應用,到近期的LLM測量工具、GPT-based rater、虛擬病人及AI Agent,研究主軸其實始終相當一致:運用AI降低負擔、提升評估與後續應用效能,以 applied psychometrics為評估與應用之基石、以及實證驗證。


一、2017–2018年:從臨床問題出發,而不是從AI技術出發

2017年,我開始思考能否以AI解決臨床評估效能與臨床決策支援的問題。當時關注的並不是某個特定演算法,而是臨床現場長期存在的困難:

  • 評估工具眾多,臨床人員不容易選擇。

  • 完整量表施測時間過長。

  • 分數改變不一定代表病人真正進步。

  • 不同評估結果不容易整合成可行的臨床決策。

  • 大量臨床資料尚未被有效轉化為評估與治療資訊。

到了2018年,研究團隊開始定期討論AI,並提出應用AI的多年期研究計畫。我也明確將2018年稱為研究團隊的「AI元年」。

因此,如果要為這段AI旅程設定正式起點,最合適的年份是:

2016年受到 Alpha Go 啟發,2017年開始構思,2018年正式、有組織地投入。


                                           圖1:AI研究發展的重要里程碑(2017–2026)

Note: 研究發展由臨床問題構思開始,歷經傳統Machine Learning、Generative AI、教學平台化,逐步進入多模態Agent與學習理論建構。





二、2019–2022年:Machine Learning與臨床測量的結合

2019年底,協助合作者申請小兒AI計畫獲得科技部多年期支持,研究內容涵蓋發展遲緩兒童的動作、書寫、注意力及情緒評估。這項計畫除了發展AI工具,也包含研究團隊建立及AI研究人才培育。

這個階段的研究特色,是將Machine Learning與原有的臨床測量專長結合。目的並不是讓AI直接做出診斷,而是改善評估工具的效率與臨床可用性。

1. 以Machine Learning建立short form

2021年發表的A 10-item Fugl-Meyer Motor Scale Based on Machine Learning,可視為團隊第一篇正式AI代表作。

這項研究以Machine Learning將Fugl-Meyer Motor Scale縮短為10題,同時嘗試預測未施測題目的分數。它所代表的研究概念是:

評估工具縮短之後,不應只保留總分,還應盡可能保留原量表的臨床資訊與分數可解釋性。

後續再將相同概念應用於:

這些研究逐漸形成一條完整路徑:

完整量表 → Machine Learning選題 → short form → 預測未施測題目 → 驗證reliability、validity與responsiveness

2. 以Machine Learning提升臨床辨識能力

另一篇2021年的研究,運用Machine Learning改善FERD screener區辨思覺失調者與健康成人的能力。

這篇研究的意義在於:Machine Learning不只可以縮短量表,也可用於特徵擷取與分類。然而,它的定位仍應是協助screening與clinical decision support,而不是直接取代臨床診斷。


三、AI開始分析真實職能活動

AI研究的另一項重要發展,是由結構化量表資料逐漸走向真實職能活動的影像。

2023年發表於American Journal of Occupational Therapy的研究:Using Artificial Intelligence to Identify the Associations of Children’s Performance of Coloring, Origami, and Copying Activities With Visual–Motor Integration,以370位幼兒的著色、摺紙及臨摹作品照片訓練AI模型,用以預測VMI-6分數。

研究發現,摺紙與臨摹作品的組合,可解釋約39.0%至57.7%的VMI分數變異。

2025年又進一步發表Predicting Age and Visual-Motor Integration Using Origami Photographs: Deep Learning Study,使用Deep Learning分析摺紙作品照片。

這一系列研究具有相當鮮明的職能治療特色:

AI不只分析量表題目,也可以由真實活動產物中擷取與兒童發展及visual-motor integration相關的資訊。

換言之,研究方向開始由AI-assisted assessment,進一步走向AI-based occupational performance analysis。






四、2023年:Generative AI帶來第二次轉捩點

2023年2月,我開始實際測試OpenAI及ChatGPT。到了3至4月,我決定正式投入Generative AI。回頭來看,這可能是職涯後期最關鍵的決定之一。

與傳統Machine Learning相比,Generative AI的影響範圍更廣。它不只可以分析既有資料,也可以:

  • 生成與修改文字。

  • 分析、彙整及比較文獻。

  • 扮演虛擬病人。

  • 依評分規準提供回饋。

  • 協助研究計畫與學術寫作。

  • 支援個別化學習。

  • 串聯不同工具與研究工作流程。

因此,研究主軸由「AI改良評估工具」,逐漸擴展為「AI如何影響研究、教學、臨床與學習」。

我在2023年ChatGPT研究回顧中曾寫道:

「2023年3~4月決定投入,這或是職涯末期最關鍵的決定。」

這並不代表放棄原有研究方向。相反地,原本累積的psychometrics、臨床評估、研究方法與教學經驗,正好成為評估Generative AI是否真正有效的基礎。


五、從評估AI工具,轉向測量AI使用者

2025年發表的Developing the Questionnaire of Self-Efficacy and Needs in Using Large-Language Model-Based AI Services,建立了Q-SNELL。

Q-SNELL用於測量使用者對八項LLM核心功能的self-efficacy與needs。研究以398位使用者進行驗證,結果支持其content validity、known-groups validity及一定程度的test–retest reliability。

這篇研究的重點,是將問題由:

「AI能做什麼?」

轉換為:

「使用者需要哪些AI功能?是否有信心正確使用這些功能?」

這也是研究方向的重要改變。AI教育不能只提供工具,也必須評估學習者的AI能力、需求、使用經驗及學習成效。

Q-SNELL因此可視為團隊第一篇正式的Generative AI psychometrics研究。


六、從ChatGPT使用走向GPT-based rater

2026年刊登於Medical Teacher的Development and Validation of a GPT-Based Rater for Assessing Communication Skills Using the GKCSAF,嘗試讓GPT依照Gap–Kalamazoo Communication Skills Assessment Form評估治療師與病人的訪談逐字稿。

這篇研究的重要性,不是證明GPT已經可以取代專家。事實上,研究結果顯示:

  • GPT與專家的total scores差異在部分分析中可以接受。

  • 但ICC仍然偏低。

  • domain-level agreement也相當有限。

  • 目前較適合用於low-stakes assessment與形成性回饋。

這項結果提醒我們,評估AI表現時,不能只比較平均分數,也不能因為兩組平均分數接近,就宣稱AI與專家一致。

至少還必須檢查:

  • absolute difference

  • MAE或MAE%

  • ICC

  • weighted kappa

  • measurement error

  • domain-level performance

  • responsiveness

  • 不同任務及嚴重程度下的穩定性

近期進一步發表的研究,開始比較專家與ChatGPT評分的responsiveness,也就是兩者能否偵測溝通能力訓練前後的改變。

這使研究問題由「AI能否評分」,推進至:

AI評分是否能夠穩定、有效地測量能力改變?


七、GPT開始協助evidence appraisal

2026年發表於Archives of Physical Medicine and Rehabilitation的Development and Performance Validation of an Automated GPT-Based Evaluation Tool for the PEDro Scale,進一步讓GPT依PEDro scale評估RCT的方法品質。

研究結果顯示,GPT-based PEDro rater具有接近完整的intra-rater reliability,並與既有PEDro評分呈現moderate-to-high concurrent validity。

這項研究代表AI應用已由臨床量表及學生能力評分,延伸至:

研究方法品質評估與evidence-based practice。

未來AI可能協助處理大量RCT的初步評讀,降低systematic review及文獻評析的工作負荷。然而,這類應用仍須保留human verification,特別是涉及模糊報告、方法學判斷及高風險研究結論時。

AI在此較適合扮演的是:

可重複、有效率的初評者及研究助理,而不是擁有最終決定權的審查者。


八、2024–2026年:由單一GPT走向平台與Agent

隨著My GPTs及ChatGPT功能逐漸成熟,我開始發展虛擬病人、AI考官及多層次GPT自主學習平台(ML-GPT)。

ML-GPT將學習分成三項主要功能:

  1. 虛擬病人或練習GPT。

  2. 回饋GPT。

  3. 測驗或評分GPT。

2026年發表的Developing a GPT-Based Virtual Training System for Medical Undergraduates’ History Taking in Stroke Rehabilitation,進一步整合GPT virtual patient與virtual examiner。

系統讓學生與中風虛擬病人互動,完成10項functional assessment domains的問診,再由虛擬考官自動評分與提供回饋。這代表AI研究已由單一工具進入:

互動練習 → 自動評分 → 個別化回饋 → 重複練習

到了2026年,Codex等AI Agent出現後,又可進一步整合:

  • Word與Excel資料

  • 逐字稿

  • 投影片

  • 聲音與影片

  • 評分量表

  • 文獻檢索

  • 結果報告

  • 不同AI模型及專業Skills

這使AI由「回答問題的Chatbot」,轉變為「執行多步驟任務的Agent」。

但Agent自動化程度越高,越需要清楚的任務規格、驗證程序與human checkpoints。自動化不能等同於完全授權,更不能省略專業判斷。




九、這些AI著作共同代表什麼?

回顧目前的AI研究成果,大致可以整理為以下演進:

階段代表成果核心含意
Machine Learning short formFugl-Meyer、Stroke Impact Scale、Berg Balance Scale、PANSS降低施測負擔並保留臨床資訊
Machine Learning screeningFERD screener提升臨床辨識與分類能力
Computer Vision/Deep Learning著色、摺紙與臨摹作品分析由職能活動產物推估能力
LLM使用測量Q-SNELL測量使用者的AI self-efficacy與needs
GPT-based assessmentGKCSAF rater驗證AI評分的agreement與使用界線
GPT-based evidence appraisalPEDro rater協助RCT方法品質初評
GPT learning systemVirtual patient與virtual examiner建立自主練習、評分與回饋循環
AI Agent多模態教學與研究工作流程整合多步驟任務與專業Skills

從表面上看,這些研究使用的AI技術不同;但背後其實有一個共同主軸:

AI是否能在明確的臨床、研究或教學任務中,提供具reliability、validity、responsiveness、可解釋性及適當使用界線的評估與回饋?


十、AI研究的下一階段:由工具效能走向學習理論

當AI可以提供解釋、提示、回饋、評分,甚至主動完成多步驟任務後,真正困難的問題可能不再是「AI能不能做」,而是:

  • 學習者應該在何時自己嘗試?

  • 何時才應尋求AI協助?

  • AI應提供完整答案,還是適量scaffolding?

  • 如何確認學習者真的理解,而不是只接受AI產出?

  • 如何避免AI依賴?

  • AI支持下的學習能否transfer到沒有AI的真實情境?

  • 如何以delayed testing與external validation確認學習成效?

因此,我近期開始進一步思考AI輔助self-regulated learning與mastery learning的理論架構。

核心原則是:

AI可以提供適性支持,但學習者必須保有最終主導權。

AI的角色不是盡快替學習者完成任務,而是協助學習者:

  1. 發現自己真正不理解之處。

  2. 選擇適當層次的AI支持。

  3. 回到原始資料進行驗證。

  4. 修正原有理解與策略。

  5. 在逐步撤除AI協助後獨立完成任務。

  6. 於延宕及真實情境中確認學習是否保留與遷移。





結語:AI不是另一個獨立研究題目

回頭來看,AI並不是突然加入的一個全新研究題目,而是原有研究理念的延伸。

早期的研究關心:

  • 評估結果是否可靠?

  • 量表是否有效?

  • 分數改變是否超過measurement error?

  • 評估工具能否縮短?

  • 結果能否協助臨床決策?

現在面對AI,我們仍然在問類似的問題:

  • AI產出是否可靠?

  • AI評分是否有效?

  • AI能否偵測真正的改變?

  • AI是否可以降低專業人員的負擔?

  • AI的錯誤與不確定性如何被發現?

  • 哪些任務可以交給AI,哪些仍須由人負責?

因此,我目前對AI研究的理解可以濃縮為:

AI的價值不只是產生答案,而是能否在人的監督下,提供可驗證、可解釋、可調節,並真正促進臨床決策、研究品質與學習成效的支持。

整體發展則可概括為:

臨床問題構思 → 正式AI研究 → Machine Learning與實證成果 → Generative AI轉型 → 教學平台化 → Agent自動化 → 學習理論建構

這條路仍在快速發展。接下來最值得投入的,或許不是再增加更多AI功能,而是建立更清楚的使用原則、驗證架構與學習理論,讓AI真正成為促進專業成長的工具,而不是替代思考的捷徑。

2026年6月6日 星期六

評分與排序--以同理心評分言

絕對分數(評分所得)可用以描述同理心的水準,排序用來描述受試者於同批中的相對位置。

因為同理心分數通常較粗(不易評分),排序可以補充分辨力;但排序必須搭配排名信心、差距說明與同層級分組,才不會把微小差異誤解成穩定差異。

但只要「單向度/項目」設計好(符合階層難度差異),應可暨評分又排序。

AI agent 或可同時達成!!


-----------------------------------------

以下以「單向度的同理心」作為例子,彙整「評分」與「排序」之概念與用途。

**核心概念**

若將同理心視為一個單向度構念,意思是我們暫時把同理心看成一條由低到高的連續向度。受評者的表現可以被放在這條向度上,例如從「較少辨識他人感受」到「能深入理解他人處境並做出貼合回應」。

但同理心本身不容易被切得很細,因此絕對分數通常比較適合做粗略分級;排序則可補充同分者之間的相對區隔。

**1. 絕對分數評分**

絕對分數回答的是: 這個人的同理心表現本身達到什麼水準?

例如使用 1-5 分:

分數意義
1幾乎未辨識他人情緒或需求
2有注意到情緒,但回應表淺
3能基本理解對方感受並做出適當回應
4能準確辨識情緒、處境與需求
5能深入理解對方觀點,並給出高度貼合的回應


這種分數的優點是容易解釋,也適合判斷是否達標。  

限制是分數通常較粗,很多人可能集中在 3 或 4 分,不適合過度解讀細微差異。


**2. 排序概念**


排序回答的是:在這一批受評者中,誰的同理心相對較高?


排序可以補足絕對分數的不足。例如 A、B、C 都是 4 分,但仍可透過 AI 或評分者進行兩兩比較,判斷誰的表現相對更完整。


不過排序要謹慎解讀。第 1 名不一定代表同理心非常高,只代表在這一批裡相對最高。第 3 名也不一定明顯低於第 2 名,尤其當兩者分數或表現證據很接近時。


因此排序最好搭配:

- 排名

- 排名信心

- 分數差距

- 同層級分組

- 差異說明


**3. 後續應用**

絕對分數適合用於:

- 判斷是否達到基本標準

- 教學、訓練或回饋

- 前後測比較

- 個人能力診斷

- 決定是否需要補強訓練


排序適合用於:

- 選拔或名額有限的決策

- 同批受評者比較

- 找出示範案例

- 分組,例如高、中、低同理心組

- 資源配置,例如優先輔導低排序者


兩者合併時,可以避免誤判。例如某人同理心 4/5,但排名第 15/20,這不代表他差,而是代表同批整體可能很強。


**4. 完整分數呈現**

一份完整的同理心評量結果可以包含:


項目說明
絕對分數例如 4/5
等級描述例如良好、達標、需加強
排名例如第 6/30 名
百分位例如高於同批 80% 受評者
排名信心高、中、低
分數差距與平均值、標準、前後名的差距
同層級分組例如高同理心組、中等組
文字證據說明為何如此評分或排序
不確定性說明說明哪些名次不宜過度解讀

例如:


> 同理心分數為 4/5,屬於良好表現。排序為第 6/30 名,約位於第 83 百分位。排名信心中高。雖然排名第 6,但第 4 至第 8 名差距很小,建議視為同一層級。其主要優勢是能辨識對方情緒並給予支持性回應,但在深入理解對方需求方面仍可加強。


**5. 資料分析方式**


若要分析同理心評分與排序,可以從幾個面向進行。


首先,看絕對分數分布:

- 平均數

- 中位數

- 標準差

- 各分數人數比例

- 是否集中在 3 或 4 分


其次,看排序穩定性:

- 多次 AI 排序後,名次是否穩定

- 每個人的排名範圍

- 中位排名

- 排名變動幅度


第三,看兩兩比較勝率:

- A 是否穩定勝過 B

- 勝率是否高於 80%

- 是否有大量接近 50% 的比較,代表難以區分


第四,看一致性:

- 不同評分者是否給出相近排序

- 人工排序與 AI 排序是否一致

- 可使用 Spearman 相關、Kendall’s tau 或評分者一致率


第五,看效度證據:

- 高同理心排序者是否也有較好的外部表現

- 是否與專家判斷一致

- 是否能預測後續學習、溝通或臨床表現


總結來說:


> 絕對分數用來描述同理心的水準,排序用來描述同批中的相對位置。  

> 因為同理心分數通常較粗,排序可以補充分辨力;但排序必須搭配排名信心、差距說明與同層級分組,才不會把微小差異誤解成穩定差異。


2026年3月8日 星期日

發展機器人--這是我的研究主題/主軸嗎?

 我最近幾年,運用生成式 AI 做醫學教育的研究,我覺得好像都在做發展機器人的研究。發展這類機器人大概可以分成幾個主要面向:

 1. 提升學生或臨床人員的學習能力與效能

   (a) 包含基礎知識的建構。

   (b) 臨床執業所需的必要知識。

 2. 在應用端提升臨床技能與效能

   (a) 透過生成式 AI 提供教學回饋並讓他們練習。

   (b) 讓使用者可以跟 ChatGPT 或 Gemini 學習基本知識與臨床技能。

   (c) 甚至進一步優化臨床流程,讓機器人能實質協助他們處理臨床事務。


發展虛擬病人/虛擬考官//AI輔助教學等主題...皆然!!

2025年12月22日 星期一

AI與二八定律 &「與AI協做的能力」

 「AI與二八定律」由陳力俊院士主筆的社論

主要內容包含:AI的平均認知能力、語言處理能力與邏輯推理能力,已超越全球約八成的人類。

前二成的頂尖創作者、研究者、管理者,可輕鬆駕馭AI,把它當成倍增器。後八成的典型知識工作,正逐步被AI技能所覆蓋、接管或重新定義。

他還提到「理解問題與善用AI的能力」,這與我上週四聽到的演講提到「與AI協做的能力」大致相當!

這能力應是我後續發展評估工具的測量概念!!

2025年7月2日 星期三

OSCE真人考官 vs AI 考官之回饋內容與品質比較

不能比速度!!

那能比較內容與品質嗎?

先說如何提升回饋品質!!

先以2~3個AI (e.g., ChatGPT+Gemini+Cluade)依據評估表給予回饋,彙整後,再請專家確認。

最後可以產生三種AI回饋版本:1. AI+專家確認之完整版(未限制AI);2. AI完整版(未限制AI);3.以真人考官回饋之字數版本(限制AI回饋字數版)。上述3版本再與真人考官之回饋比較。

評估表可為國際現有知名量表如 GKCSAF或我們自行發展的量表(COT或REST)。

-------------------------------------------------------------------

以下是Claude AI的評論:

這個研究構想很有實用價值,針對醫學教育中的客觀結構式臨床考試(OSCE)回饋機制進行創新探索。讓我分析這個設計的優勢與可能的改進方向:

研究設計優勢

多層驗證機制 您採用的「AI初步評估→專家確認→多版本比較」流程很周全,能有效控制AI回饋的品質與可靠性。

版本控制策略 三個版本的設計巧妙地區分了不同變因:

  • 版本1控制專家介入的影響
  • 版本2評估純AI能力
  • 版本3控制回饋長度對品質的影響

提升回饋品質的建議

評估標準化

  • 建立明確的回饋品質評估指標(如具體性、建設性、可操作性)
  • 設計評分量表供後續比較分析使用

AI協作最佳化

  • 考慮使用不同AI模型的專長領域分工(如GPT-4處理溝通技巧、Claude處理臨床推理)
  • 設計AI間的交互驗證機制

專家參與深度

  • 明確專家確認的範圍(僅修正錯誤 vs 全面改寫)
  • 記錄專家修改的類型與頻率,作為AI改進依據

潛在挑戰與解決方案

評估一致性 真人考官間的回饋品質本身可能存在變異,建議:

  • 增加多位真人考官的回饋作為對照
  • 建立考官間信度測試

情境適應性 不同OSCE站別可能需要不同的回饋策略,可考慮:

  • 按臨床技能類別分組分析
  • 針對溝通技巧 vs 技術操作設計不同評估重點

這個研究架構為醫學教育的數位轉型提供了實證基礎,有望為未來的混合式評估模式奠定基礎。

2025年6月29日 星期日

發展「精神病患職能治療團體帶領表現評估表」--適用於團體帶領逐字稿或錄影檔

「治療團體帶領」之準備、執行、成果與檢討---這些過程極為複雜!!

我們已挑簡單的先下手--計畫書之評估與回饋,目前已可使用 ChatGPT 協助評估與回饋!!

之前我們已累積諸多團體帶領的錄影檔(如前一貼文所示)...

故我們下一階段 似可 推動以下研究計畫 A, B, C, & D:

A. 發展精神病患職能治療團體帶領表現評估表

研究目的:

1. 以 Cole 團體帶領7步驟為理論架構,發展精神病患職能治療團體帶領表現評估表

2. 驗證其內容效度與表面效度

適用情境:團體帶領/執行錄影之「逐字稿」或「錄影檔」 

         註解:錄影檔之評估,不論專家或AI皆很費力(或需要高階AI效能)... 逐字稿簡單多了,故可作為初步驗證之情境! 

-------------------------------------------------------

B. 以ChatGPT協助精神病患職能治療團體帶領品質之分析與回饋效能

研究目的:

1. 依據A計畫之評估表,發展治療團體帶領技巧評論之ChatGPT工具,再驗證其信效度

2. 依據上述B1之評估結果,發展治療團體帶領技巧回饋之ChatGPT工具,再驗證其信效度

3. 驗證上述工具之教學效能(預期學員於接受上述評估與回饋3次之後,即有明顯進步!)

-------------------------------------------------------

C. 以ChatGPT協助精神病患職能治療團體帶領之Yalom治療因子分析與回饋效能

研究目的:

1. 依據Yalom團體治療之11項治療因子,發展針對「團體帶領逐字稿」治療因子ChatGPT分析工具,再驗證其信效度

2. 依據上述C1之分析結果,發展治療團體治療因子回饋之ChatGPT工具,再驗證其信效度

3. 驗證上述工具之教學效能(預期學員於接受上述分析與回饋3次之後,即有明顯進步!)

-------------------------------------------------------

D. 以ChatGPT協助精神病患職能治療團體帶領與計畫書所提治療原理之一致性分析與回饋效能

研究目的:

1. 依據團體帶領計畫書所提治療原理,發展針對「團體帶領逐字稿」治療原理之ChatGPT分析工具,再驗證其信效度

2. 依據上述D1之分析結果,發展治療團體治療原理回饋之ChatGPT工具,再驗證其信效度

3. 驗證上述工具之教學效能(預期學員於接受上述分析與回饋3次之後,即有明顯進步!)


 

2025年6月18日 星期三

團體帶領的評估與回饋

我們在臨床收集到的團體錄影檔,應該超過100個團體/錄影檔。

現有AI的技術至少可以分析其音檔/逐字稿(順道做成錄影檔的字幕),且速度快!!

所以我們已啟動「主持人帶領團體表現」之評估與回饋研究計畫!!

另,臨床教學時,後續臨床帶領的團體影音檔,我們應可於2天之內及完成評估與回饋!!

也可交給帶領者自行操作,以快速獲得評分與回饋!!

加上之前計畫書的評分與回饋,即可更完整!!

我相信後續應可證實這些評估與回饋可讓團體帶領的品質與成果「顯著提升」!!

---------------------------------------------------------

上述教學或研究的關鍵在於:「治療師帶領團體表現評估表」之良寙!

2025年6月6日 星期五

很多精神科EPAs都是生成式AI的立即研究議題

 

出處:《醫療品質雜誌》 16卷1期 (2022/01) Pp. 70-75

綠色字部分(準備文本紀錄或計畫等任務):

如 4. 擬定適當且完整治療計畫。

5. 記錄與報告病人的臨床事件。

6. 記錄與報告精神疾病病人的臨床資料。

這是 LLMs 即可搞定/幫大忙的任務!!若僅以專家驗證信效度,則IRB頂多簡審!!

紅色字:訪談/諮詢部分,毋須(或較少)觀察, My GPTs 也可搞定!!

後續可行的研究題材超多!!

另一發現是,國內精神科醫學教育的研究成果極少!!


2025年6月1日 星期日

Generative AI for Medical Education Standards (GAMES )

生成式AI醫學教育標準---

後續宜發展「以生成式AI發展影音教材之SOP與評估標準」&「以LLM發展虛擬病人與虛擬考官之SOP與評估標準」,因為這些SOP與評估標準皆對於後續的醫學教育研究具有很重要的指引與驗證需求。

---------------------------------------

以下是針對「以生成式AI發展影音教材之SOP與評估標準」的評論:

獨特價值:技術創新與教育結合:

  • 將生成式AI(如影片生成、語音合成、動畫製作)應用於醫學教育,開創新的教材製作模式
  • 大幅降低高品質教材的製作成本和時間
  • 能夠快速產生多語言版本,促進醫學教育的國際化

個人化學習的突破:

  • 可根據學習者程度/目標,自動調整教材難度和呈現方式
  • 產生多樣化的臨床案例變化,避免學習固定模式
  • 即時更新醫學知識,保持教材的時效性

教學設計整合:

  • 如何將AI工具整合到現有的教學設計流程
  • 教師在AI輔助下的新角色定位
  • 保持人文關懷在醫學教育中的核心地位

---------------------------------------------------

「以LLM發展虛擬病人與虛擬考官之SOP與評估標準」

創新價值:

  • 解決臨床教學資源限制問題(標準化病人數量有限、考官時間寶貴)
  • 提供24/7的練習機會,增加學生接觸多樣化案例的機會
  • 能夠模擬罕見疾病或高風險情境,提供安全的學習環境

---------------------------------------------------

VP 驗證模式:

對話內容之一致性與正確性(>12項*2種對話來源[自然對話(>10 examiness)與設定對話(New Chat 3次)]*>5VP)

對話風格之一致性與正確性(>5項*2種對話來源[自然對話與設定對話]*>5VP)

專家設定對話,以FIFE言,可約12題(可驗證prompt有無舉例/設定)


VR (virtual rater) 驗證模式:

評分與回饋內容之一致性與正確性

2025年4月25日 星期五

FIFE疾病經驗訪談之研究議題

1. FIFE知識之教學方法與效能驗證

2. 訪談技能(包含記錄)評估工具發展與驗證(含訪談能力、溝通技巧/同理心、記錄與應用能力)

3. 虛擬病人發展與驗證(不同診斷)

4. 虛擬考官發展與驗證(依據#2以及回饋模式)(結合 #2 量表與自動回饋模組,可形成完整「自學—自評—即時回饋」生態系。)

5. FIFE訪談學習模式(多種模式,如線上到實務;不同設計)發展與驗證(含學員對於FIFE之態度驗證--(FIFE Attitude Scale, 需自行研發並驗證))

---------------------------------------

CBME 之 milestones (ChatGPT 生成)



參考CBME 里程碑以及 FIFE 訪談所需的多面向能力,重新改寫整體研想構想如下(與 Gemini 2.5討論):

研究計畫總標題:

建構、實施與評估一個基於能力導向醫學教育(CBME)里程碑之 FIFE 訪談核心能力整合性培育計畫

計畫願景 (Overall Goal / Vision):

本研究旨在發展、實施並評估一個全面性的 CBME 教育計畫,聚焦於「病人疾病經驗」-- FIFE(感受 Feelings, 想法 Ideas, 功能 Function, 期望 Expectations)訪談核心能力。此計畫將透過明確的發展性里程碑,系統性地培育學習者掌握執行有效 FIFE 訪談所需的相關知識與能力(包含基本知識、閱覽病歷資料/擷取相關資訊、溝通技巧、同理心、認知整合(記錄)與應用能力及相關態度),建立一個從學習、準備、練習、應用、評估到回饋的完整教育生態系,最終目標在於提升以病人為中心的溝通品質與醫療照護成效。(自我學習的生態系統!?)

核心理念與概念框架 (Conceptual Framework):

  1. 採納 CBME 模式: 以學習成果為導向,強調學習者能力的達成。
  2. 運用里程碑 (Milestones) 作為發展藍圖: 將 FIFE 訪談能力視為一項關鍵的臨床溝通實踐活動,界定其從新手到熟練者的可觀察、發展性的里程碑。
  3. 承認 FIFE 訪談的複雜性與多面向特質: 成功的 FIFE 訪談需要整合以下要素:
    • 知識基礎: 理解 FIFE 概念、溝通理論及其重要性。
    • 溝通技能: 包含提問、傾聽、非語言溝通、同理心展現 (NURS) 等可訓練技巧。
    • 認知整合與應用: 能綜合 FIFE 資訊進行臨床推理、記錄並應用於共享決策。
    • 情感態度: 具備同理心、尊重、好奇心、自我覺察與專業態度。
  4. 整合性培育: 研究計畫的各個環節(教學、評估、科技工具)將圍繞這些里程碑及所需的多面向能力進行設計與驗證。

具體研究目標與內容 (Specific Research Aims / Phases):

第一階段:奠定 FIFE 能力框架與評估基礎 (Foundation & Assessment)

  • 目標 1.1 (界定里程碑): 依據文獻、專家意見及學習者發展理論,界定一套適用於目標學習者(例如:醫學生、住院醫師)的 FIFE 訪談能力發展里程碑。此里程碑需具體描述不同階段學習者在上述多面向能力上的預期行為表現。完成後需進行專家內容效度驗證。
  • 目標 1.2 (發展評估工具): 基於已驗證的 FIFE 里程碑,發展並驗證一套多面向、多來源的評估工具組合(例如:包含針對溝通技巧觀察的評分量表 Rubric、評估記錄與應用能力的案例分析或病歷審查標準、可能的自我評估或同儕回饋表單)。此工具組合需具備良好的信效度,能可靠區分不同里程碑水平的學習者,並能評估 FIFE 所需的多元能力。

第二階段:設計與驗證里程碑導向的學習體驗 (Learning Experiences)

  • 目標 2.1 (教學策略效能): 設計並比較不同教學方法(如:互動式工作坊、標準化病人演練、虛擬病人模擬、線上學習模組、案例討論、反思練習等)對於促進學習者在 FIFE 里程碑上進展的相對效能,特別關注不同方法對特定面向能力(如:同理心展現、資訊整合)的提升效果。
  • 目標 2.2 (學習路徑優化): 規劃並評估不同的整合性學習路徑(例如:線上知識學習 -> VP 模擬練習 -> SP 實境演練與回饋),探討何種組合模式最能有效支持學習者循序漸進地達成 FIFE 能力里程碑。
  • 目標 2.3 (態度量表與影響): 開發並驗證一個「FIFE 學習與實踐態度量表」,用以測量學習者對 FIFE 的價值觀、自我效能、學習動機等,並探討態度與學習模式選擇、里程碑達成度之間的關係。

第三階段:開發與整合科技輔助學習與評估工具 (Technology Integration)

  • 目標 3.1 (分級虛擬病人 VP): 開發一系列具備不同臨床情境與溝通挑戰複雜度的虛擬病人案例。這些案例需能對應 FIFE 里程碑的不同階段,提供標準化、可重複、具針對性的模擬練習機會,特別是用於練習較難透過傳統方式標準化的情境(如:處理強烈情緒、文化差異)。
  • 目標 3.2 (智慧虛擬考官 VE): 研發一個能整合 VP 系統的智慧虛擬考官。此 VE 需能:
    • 運用第一階段發展的里程碑導向評估工具(或其演算法化的版本)分析學習者與 VP 的互動數據(文本、語音、行為)。
    • 自動評估學習者在 FIFE 各面向能力的表現,並判斷其當前所處的里程碑級別。
    • 提供具體、可操作、針對其里程碑水平的形成性回饋,引導學習者自我修正與成長,實現「練習-評估-回饋」的即時自主學習循環。

第四階段:整合性計畫實施與成效評估 (Program Implementation & Evaluation)

  • 目標 4.1 (計畫試行): 在目標學習者群體中,試行整合前三階段成果的 FIFE 能力培育計畫(包含課程、教學活動、VP/VE 工具、評估機制)。
  • 目標 4.2 (總體成效評估): 全面評估此整合性計畫的可行性(Feasibility)、學習者與教師的接受度(Acceptability)及成效(Effectiveness)。成效指標應包含:學習者 FIFE 能力里程碑的達成率與進展速度(使用目標 1.2 工具)、知識與技能的提升、態度的轉變(使用目標 2.3 量表),以及探索對臨床行為(如病歷記錄品質)或病人回饋(若可行)的潛在影響。

研究流程與關聯性 (Interdependencies & Flow):

第一階段是整個計畫的基石,其產出的里程碑框架與評估工具是後續所有研究的依據與標準。第二、三階段可部分平行展開,但教學活動(第二階段)的設計與成效評估需依賴第一階段的工具,科技工具(第三階段)的開發也需以第一階段的框架為基礎。第四階段則是對前三階段成果的整合應用與總體檢驗。

預期貢獻與影響 (Expected Impact):

  • 為 FIFE 訪談能力的培育提供一個具體、可行的 CBME 實施範例。
  • 產出經過驗證的 FIFE 能力里程碑、多面向評估工具及態度量表。
  • 提供不同教學策略與學習路徑對 FIFE 能力發展成效的實證依據。
  • 開發創新的科技輔助工具(VP/VE),促進自主學習與形成性評估。
  • 最終有望提升臨床人員的 FIFE 訪談能力,改善醫病溝通品質,促進以病人為中心的照護。

這個修訂後的計畫更強調能力的發展性、多面向性,並將 CBME 里程碑作為貫穿始終的核心架構,希望能更全面且深入地探討 FIFE 的教與學。