顯示具有 Research-研究主題-溝通技巧 標籤的文章。 顯示所有文章
顯示具有 Research-研究主題-溝通技巧 標籤的文章。 顯示所有文章

2026年6月18日 星期四

「醫病關係」與其評量

 

醫病關係或如何有效建立(或評量)醫病關係,上述圖示,應已提供諸多訊息(左圖:哪些技巧/核心能力「影響醫病關係」;右圖:醫病關係如何影響「個案表現」或從個案表現如何看到醫病關係)!!

我們之前投入很多「溝通技巧」「同理心」「疾病經驗訪談」「共享決策」等,皆是建立良好醫病關係的關鍵!!

我們已有諸多音檔/逐字稿,應可呈現「醫病關係」。以中風病人第一次接受職能治療的醫病互動,應可評估呈現醫病關係!



我們的錄音檔與逐字稿,可以補充一些「上圖還沒有明確呈現、但在對話中很容易觀察」的 indicators。這些不必推論病人內心,而是從語句、輪替、停頓、修正、提問與聲音反應來判斷。如下圖:


------------------------------------------------------

Q: 問候病人最近一個禮拜復健或接受職能治療的經驗,以及他們的感受或想法。

以這樣的任務,適不適合轉作為建立關係,以及觀察醫病關係的合適任務呢?
---------------------------------

Re: 適合,而且我覺得比「第一次接受職能治療的醫病互動」更適合做成**短時間觀察醫病關係的任務**。因為它自然會引出病人的經驗、困難、感受、期待與治療師回應方式,不需要刻意製造衝突或壞消息情境。

但它比較適合觀察「關係建立與維持」,不一定能完整觀察「功能評估合作」或「身體接觸中的安全感」。

**為什麼適合**
這個任務可以觀察:

- 病人是否說出真實經驗,而不只是回答「還好」。
- 病人是否提到復健中的挫折、疼痛、疲倦、害怕或成就感。
- 病人是否敢說出不滿、困惑或不理解治療目的。
- 病人是否能表達自己覺得有用或沒用的部分。
- 治療師是否能接住情緒,而不是馬上教訓或轉成衛教。
- 對話是否能從「問候」進到「共同調整治療目標」。

**建議任務設計**
可以設成 5 分鐘短站:

> 「請你關心病人最近一週接受復健或職能治療的經驗,了解他/她的感受、想法、困難與期待,並用病人的回應來確認接下來治療可以怎麼調整。

這樣比單純「問候病人」更好,因為它有明確任務:從經驗進入關係,再連到治療合作。

**適合觀察的 indicators**

指標客觀言行例子
病人描述具體治療經驗「這週練站起來比較多」「手還是不太會動」
病人說出感受「有點挫折」「覺得累」「有一點進步很高興」
病人說出困難或障礙「練完很痛」「回病房沒人幫我練」「我不知道這個練習有什麼用」
病人表達偏好「我比較想先練吃飯」「我不想一直練走路」
病人提出疑問「這樣練多久才會好?」
病人修正治療師理解「不是不想練,是我怕跌倒」
病人在情緒後仍繼續談說出挫折後,仍能回應「那你最想先改善哪一件事?」
病人參與下一步調整「那我想每天多練一次拿湯匙」
**它特別能觀察的醫病關係層面**
這個任務最能看出:

- 被理解感:病人說完後,是否有「對,我就是這個意思」的反應。
- 安全感:病人是否敢說負面經驗或不滿。
- 合作感:病人是否能和治療師一起調整目標。
- 主體性:病人是否從被動接受治療,轉為說出自己的 priority。
- 情緒承接:治療師是否能處理挫折、害怕、失望。

**需要注意的限制**
不要把「病人講很多」直接等於醫病關係好。中風病人可能有失語、構音困難、疲倦、認知障礙或情緒低落,所以應允許:

- 點頭/搖頭
- 指認選項
- 圖卡
- 家屬補充後由病人確認
- 簡短語句
- 較長等待時間

**我會建議的評分語句**
- 病人描述至少一項過去一週復健或職能治療的具體經驗。
- 病人表達至少一項感受、想法、疑問或困難。
- 病人指出至少一項覺得有幫助、沒幫助或想調整的治療內容。
- 病人以口語或非口語方式修正、補充或確認治療師的理解。
- 病人在治療師回應後,能繼續參與下一步治療目標或安排的討論。

結論:這是一個很適合的任務,尤其適合做為「建立關係」與「觀察醫病關係」的短站。它比第一次身體功能評估更自然,也比較不會被動作能力限制干擾;但最好把題目設計成「關心經驗與感受,並連結到下一步治療調整」,而不是只做一般寒暄。

-------------------------------------
就職能治療師而言,你覺得還有哪些短時間的任務,可以觀察醫病關係的?
-------------------------------------
短時間任務為什麼適合觀察醫病關係可觀察指標
詢問最近一週復健經驗最自然、低壓力病人說出感受、困難、偏好、疑問
討論「最想恢復的一件事」很符合 OT 作業導向病人是否說出有意義角色或生活目標
詢問日常活動中最困難的情境可從功能問題進入生活脈絡病人是否說出具體障礙與環境限制
選擇今天治療優先順序可觀察共同決策病人是否表達選擇、修正或拒絕
回顧一次失敗或挫折的練習可觀察情緒承接病人是否說出害怕、挫折、疼痛或疲倦
解釋一項功能評估目的可觀察理解與安全感病人是否提問、確認或說出不懂
身體接觸或移位前說明可觀察尊重與界線病人是否表達不適、害怕、需要暫停
討論輔具或環境調整可觀察生活脈絡與合作病人是否說出家中限制、使用疑慮
與家屬共同討論照護方式可觀察病人主體性家屬發言後,病人是否仍被詢問並回應
結尾確認下一步治療計畫可觀察合作關係是否形成病人是否確認、補充、修正或提出問題

我會特別推薦這 5 個:

1. 「你現在最想恢復的一件日常活動是什麼?」

適合看病人是否能從身體功能轉到生活目標。

例如:不是只說「手要好」,而是說「我想自己吃飯」「我想自己上廁所」「我想回去煮飯」。

2. 「這幾天復健最困難或最挫折的是哪一段?」

適合看病人是否能表達負面經驗,也看治療師是否能接住情緒。

可觀察:病人說出痛、累、怕跌、沒進步、覺得丟臉、不知道為什麼要練。

3. 「今天我們可以先練 A 或 B,你比較想先處理哪一個?」

適合看共同決策。

可觀察:病人是否選擇、猶豫、修正、拒絕,或說出理由。

4. 「我等一下要協助你坐起/移位,先跟你說明,哪裡不舒服要告訴我。」

適合看安全感與身體界線。

可觀察:病人是否說痛、怕、暈、想休息,或用表情/手勢示意暫停。

5. 「你回到家最擔心哪一件事?」

適合看生活脈絡與真實需求。

可觀察:病人是否說出家中樓梯、浴室、照顧者、工作、經濟、家人期待等限制。

若要設計成 OSCE 或錄音逐字稿評分,我會選「最近一週治療經驗+最想調整的一件事」作為主任務,因為它最容易在短時間內誘發病人的感受、偏好、疑問與共同決策。

2026年3月10日 星期二

愛上 Typeless AI 了

我應用 Typeless AI 的主要功能/優點有四:

邏輯彙整: 自動將口語轉化為組織嚴密、重點明確的條列文字。

抗噪辨識: 在公車、戶外等高分貝環境下,依然維持極高辨識率。

多人應用: 支援遠距離收音,適用於多人會議討論與紀錄。

即時靈感捕捉: 隨時隨地透過語音產出想法,系統將自動完成內容整合。

*以上是我口頭講講之後,再由 Gemini 彙整。

我最喜歡:「邏輯彙整: 自動將口語轉化為組織嚴密、重點明確的條列文字。」,基本上適用於任何人...

----------------------------------

*以下是 Gemini 的補充:

除了您提到的會議記錄與靈感捕捉,這類具備**高抗噪、遠距收音與邏輯重組**功能的工具,在學術研究與教學實務上還有許多極具價值的應用場景:

---

### 1. 訪談逐字稿與研究編碼 (Qualitative Research)

在進行**質性研究訪談**時,這類工具能節省大量人工聽寫時間。

* **優勢:** 即使在收音環境不完美的咖啡廳或研究室,也能精準捕捉受訪者的語句,並初步將瑣碎的口語轉化為書面語,方便後續進行主題編碼(Coding)。

### 2. 行動式教學與田野筆記 (Field Notes)

對於需要邊走邊觀察的場景(如**臨床實習指導**或**田野調查**),它能擔任「數位助理」。

* **應用:** 老師或研究者可以一邊觀察、一邊對著手機描述看到的現象或個案反應,工具會即時將這些碎片化的觀察彙整成具結構性的日誌,避免回辦公室後遺忘細節。

### 3. 個案紀錄與病歷草稿 (Clinical Documentation)

在醫療或職業治療環境中,臨床人員常面臨大量文書工作。

* **應用:** 在治療結束後的空檔,直接口述治療過程與患者表現(如 SOAP 紀錄的架構),讓 AI 預先生成**初稿**,再由人工進行最後核對與修改,大幅降低文書負擔。

### 4. 論文初稿的「口述寫作」 (Dictating First Drafts)

面對空白螢幕常有寫作障礙(Writer's Block)時,「講」比「寫」通常更快、更自然。

* **應用:** 您可以先對著工具講出論文某個章節的大致邏輯或論點,利用它「強化組織」的功能,將散亂的口語轉化為**學術初稿的雛形**,再進行精修。

### 5. 即時翻譯與跨語言交流 (Cross-lingual Support)

其強大的抗噪與遠距收音可轉化為「隨身翻譯機」。

* **應用:** 在國際研討會的 Q&A 時間,或是與外籍同仁交流時,即時將對方的發音轉化為您熟悉的語言文字,確保溝通細節不漏失。

---

### 6. 輔助溝通工具 (AAC)

針對口語表達較吃力,但邏輯思考正常的個案。

* **應用:** 幫助個案將模糊、斷續的發音,轉化為旁人易懂、有組織的文字,提升個案在社交或臨床情境中的溝通信心。


2025年12月27日 星期六

現有「告知壞消息」逐字稿之後續稿件撰寫主題

重症醫療溝通//告知壞消息資料,以LLM使用 NURSE (Naming、Understanding、Respecting、Supporting、Exploring)同理評估言:

研究主題

  1. 應用LLM評估臨床同理心之研究:以 NURSE 框架的 LLM 同理評估與回饋之信效度驗證 
  2. LLM 效能比較:比較 GPT 與 Gemini 以 NURSE 框架評估之信度與已知族群效度
  3. 基於 NURSE 框架之智慧醫學教育研究:LLM 虛擬同理情境開發與驗證 
  4. 提升 LLM 同理心評估準確性:比較 Chain-of-Thought 與 Few-shot 提示工程對 NURSE 框架評估之影響
*楊醫師:主題 1 & 3 (加上急重症標題)是很適合投稿 ESICM 會議 (European Society of Intensive Care Medicine)

*改良逐字稿(虛擬對話開發[上述主題3]--也是研究主題!)或是關鍵之一,讓逐字稿的同理技巧或溝通任務執行地更好或較差!可作為已知族群效度驗證以及後續教學示範使用。

GKCSAF GPT 之主題
  1. 從職能治療到急重症醫療:GPT 溝通技巧評分系統在跨領域場域之信度/效度驗證(提升?)
------------------------

若您計劃投遞 **AMEE (Association for Medical Education in Europe)** 國際醫學教育會議,考量該會議強調醫學教育創新、科技輔助學習 (TEL) 以及評估方法的嚴謹性,以下根據您已發表的論文成果  與新擬的研究構想,建議三個最合適的主題:

---

### 推薦主題一:科技評估與效度驗證(最符合 AMEE Assessment 類別)

#### **主題名稱:**

**"Beyond the Scale: Validating an LLM-based Rater for Empathy in High-Stakes Critical Care Conversations Using the NURSE Framework"** (超越量表:應用大型語言模型評估急重症高壓力溝通中同理心之效度驗證——以 NURSE 框架為例)

#### **合適理由:**

* **延續論文優勢:** AMEE 對於評估工具的信效度(Reliability and Validity)有極高要求 。您已在職能治療領域驗證了 GKCSAF 的總分評估具備可接受的 MAE% ,此主題將其遷移至更具挑戰性的「急重症同理心 (NURSE)」評估。

* **解決論文限制:** 您先前的研究指出領域層級(Domain-level)的評估信度較低 ,且 zero-shot 提示法可能限制 AI 表現 。本研究可強調透過更精進的提示工程或跨模型比較(GPT vs. Gemini)來優化表現。

* **臨床真實性:** 使用逐字稿中關於葉克膜(ECMO)撤除與腦死判定等高度情感衝突的情境 ,對於醫學教育界具備極高的教學探討價值。

---

### 推薦主題二:教學設計與虛擬模擬(最符合 AMEE Innovation 類別)

#### **主題名稱:**

**"Developing AI-Generated Virtual Dialogues for Empathy Training: A Feasibility Study on Differentiating High and Low Empathy Scenarios in ICU Settings"** (開發 AI 生成之同理心培訓虛擬對話:區分急診加護情境中高/低同理心腳本之可行性研究)

#### **合適理由:**

* **創新性:** AMEE 鼓勵能直接應用於教學的創新方案。利用 AI 模擬家屬對於病患過往生活習慣(如抽菸、喝酒)產生的強烈自責情緒 ,進而發展出不同同理心等級的對話腳本作為教學模組。

* **實務應用:** 回應論文中提到 AI 評分能減少臨床教師負擔 、避免疲勞且具備一致性評分標準的優點 ,並將其從「評分工具」轉化為「教學素材產生器」。

---

### 推薦主題三:AI 模型效能比較與教育倫理(符合 AMEE TEL/AI 類別)

#### **主題名稱:**

**"Reliability Paradox in AI Assessment? Comparing GPT and Gemini in Evaluating Complex Emotional Support during End-of-Life Decisions"** (AI 評估中的信度悖論?比較 GPT 與 Gemini 在評估末期醫療決策中複雜情感支持之表現)

#### **合適理由:**

* **學術深度:** 引用論文中提到的「信度悖論 (Reliability Paradox)」與「分數變異度限制 (Limited Score Variability)」,探討 AI 模型在處理複雜細微情緒(如家屬強調與弟相依為命的情感連結 )時的表現差異。

* **前瞻性:** 論文建議未來應測試不同版本的 GPT 模型 。此主題直接回應此需求,並加入 Gemini 的比較研究,符合目前 AMEE 對於 AI 應用與演算法透明度的前瞻討論趨勢 。

---

### 總結建議

* 如果您希望以**「學術論文 (Short Communication / Research Paper)」**形式投遞,建議選擇**主題一**,因為它具備最紮實的心理計量學驗證架構 。

* 如果您希望以**「教學創新 (Educational Innovation / Poster)」**形式投遞,則**主題二**更具吸引力,因為它展示 AI 技術如何轉化為實際的臨床教學工具。


2025年12月25日 星期四

從寫計畫到寫書...

之前聽過,寫好一個研究計畫,就接近寫一本書了... 最近一個月的努力... 與楊醫師團隊合作... 似乎可以實現了!!


建議書名

《醫療互動的動態變革:從核心溝通實證、傳統訓練困境到 AI 賦能的 MIDA 新解方》 (Medical Interaction in Transition: From Core Evidence and Training Dilemmas to AI-Enhanced MIDA Solutions)

 




全書架構與重點內容

第一部:溝通的科學——概念、重要性與實證基礎

本部的目標是確立「溝通是核心醫療處置」的科學地位,而非僅是軟實力。

  • 第一章:溝通如何療癒?從理論模型到健康結果
    • 溝通的路徑模型: 引用 Street 等人的經典研究,說明溝通如何透過「近端結果」(理解、信任)與「中介結果」(服藥依從性、自我管理)最終改善「健康結果」(存活率、生活品質)。
    • 實證效力: 引用 Cochrane 系統性回顧,指出溝通介入措施確實能改善整體的溝通技巧與同理心表現,但目前對「建立關係(Rapport)」的提升效果仍具挑戰性。
    • 去迷思化: 澄清溝通不只是天份,而是可教、可學的行為科學。
  • 第二章:當代醫療互動的核心能力標準
    • Kalamazoo 到全人照護: 介紹 Kalamazoo 共識聲明 Calgary-Cambridge 指引 等主流架構。
    • Sim-Comfort 模型: 引入護理觀點,強調溝通是「關係的產物」,不僅是訊息交換,更包含舒適與連結。

第二部:現況與困境——傳統訓練的極限

專章剖析為何現有方法(如傳統 OSCE)不夠用,為引入 AI MIDA 鋪路。

  • 第三章:傳統模擬教學(Simulation & OSCE)的實務困境
    • 「雙重缺口」論述: 引用 MIDA 計畫書,點出理論上過度依賴線性步驟,以及媒介上標準化病人(SP)的高昂成本與低可近性。
    • 回饋的侷限: 傳統 OSCE 中,SP 或教師的回饋往往不夠即時、具體或個人化,且受限於人力資源,難以落實「刻意練習(Deliberate Practice)」所需的重複頻率。
    • 同儕角色扮演(Peer Role-Play)的利弊: 引用 Cochrane 回顧指出,目前證據無法確定 SP 是否絕對優於同儕扮演,但同儕扮演在真實性上常受質疑;不過最新的 2025 研究顯示,同儕扮演在「建立關係」的真實感上仍有其獨特價值。

第三部:理論重構——醫療互動動態調適架構 (MIDA)

本部的目標是提出解決「動態性」問題的理論解方。

  • 第四章:從線性流程走向動態導航
    • MIDA 的核心精神: 將醫療互動視為「動態風險管理歷程」,而非靜態任務清單。
    • 四層脈絡檢視: 疾病、醫療人員、病家、系統層面的風險因子分析。
  • 第五章:「停看聽保平安」操作模組詳解
    • 覺察(停看聽): 停頓重啟、察言觀色、傾聽詢問。
    • 介入(保平安): 保障界線、平衡思考、安心決策。此章節應結合具體臨床案例(如急重症情境)說明如何應用。

第四部:科技賦能——LLM 驅動的虛擬實戰

本部重點在於整合 2025 年最新的 AI 實證研究,證明 AI 是解決第二部所述困境的有效工具。

  • 第六章:生成式 AI 作為新時代的標準化病人 (VP)
    • 技術原理與優勢: 說明 LLM ( GPT-4) 如何生成具備情緒反應與記憶的虛擬病人,解決傳統 SP 劇本僵化與成本過高的問題。
    • 2025 最新實證:
      • 有效性: 引用 McCarrick (2025) 的隨機對照試驗 (RCT),證明使用 AI 模擬訓練的醫學生在病史詢問上的表現顯著優於傳統組。
      • 診斷溝通: 引用 Suárez-García (2025) 的研究,顯示 AI 訓練能顯著提升學生在告知糖尿病診斷時的結構性與同理心。
      • 互補性: 引用 Lee (2025) 的研究,指出 AI 擅長提供「重複練習與結構化回饋」,而真人同儕擅長「真實互動感」,兩者應為互補關係。
  • 第七章:虛擬教師 (VT) 與自動化回饋機制
    • AI 評分的準確度: 引用 Ju (2025) 的研究,利用 GPT 進行 Gap-Kalamazoo 量表評分,在總分上與人類評分者具有可接受的一致性。
    • AI 回饋的特質: 引用 Panchasara (2025) 的比較研究,指出 AI 的回饋較具結構性、協議導向(Protocol-driven),而人類考官的回饋則較具經驗性與情境脈絡。
    • 系統設計: 說明如何設計 Prompt AI 扮演嚴格但具建設性的導師。

第五部:實務應用與未來展望

總結如何將 MIDA AI 平台整合進現有的醫學教育體系。

  • 第八章:分級訓練藍圖與混合式教學
    • 初階 vs. 進階: 醫學生(廣度練習)與住院醫師(高張力情境、壞消息告知)的差異化 AI 劇本設計。
    • 混合模式 (Blended Learning) 建議結合「AI 進行大量基礎練習」與「真人進行高階情感訓練」的最佳化教學策略。
  • 第九章:挑戰、倫理與未來
    • AI 的侷限: 討論 AI 在非語言溝通(肢體語言)偵測上的不足,以及可能產生的偏誤。
    • 人本反思: 引用 Zohny (2025) 的觀點,反駁 AI 會導致「去人性化」的擔憂,主張若設計得當,AI 實際上能通過提供隨時可得的解釋與同理回應,來增強以病人為中心的照護。

------------------------------------------

以上是楊醫師為計畫主持人的研究計畫+ PubMed 檢索2025年溝通技巧與LLM研究,還有幾篇關鍵文獻,再與 NotebookLM 協力生成的!!

簡介影片



2025年10月27日 星期一

GKCSAF GPT rating 的困境

區辨力有限--我們即使給GPT不同溝通能力(含專家評估高中低溝通能力)的逐字稿,GPT 評分結果仍趨向集中,SD變小(比專家評分的SD小很多)(圖)。

圖:專家與GPT評估GKCSAF之分數分布趨勢與差異(專家評分[灰色]由高至低;GPT評分[天藍色]分數較為集中)

可能的解決方法之一,或是給予GPT高中低溝通能力的逐字稿,提醒 GPT 盡力區辨個別差異...

-------

以下是 Claude AI 的建議:

這個「分數集中化」現象確實是GPT評分系統的重要限制,反映了幾個關鍵問題:

問題分析

1. 迴歸均值傾向

GPT可能過度學習了訓練資料中的平均表現,導致:

  • 對極端表現(特別優秀或特別差)的辨識不足
  • 傾向給出「安全」的中間分數
  • 缺乏對細微差異的敏感度

2. 缺乏真實臨床判斷經驗

  • GPT缺少實際觀察不同能力層級治療師的經驗
  • 無法像人類專家那樣累積對「優秀」vs「普通」vs「需改進」的直覺判斷
  • 可能過度依賴表面的語言特徵而非深層的溝通品質

3. 評分標準的理解限制

  • GPT可能僅理解評分標準的文字描述,但缺乏對實際應用時細微差別的把握
  • 對於什麼構成「卓越」或「不足」的溝通,可能缺乏具體的內在標準

改善建議

短期策略

1. Few-shot prompting with anchoring examples

  • 在prompt中提供明確的高、中、低分範例
  • 特別強調極端案例的特徵
  • 要求GPT先識別屬於哪個能力層級,再進行細部評分

2. 評分校準機制

建議prompt架構:
- 先要求GPT識別3-5個關鍵溝通事件
- 對每個事件評估其品質(優/可/差)
- 基於事件分布決定整體分數範圍
- 最後才給出具體分數

3. 強制分布考量

  • 明確告知GPT期望看到分數的變異性
  • 要求GPT在評分前先排序多個案例(如果同時評多個)

中長期策略

1. Fine-tuning with expert-annotated data

  • 收集專家一致認定的高、中、低分案例
  • 特別標註關鍵差異點
  • 使用這些資料進行模型微調

2. 開發階層式評分系統

第一層:分類(優秀/良好/待改進)
第二層:在類別內細分(如優秀中的高/中/低)
第三層:給出具體分數

3. 結合多個評估策略

  • 使用不同的prompt策略多次評分
  • 分析評分的一致性和變異性
  • 可考慮ensemble方法

驗證建議

1. 診斷性測試

  • 創建明確的對比案例(如同一情境的優劣版本)
  • 測試GPT是否能識別關鍵差異
  • 記錄哪些特徵GPT容易忽略

2. 敏感度分析

  • 系統性地修改逐字稿中的關鍵元素
  • 觀察分數變化是否合理
  • 識別GPT的「盲點」

3. 與專家評分的差異分析

  • 不只看總分,更要分析哪些案例GPT給分特別保守
  • 找出專家認為差異大但GPT認為相似的案例對
  • 理解背後的評判邏輯差異

實務考量

如果短期內無法解決這個問題,建議:

  1. 調整使用定位:將GPT評分器定位為「初步篩選工具」而非「精確評分工具」
  2. 結合人工複審:對GPT評分集中的案例,特別進行人工複審
  3. 透明溝通:向使用者說明目前的限制,特別是在區分能力層級方面的不足

這個問題突顯了目前LLM在專業判斷任務上的根本限制——它們擅長識別「是否符合標準」,但在判斷「符合程度」的細緻差異上仍有很大改進空間。


2025年8月6日 星期三

疾病經驗(FIFE)訪談架構、訪談能力評估與回饋系統之建立與驗證

這是我倫理學教學10幾年的主題之一,內容更改至少5次了....

臨床一直沒有採用,我依然沒放棄.... 這頗像我30年的主要研究成果(評估工具),乏人問津一般.... 哀怨的緣由,有些已於之前的貼文論述了...

回到FIFE,因生成式AI的誕生,讓我們多一項強大的研究技術/方法!!我已設計多位可供訪談的虛擬病人(生理、心理與小兒個案或家屬)!因此「FIFE訪談架構、訪談能力評估與回饋系統之建立與驗證」已正式進入「研發/改良」階段。

我們團隊的學術基礎包含:

  1. 心理計量應用學,提供發展與驗證評估與回饋系統之基礎。
  2. 溝通技巧與臨床同理學理與評估工具,提供關鍵核心能力/臨床技能的評估與回饋之基礎。
  3. 生成式AI應用,提供研發/改良的加速器!!經由虛擬病人與考官的建置,可大幅提升驗證與改良之效能。

上述1&2是核心知識;3是核心技術!

我們團隊的臨床與人才資源包含:,

  1. 臨床專家/單位合作,提供人才與臨床測試場域
  2. 已累積諸多錄影檔與逐字稿,提供大量試驗資料

有了上述條件,下列教學/研究,甚至臨床應用議題皆「更接近」可以實現:

  1. 建構可行的訪談架構,可完整或分拆的訪談架構/紀錄要點,以利執行。
  2. 建構與驗證虛擬病人與考官(偏重虛擬臨床技能測驗「方法學」之發展)
  3. 建構訪談/會談核心能力/臨床技能之評估與回饋(偏重「臨床技能教育成效」之驗證)

Note: 更早投入研究的共享決策(也是倫理學教學10幾年的主題之一),已放到冰庫!~ 主要原因是準備不足(或基礎不足),因為條件更多。其一條件/原因是FIFE沒做好!!


待續....

 

2025年7月6日 星期日

數據/稿件的起死回生!?

數據不好的研究結果,為何可以改變其命運(結果變得比較好,且發表於著名期刊):一個特例!

今年我們發表二篇論文,皆大致發現:GKCSAF displays acceptable intra-rater but poor inter-rater reliability in occupational therapy clinical scenarios.(心理&生理領域)(二篇論文皆有 inter-rater reliability 驗證,但ICC結果皆差,二文結論也如此定位--poor inter-rater reliability!我應發表>50篇類似論文了,資料分析與解釋,絕對經驗豐富!)(Note: GKCSAF 是國際著名的溝通技巧評估工具)

因為上述2論文皆有錄音/逐字稿,故我們去年提出新的研究構想:設計 ChatGPT 使用 GKCSAF 以評估逐字稿中學員的溝通技巧,再跟前述2篇論文專家 raters 的評估結果比較。

我們初稿的重點(牛肉)放在「發展 ChatGPT rater」 以及「ChatGPT評估結果跟專家評估結果無顯著差異(如 Figure 1所示:ChatGPT評估的總分大多在專家評估總分之間)」,後者我們的解釋為:代表 ChatGPT rater 或可替代專家評估。那時,我們未驗證效度.... 且ChatGPT與專家評估結果之ICC差(如同已發表論文之結論)...
Figure 1. Total scores of the ChatGPT rater (blue) and human raters (gray).

審稿後,有位審查委員認為我們既沒有驗證效度,主題就勿稱為 "validation", 另一個委員建議我們繪製下圖(各種raters 之評分總分比較) 

Figure 2. 所有 raters 之評分總分比較

Figure 2 讓我們更清楚:各raters 評分結果真的差別有限(總分皆在很窄的區間)!!若此為真(當然要相信數據,但哪一項統計指標的數據?), inter-rater reliability 真的不好嗎?且我們可否將多位專家 raters評分的平均值,當成效標,以驗證效度(concurrent validity)!? 

所以在修改稿件時,我們就增加 "mean absolute error" 以及 "mean absolute error %"二統計指標(這比是否統計顯著,可呈現更直觀的總分差異大小), 再將多位專家 評分的平均值,當成效標,驗證效度!! 我們發現GKCSAF總分在"mean absolute error" 以及 "mean absolute error %"結果不錯(inter-rater reliability & concurrent validity二驗證皆類似),所以支持 ChatGPT rater 總分的 inter-rater reliability & concurrent validity至少是 acceptable!! 我們也說明ICC因為總分差異小(如 Figure 2 所示),故可能造成ICC值被低估。

就這樣(事實上,主筆者--玉正努力了許久/被我嚴厲折磨...)稿件被 (Medical Teacher主編) 接受了!!

此稿件已成為我自認的代表性著作:Ju YJ, Wang YC, Lee SC, Liu CH, Lee ML, Hou CY, Yang CW, Hsieh CL. Development and validation of a GPT-based Rater for Assessing Communication Skills Using the Gap-Kalamazoo Communication Skills Assessment Form. Medical Teacher. 1st July, 2025. Accepted for publication. 

有興趣者可參考玉正的反思與心得

衍生的議題:如這貼文第2段所提--今年我們發表二篇論文,皆大致發現:... poor inter-rater reliability, 這解釋可能有誤阿!!已請玉正個別分析之,再思索是否寫信給主編更正解釋 或 撰寫 letter-to-editor.....以還 GKCSAF 公道!還有自我修正!!

感謝 reviewers 的評論, 讓我們成長,還有接受我們的論文!!

2025年6月6日 星期五

很多精神科EPAs都是生成式AI的立即研究議題

 

出處:《醫療品質雜誌》 16卷1期 (2022/01) Pp. 70-75

綠色字部分(準備文本紀錄或計畫等任務):

4. 擬定適當且完整治療計畫。

5. 記錄與報告病人的臨床事件。

6. 記錄與報告精神疾病病人的臨床資料。

這是 LLMs 即可搞定/幫大忙的任務!!若僅以專家驗證信效度,則IRB頂多簡審!!

紅色字:訪談/諮詢部分,毋須(或較少)觀察, My GPTs 也可搞定!!

後續可行的研究題材超多!!

另一發現是,國內精神科醫學教育的研究成果極少!!


2025年4月25日 星期五

FIFE疾病經驗訪談之研究議題

1. FIFE知識之教學方法與效能驗證

2. 訪談技能(包含記錄)評估工具發展與驗證(含訪談能力、溝通技巧/同理心、記錄與應用能力)

3. 虛擬病人發展與驗證(不同診斷)

4. 虛擬考官發展與驗證(依據#2以及回饋模式)(結合 #2 量表與自動回饋模組,可形成完整「自學—自評—即時回饋」生態系。)

5. FIFE訪談學習模式(多種模式,如線上到實務;不同設計)發展與驗證(含學員對於FIFE之態度驗證--(FIFE Attitude Scale, 需自行研發並驗證))

---------------------------------------

CBME 之 milestones (ChatGPT 生成)



參考CBME 里程碑以及 FIFE 訪談所需的多面向能力,重新改寫整體研想構想如下(與 Gemini 2.5討論):

研究計畫總標題:

建構、實施與評估一個基於能力導向醫學教育(CBME)里程碑之 FIFE 訪談核心能力整合性培育計畫

計畫願景 (Overall Goal / Vision):

本研究旨在發展、實施並評估一個全面性的 CBME 教育計畫,聚焦於「病人疾病經驗」-- FIFE(感受 Feelings, 想法 Ideas, 功能 Function, 期望 Expectations)訪談核心能力。此計畫將透過明確的發展性里程碑,系統性地培育學習者掌握執行有效 FIFE 訪談所需的相關知識與能力(包含基本知識、閱覽病歷資料/擷取相關資訊、溝通技巧、同理心、認知整合(記錄)與應用能力及相關態度),建立一個從學習、準備、練習、應用、評估到回饋的完整教育生態系,最終目標在於提升以病人為中心的溝通品質與醫療照護成效。(自我學習的生態系統!?)

核心理念與概念框架 (Conceptual Framework):

  1. 採納 CBME 模式: 以學習成果為導向,強調學習者能力的達成。
  2. 運用里程碑 (Milestones) 作為發展藍圖: 將 FIFE 訪談能力視為一項關鍵的臨床溝通實踐活動,界定其從新手到熟練者的可觀察、發展性的里程碑。
  3. 承認 FIFE 訪談的複雜性與多面向特質: 成功的 FIFE 訪談需要整合以下要素:
    • 知識基礎: 理解 FIFE 概念、溝通理論及其重要性。
    • 溝通技能: 包含提問、傾聽、非語言溝通、同理心展現 (NURS) 等可訓練技巧。
    • 認知整合與應用: 能綜合 FIFE 資訊進行臨床推理、記錄並應用於共享決策。
    • 情感態度: 具備同理心、尊重、好奇心、自我覺察與專業態度。
  4. 整合性培育: 研究計畫的各個環節(教學、評估、科技工具)將圍繞這些里程碑及所需的多面向能力進行設計與驗證。

具體研究目標與內容 (Specific Research Aims / Phases):

第一階段:奠定 FIFE 能力框架與評估基礎 (Foundation & Assessment)

  • 目標 1.1 (界定里程碑): 依據文獻、專家意見及學習者發展理論,界定一套適用於目標學習者(例如:醫學生、住院醫師)的 FIFE 訪談能力發展里程碑。此里程碑需具體描述不同階段學習者在上述多面向能力上的預期行為表現。完成後需進行專家內容效度驗證。
  • 目標 1.2 (發展評估工具): 基於已驗證的 FIFE 里程碑,發展並驗證一套多面向、多來源的評估工具組合(例如:包含針對溝通技巧觀察的評分量表 Rubric、評估記錄與應用能力的案例分析或病歷審查標準、可能的自我評估或同儕回饋表單)。此工具組合需具備良好的信效度,能可靠區分不同里程碑水平的學習者,並能評估 FIFE 所需的多元能力。

第二階段:設計與驗證里程碑導向的學習體驗 (Learning Experiences)

  • 目標 2.1 (教學策略效能): 設計並比較不同教學方法(如:互動式工作坊、標準化病人演練、虛擬病人模擬、線上學習模組、案例討論、反思練習等)對於促進學習者在 FIFE 里程碑上進展的相對效能,特別關注不同方法對特定面向能力(如:同理心展現、資訊整合)的提升效果。
  • 目標 2.2 (學習路徑優化): 規劃並評估不同的整合性學習路徑(例如:線上知識學習 -> VP 模擬練習 -> SP 實境演練與回饋),探討何種組合模式最能有效支持學習者循序漸進地達成 FIFE 能力里程碑。
  • 目標 2.3 (態度量表與影響): 開發並驗證一個「FIFE 學習與實踐態度量表」,用以測量學習者對 FIFE 的價值觀、自我效能、學習動機等,並探討態度與學習模式選擇、里程碑達成度之間的關係。

第三階段:開發與整合科技輔助學習與評估工具 (Technology Integration)

  • 目標 3.1 (分級虛擬病人 VP): 開發一系列具備不同臨床情境與溝通挑戰複雜度的虛擬病人案例。這些案例需能對應 FIFE 里程碑的不同階段,提供標準化、可重複、具針對性的模擬練習機會,特別是用於練習較難透過傳統方式標準化的情境(如:處理強烈情緒、文化差異)。
  • 目標 3.2 (智慧虛擬考官 VE): 研發一個能整合 VP 系統的智慧虛擬考官。此 VE 需能:
    • 運用第一階段發展的里程碑導向評估工具(或其演算法化的版本)分析學習者與 VP 的互動數據(文本、語音、行為)。
    • 自動評估學習者在 FIFE 各面向能力的表現,並判斷其當前所處的里程碑級別。
    • 提供具體、可操作、針對其里程碑水平的形成性回饋,引導學習者自我修正與成長,實現「練習-評估-回饋」的即時自主學習循環。

第四階段:整合性計畫實施與成效評估 (Program Implementation & Evaluation)

  • 目標 4.1 (計畫試行): 在目標學習者群體中,試行整合前三階段成果的 FIFE 能力培育計畫(包含課程、教學活動、VP/VE 工具、評估機制)。
  • 目標 4.2 (總體成效評估): 全面評估此整合性計畫的可行性(Feasibility)、學習者與教師的接受度(Acceptability)及成效(Effectiveness)。成效指標應包含:學習者 FIFE 能力里程碑的達成率與進展速度(使用目標 1.2 工具)、知識與技能的提升、態度的轉變(使用目標 2.3 量表),以及探索對臨床行為(如病歷記錄品質)或病人回饋(若可行)的潛在影響。

研究流程與關聯性 (Interdependencies & Flow):

第一階段是整個計畫的基石,其產出的里程碑框架與評估工具是後續所有研究的依據與標準。第二、三階段可部分平行展開,但教學活動(第二階段)的設計與成效評估需依賴第一階段的工具,科技工具(第三階段)的開發也需以第一階段的框架為基礎。第四階段則是對前三階段成果的整合應用與總體檢驗。

預期貢獻與影響 (Expected Impact):

  • 為 FIFE 訪談能力的培育提供一個具體、可行的 CBME 實施範例。
  • 產出經過驗證的 FIFE 能力里程碑、多面向評估工具及態度量表。
  • 提供不同教學策略與學習路徑對 FIFE 能力發展成效的實證依據。
  • 開發創新的科技輔助工具(VP/VE),促進自主學習與形成性評估。
  • 最終有望提升臨床人員的 FIFE 訪談能力,改善醫病溝通品質,促進以病人為中心的照護。

這個修訂後的計畫更強調能力的發展性、多面向性,並將 CBME 里程碑作為貫穿始終的核心架構,希望能更全面且深入地探討 FIFE 的教與學。