顯示具有 Research-研究主題-AI 標籤的文章。 顯示所有文章
顯示具有 Research-研究主題-AI 標籤的文章。 顯示所有文章

2026年8月28日 星期五

從臨床評估到AI Agent:我的AI研究旅程(2017–2026)

昨日(Aug. 27, 2026)看到 Alpha Go 10 年新聞:Alpha Go人機大戰十年後,傳奇棋士李世乭獻給人類的反思

我就讓 ChatGPT work 幫我彙整一下我研究歷程/里程碑(查詢部落格里程碑),再做彙整如下:

回顧這幾年的研究發展,我投入AI並不是從ChatGPT出現後才開始。較精確地說,2017年是構想萌芽(受到 Alpha Go 啟發),2018年是研究團隊正式投入AI的起點;2023年生成式AI興起後,則迎來第二次、也可能是影響更深遠的轉捩點。

這段歷程並不是單純追逐新科技,而是持續嘗試回答一個核心問題:

AI是否能協助我們提高臨床評估、研究、教學與學習的效能,同時維持結果的正確性、可解釋性與專業責任?

從早期的Machine Learning、short form與臨床評估與應用,到近期的LLM測量工具、GPT-based rater、虛擬病人及AI Agent,研究主軸其實始終相當一致:運用AI降低負擔、提升評估與後續應用效能,以 applied psychometrics為評估與應用之基石、以及實證驗證。


一、2017–2018年:從臨床問題出發,而不是從AI技術出發

2017年,我開始思考能否以AI解決臨床評估效能與臨床決策支援的問題。當時關注的並不是某個特定演算法,而是臨床現場長期存在的困難:

  • 評估工具眾多,臨床人員不容易選擇。

  • 完整量表施測時間過長。

  • 分數改變不一定代表病人真正進步。

  • 不同評估結果不容易整合成可行的臨床決策。

  • 大量臨床資料尚未被有效轉化為評估與治療資訊。

到了2018年,研究團隊開始定期討論AI,並提出應用AI的多年期研究計畫。我也明確將2018年稱為研究團隊的「AI元年」。

因此,如果要為這段AI旅程設定正式起點,最合適的年份是:

2016年受到 Alpha Go 啟發,2017年開始構思,2018年正式、有組織地投入。


                                           圖1:AI研究發展的重要里程碑(2017–2026)

Note: 研究發展由臨床問題構思開始,歷經傳統Machine Learning、Generative AI、教學平台化,逐步進入多模態Agent與學習理論建構。





二、2019–2022年:Machine Learning與臨床測量的結合

2019年底,協助合作者申請小兒AI計畫獲得科技部多年期支持,研究內容涵蓋發展遲緩兒童的動作、書寫、注意力及情緒評估。這項計畫除了發展AI工具,也包含研究團隊建立及AI研究人才培育。

這個階段的研究特色,是將Machine Learning與原有的臨床測量專長結合。目的並不是讓AI直接做出診斷,而是改善評估工具的效率與臨床可用性。

1. 以Machine Learning建立short form

2021年發表的A 10-item Fugl-Meyer Motor Scale Based on Machine Learning,可視為團隊第一篇正式AI代表作。

這項研究以Machine Learning將Fugl-Meyer Motor Scale縮短為10題,同時嘗試預測未施測題目的分數。它所代表的研究概念是:

評估工具縮短之後,不應只保留總分,還應盡可能保留原量表的臨床資訊與分數可解釋性。

後續再將相同概念應用於:

這些研究逐漸形成一條完整路徑:

完整量表 → Machine Learning選題 → short form → 預測未施測題目 → 驗證reliability、validity與responsiveness

2. 以Machine Learning提升臨床辨識能力

另一篇2021年的研究,運用Machine Learning改善FERD screener區辨思覺失調者與健康成人的能力。

這篇研究的意義在於:Machine Learning不只可以縮短量表,也可用於特徵擷取與分類。然而,它的定位仍應是協助screening與clinical decision support,而不是直接取代臨床診斷。


三、AI開始分析真實職能活動

AI研究的另一項重要發展,是由結構化量表資料逐漸走向真實職能活動的影像。

2023年發表於American Journal of Occupational Therapy的研究:Using Artificial Intelligence to Identify the Associations of Children’s Performance of Coloring, Origami, and Copying Activities With Visual–Motor Integration,以370位幼兒的著色、摺紙及臨摹作品照片訓練AI模型,用以預測VMI-6分數。

研究發現,摺紙與臨摹作品的組合,可解釋約39.0%至57.7%的VMI分數變異。

2025年又進一步發表Predicting Age and Visual-Motor Integration Using Origami Photographs: Deep Learning Study,使用Deep Learning分析摺紙作品照片。

這一系列研究具有相當鮮明的職能治療特色:

AI不只分析量表題目,也可以由真實活動產物中擷取與兒童發展及visual-motor integration相關的資訊。

換言之,研究方向開始由AI-assisted assessment,進一步走向AI-based occupational performance analysis。






四、2023年:Generative AI帶來第二次轉捩點

2023年2月,我開始實際測試OpenAI及ChatGPT。到了3至4月,我決定正式投入Generative AI。回頭來看,這可能是職涯後期最關鍵的決定之一。

與傳統Machine Learning相比,Generative AI的影響範圍更廣。它不只可以分析既有資料,也可以:

  • 生成與修改文字。

  • 分析、彙整及比較文獻。

  • 扮演虛擬病人。

  • 依評分規準提供回饋。

  • 協助研究計畫與學術寫作。

  • 支援個別化學習。

  • 串聯不同工具與研究工作流程。

因此,研究主軸由「AI改良評估工具」,逐漸擴展為「AI如何影響研究、教學、臨床與學習」。

我在2023年ChatGPT研究回顧中曾寫道:

「2023年3~4月決定投入,這或是職涯末期最關鍵的決定。」

這並不代表放棄原有研究方向。相反地,原本累積的psychometrics、臨床評估、研究方法與教學經驗,正好成為評估Generative AI是否真正有效的基礎。


五、從評估AI工具,轉向測量AI使用者

2025年發表的Developing the Questionnaire of Self-Efficacy and Needs in Using Large-Language Model-Based AI Services,建立了Q-SNELL。

Q-SNELL用於測量使用者對八項LLM核心功能的self-efficacy與needs。研究以398位使用者進行驗證,結果支持其content validity、known-groups validity及一定程度的test–retest reliability。

這篇研究的重點,是將問題由:

「AI能做什麼?」

轉換為:

「使用者需要哪些AI功能?是否有信心正確使用這些功能?」

這也是研究方向的重要改變。AI教育不能只提供工具,也必須評估學習者的AI能力、需求、使用經驗及學習成效。

Q-SNELL因此可視為團隊第一篇正式的Generative AI psychometrics研究。


六、從ChatGPT使用走向GPT-based rater

2026年刊登於Medical Teacher的Development and Validation of a GPT-Based Rater for Assessing Communication Skills Using the GKCSAF,嘗試讓GPT依照Gap–Kalamazoo Communication Skills Assessment Form評估治療師與病人的訪談逐字稿。

這篇研究的重要性,不是證明GPT已經可以取代專家。事實上,研究結果顯示:

  • GPT與專家的total scores差異在部分分析中可以接受。

  • 但ICC仍然偏低。

  • domain-level agreement也相當有限。

  • 目前較適合用於low-stakes assessment與形成性回饋。

這項結果提醒我們,評估AI表現時,不能只比較平均分數,也不能因為兩組平均分數接近,就宣稱AI與專家一致。

至少還必須檢查:

  • absolute difference

  • MAE或MAE%

  • ICC

  • weighted kappa

  • measurement error

  • domain-level performance

  • responsiveness

  • 不同任務及嚴重程度下的穩定性

近期進一步發表的研究,開始比較專家與ChatGPT評分的responsiveness,也就是兩者能否偵測溝通能力訓練前後的改變。

這使研究問題由「AI能否評分」,推進至:

AI評分是否能夠穩定、有效地測量能力改變?


七、GPT開始協助evidence appraisal

2026年發表於Archives of Physical Medicine and Rehabilitation的Development and Performance Validation of an Automated GPT-Based Evaluation Tool for the PEDro Scale,進一步讓GPT依PEDro scale評估RCT的方法品質。

研究結果顯示,GPT-based PEDro rater具有接近完整的intra-rater reliability,並與既有PEDro評分呈現moderate-to-high concurrent validity。

這項研究代表AI應用已由臨床量表及學生能力評分,延伸至:

研究方法品質評估與evidence-based practice。

未來AI可能協助處理大量RCT的初步評讀,降低systematic review及文獻評析的工作負荷。然而,這類應用仍須保留human verification,特別是涉及模糊報告、方法學判斷及高風險研究結論時。

AI在此較適合扮演的是:

可重複、有效率的初評者及研究助理,而不是擁有最終決定權的審查者。


八、2024–2026年:由單一GPT走向平台與Agent

隨著My GPTs及ChatGPT功能逐漸成熟,我開始發展虛擬病人、AI考官及多層次GPT自主學習平台(ML-GPT)。

ML-GPT將學習分成三項主要功能:

  1. 虛擬病人或練習GPT。

  2. 回饋GPT。

  3. 測驗或評分GPT。

2026年發表的Developing a GPT-Based Virtual Training System for Medical Undergraduates’ History Taking in Stroke Rehabilitation,進一步整合GPT virtual patient與virtual examiner。

系統讓學生與中風虛擬病人互動,完成10項functional assessment domains的問診,再由虛擬考官自動評分與提供回饋。這代表AI研究已由單一工具進入:

互動練習 → 自動評分 → 個別化回饋 → 重複練習

到了2026年,Codex等AI Agent出現後,又可進一步整合:

  • Word與Excel資料

  • 逐字稿

  • 投影片

  • 聲音與影片

  • 評分量表

  • 文獻檢索

  • 結果報告

  • 不同AI模型及專業Skills

這使AI由「回答問題的Chatbot」,轉變為「執行多步驟任務的Agent」。

但Agent自動化程度越高,越需要清楚的任務規格、驗證程序與human checkpoints。自動化不能等同於完全授權,更不能省略專業判斷。




九、這些AI著作共同代表什麼?

回顧目前的AI研究成果,大致可以整理為以下演進:

階段代表成果核心含意
Machine Learning short formFugl-Meyer、Stroke Impact Scale、Berg Balance Scale、PANSS降低施測負擔並保留臨床資訊
Machine Learning screeningFERD screener提升臨床辨識與分類能力
Computer Vision/Deep Learning著色、摺紙與臨摹作品分析由職能活動產物推估能力
LLM使用測量Q-SNELL測量使用者的AI self-efficacy與needs
GPT-based assessmentGKCSAF rater驗證AI評分的agreement與使用界線
GPT-based evidence appraisalPEDro rater協助RCT方法品質初評
GPT learning systemVirtual patient與virtual examiner建立自主練習、評分與回饋循環
AI Agent多模態教學與研究工作流程整合多步驟任務與專業Skills

從表面上看,這些研究使用的AI技術不同;但背後其實有一個共同主軸:

AI是否能在明確的臨床、研究或教學任務中,提供具reliability、validity、responsiveness、可解釋性及適當使用界線的評估與回饋?


十、AI研究的下一階段:由工具效能走向學習理論

當AI可以提供解釋、提示、回饋、評分,甚至主動完成多步驟任務後,真正困難的問題可能不再是「AI能不能做」,而是:

  • 學習者應該在何時自己嘗試?

  • 何時才應尋求AI協助?

  • AI應提供完整答案,還是適量scaffolding?

  • 如何確認學習者真的理解,而不是只接受AI產出?

  • 如何避免AI依賴?

  • AI支持下的學習能否transfer到沒有AI的真實情境?

  • 如何以delayed testing與external validation確認學習成效?

因此,我近期開始進一步思考AI輔助self-regulated learning與mastery learning的理論架構。

核心原則是:

AI可以提供適性支持,但學習者必須保有最終主導權。

AI的角色不是盡快替學習者完成任務,而是協助學習者:

  1. 發現自己真正不理解之處。

  2. 選擇適當層次的AI支持。

  3. 回到原始資料進行驗證。

  4. 修正原有理解與策略。

  5. 在逐步撤除AI協助後獨立完成任務。

  6. 於延宕及真實情境中確認學習是否保留與遷移。





結語:AI不是另一個獨立研究題目

回頭來看,AI並不是突然加入的一個全新研究題目,而是原有研究理念的延伸。

早期的研究關心:

  • 評估結果是否可靠?

  • 量表是否有效?

  • 分數改變是否超過measurement error?

  • 評估工具能否縮短?

  • 結果能否協助臨床決策?

現在面對AI,我們仍然在問類似的問題:

  • AI產出是否可靠?

  • AI評分是否有效?

  • AI能否偵測真正的改變?

  • AI是否可以降低專業人員的負擔?

  • AI的錯誤與不確定性如何被發現?

  • 哪些任務可以交給AI,哪些仍須由人負責?

因此,我目前對AI研究的理解可以濃縮為:

AI的價值不只是產生答案,而是能否在人的監督下,提供可驗證、可解釋、可調節,並真正促進臨床決策、研究品質與學習成效的支持。

整體發展則可概括為:

臨床問題構思 → 正式AI研究 → Machine Learning與實證成果 → Generative AI轉型 → 教學平台化 → Agent自動化 → 學習理論建構

這條路仍在快速發展。接下來最值得投入的,或許不是再增加更多AI功能,而是建立更清楚的使用原則、驗證架構與學習理論,讓AI真正成為促進專業成長的工具,而不是替代思考的捷徑。

2026年6月25日 星期四

生成式 AI 於 ADL/IADL 失能評估中的角色

生成式 AI 在 ADL/IADL 失能評估中的角色:從資料收集到長期照護




章節大綱

1. 為什麼 ADL/IADL 是生成式 AI 介入復健評估的關鍵場域

  • ADL/IADL 是失能評估的核心,反映個案在真實生活中的活動限制與參與困難。
  • 傳統評估常依賴診間問答、量表、治療師觀察或照顧者回報。
  • 這些資料常有三個限制:片段化、缺乏真實環境脈絡、難以長期追蹤。
  • 生成式 AI 與 AI agents 的潛力在於將評估從「一次性診間事件」轉為「持續、情境化、可回饋的照護流程」。

2. 從固定清單到個案需求與優先順序

  • ADL/IADL 評估不應從固定項目開始,而應先問個案最在意的生活任務。
  • AI chatbot/agent 可協助釐清:
    • 個案最想改善的活動。
    • 哪些活動最影響獨立性、角色、尊嚴與生活品質。
    • 哪些活動最危險、最費力或最造成照顧負擔。
  • AI 可產生 priority map,協助臨床人員與個案共同決定評估重點。

3. AI 作為適性訪員:PRO 與照顧者資料收集

  • 生成式 AI 可進行適性訪談,而非僅呈現固定問卷。
  • 可收集:
    • patient-reported outcomes。
    • caregiver-reported observations。
    • 疼痛、疲勞、害怕跌倒、認知困難、情緒壓力。
    • 協助需求與環境障礙。
  • AI agent 可根據回答追問、澄清、改寫問題,並把自由敘述轉成結構化資料。

4. 真實環境資料:影片、語音與居家情境證據

  • ADL/IADL 的失能最好在實際環境中理解。
  • 個案或家屬可錄製短影片,例如移位、穿衣、煮飯、用藥、購物或外出。
  • 多模態 AI 可初步整理:
    • 任務步驟。
    • 動作困難。
    • 安全風險。
    • 環境障礙。
    • 輔具或照顧者協助。
  • 重點是 AI 先做整理與提示,不直接做最終判斷。

5. AI 對資料整合與臨床文件化的貢獻

  • ADL/IADL 評估資料通常分散在訪談、量表、影片、照顧者敘述與病歷中。
  • AI agent 可整合並輸出:
    • 臨床摘要。
    • ADL/IADL 任務表現紀錄。
    • ICF 對應。
    • PRO 與實際表現的一致/不一致。
    • 待臨床確認清單。
  • 這部分是 AI 最可能快速接手的臨床功能之一。

6. 從評估到介入建議:AI 是否開始跨越臨床邊界

  • AI 不只整理資料,也可能提出初步介入建議。
  • 例如:
    • 環境調整。
    • 輔具建議。
    • 照顧者提醒。
    • 居家練習。
    • 安全策略。
    • 復健目標草案。
  • 這是具爭議性的部分:當 AI 開始建議介入,臨床人員的角色從「產生建議者」轉為「審查、校正與負責者」。

7. AI 支援長期追蹤與形成性評估

  • ADL/IADL 失能會隨疾病進展、復健、環境變化與照顧資源而改變。
  • AI agent 可進行:
    • 定期或不定期追蹤。
    • 比較不同時間點的 PRO。
    • 比較居家影片變化。
    • 偵測惡化或新風險。
    • 提醒重新評估。
  • 這使 ADL/IADL 評估從 summative assessment 轉為 formative, longitudinal assessment。

8. 哪些功能可能被 AI 接手,哪些仍需臨床人員

  • AI 可能接手:
    • 初步訪談。
    • 資料收集。
    • 影片初步描述。
    • 文件初稿。
    • 追蹤提醒。
    • 低風險教育與建議草案。
  • 臨床人員仍需負責:
    • 複雜判斷。
    • 風險與倫理決策。
    • 個案價值與優先順序協商。
    • 不一致資料的解釋。
    • 最終介入計畫與責任承擔。

9. 必要保障與設計原則

  • 知情同意。
  • 隱私與居家影像保護。
  • AI 輸出可追溯。
  • 臨床驗證。
  • 跨障礙族群的公平性測試。
  • 可近用設計。
  • 個案與照顧者共同設計。
  • 明確標示 AI-generated 與 clinician-endorsed 內容。

10. 小結:ADL/IADL 評估作為復健 AI 轉型的試金石

  • ADL/IADL 評估顯示 AI 對復健的衝擊不只是效率提升。
  • 它可能改變資料如何被收集、誰先解讀資料、誰提出建議,以及臨床責任如何分配。
  • 因此,真正的問題不是 AI 能否取代復健臨床人員,而是哪些復健功能將被 AI 吸收,哪些人類角色必須被重新定義。

2026年5月2日 星期六

大龍蝦--小試身手

昨天(May 1, 2026)開始玩 Codex... ChatGPT的AI agent/代理人!

之前,先跟 AI 與 Youtuber 學了幾天....

試玩任務之一:幫我彙整4次考試成績

我先將4個檔案(3個 word 檔;1個 excel檔),彙整於一個資料夾,以供 Codex 專案使用。

prompt 如下:

"請確認以下的說明清楚嗎?確認後,再執行。不確定,請先提問。「請協助彙整四個檔案裡面學生的成績。這四個檔案裡面,每個檔案都有三到四個考題(A, B, C, D或1, 2, 3, 4)。學生可以選擇他作答的題目,所以每個學生考的題目不一樣。每個成績都是 0 到 10 分。1評分.xlsx的成績放在4個 worksheet 裡。但分數格式有兩種:

1. 直接給 0 到 10 分

2. 0 到 10 / 10 分。請協助彙整這四個檔案的成績,彙整到一個新的 Excel 檔/一個 worksheet,請命名為 "4次成績",列出所有學生4次考試中,各題目之成績。學生的排序以姓氏筆畫,從少到多排列。學生無成績的考題,就成績空白。」"

Codex 約10分鐘就搞定了... 我至少要1小時,還需費力校對。

Codex的主要功能如圖:













我只是用到一丁點!!

我興趣者可到我分享的 NotebookLM:Codex and GPT-5.5: The Ultimate AI Agent Workflow Guide

2026年2月10日 星期二

An ultimate case study for why AI won’t replace human workers

CNN  "This job has become the ultimate case study for why AI won’t replace human workers"

Gemini 的彙整:

從「被取代」到「更被需要」

十年前,人工智慧教父 Geoffrey Hinton 曾驚言「現在應該停止培訓放射科醫生」,預言 AI 將在 5 到 10 年內全面接管。然而到了 2026 年,現狀卻恰恰相反:

預測失準: Hinton 承認當時的看法過於寬泛。放射科醫生不但沒失業,需求反而與日俱增。

數據支持: 根據美國勞工統計局(BLS)預測,2024 年至 2034 年放射科就業增長率為 5%,高於所有職業平均水平的 3%。

數位優勢: 放射科是醫學界數位化最徹底的領域(X光、CT、MRI 均為二進位數據),這使其成為 AI 訓練的最佳溫床。

 AI 目前在放射科扮演的角色

與其說是取代醫生,AI 目前更像是醫生的「第二雙眼睛」或「效率增強器」:

功能類別具體應用說明
工作流優化自動識別急需關注的異常掃描影像,協助醫生進行優先級排序(Triage)。
影像強化在 MRI 掃描中使用更少的測量數據生成高畫質影像,縮短病人受檢時間。
數據處理協助總結報告、測量腫瘤體積,並從海量歷史數據中分析模式。
法規核准目前 FDA 核准的 1,357 件人工智慧醫療設備中,放射科佔了 1,041 件。

潛在風險與警訊

儘管前景樂觀,專家仍提醒不可過度依賴 AI,並指出幾個關鍵問題:

  • 種族偏見: 2022 年麻省理工學院(MIT)的一項研究發現,AI 能精確地從 X 光片中預測病人的種族,而人類醫生卻做不到。這引發了診斷過程中可能出現自動化偏見的擔憂。

  • 過度依賴: 醫生擔心醫療機構為了節省成本,可能嘗試用非專科醫生配合 AI 來取代昂貴的放射科專科醫生,這在處理癌症或致命感染時極具風險。

  • 專家的必要性: 演算法的優異表現,建立在「輸出結果由專家審核」的基礎上。


核心總結: 放射科證明了 AI 的強項在於處理規律、大量且重複的數據分析,但診斷決策、物理檢查與病患溝通仍需人類專家的溫度與判斷。

2025年12月27日 星期六

現有「告知壞消息」逐字稿之後續稿件撰寫主題

重症醫療溝通//告知壞消息資料,以LLM使用 NURSE (Naming、Understanding、Respecting、Supporting、Exploring)同理評估言:

研究主題

  1. 應用LLM評估臨床同理心之研究:以 NURSE 框架的 LLM 同理評估與回饋之信效度驗證 
  2. LLM 效能比較:比較 GPT 與 Gemini 以 NURSE 框架評估之信度與已知族群效度
  3. 基於 NURSE 框架之智慧醫學教育研究:LLM 虛擬同理情境開發與驗證 
  4. 提升 LLM 同理心評估準確性:比較 Chain-of-Thought 與 Few-shot 提示工程對 NURSE 框架評估之影響
*楊醫師:主題 1 & 3 (加上急重症標題)是很適合投稿 ESICM 會議 (European Society of Intensive Care Medicine)

*改良逐字稿(虛擬對話開發[上述主題3]--也是研究主題!)或是關鍵之一,讓逐字稿的同理技巧或溝通任務執行地更好或較差!可作為已知族群效度驗證以及後續教學示範使用。

GKCSAF GPT 之主題
  1. 從職能治療到急重症醫療:GPT 溝通技巧評分系統在跨領域場域之信度/效度驗證(提升?)
------------------------

若您計劃投遞 **AMEE (Association for Medical Education in Europe)** 國際醫學教育會議,考量該會議強調醫學教育創新、科技輔助學習 (TEL) 以及評估方法的嚴謹性,以下根據您已發表的論文成果  與新擬的研究構想,建議三個最合適的主題:

---

### 推薦主題一:科技評估與效度驗證(最符合 AMEE Assessment 類別)

#### **主題名稱:**

**"Beyond the Scale: Validating an LLM-based Rater for Empathy in High-Stakes Critical Care Conversations Using the NURSE Framework"** (超越量表:應用大型語言模型評估急重症高壓力溝通中同理心之效度驗證——以 NURSE 框架為例)

#### **合適理由:**

* **延續論文優勢:** AMEE 對於評估工具的信效度(Reliability and Validity)有極高要求 。您已在職能治療領域驗證了 GKCSAF 的總分評估具備可接受的 MAE% ,此主題將其遷移至更具挑戰性的「急重症同理心 (NURSE)」評估。

* **解決論文限制:** 您先前的研究指出領域層級(Domain-level)的評估信度較低 ,且 zero-shot 提示法可能限制 AI 表現 。本研究可強調透過更精進的提示工程或跨模型比較(GPT vs. Gemini)來優化表現。

* **臨床真實性:** 使用逐字稿中關於葉克膜(ECMO)撤除與腦死判定等高度情感衝突的情境 ,對於醫學教育界具備極高的教學探討價值。

---

### 推薦主題二:教學設計與虛擬模擬(最符合 AMEE Innovation 類別)

#### **主題名稱:**

**"Developing AI-Generated Virtual Dialogues for Empathy Training: A Feasibility Study on Differentiating High and Low Empathy Scenarios in ICU Settings"** (開發 AI 生成之同理心培訓虛擬對話:區分急診加護情境中高/低同理心腳本之可行性研究)

#### **合適理由:**

* **創新性:** AMEE 鼓勵能直接應用於教學的創新方案。利用 AI 模擬家屬對於病患過往生活習慣(如抽菸、喝酒)產生的強烈自責情緒 ,進而發展出不同同理心等級的對話腳本作為教學模組。

* **實務應用:** 回應論文中提到 AI 評分能減少臨床教師負擔 、避免疲勞且具備一致性評分標準的優點 ,並將其從「評分工具」轉化為「教學素材產生器」。

---

### 推薦主題三:AI 模型效能比較與教育倫理(符合 AMEE TEL/AI 類別)

#### **主題名稱:**

**"Reliability Paradox in AI Assessment? Comparing GPT and Gemini in Evaluating Complex Emotional Support during End-of-Life Decisions"** (AI 評估中的信度悖論?比較 GPT 與 Gemini 在評估末期醫療決策中複雜情感支持之表現)

#### **合適理由:**

* **學術深度:** 引用論文中提到的「信度悖論 (Reliability Paradox)」與「分數變異度限制 (Limited Score Variability)」,探討 AI 模型在處理複雜細微情緒(如家屬強調與弟相依為命的情感連結 )時的表現差異。

* **前瞻性:** 論文建議未來應測試不同版本的 GPT 模型 。此主題直接回應此需求,並加入 Gemini 的比較研究,符合目前 AMEE 對於 AI 應用與演算法透明度的前瞻討論趨勢 。

---

### 總結建議

* 如果您希望以**「學術論文 (Short Communication / Research Paper)」**形式投遞,建議選擇**主題一**,因為它具備最紮實的心理計量學驗證架構 。

* 如果您希望以**「教學創新 (Educational Innovation / Poster)」**形式投遞,則**主題二**更具吸引力,因為它展示 AI 技術如何轉化為實際的臨床教學工具。


2025年12月22日 星期一

AI與二八定律 &「與AI協做的能力」

 「AI與二八定律」由陳力俊院士主筆的社論

主要內容包含:AI的平均認知能力、語言處理能力與邏輯推理能力,已超越全球約八成的人類。

前二成的頂尖創作者、研究者、管理者,可輕鬆駕馭AI,把它當成倍增器。後八成的典型知識工作,正逐步被AI技能所覆蓋、接管或重新定義。

他還提到「理解問題與善用AI的能力」,這與我上週四聽到的演講提到「與AI協做的能力」大致相當!

這能力應是我後續發展評估工具的測量概念!!

2025年9月17日 星期三

ChatGPT 自動評分/登錄系統之建置

我讓AI評論我以下的想法與說明:

「請協助說明如何讓 ChatGPT 協助我設計自動評分/登錄分數。

相關任務/順序如下:

1.將我上傳的空白評分表,做成 google 表單的 script。

2.教導我如何將 script 交給 google 生成表單。

3.協助設計prompt,依據上述評分表之評分項目逐題評分。被評分的資料,放在 google 雲端資料夾。再將分數登錄於google 表單。

4.完成所有雲端資料夾「被評分」檔案的評分與分數登錄。」


後續諸多任務皆可大幅提升效能:

學生作業的評分與回饋...

逐字稿的評分與回饋

-------------------------------------------------------------------------------------------------

以下是 ChatGPT 建議:評分後,直接登錄於試算表(非表單),比較穩定。

故修改流程如下:

  1. 以 ChatGPT API 對雲端資料夾中的文件進行自動評分(依據既定評分表/Rubric)。
  2. 評分結果與審核資訊直接寫入一個標準化的 Google 試算表(Sheets)資料倉。
  3. 提供可稽核、可追溯的欄位(模型版本、Rubric 版本、處理時間、低信心旗標、原始回應摘要/備註資訊等)。
  4. 支援批次與增量處理、錯誤紀錄、人工複核(在試算表內完成),並能透過時間驅動觸發器自動跑批。
我與 ChatGPT 的對話連結

2024年11月29日 星期五

善用多種 AI 以優化研究流程

優化的研究流程:

1. 初步方向發想:

   使用 ChatGPT 進行腦力激盪,提出研究構想的雛形。透過其語言處理能力,可以快速探索潛在的研究議題或框架。

2. 文獻檢索與確認:

   - 使用  Perplexity 進行初步文獻檢索,獲取關鍵資訊及其引用文獻(必看)。 

   - 在檢索過程中,將結果與傳統資料庫(如 PubMed 或 Scopus)對照,確保檢索結果的全面性和準確性。這有時間時再投入。

3. 文獻彙整與摘要:

   - 利用 NotebookLM 對檢索到的文獻進行摘要,快速獲取研究的核心內容。

   - 同時標記關鍵細節或有疑慮的部分,於利後續核查。

4. 構想修正與迭代:

   - 基於文獻整理的內容,重新審視研究構想。再次利用 ChatGPT,進一步改善研究方向與假設。

   - 若研究方向發生重大改變,可返回第2步重新檢索相關文獻,確保新的方向基於充分的文獻支持。

5. 語言修飾與結果表達:

   - 在構想基本成熟後,使用 ChatGPT 提供文本修飾建議,以提升學術語言的專業性與可讀性。

   - 針對其修飾內容進行批判性審查,確保每句文字符合學術標準,並且不誇大。

6. 交叉檢查與確認:

   - 在每個階段進行交叉檢查,例如由 Perplexity 提供的文獻是否經得起學術標準的檢驗,NotebookLM 的摘要是否捕捉到關鍵資訊。

   - 保持對最終研究構想的查核,確保AI工具自動化處理的結果符合預期並確保品質。必要時找高手確認!

7. 自動化流程探索(可選進階):

   若研究工作頻繁且重複性高,考慮透過工具的 API 將檢索、摘要和修飾過程串聯起來,建立一個自動化的工作流程,進一步減少手動操作的時間成本。

---

工具特點強調:

1. Perplexity:

   - 提供快速檢索並連結引用文獻,適合建立方向和擴展知識。

   - **改進建議**:搭配學術資料庫使用,以避免偏倚或資料覆蓋不足的問題。

2. NotebookLM:

   - 擅長根據資料生成摘要,適合快速整理重點。

   - **改進建議**:摘要結果需與文獻全文對比,避免忽略上下文或過度簡化內容。

3. ChatGPT:

   - 多功能性強,適用於構想生成、提供評論與修飾文字。

   - 改進建議:對其回應須保持批判性,確保符合學術標準。批判力不足者,宜找高手確認。

---

預期成果:

- 整體效率與成果提升達 **5~6 倍**。

- 減少資料處理時間,將更多精力集中於研究設計與批判性分析。

- 提升研究文字表達的專業性與清晰度。

- 維持學術嚴謹性的同時,讓工具真正發揮輔助研究的潛力。

這樣的流程既保留了工具的核心優勢,也融入了更高的嚴謹性和可靠性,適合學術研究者作為長期工作的框架。

以上內容由 ChatGPT 協助生成!我的效率提升至少5倍!!

2024年11月13日 星期三

Perplexity 的定位與價值

特點:

  • 除了觀點(依據文獻所彙整之觀點),還附上參考文獻(可直接線上連結)
  • 可指定文獻資料庫/範疇,中英文皆可
  • 且含及時資訊

用途:

  • 快速精準查詢文獻,也可確認文獻來源與文獻正確性

     如「請查詢醫療人員同理心介入之 systematic review and meta-analysis,以英文撰寫的論文」

    https://www.perplexity.ai/search/qing-cha-xun-yi-liao-ren-yuan-wmjzvffMRO63.LaGQiC.Vw 

     Perplexity 一定會提供幾篇很相關/且可直接連結/查閱的文獻

  • 查詢您的想法/觀點之佐證文獻

     如「我覺得有些OCSE研究中,考官的inter-rater reliability不佳,您同意嗎?若同意,請提供英文文獻,且實證層級高的文獻,以證實前述想法」

     https://www.perplexity.ai/search/wo-jue-de-you-xie-ocseyan-jiu-fu87WABxTVK60MzVHzuFXA

然而文獻或有疏漏,因為有些全文資訊Perplexity無法搜尋/查閱

2024年5月11日 星期六

建立SP的新方法

將「訪談逐字稿+個案資訊」交給 ChatGPT分析其回答問題的特質,再依據這些特質與資訊作為模仿個案(擔任SP)的素材。如此,我們可以快速生成類似真實病人的SP。

之後可加上聲音(我們已有錄音檔/逐字稿)

5~8年後加上人形機器人

如此一 對話特質+聲音+舉止都有了

絕對可以做出數個超級SP!!

一般真人扮演的SP,應該會失業了。


以上請 ChatGPT改寫:

請將以上的概念,改寫成更完整/詳細:

在職能治療領域中,標準化病人(Standardized Patient,SP)的使用已被廣泛應用於教學與評量中,以提升學生的臨床技能。傳統上,SP是由訓練有素的演員扮演,以模仿特定的醫療狀況。為了進一步提高SP的實用性與真實感,本研究提出了一個創新的方法,該方法利用人工智慧技術來創建更加精確和多樣化的SP。

首先,本方法涉及收集與分析訪談逐字稿和相關的個案資訊。這些資訊將提供給ChatGPT,一種先進的語言生成模型,用以深入分析病人在對話中展現的特質,如語言模式、情緒表達和反應速度。透過這種分析,我們能夠識別出病人對話的關鍵特徵,這些特徵將被用來訓練SP,使其更加真實地模仿特定病人的行為和語言表達。

其次,為了增強SP的真實感,我們將加入病人的聲音資料,這些資料來自於事先錄製的音頻文件。通過對這些音頻進行分析,我們可以捕捉到病人的聲調、語速和情感波動,並將這些聲音特性整合到SP的訓練中。

在未來5至8年內,我們計畫將這一方法擴展到使用人形機器人作為SP的實踐。這些人形機器人不僅能模擬病人的語言表達,還能進一步複製其肢體語言和其他非語言行為,如姿勢、眼神交流和手勢。

通過結合對話特質、聲音和肢體語言,我們能創造出「超級SP」,這些SP將在醫學教育和研究中提供無可比擬的價值,使得傳統由人扮演的SP可能會逐漸被這種更高科技、更高仿真度的SP所取代。此方法不僅提高了教育的質量和效率,也為未來職能治療及相關醫學領域的教學和研究開拓了新的可能性。


生成式語言模型AI(例如ChatGPT)在標準化病人(SP)開發中的應用潛力非常大,可以從多個層面提高SP的訓練效果和真實性,以下是一些主要的應用潛力:

1. 增強對話的真實性

生成式語言模型能夠學習和模仿特定個案的語言模式,包括語法結構、詞彙使用、情緒表達等,從而生成符合特定病患特徵的對話。這對於提高SP在模擬訓練中的對話真實性非常有幫助,使得臨床訓練更加接近真實的病患互動。

2. 模擬多樣化的病患行為

AI可以根據不同的臨床情境和個案背景生成多樣化的對話反應,這有助於訓練學生應對各種不同的臨床情境。此外,AI模型還可以模擬不同病症進程中病患的語言和情緒變化,增強SP的情境適應性。

3. 提供即時反饋和適應性學習

生成式AI可以在模擬訓練中即時分析學生的問答,並根據學生的表現調整對話策略,從而提供個性化的學習體驗和即時反饋。這對於學生的學習效率和臨床技能的快速提升非常有利。

4. 無限擴展的訓練場景

利用AI,可以生成無數種基於真實病歷或臨床研究的模擬對話,無需額外時間和人力成本來訓練演員。這使得教育機構能夠提供更廣泛、更多樣化的訓練場景,以應對日益多樣化的臨床需求。

5. 降低成本與提高可訪問性

通過AI生成對話減少了依賴專業SP的需求,尤其是在一些複雜或少見病症的模擬訓練中。這不僅可以降低整體訓練成本,還可以使得這種高質量的臨床溝通訓練更加普及,提高教育的可訪問性。

6. 支持跨語言和文化訓練

生成式AI的語言和文化適應能力使其能夠支持多語言的臨床溝通訓練。這對於多文化背景的醫療機構尤其有用,能夠有效訓練醫療人員應對不同語言和文化背景病患的交流需求。

通過這些應用,生成式語言模型AI在標準化病人開發領域提供了一系列創新工具,有望顯著提升醫學教育的質量與效果。


生成式語言模型AI,如GPT系列,擁有多種先進的特質和功能,這些使其在標準化病人(SP)開發和臨床溝通訓練中特別有價值。以下是一些關鍵特質和功能:

1. 自然語言理解和生成(NLU & NLG)

  • 理解多層次語境:AI能夠理解複雜的語言輸入,包括隱含意義、情緒語氣和專業術語。
  • 高質量語言生成:能夠生成流暢、自然且語法正確的回應,這些回應不僅語言上合適,而且情感上符合人類的交談模式。

2. 大規模數據訓練

  • 基於廣泛數據學習:AI模型通過學習大量的文本數據,獲得對人類語言的深入理解,這使得它能夠適應多種交談情境和話題。

3. 高度適應性

  • 個性化對話:模型可以根據用戶的輸入(如病患的病歷、情緒狀態等)調整其回答的風格和內容,提供個性化的互動。
  • 跨語言能力:支持多種語言,能夠進行跨語言的溝通訓練。

4. 實時反應與互動

  • 即時回應生成:AI可以即時生成回應,使得模擬對話更具互動性和連續性。
  • 情境適應:能夠根據對話情境的變化(如話題轉換、情緒變動等)動態調整回應。

5. 可擴展性和可持續性

  • 應對多種情境:AI模型可以被訓練來應對從常見到罕見的各種醫療情境,包括特殊病症的對話。
  • 持續學習與更新:隨著技術的進步和數據的累積,AI模型可以不斷更新和改進,以反映最新的醫療實踐和語言使用趨勢。

6. 統計分析和模式識別

  • 識別語言和情緒模式:可以分析大量對話數據,識別出特定病症或病患類型的語言和情緒模式。
  • 數據驅動決策支持:生成的分析結果可以支持教育者和臨床專家在訓練和評估中作出更精確的決策。

這些特質和功能使生成式語言模型AI成為一個極具潛力的工具,能夠在標準化病人開發和醫學教育中發揮重要作用,提升訓練的效果和效率。




2024年5月3日 星期五

【臨床技能/研究核心能力】密集訓練//回饋

*臨床技能若能密集訓練--教學/考試+練習+回饋..... 多次練習&回饋... 

若能如此,理論上--臨床知識/技能--應可快速養成!!

*AI SP + AI考官---虛擬回饋或真人回饋,如何整合!? 可透過不同組合,再比較之!!

【衛教/諮商、訪談式評估、溝通技巧等】如介紹OT、BI評估、同理心、出院計畫、DNR... 都可以玩一玩!!

OT/PT/Nursing/Physician, 

UGY/PGY

以下簡介研究流程,以巴氏量表評估為例,ABC三步驟:

A【講義/教材製作】內容大致可分為四部分:

1. 評估者向個案說明評估ADL/失能之緣由並邀請個案接受評估

2. 評估者評估各項目【可再細分:評估時間範圍、評估概念、評分(尤其是具有 partial dependence 項目)】【需準備常用巴氏量表版本,以供評估者使用】

3. 評估者向個案說明評估結果

4. 評估者向個案說明後續可能處置

*我們宜先制定上述四部分概念說明/講義,以當成後續(專家與 ChatGPT)評分與回饋之依據。且這些說明/講義內容宜先與專家確認。

B【教學模式設計:皆遠距/視訊教學】

傳統教學/考試 + ChatGPT 輔助教學 (僅SP) vs 傳統教學/ChatGPT命題 + ChatGPT 輔助教學 (SP+考官)

Google Meet 錄影

預試:至少找3~5位考生測試

C【教學成效驗證:皆遠距/視訊】

Google Meet 錄影

正式:應該可以很快,1~2周內完成

每組至少20人,2周之後再測/追蹤



#研究核心能力

寫作能力比較難,因為牽涉基本知識、閱讀能力、批判能力,不僅只有寫作而已。

統計知識--應該不難--AI自學/AI考試

其他:

PPT設計也大概僅有格式修改建議....


以下是跟 ChatGPT 對話:https://chat.openai.com/share/383c12cc-fd8c-4bd2-8adb-a51f82c1d3ee

您的研究構想看起來相當全面,著重於利用高頻率的練習與回饋來提升臨床技能。以下是對您的研究構想的整理與擴展:

研究目的

探討透過高密度的訓練與回饋,結合人工智慧模擬病人 (AI SP) 與 AI 考官,來加速臨床知識與技能的養成。進一步比較虛擬回饋與真人回饋的效果,以及不同教學組合的成效。

研究對象

  • 目標群體包括職能治療 (OT)、物理治療 (PT)、護理 (Nursing) 及醫師 (Physician)。
  • 參與者階段涵蓋大學部學生 (UGY) 及研究所及專科醫師 (PGY)。

研究設計

Step A: 講義與教材製作

  1. 評估者向個案介紹評估活動日常生活 (ADL) 失能的原因,並邀請個案參與。
  2. 評估者使用常用的巴氏量表版本進行詳細評估,包括評估時間範圍、概念及具有部分依賴性的項目評分。
  3. 評估者向個案解釋評估結果。
  4. 評估者討論可能的後續處置。

Step B: 教學模式設計

  • 比較傳統教學與考試,加上 ChatGPT 輔助教學(僅模擬病人 SP)與傳統教學結合 ChatGPT 設計的考題和輔助教學(模擬病人 SP + AI 考官)。
  • 使用 Google Meet 進行錄影,以確保遠程教學與評估的進行。

Step C: 教學成效驗證

  • 初步試驗:邀請 3-5 名考生進行教學與評估的測試。
  • 正式評估:於 1-2 周內快速完成,每組至少 20 人,並於 2 周後進行後續測試與追蹤。

預期成果

  • 比較不同教學模式下的學習成效。
  • 評估 AI 輔助教學與真人回饋相結合的效果。
  • 為臨床技能教學提供創新的遠程教學方案。

此研究設計有助於確認密集訓練與回饋結合 AI 技術在提升臨床技能方面的實際效果,並可能對未來的臨床教育方法提供重要的指引。