Hospital AI Lab HOSPITAL AI LAB — 醫療 AI 的實務資訊

更新日期:

北京AI眼科實測三大教訓:導入前該做什麼

北京眼科AI臨床實測顯示,導入前的資料品質與操作介面設計,比模型本身更容易決定成效。整理《Nature Medicine》研究裡,對醫院行政與診間導入評估有參考價值的三個教訓。

「導入 AI 之後,醫護人員真的會用嗎?」是評估 AI 產品時常被忽略的問題。科技新報在 2026 年 9 月 27 日的報導中,整理了北京視覺科學與轉化醫學中心(BERI)團隊發表於《Nature Medicine》的一項臨床實測結果——這套名為 AI-TEC 的眼科 AI 系統在真實診間運作後,暴露出三個與模型準確度無關、卻直接決定成效的問題(科技新報,2026-09-27)。這項實測發生在中國的醫學中心,並非台灣案例,但呈現的三個教訓,正好對應院方在採購前該追問廠商的問題,值得列入評估參考。

教訓一:AI 不是外掛工具,而是要重新設計流程

報導指出,AI-TEC 並非單純加在既有系統上的診斷小工具,而是全程參與問診流程的系統。研究團隊發現,把 AI 直接嵌進既有的看診動線,效果有限;真正有效的做法,是圍繞 AI 重新設計整段診療流程。這代表評估廠商提案時,「能不能直接接上現有系統」不是唯一該問的問題,還要追問:導入後,醫護人員原本的操作步驟會不會被打斷或重複。

教訓二:資料品質比資料數量重要

實測資料顯示,餵給 AI 近 2.7 萬張品質不一、標註方式也不一致的原始影像時,判讀準確度(AUROC,一種衡量AI判斷正確程度的指標,數值愈接近 1 代表判斷愈準)表現有限;但換成僅 1,426 張經眼科專家親自、精確標註過的高品質影像後,準確度大幅躍升至 0.93 以上。也就是說,數量遠遠不足的「乾淨資料」,表現反而遠勝過數量龐大但品質參差的資料。對評估採購案的行政人員來說,這代表廠商展示的準確度數字,需要進一步確認是在哪種品質的資料上量出來的。

教訓三:操作介面複雜,實際使用率就會偏低

即使系統準確度達標,實際上線後前 5 個月的使用率僅約 3.8%(1,113 次檢查中只有 41 次使用了這套 AI 流程)。研究團隊在簡化操作介面、並根據醫師的即時回饋調整後,使用率才回升至約 23%(1,126 次檢查中使用 259 次)。這說明就算系統準確,若操作步驟繁瑣、不符合臨床人員原本的習慣,實際使用率仍會偏低——而這正是採購前的展示(Demo)環境最難呈現、卻在正式上線後才會浮現的落差。

評估採購案時可以先問的問題

  • 這套系統是加在既有流程上,還是需要重新設計看診動線? 後者代表導入成本與訓練需求會更高。
  • 廠商展示的準確度,是用什麼品質的資料量測出來的? 標註方式與資料乾淨程度,比資料筆數更值得追問。
  • 有沒有實際上線後的使用率數據,而不只是展示環境的效果? 展示環境的操作流暢度,不代表臨床人員日常會願意使用。

重點整理

  • 北京視覺科學與轉化醫學中心團隊的 AI-TEC 眼科系統實測(《Nature Medicine》,經科技新報 2026 年 9 月 27 日報導)指出三個與模型準確度無關的導入問題。
  • 教訓一:AI 需要圍繞既有診療流程重新設計,而非單純外掛在原系統上。
  • 教訓二:約 1,426 張經專家精確標註的高品質影像,準確度(AUROC)達 0.93 以上,表現優於近 2.7 萬張品質不一的原始影像。
  • 教訓三:上線初期使用率僅約 3.8%,簡化操作介面後回升至約 23%,顯示介面複雜度直接影響臨床人員實際使用意願。
  • 這是中國醫學中心的研究階段實測案例,尚非大規模臨床常規使用,但三個教訓可作為採購評估時追問廠商的具體問題。

本文內容僅供一般資訊參考與研究教育之用,不能取代對特定病患的醫療診斷或建議。

這篇文章所屬的系列

查看所有系列

← 專欄