AI를 과신하지 않기
AI 답이 그럴듯해도 틀릴 수 있는 이유와 점검 방법을 다룹니다. 자동화 편향, 경보 피로, 알고리즘 편향, 없는 출처까지 현장에서 실제로 일어나는 함정을 모았습니다.
글 8편 · 아래 순서대로 읽으시길 권합니다.
- 자동화 편향 — 병원 의료 AI 과신 위험과 점검 방법
AI 도구는 정확할 때 사람을 돕지만, 틀리는 순간에는 사람이 스스로 옳게 내린 판단까지 뒤집게 만듭니다. 전자처방 실험과 체계적 리뷰 두 편으로 '자동화 편향'이 무엇인지, 왜 바쁠수록 심해지는지, 그리고 행정·간호가 도입 검토에서 확인할 점을 쉽게 정리합니다.
- AI 알림이 많아질수록 무뎌진다 — '경보 피로'와 병원이 확인할 점
패혈증·낙상·약물 경고까지, 많은 AI 도구는 결국 '알림' 한 줄로 현장에 도착합니다. 알림이 많아질수록 사람이 둔감해지는 경보 피로 현상을 환자안전 보고서로 짚고, 행정과 간호가 도입 검토에서 확인할 점을 정리합니다.
- 의료 AI가 '무엇을' 예측하는지 봐야 하는 이유 — 알고리즘 편향
같은 위험 점수인데도 특정 환자군에게만 도움이 덜 가는 AI가 있습니다. 미국 건강관리 알고리즘 사례와 국제 권고를 근거로, AI가 무엇을 예측하도록 설계됐는지가 왜 형평성을 좌우하는지 정리합니다.
- AI가 붙여 준 출처, 없는 문헌일 때가 있습니다 — 확인 순서
보고서나 제안서 검토 의견에 근거를 붙일 때 AI에 물으면 저자·연도까지 딱 떨어지는 출처가 함께 나옵니다. 그런데 그중 상당수는 존재하지 않는 문헌입니다. 실제로 측정한 연구 세 편으로 어느 정도인지 확인하고, 붙여 넣기 전에 거칠 세 단계를 정리합니다.
- AI로 만든 교육자료, 검증해보니 목표보다 세 배 높은 오류가 나왔습니다
서울아산병원 연구팀이 생성형 AI로 만든 전문의 시험 대비 교육자료를 직접 검증한 결과를 공개했습니다. AI 자체 검증을 통과한 자료에서도 목표 기준의 세 배가 넘는 오류가 나왔다는 점이 병원 교육 실무에 시사하는 바를 정리합니다.
- 환자가 AI로 응급도를 판단하고 올 때 — 증상 체커·챗GPT의 정확도
병원에 오기 전 증상 체커 앱이나 챗GPT로 스스로 진단·응급도를 가늠하는 환자가 늘고 있습니다. 이런 도구의 정확도가 실제로 어느 정도인지, 왜 '과잉 안내'와 '과소 안내'가 둘 다 문제인지, 그리고 병원 행정·간호가 확인할 점을 두 편의 체계적 문헌고찰을 근거로 쉽게 정리합니다.
- 진료·간호 기록을 AI가 대신 쓴다면 — 앰비언트 AI 스크라이브의 한계
진료실 대화를 듣고 기록 초안을 만드는 'AI 스크라이브'가 문서 부담을 덜어 줄지 주목받고 있습니다. 무작위배정 시험과 5개 대학병원 연구를 근거로 실제 효과와 확인할 점을 정리합니다.
- AI 치료 권고, 다학제 진료팀과 얼마나 일치했나
분당차병원이 췌담도암 다학제 진료 107건을 생성형 AI 4종에 입력해 비교한 결과, 치료 권고 일치율은 모델과 평가 방식에 따라 48.6~74.5%였고, 수술 여부처럼 중요한 판단일수록 정확도가 낮았습니다. 다학제 진료가 왜 필요한지 보여주는 결과입니다.