AI 제안서의 '안전합니다', 무엇으로 뒷받침되나요
의료 AI가 안전하다는 문구를 제안서에서 만났을 때, 그 주장이 어떤 근거에 기대는지 묻는 방법을 최근 논문 두 편과 함께 정리합니다.
AI 도입 제안서를 검토하다 보면 ‘안전합니다’, ‘정확도가 높습니다’ 같은 문장을 자주 만납니다. 그런데 이 문장이 무엇을 근거로 하는지는 제안서만 봐서는 알기 어렵습니다. 메디칼타임즈는 2026년 9월 21일 자 기사 「‘안전하다’는 의료 AI, 증거를 대라(상)」에서 안전하다는 주장의 범위와 강도는 그것을 뒷받침하는 증거의 범위와 강도를 넘을 수 없다는 취지의 논점을 짚었습니다(메디칼타임즈). 이 글에서는 그 기사가 다룬 연구 가운데 출처를 확인한 두 편을 바탕으로, 행정·간호 담당자가 제안서 앞에서 던질 수 있는 질문을 정리해 봅니다.
시험에서 잘 푸는 것과 현장에서 쓰이는 것은 다릅니다
2026년 2월 학술지 「네이처 메디신」에 실린 무작위 배정 연구는 영국 성인 1,298명이 열 가지 건강 상황을 두고 대화형 AI(GPT-4o, Llama 3, Command R+)의 도움을 받게 했습니다. AI가 혼자 문제를 풀었을 때는 상황에 맞는 병명을 94.9% 짚었고, 어떻게 행동해야 하는지는 평균 56.3% 맞혔습니다. 그런데 같은 AI를 실제 사람이 쓰자 병명을 찾은 비율은 34.5% 미만, 올바른 행동을 고른 비율은 44.2% 미만으로 내려갔고, 검색 등 원하는 방법을 쓴 대조군과 다르지 않았습니다(Nature Portfolio 보도자료). 연구진은 사용자가 정보를 빠뜨리거나 AI가 오해를 부르는 내용을 내놓는 문제가 있었다고 설명합니다.
이 연구의 참여자는 일반 시민이며 병원 직원이 아닙니다. 그러니 병원 도구에 그대로 대입할 수는 없습니다. 다만 ‘기계 혼자 시험 본 점수’와 ‘사람이 쓸 때의 결과’가 다를 수 있다는 점은 제안서의 정확도 수치를 읽을 때 분명히 기억해 둘 만합니다.
안전 안내 문구는 저절로 늘지 않습니다
2025년 학술지 「npj 디지털 메디슨」에 실린 분석은 대화형 AI가 의료 질문에 답할 때 ‘저는 의료인이 아닙니다’ 같은 안내 문구를 붙이는 비율을 살폈습니다. 언어 모델의 답변 가운데 안내 문구가 있던 비율은 2022년 26.3%에서 2025년 0.97%로 줄었습니다(npj Digital Medicine, PMC). 연구진은 의료와 관련된 모든 답변에 안내 문구가 있어야 하며, 질문의 심각성에 맞게 달라져야 한다고 제안했습니다.
모델이 좋아지면 안전 장치도 함께 좋아질 것이라고 가정하기 쉽지만, 이 연구는 그 가정이 항상 맞지는 않음을 보여 줍니다. 제안서가 ‘최신 모델 기반’이라고만 적고 있다면, 안내 문구와 제한 사항이 실제 화면에 어떻게 나오는지 직접 확인해 봐야 합니다.
제안서 앞에서 던질 수 있는 질문
아래는 위 두 연구와 기사의 문제의식을 바탕으로 한 제안이며, 정해진 기준은 아닙니다.
- 어떤 조건에서 시험했나요? AI 단독 성능인지, 실제 사용자가 쓴 결과인지 구분해서 물어봅니다.
- 우리 병원과 비슷한 환경인가요? 시험 대상이 누구였고 어떤 업무였는지 확인하고, 다르면 시범 운영으로 먼저 확인할 것을 요청합니다.
- 한계 안내가 화면에 있나요? 사용자가 결과를 그대로 믿지 않도록 하는 문구와 절차가 있는지 봅니다.
- 주장의 근거 자료를 볼 수 있나요? ‘안전합니다’라는 문장 옆에 시험 방법과 결과가 붙어 있는지 확인합니다.
핵심 요약
- 제안서의 ‘안전합니다’는 그것을 뒷받침하는 시험의 범위를 넘어서 읽으면 안 됩니다.
- 한 연구에서 AI 혼자일 때의 점수와 사람이 함께 썼을 때의 결과는 크게 달랐습니다.
- 다른 연구에서 AI의 안전 안내 문구 비율은 2022년 26.3%에서 2025년 0.97%로 줄었습니다.
- 도입 검토 때는 시험 조건, 우리 병원과의 유사성, 화면의 한계 안내, 근거 자료를 물어보시길 권합니다.
본 사이트의 콘텐츠는 일반적인 정보 제공과 연구·교육 목적이며, 특정 환자에 대한 의학적 진단이나 조언을 대신하지 않습니다.