FDA 승인 AI 의료기기 1357개 중 3개 — 환자가 나아졌는지 확인한 것
병원에서 쓰이는 AI가 늘고 있습니다. 영상을 판독하고, 위험 환자를 골라내고, 진단을 보조합니다. 그런데 그중 몇 개나 "이 AI를 썼더니 환자가 실제로 더 오래, 더 잘 살았다"는 검증을 거쳤을까요. 토론토대 연구진이 세어 봤습니다. 1,357개 중 3개였습니다.

1357개 중 세 개
미국 식품의약국(FDA)이 환자 진료용으로 승인한 AI 의료기기는 1,357개입니다. 2025년 12월 5일 기준 집계입니다.
이 중 환자 중심 결과로 검증된 것은 세 개였습니다. 비율로 따지면 0.2%입니다. 바꿔 말하면 99.8%는 환자에게 실제로 도움이 됐는지 확인되지 않은 채 진료 현장에 들어가 있습니다.
무슨 연구인가 — 토론토대가 센 숫자
캐나다 토론토대의 라완 아불리브데(Rawan Abulibdeh) 연구팀이 수행한 분석으로, 2026년 8월 19일 학술지 PLOS Digital Health에 게재됐습니다.
연구팀은 FDA가 승인한 AI 기기 전체 목록을 확보한 뒤, 각 기기가 임상시험 등록부에 올라 있는지, 결과가 공개됐는지, 그 결과가 무엇을 측정했는지를 하나씩 대조했습니다.

환자 중심 결과라는 말의 뜻
연구에서 말하는 환자 중심 결과(patient-centered outcome)는 구체적입니다. 사망률, 뇌졸중 발생, 입원과 재입원, 삶의 질 같은 것들입니다.
환자가 실제로 겪는 일을 기준으로 삼는다는 뜻입니다. "AI가 병변을 얼마나 잘 찾아냈는가"가 아니라 "그래서 환자가 더 살았는가"를 묻습니다.
34개는 임상시험에 등록됐지만
1,357개 중 등록된 임상시험과 연결된 기기는 34개였습니다. 전체의 2.5% 수준입니다.
나머지 1,300개가 넘는 기기는 등록된 전향적 임상시험 없이 승인 절차를 통과했다는 뜻입니다.

결과가 공개된 것은 열두 건
34건 중에서도 결과가 실제로 게시된 것은 12건, 동료 심사를 거친 논문으로 나온 것도 12건이었습니다.
그리고 그 안에서 환자 중심 결과를 평가한 것이 3건입니다. 등록에서 결과 공개, 다시 환자 결과 측정으로 갈수록 숫자가 급격히 줄어드는 구조입니다.
FDA 승인은 무엇을 보증하나
여기서 오해가 자주 생깁니다. "FDA 승인"은 그 기기가 환자에게 이롭다는 증명이 아닙니다.
대부분의 AI 의료기기는 510(k)라는 경로로 시장에 들어옵니다. 이 경로가 요구하는 것은 이미 승인된 기존 기기와 실질적으로 동등하다는 입증입니다.

실질적 동등성이라는 통과 문턱
실질적 동등성(substantial equivalence)은 안전성과 유효성 면에서 기존 제품과 비슷하다는 판단입니다. 새로운 임상적 이득을 증명하라는 요구가 아닙니다.
이 제도는 원래 물리적인 의료기기를 염두에 두고 설계됐습니다. 기존 카테터와 비슷한 카테터라면 처음부터 다시 검증할 필요가 없다는 합리적인 발상이었습니다.
전통 의료기기와 AI 기기가 다른 점
문제는 AI가 그 전제에 잘 들어맞지 않는다는 데 있습니다.
물리적 기기는 만들어진 대로 작동합니다. 반면 AI 모델은 학습 데이터가 무엇이었는지, 어떤 환자군에서 훈련됐는지에 따라 성능이 크게 달라집니다. 겉보기 기능이 같아도 속은 전혀 다를 수 있습니다.

승인 이후에도 계속 변하는 기기
더 까다로운 지점은 일부 AI 도구가 배포 이후에도 계속 학습하거나 업데이트된다는 것입니다.
승인 시점에 검증한 그 모델과, 1년 뒤 병원에서 돌아가는 모델이 같다는 보장이 없습니다. 현행 규제 체계는 이런 사후 변화를 지속적으로 추적하도록 설계돼 있지 않습니다.
누가 시험에서 빠졌나 — 임신부·75세 이상·비영어권
연구팀이 짚은 또 하나의 문제는 검증에 포함된 사람이 누구였는가입니다.
수행된 소수의 연구들조차 취약 집단을 배제하는 경향이 있었습니다. 임신한 여성, 75세를 넘는 고령자, 영어를 쓰지 않는 환자가 대표적으로 빠졌습니다.

잘 갖춰진 병원에서만 검증됐다는 것
연구가 이뤄진 장소도 한쪽에 쏠려 있었습니다. 자원이 충분한 대형 의료기관이 대부분이었습니다.
장비가 좋고 인력이 넉넉한 곳에서 잘 작동한 AI가, 인력이 부족하고 장비가 오래된 곳에서도 같은 성능을 낼지는 별개의 문제입니다. 오히려 AI의 도움이 더 절실한 쪽은 후자입니다.
저시력·고령 환자에게 이 공백이 갖는 뜻
75세 이상이 검증에서 빠졌다는 사실은 그냥 넘길 대목이 아닙니다. 의료 AI를 가장 자주 마주치는 연령대가 바로 고령층이기 때문입니다.
시각 기능이 떨어진 환자, 여러 만성질환을 함께 앓는 환자, 통역이 필요한 환자는 데이터에서도 소수이고 시험에서도 소수입니다. 그 결과 이들에게 AI가 어떻게 작동하는지는 가장 덜 알려진 채로 남습니다. 검증의 공백은 대개 이미 취약한 쪽에 더 깊게 파입니다.

영상의학에 몰려 있는 이유
승인된 AI 의료기기의 압도적 다수는 영상의학 분야입니다. 관련 분석들에서 대략 4분의 3 이상이 이 영역으로 집계돼 왔습니다.
이유는 단순합니다. 영상은 디지털 데이터로 이미 쌓여 있고, 정답을 붙이기가 상대적으로 쉽습니다. 학습에 유리한 조건이 갖춰져 있는 겁니다.
정확도가 높다는 말과 환자가 낫는다는 말
AI 의료기기 홍보에서 가장 흔히 보이는 표현은 정확도입니다. 판독 정확도 몇 퍼센트, 전문의 수준, 이런 문구들입니다.
하지만 정확도가 높다는 것과 환자의 예후가 좋아진다는 것 사이에는 여러 단계가 놓여 있습니다. 발견이 치료로 이어져야 하고, 치료가 실제 이득으로 이어져야 합니다.

민감도·특이도가 놓치는 것
민감도와 특이도는 병을 얼마나 잘 잡아내고 얼마나 헛짚지 않는지를 나타냅니다. 유용한 지표지만 한계도 분명합니다.
조기에 발견해도 결과가 달라지지 않는 병이 있고, 발견 자체가 불필요한 검사와 시술을 부르는 경우도 있습니다. 과잉 진단이라는 문제가 여기서 나옵니다.
실제 사례 — 패혈증 경보 알고리즘이 남긴 교훈
의료 AI 논의에서 자주 언급되는 사례가 패혈증 조기 경보 시스템입니다. 널리 도입된 뒤 외부 연구진이 실제 병원 데이터로 검증했더니, 홍보된 성능에 크게 못 미친다는 결과가 나온 일이 있었습니다.
중요한 건 그 검증이 도입 이전이 아니라 이후에 이뤄졌다는 점입니다. 이미 수많은 병원에서 쓰이고 난 뒤였습니다. 이번 연구가 지적하는 구조적 공백이 실제로 어떻게 나타나는지 보여 주는 장면입니다.

경보가 늘면 무시가 늘어난다
또 하나 알려진 부작용은 경보 피로입니다. 알림이 너무 자주 울리면 의료진이 반응하지 않게 됩니다.
이건 알고리즘 성능만 봐서는 드러나지 않습니다. 실제 진료 흐름 속에 넣어 봐야 보이는 문제이고, 그래서 환자 중심 결과로 재는 시험이 필요합니다.
같은 저자들이 작년에 낸 경고
이 연구팀은 앞서 2025년에도 PLOS Digital Health에 관련 논문을 냈습니다. 「안전의 착각(The illusion of safety)」이라는 제목으로, FDA의 AI 의료제품 승인 절차를 검토한 보고서였습니다.
그때 지적한 내용이 시판 후 감시 부족, 학습 데이터 공개 의무 부재, 공정성 기준의 부재였습니다. 이번 연구는 그 주장에 구체적인 숫자를 붙인 셈입니다.

시판 후 감시는 왜 어려운가
약은 부작용이 비교적 뚜렷하게 드러납니다. 반면 AI의 실패는 조용합니다.
진단 보조 AI가 놓친 병변은 기록에 남지 않습니다. 놓쳤다는 사실 자체를 나중에야, 그것도 우연히 알게 되는 경우가 많습니다. 무엇을 집계해야 하는지부터 불분명합니다.
기기 부작용 보고 제도의 한계
의료기기 이상사례 보고 제도가 있긴 하지만, 자발적 보고에 크게 의존합니다. 보고되지 않은 사건은 통계에 잡히지 않습니다.
소프트웨어가 오작동했는지, 사용자가 잘못 썼는지, 애초에 그 환자에게 맞지 않는 도구였는지를 구분하기도 어렵습니다.

유럽은 어떻게 하고 있나
유럽연합은 의료기기 규정(MDR)을 통해 임상적 근거 요구를 강화해 왔고, AI 법을 통해 의료용 AI를 고위험 범주로 다루고 있습니다.
다만 규제가 강화되면 인증 병목이 생기고 제품 출시가 늦어진다는 문제도 함께 제기돼 왔습니다. 어느 쪽이든 대가가 따릅니다.
한국의 상황은 어떤가
한국도 AI 의료기기 허가 건수가 꾸준히 늘어 왔고, 영상의학 중심이라는 분포도 비슷합니다.
환자 중심 결과를 요구하는 규제는 어느 나라에서도 아직 표준이 아닙니다. 이번 연구가 미국 데이터를 다뤘지만 문제 제기 자체는 특정 국가에 한정되지 않습니다.

규제를 조이면 혁신이 죽는다는 반론
이런 지적에는 반론도 따라옵니다. 모든 AI 기기에 대규모 임상시험을 요구하면 개발 비용이 치솟고, 자본이 있는 대기업만 남게 된다는 것입니다.
실제로 무작위 대조시험은 비용과 시간이 많이 듭니다. 소프트웨어는 업데이트 주기가 짧아 시험이 끝날 무렵이면 이미 다음 버전이 나와 있기도 합니다.
그 반론에 담긴 진실과 과장
비용 문제는 사실입니다. 다만 이번 연구가 요구하는 것이 "모든 기기에 대규모 무작위 시험"은 아닙니다.
연구진의 제안은 위험도에 따라 요구 수준을 달리하고, 배포 이후의 실사용 데이터를 체계적으로 모으자는 쪽에 가깝습니다. 사전 시험을 늘리는 것만이 유일한 길은 아니라는 뜻입니다.

무엇이 바뀌어야 하나 — 연구진의 제안
연구팀이 제시한 방향은 세 갈래입니다.
첫째, 시판 후 평가를 의무화해 실제 사용 환경에서의 성과를 계속 확인하는 것입니다. 둘째, 개발사가 학습 데이터의 출처와 구성을 공개하도록 하는 것입니다. 셋째, 공정성과 형평성에 대해 강제력 있는 기준을 세우는 것입니다.
환자가 지금 할 수 있는 질문
제도가 바뀌기를 기다리는 동안에도 할 수 있는 일은 있습니다.
진료 중 AI 판독이나 AI 보조 진단이 쓰인다면, 그 결과가 어떻게 활용되는지 물어보셔도 됩니다. 최종 판단은 사람이 하는지, AI 결과가 참고 자료인지 결정 근거인지를 확인하는 것만으로도 상황이 훨씬 분명해집니다.

핵심 정리
정리하면 이렇습니다.
첫째, FDA가 승인한 AI 의료기기 1,357개 중 환자가 더 오래·더 잘 사는지를 검증한 것은 3개뿐입니다. 임상시험에 등록된 것도 34개에 그쳤습니다.
둘째, 원인은 부정이 아니라 제도 설계에 있습니다. 510(k) 경로는 기존 기기와의 동등성만 요구하며, 애초에 임상적 이득 증명을 전제로 만들어지지 않았습니다.
셋째, 소수의 검증조차 임신부·75세 이상·비영어권 환자를 배제하고 자원이 풍부한 병원에서 이뤄졌습니다. 검증의 공백은 이미 취약한 쪽에 더 깊습니다.
참고하실 만한 것
의료 AI 관련 기사를 보실 때 "FDA 승인"이라는 표현이 나오면, 그것이 무엇을 통과했다는 뜻인지 한 번 더 생각해 보시면 좋겠습니다. 안전성 심사를 통과했다는 뜻이지, 환자에게 이롭다는 증명은 대개 아닙니다.
그리고 이 연구는 AI 의료기기를 쓰지 말자는 주장이 아닙니다. 무엇이 검증됐고 무엇이 아직 검증되지 않았는지를 구분해서 알자는 쪽에 가깝습니다. 그 구분이 있어야 신뢰할 지점과 조심할 지점을 나눌 수 있습니다.
출처
- News-Medical — FDA-cleared medical AI rarely tested for real-world benefits
- MedicalXpress — Most AI medical devices cleared for use were not tested on patient outcomes
- Inside Precision Medicine — Nearly All FDA-Cleared AI Medical Devices Lack Evidence of Patient Benefit
- Mirage News — AI Medical Devices Cleared Without Outcome Testing
- Scimex — Barely any authorised AI-based medical devices tested on patient health
- PLOS Digital Health — 저널
- PLOS Digital Health — The illusion of safety: A report to the FDA on AI healthcare product approvals
- FDA — Premarket Notification 510(k)
협업문의 : kuroicode@gmail.com
블로그 : https://blog.svil.dev/
홈페이지 : https://kuroicode-beep.github.io/svil-homepage/