AI Journal Club매주

의료 AI·디지털헬스 신간 논문을 골라 읽습니다. 요지·핵심 결과·임상적 의미를 짧게 정리합니다.

19편 누적 · 최근 업데이트 2026-09-22

선정 기준 — PubMed와 Consensus에서 새로 나온 논문 중 임상 적용 가능성과 파급력을 기준으로 매주 화요일 2~3편을 고릅니다. 호(號)로 나누지 않고 최신 리뷰가 위에 쌓이는 방식이며, 각 리뷰는 초록·본문 기반 요약과 원문 DOI를 함께 제공합니다.
영상진단 AI · 산전 초음파 다기관 자기교차 무작위배정 시험 2026-09-10

Evaluating AI-assisted detection of fetal intracranial malformations in prenatal ultrasound practice: a multicentre, self-crossover, randomised controlled trial in China

Lei T, Shang N, Xie B, Luo Y, Zheng H, Li H, Zhang C, Wang N, Zhou Q, Xie H. The Lancet Digital Health 2026;101040 (온라인 우선 공개 2026-09-10) · 중산대학 제1부속병원·광둥성 부녀아동병원 등 중국 5개 기관 · 다기관 자기교차(self-crossover) 무작위배정 시험, 초음파 검사 1,584건(ChiCTR2200063424)

경력 3년 이상 8년 미만의 초음파 검사자가 실시간 AI 보조를 받자 태아 두개내 기형 10종의 민감도가 올랐고, 특이도는 비열등성 기준을 충족했다

태아 두개내 기형은 산전 초음파에서 놓치기 쉬운 영역이고, 발견 여부가 검사자의 경험에 크게 좌우됩니다. 영상 AI의 성능 보고는 많지만, 실제 검사실에서 검사자와 함께 쓸 때 진단이 나아지는지를 무작위배정으로 확인한 연구는 드문 편입니다(리뷰어의 평가). 중국 5개 기관 연구진은 기형 고위험 단태 임신(임신 11~32주)을 대상으로, 경력 3년 이상 8년 미만의 초음파 검사자가 산전 초음파 AI 시스템 PAICS를 쓰는 효과를 평가했습니다. 대상 임신부를 1:1로 두 진단 순서에 무작위 배정했습니다 — ① 혼자 실시간 진단한 뒤 PAICS 보조로 오프라인 재검토, ② PAICS 보조로 실시간 진단한 뒤 혼자 오프라인 재검토(두 판독 사이 4주 휴지기). 기준 진단은 동영상을 검토한 독립 전문가 패널의 판정이었고, 주평가변수는 AI가 인식하도록 만든 10가지 두개내 기형의 민감도(우월성)와 특이도(비열등성 한계 5%)였습니다.

2022년 9월부터 2023년 11월까지 1,584건의 검사가 이뤄졌습니다. 태아 단위 분석에서 PAICS 보조는 민감도를 0.087(95% CI 0.029–0.147) 높였고, 특이도 차이는 0.009(−0.006–0.023)로 비열등성 기준을 충족했습니다. 기형 단위 분석에서는 민감도가 0.118(0.054–0.181) 올랐고 특이도 차이는 0.001(−0.001–0.002)이었습니다. 진단 과정이나 AI 보조와 관련된 이상반응은 보고되지 않았습니다.

영상 AI를 "판독 성능"이 아니라 검사자가 쓸 때의 진단 성과로 무작위 비교했다는 점에서 의미 있는 설계입니다. 다만 몇 가지를 함께 읽어야 합니다. 대상은 기형 고위험 임신이라 일반 선별검사보다 기형 유병률이 높을 것으로 보이고(리뷰어의 추정), 검사자는 AI 사용 여부를 알고 있었습니다. 민감도 향상은 AI가 학습한 10가지 기형에 대한 것이며, 연구진이 함께 살핀 "AI 인식 범위 밖의 이상"에 대한 효과는 초록에 수치로 제시되지 않았습니다. 또 기준 진단이 출생 후 확진이 아니라 전문가 패널의 동영상 판정이라는 점도 한계입니다(이 해석은 초록에 근거한 리뷰어의 판단입니다). 국내에서도 산전 초음파는 검사자 숙련도 편차가 크고 분만 인프라가 줄어드는 지역일수록 부담이 커지는 영역이라, 이런 보조 도구를 도입한다면 저위험 일반 산전 검사에서의 성능을 따로 확인해야 할 것입니다(국내 맥락은 리뷰어의 해석입니다).

TAKEAWAY

산전 초음파 AI 보조는 경력 3년 이상 8년 미만 검사자의 태아 두개내 기형 민감도를 8.7%p(태아 단위) 높였고 특이도는 비열등성 기준(한계 5%)을 충족했다 — 영상 AI를 "검사자와 함께 쓸 때"로 검증한 드문 무작위배정 근거다.

AI 교육 보조 · 초음파 · 국내 연구 전향적 무작위배정 시험 2026-09-18

Real-time AI-assisted nerve tracking for ultrasound-guided nerve identification: a prospective randomized trial

Kim J, Nam SP, Yoo J, Hong Y, Joo H, Yoo Y, Moon JY. Regional Anesthesia & Pain Medicine 2026 (온라인 우선 공개 2026-09-18) · 서울대학교병원 마취통증의학과 · 전향적 무작위배정 시험, 초음파 초심자 80명(의대생 60명·마취통증의학과 전공의 20명, 완료 78명)(NCT05857787)

실시간 신경 추적 AI로 10분 실습한 초심자도, 직후 AI를 끄고 평가하자 혼자 신경을 찾는 성공률은 AI 없이 실습한 초심자와 유의한 차이가 없었다

초음파 유도 신경차단에서 신경을 화면에 표시해 주는 AI는 초심자의 진입 장벽을 낮출 도구로 주목받습니다. 그런데 교육 관점에서 중요한 질문은 따로 있습니다. AI의 도움을 받으며 배운 사람이, AI가 꺼진 뒤에도 혼자 찾을 수 있는가입니다. 서울대병원 연구진은 초음파 초심자 80명(의대생 60명, 마취통증의학과 전공의 20명)을 AI 없이 일반 B-모드 초음파로 훈련받는 대조군과, 실시간 신경 추적 시스템(NerveTrack)을 쓰며 훈련받는 AI 보조군에 배정했습니다. 두 군 모두 표준 강의와 10분간의 실습을 받은 뒤 AI 기능을 끈 상태에서 평가했고, 주평가변수는 정중신경과 쇄골상 상완신경총을 첫 시도에 혼자 찾아내는 성공률이었습니다.

78명이 연구를 마쳤습니다. 첫 시도 독립 식별 성공률은 정중신경에서 대조군 57.5% 대 AI 보조군 65.8%(RR 1.14, 95% CI 0.81–1.62; p=0.452), 상완신경총에서 35.0% 대 42.1%(RR 1.20, 0.68–2.11; p=0.519)로 통계적으로 유의한 차이가 없었습니다. 추가로 AI 보조 훈련을 더 받은 뒤에도 독립 식별 성공률에는 유의한 차이가 없었습니다. 달라진 것은 자신감이었습니다. 추가 훈련 후 AI 보조군은 상완신경총 식별에 대한 자기 평가 자신감이 더 높았습니다(4.7±0.5 대 4.4±0.9; p=0.046).

AI가 "쓰는 동안" 성과를 높이는지와 "배우는 데" 도움이 되는지는 별개의 질문이라는 점을 보여준 국내 연구입니다. 성공률 수치는 AI 보조군이 조금 높은 쪽으로 기울어 있지만 신뢰구간이 넓어, 효과가 없다기보다 이 표본 크기로는 차이를 확인하지 못했다고 읽는 편이 정확합니다. 저자들도 장기 유지, 낯선 해부 구조로의 전이, 실제 시술 수행은 이 연구로 알 수 없다고 밝혔습니다. 주목할 대목은 독립 식별 성공률에는 차이가 없는데 추가 훈련 후 상완신경총 식별 자신감만 높아진 결과입니다. 자신감과 실력의 간극은 AI에 의존해 배운 세대가 AI 없는 상황에서 과신할 위험과 맞닿아 있어, 전공의 수련에 AI 보조 도구를 들일 때 AI를 끈 상태의 평가를 교육과정에 넣을 필요가 있어 보입니다(이 교육적 함의는 리뷰어의 해석입니다).

TAKEAWAY

실시간 신경 추적 AI로 10분 실습한 초심자는 직후 AI를 끈 평가에서 독립 식별 성공률이 대조군과 유의한 차이가 없었고(정중신경 65.8% 대 57.5%), 추가 훈련 후 상완신경총 식별 자신감만 더 높았다 — AI로 "배운 것"은 AI를 끄고 평가해야 한다.

원격의료 · 정신건강 후향적 비교효과 연구 2026-09-01

Comparative Outcomes of Video, Phone, and In-Person Mental Health Care

Connolly SL, Raciborski RA, Abdulkerim H, Hogan TP, Lindsay JA, Heyworth L, Sullivan JL, Weaver KR, Shimada SL, Miller CJ. JAMA Network Open 2026;9(9):e2633396 · 미국 보훈부(VA) 보스턴 의료체계·하버드의대 등 · 행정자료 기반 후향적 비교효과 연구, 813,699명(1년 추적)

보훈병원 정신건강 외래를 주로 화상으로 받은 환자는 전화·대면 진료를 받은 환자보다 입원·응급실 방문·자살 행동이 조금 적었다 — 다만 차이는 작고 교란 가능성이 남는다

미국 보훈부(VA) 의료체계에서는 정신건강 진료의 약 절반이 원격으로 이뤄집니다. 그러나 화상·전화·대면 진료의 질이 서로 같은지는 거의 알려지지 않았습니다. 연구진은 2021년 7월부터 2022년 10월 사이 정신건강 외래를 3회 이상 받은 환자 전원을, 그 기간에 외래 대부분을 받은 방식에 따라 화상·전화·대면 코호트로 나누고 이후 1년간의 결과를 비교했습니다. 결과 지표는 정신건강 관련 입원, 정신건강 관련 응급실 방문, 자살 행동, 예약 이행률이었고, 역확률가중 회귀보정(IPWRA)으로 평균처치효과(ATE)를 추정했습니다.

대상자는 813,699명(남성 82.7%, 60세 이상 43.6%)으로, 대면 37.5%, 화상 42.2%, 전화 20.3%였습니다. 정신건강 입원은 화상 0.9%, 대면 2.1%, 전화 1.6%, 응급실 방문은 화상 1.5%, 대면 2.6%, 전화 2.3%, 자살 행동은 화상 1.0%, 대면 1.2%, 전화 1.3%였습니다. 보정 후에도 모두가 화상 진료를 받았다면 입원 확률은 전화 대비·대면 대비 각각 0.005(0.5%p) 낮았을 것으로 추정됐고, 응급실 방문(전화 대비 −0.006, 대면 대비 −0.005)과 자살 행동(전화 대비 −0.003, 대면 대비 −0.001)도 같은 방향이었습니다. 예약 이행률은 화상군이 전화군보다 4.1%p, 대면군보다 3.6%p 높았습니다.

원격 정신건강 진료가 "대면보다 못하다"는 우려에 대규모 실사용 자료로 답한 연구입니다. 그러나 저자들 스스로 강조하듯 효과의 크기가 작고 교란이 남아 있을 수 있습니다. 방식은 무작위가 아니라 환자와 의료진이 고른 결과이므로, 증상이 무겁거나 불안정한 환자가 대면 진료로 모였을 가능성은 행정자료 보정만으로 다 지워지지 않습니다(리뷰어의 해석). 따라서 "화상이 대면보다 낫다"보다는 "화상이 대면보다 나쁘다는 신호는 없었다"에 가깝게 읽는 편이 안전합니다. 전화보다 화상이 나았다는 결과는, 비대면진료 제도화를 논의하는 국내에서 전화 상담과 화상 진료를 같은 것으로 취급할지를 따져볼 근거가 됩니다(국내 맥락은 리뷰어의 해석이며, 대상이 남성 비율이 높은 미국 재향군인이라는 점도 일반화에 제약입니다).

TAKEAWAY

보훈병원 환자 81만 명에서 정신건강 외래를 주로 화상으로 받은 군은 전화·대면 군보다 입원·응급실·자살 행동이 조금 적었다(입원 확률 0.5%p 낮음) — 효과는 작고 교란이 남지만, 화상 진료가 대면보다 나쁘다는 신호는 없었다.

LLM · 인간-AI 협업 · 국내 연구 후향적 판독자 연구 2026-08

Determinants of Reader-LLM Interaction in Thoracic Radiology: Impact of Model Confidence and Reader Expertise

Song J, Jeong WG, Han DH, Ko H, Yoon SH, Kim H, Naruetook P, Leong WL, Kim S, Moon HE, An JY, Koo SJ, Lee M, Hwang EJ, Lee T. Radiology 2026;320(2):e253397 · 서울대학교병원 영상의학과·국립암센터·서울성모병원 · 대한흉부영상의학회 Weekly Case 흉부영상 100증례를 판독자 10명이 판독한 후향적 판독자 연구(판독자-증례 1,000쌍)

판독의가 LLM의 조언을 잘 쓰느냐는 모델의 확신도·판독의의 숙련도와 연관됐고, 설명이 좋을수록 틀린 답을 받아들이는 경향도 커졌다

LLM은 이제 진단 후보와 함께 "왜 그렇게 보는지" 설명까지 내놓습니다. 그런데 협업의 성패는 모델이 맞히느냐만으로 정해지지 않습니다. 사람이 맞는 조언은 받아들이고 틀린 조언은 걸러내야 하기 때문입니다. 서울대병원 연구진은 대한흉부영상의학회 Weekly Case 플랫폼(2018년 1월~2020년 12월)에서 흉부 단순촬영·CT·MRI·PET 100증례를 골라, 판독자 10명에게 먼저 도움 없이 판독하게 했습니다(1차). 2차 판독에서는 판독자-증례 단위로 무작위 배정해 정확도가 높은 GPT-5(정답률 76%, 500쌍 중 379쌍) 또는 정확도가 낮은 GPT-4o(27%, 500쌍 중 133쌍)가 순위를 매긴 진단 후보와 근거를 제시했습니다. 주평가변수는 "적절한 상호작용", 즉 맞는 제안을 받아들이거나 틀린 제안을 거부한 비율입니다.

다변량 일반화추정방정식으로 분석하자 두 요인이 독립적으로 적절한 상호작용과 연관됐습니다. 모델 확신도(정답에 매긴 점수, OR 3.82, 95% CI 1.58–9.25)와 판독자 숙련도(OR 2.06, 1.38–3.07)입니다. 다만 전문가일수록 모델 확신도에 덜 흔들렸습니다(교호작용 OR 0.79, 0.67–0.94). 가장 눈여겨볼 대목은 설명(rationale)의 질입니다. 설명이 좋을수록 맞는 제안을 거부하는 일은 줄었지만(OR 0.79, 0.67–0.93), 틀린 제안을 받아들이는 일은 늘었습니다(OR 1.71, 1.47–1.99). 반대로 판독자 숙련도(OR 0.54, 0.41–0.70)와 1차 판독 때의 판독자 확신도(OR 0.80, 0.67–0.94)는 틀린 제안을 받아들이지 않게 막아 주는 방향이었습니다.

"설명 가능한 AI가 신뢰를 높인다"는 통념의 이면을 수치로 보여준 연구입니다. 설명은 좋은 조언을 쓰게도 하지만 나쁜 조언도 설득력 있게 포장합니다. 경험이 적은 판독자일수록 이런 과신(overreliance)에 취약했다는 점은 전공의 교육이나 야간 판독처럼 숙련도가 낮은 상황에서 LLM을 붙일 때 더 조심해야 한다는 뜻으로 읽힙니다(이 적용 맥락은 원문이 아니라 리뷰어의 해석입니다). 한계도 있습니다. 판독자는 10명, 증례는 학회 Weekly Case 플랫폼의 100건이고, 두 모델의 정답률이 76%와 27%로 크게 달라 실제 진료에서 단일 모델을 쓰는 상황과는 거리가 있습니다. 학회 증례 플랫폼의 사례는 일상 판독 목록보다 교육적 가치가 큰 증례 위주일 가능성도 있습니다(리뷰어의 추정). 모델 확신도가 적절한 상호작용과 연관됐다는 결과에 비추어, 도입할 때 모델의 확신도를 판독의에게 드러내는 방식을 함께 고민할 만합니다(원문이 아닌 리뷰어의 제안입니다).

TAKEAWAY

LLM의 설명이 좋을수록 판독의가 맞는 조언을 덜 거부했지만 틀린 조언을 받아들일 가능성도 커졌다(OR 1.71) — 의료 LLM의 설명은 신뢰를 높이는 장치이자 과신을 부르는 장치다.

영상진단 AI · 간암 · 실진료 배치 다기관 검증 + 단일군 임상시험 2026-08-19

Large-scale AI-guided liver malignancy diagnosis: multicenter study and a single-arm trial

Zhang X, Li C, Han X, Yin X, Zhang C, Zhou J, Cao K, Liu Q, …, Ourselin S, Zuluaga MA, Yan K, Zhang Q, Hou Y, Liang T, Zhang L, Shi Y. Nature Medicine 2026 (온라인 우선 공개 2026-08-19) · 중국의과대학 성경병원·알리바바 DAMO 아카데미·저장대 제1부속병원·킹스칼리지런던(영국)·EURECOM(프랑스) 등 · 개발 6,443명, 후향적 다기관·실사용 검증 22,251명, 실진료 단일군 시험 10,333명(NCT07153783)

조영증강 CT에서 간 악성종양을 읽는 AI를 판독자 한 명으로 더 앉혔더니, 1만 명 중 판독에서 빠졌던 병변 51개가 새로 드러났다

간 악성종양은 대개 조영증강 CT로 평가하지만, 판독량이 많은 실제 진료에서는 놓치거나 늦게 진단하는 일이 여전히 생깁니다. 연구진은 LiON(Liver DiagnOsis Network)을 개발했습니다. 여러 조영 시기의 영상을 유연하게 처리하고 임상 정보까지 함께 반영하도록 만든 AI로, 기존 판독 흐름에 끼워 넣을 수 있게 설계했습니다. 6,443명으로 학습한 뒤 다기관·실사용 코호트 22,251명에서 후향적으로 검증했고, 이어 실제 진료 환자 10,333명을 대상으로 기존 판독 흐름에 "추가 AI 판독자"로 넣는 단일군 시험을 진행했습니다. 연구 질문은 "성능이 좋은가"를 넘어 "안전망 역할을 실제로 하는가"였습니다.

후향적 검증에서 악성 진단 AUC는 0.975(95% CI 0.971–0.979)였고, 판독이 까다로운 지방간 환자에서 0.971(0.952–0.985), 간경변 환자에서 0.924(0.901–0.946)를 유지했습니다. 단일군 시험의 주평가변수는 "악성 진단 AUC의 95% 신뢰구간 하한이 0.900을 넘는가"였고, AUC 0.952(0.942–0.961)로 이를 충족했습니다. 임상적으로 더 의미 있는 것은 이차 결과입니다. AI와 판독의가 함께 보는 과정에서 기존 판독에서 빠졌던 병변 51개(그중 악성 15개)가 새로 확인됐고, 이것이 판독문 수정 37건, 다학제 진료 회부 22건, 그리고 일부 환자의 치료 방침 변경으로 이어졌습니다.

이 연구는 AUC 보고에서 멈추지 않고 판독문이 실제로 몇 건 바뀌었는지까지 셌다는 점에서 눈여겨볼 만합니다. 하지만 설계의 한계도 저자들이 스스로 밝혔습니다. 대조군이 없는 단일군 시험이어서 환자 결과에 미치는 효과는 이 자료로 판단할 수 없고, 저자들도 여러 의료체계에서 임상 결과를 평가할 전향적 비교연구가 필요하다고 결론지었습니다. 1만 명 중 새로 찾은 악성 병변 15개는 대략 700명에 한 명꼴이어서, 그 대가인 추가 검사와 위양성 부담이 얼마인지 함께 따져야 합니다(이 비율 환산과 비용 관점은 리뷰어의 해석입니다). 간경변군 AUC가 0.924로 전체보다 낮았다는 점은, 만성 간질환자를 영상으로 추적하는 일이 많은 국내 환경에서 도입 전에 간경변 추적 환자군을 따로 검증해야 할 이유로 보입니다(국내 적용 맥락은 리뷰어의 해석입니다).

TAKEAWAY

간 CT AI를 실진료 1만여 명에게 추가 판독자로 적용하자 AUC 0.952를 유지하며 놓쳤던 병변 51개(악성 15개)를 찾아 판독문 37건을 바꿨다 — 다만 대조군 없는 시험이라 환자 결과 개선은 아직 증명되지 않았다.

디지털 중재 · 복약순응도 실용적 SMART 무작위배정 시험 2026-08-29

Digital Outreach to Improve Statin Refills in Patients With Low Statin Adherence: The ADHERE-ASCVD Randomized Clinical Trial

Bhatt AS, Liu VX, Sun B, Apostol-Largeteau M, Marafino BJ, Amiri M, Tran DL, Ambrosy AP, …, Solomon SD, Vaduganathan M, Go AS, Ku IA, Manthripragada G, Yee K, Lee K, Khan M. JAMA 2026 (온라인 우선 공개 2026-08-29) · 카이저 퍼머넌트 북부 캘리포니아(미국)·브리검여성병원·코펜하겐대학병원 · 의료체계 내장형 실용적 PROBE 시험, 2단계 SMART 설계, 20,604명(NCT07522645)

스타틴 처방을 받고도 약을 타 가지 않는 환자에게 문자·포털 메시지를 보내자 약 재수령이 늘었고, 반응이 없던 환자에게 한 번 더 보낸 연락도 효과가 있었다 — 연락 수단을 바꾼다고 더 나아지지는 않았다

스타틴을 처방해도 환자가 약을 타 가지 않으면 소용이 없습니다. 복약 불이행은 막을 수 있는 심혈관 사건의 주요 원인이지만, 의료기관이 흔히 보내는 안내 연락은 대부분 한 번 보내고 끝나는 고정된 방식이고 무작위배정 근거도 부족합니다. 카이저 퍼머넌트 북부 캘리포니아(회원 460만 명 이상) 연구진은 죽상경화성 심혈관질환(ASCVD)이 있거나 고위험이면서 최근 스타틴을 제때 타 가지 않은 성인을 대상으로, 진료체계 안에 그대로 녹여 넣은 시험을 설계했습니다. 1단계에서 보안 환자포털 메시지·문자(SMS)·일반 이메일·통상 연락에 1:1:1:1로 배정하고, 14일 안에 반응하지 않은 환자는 2단계에서 같은 수단 반복·다른 수단으로 전환·통상 연락에 다시 무작위 배정했습니다(SMART 설계). 주평가변수는 각 배정 후 14일 이내 스타틴 재수령(refill)률입니다.

대상자는 20,604명(평균 54.8세, 여성 40.9%, 확립된 ASCVD 15.3%)이었습니다. 1단계 디지털 연락은 14일 재수령률을 14.4% 대 12.0%로 높였습니다(보정 위험차 2.3%p, 95% CI 1.3–3.4; 보정 RR 1.20, 1.10–1.30). 처음에 반응하지 않은 환자에게 한 번 더 연락하자 재수령률이 다시 13.0% 대 10.4%로 올랐습니다(보정 위험차 2.5%p, 1.3–3.7; RR 1.25, 1.11–1.39). 그런데 연락 수단을 바꾸는 것은 같은 수단을 반복하는 것보다 낫지 않았습니다(13.2% 대 12.5%, RR 1.06, 0.94–1.17) — 반복이 전환보다 우월했다는 뜻이 아니라 둘 사이에 차이가 확인되지 않았다는 뜻입니다. 28일까지의 누적 재수령률은 디지털 연락을 받은 쪽이 24.9%, 통상 연락이 21.2%였습니다(보정 HR 1.21, 1.13–1.30). 사전에 정한 하위군에서도 결과는 일관됐습니다.

이 시험은 AI가 아니라 의료체계가 보내는 메시지 한 통을 다룬 연구지만, 디지털헬스 중재를 어떻게 검증해야 하는지를 잘 보여줍니다. 기존 진료 흐름 안에서 2만 명을 빠르게 무작위 배정했고, "누구에게 무엇을 몇 번 보낼지"라는 적응형 질문에 SMART 설계로 답했습니다. 효과의 크기는 겸손하게 봐야 합니다. 절대 증가폭 2.3%p는 대략 43명에게 연락해야 1명이 더 약을 타 간다는 뜻이고(리뷰어의 환산), 평가변수는 14일 재수령이지 LDL 콜레스테롤이나 심혈관 사건이 아닙니다. 장기 순응도가 유지되는지도 이 시험으로는 알 수 없습니다. 다만 자동화된 메시지라 한 통당 추가 부담이 작다는 점을 감안하면 인구 단위로는 의미 있는 전략일 수 있습니다(비용은 원문이 측정하지 않았으며, 이 판단은 리뷰어의 해석입니다). 국내에서는 환자포털이 널리 쓰이지 않아 문자나 메신저 알림이 현실적인 수단일 텐데, "수단을 바꿔도 이득이 없었다"는 결과는 채널 선택보다 무응답자에게 빠뜨리지 않고 다시 연락하는 구조에 먼저 공을 들이는 편이 합리적이라는 방향으로 읽힙니다(국내 적용은 리뷰어의 해석입니다).

TAKEAWAY

스타틴을 타 가지 않은 2만여 명에게 디지털 연락을 보내자 14일 재수령률이 12.0%에서 14.4%로 올랐고, 무응답자에게 한 번 더 보낸 연락도 효과가 있었지만 수단을 바꾼다고 추가 이득은 없었다 — 효과는 작지만 의료체계 안에서 바로 돌릴 수 있는 개선이다.

심전도 AI · 심부전 감별진단 다기관 진단정확도 검증 2026-08-28

Electrocardiogram-Based Deep Learning to Prioritize Testing for Transthyretin Amyloid Cardiomyopathy

Croon PM, Batinica B, Dhingra LS, Choi RB, Oikonomou EK, Shankar SV, Sangha V, …, Maurer MS, Ruberg FL, Fontana M, Khera R(교신저자). JAMA 2026 (온라인 우선 공개 2026-08-28) · 예일의대 CarDS Lab(미국)·에라스무스 MC(네덜란드)·컬럼비아대·UCL 국립아밀로이드증센터(영국) 등 · 개발 11,291명(심전도 28,174건, ATTR-CM 293명), 내부검증 44,123명, 다국가 외부 코호트 5개 + 선별 코호트 3개(코호트당 99~3,902명)

트랜스티레틴 심아밀로이드증을 찾아내는 데 종이 심전도 사진 한 장이면 되는가 — 예일 연구팀의 대답은 "확진은 못 하지만 누구를 검사할지는 고를 수 있다"

트랜스티레틴 심아밀로이드증(ATTR-CM)은 치료제가 나온 뒤로 "찾으면 치료할 수 있는 심부전"이 되었지만, 진단은 여전히 늦습니다. 좌심실 비대·저전압·전도장애처럼 흔한 소견 뒤에 숨어 있는 데다, 확진 경로인 심근 방사성핵종 영상(PYP/DPD 스캔)이나 조직검사는 의심해야만 굴러가기 때문입니다. 연구진은 인쇄·스캔된 12유도 심전도 이미지는 물론 원신호로도 작동하는, ATTR-CM 추가 평가 대상을 골라내는 병원 내부에 그대로 설치할 수 있는(locally deployable) AI 모델을 개발했습니다. Yale New Haven Health의 2015년 8월~2023년 6월 심전도로 학습하고 2023년 7월~2025년 7월 구간으로 시간적 검증을 한 뒤, 다국가 외부 코호트 5개와 선별 코호트 3개에서 성능을 확인했습니다.

내부검증(44,123명, 평균 68.5세, 여성 49.7%)에서 AUROC 0.84(95% CI 0.79–0.89), 사전 지정 임계값에서 민감도 0.72 · 특이도 0.86이었습니다. 중요한 것은 "닮은 것들"을 넣은 스트레스 테스트입니다 — 아밀로이드증이 아닌 좌심실비대나 중증 대동맥판협착 환자를 섞었을 때 AUROC 0.81(0.75–0.86), 이미 핵의학 영상에 의뢰된 환자군에서 0.78(0.73–0.84)로, 단순히 "두꺼운 심장"을 읽는 것이 아님을 보였습니다. 외부 코호트 5개에서는 AUROC 0.78~0.89, 선별 코호트에서는 SCAN-MP(고령 흑인·히스패닉 심부전 환자 645명) 0.76(0.68–0.83), CACTUS(수근관 수술 기왕력자) 두 코호트에서 0.79(0.65–0.93)·0.91(0.82–0.97)이었습니다. 탐색적으로 AI 심전도 뒤에 AI 심초음파를 이어 붙이자 양성예측도가 0.24에서 0.66으로 올랐고, 대신 민감도는 0.84에서 0.68로 떨어졌습니다 — 선별의 값을 정직하게 보여주는 맞바꿈입니다.

임상적으로 이 연구의 미덕은 야심을 줄인 데 있습니다. 저자들이 내건 목표는 진단이 아니라 "심초음파와 확진 영상으로 보낼 사람을 앞단에서 고르는 것"이고, 논문도 사용 목적과 보정(calibration)은 전향적 평가가 필요하다고 못 박았습니다. 실제로 민감도 0.72는 셋 중 하나 가까이를 놓친다는 뜻이라, 임상적 의심이 강한 환자를 이 도구가 음성으로 분류했다고 검사를 접어서는 안 됩니다. 심전도 이미지를 입력으로 삼은 설계는 국내 현실과 특히 잘 맞습니다 — 원신호 추출용 장비 연동이나 벤더별 포맷 협상 없이 PACS·EMR에 이미 쌓여 있는 심전도 그림만으로 돌릴 수 있다는 뜻이기 때문입니다. 다만 검증 코호트에 아시아 인구가 포함됐다는 근거는 논문에 제시되지 않았으므로, 국내 도입 전에는 한국인 코호트에서의 재보정이 선행되어야 한다고 보는 것이 안전합니다(이 판단은 원문의 주장이 아니라 리뷰어의 해석입니다).

TAKEAWAY

인쇄된 심전도 사진만으로 ATTR-CM 후보를 걸러내는 AI가 다국가 8개 코호트에서 AUROC 0.76~0.91을 보였다 — 확진이 아니라 "누구를 심초음파·핵의학 영상으로 보낼지"를 앞단에서 정하는 도구로 읽어야 한다.

LLM 임상적용 · 응급의학 전향적 평가(DECIDE-AI 1단계) 2026-08-19

Prospective evaluation of a large language model clinical decision support system in the emergency department

Leibovitch L, Ahituv A, Gorenshtein A, Aran D, Sorka M, Miron K, Shelly S(교신저자). Nature Medicine 2026 (온라인 우선 공개 2026-08-19) · 람밤 의료원(이스라엘 하이파)·테크니온 공대 · 3차 병원 응급실 두 구역을 4주간 병행 운영하며 환자 1,138명을 분석한 전향적 평가(DECIDE-AI 1단계, NCT06902675)

LLM 진료보조의 발목을 잡은 것은 정확도가 아니라 의사들이 그것을 점점 쓰지 않게 됐다는 사실이었다

LLM 기반 임상의사결정지원(CDSS)의 벤치마크 성적은 이미 넘칠 만큼 쌓였지만, 실제 진료 현장에 놓았을 때 무슨 일이 벌어지는지를 전향적으로 관찰한 연구는 드뭅니다. 연구진은 여러 LLM을 결합해 만든 CDSS SHAKED를 3차병원 응급실에 배치하고, DECIDE-AI 1단계(초기 임상 도입 단계의 평가를 위한 국제 보고 기준) 설계로 4주를 관찰했습니다. 응급실을 두 구역으로 나눠 한쪽은 SHAKED를 쓰고 다른 한쪽은 평소대로 근무하게 한 뒤, 환자 1,138명의 경과와 의료진의 사용 행태를 함께 기록했습니다. 물어본 것은 "AI가 맞히는가"가 아니라 "의사들이 쓰는가, 그리고 진료 흐름이 실제로 바뀌는가"였습니다.

안전성과 출력 품질은 좋았습니다 — 이상반응은 관찰되지 않았고, 표본 추출한 출력 100건 중 99건이 전문가 검토에서 임상적으로 적절하다는 평가를 받았습니다. 문제는 사용률이었습니다. 임상 채택률은 4주에 걸쳐 68%에서 30%로 떨어졌고, 근무 시간이 한 시간 길어질수록 사용 확률이 낮아졌습니다(OR 0.72/근무시간, 95% CI 0.62–0.83) — 바쁠수록 안 쓴다는 뜻입니다. 반대로 영상의학과 협진 상황에서는 선호도가 뚜렷했습니다(OR 2.98, 95% CI 1.58–5.63). 결과 지표는 움직이지 않았습니다. 응급실 체류시간은 양쪽 모두 4.9시간(P=0.99)으로 같았고, 치료의향 분석에서 협진 소요시간이 9.4분 짧아지는 경향이 있었으나 통계적으로 유의하지 않았습니다(P=0.077).

저자들의 결론이 인상적입니다 — 임상 AI의 병목은 알고리즘 정확도가 아니라 임상의의 지속적 관여(sustained engagement)일 수 있으며, 이 결과는 무작위 시험 설계에 참고할 자료이지 지금 단계에서 임상 배치를 정당화하지는 않는다고 스스로 못 박았습니다. 4주·단일기관·비무작위 설계이므로 인과를 말할 수 없고, 채택률 하락에는 신기함이 가시는 효과와 업무 부담이 뒤섞여 있어 어느 쪽이 주된 이유인지도 이 자료로는 갈라내기 어렵습니다. 그럼에도 국내에 주는 함의는 분명합니다. 병원마다 LLM 도입 실증이 늘고 있지만 성과 지표는 대개 정확도·만족도에 머물러 있습니다. "도입 후 몇 주가 지났을 때 실제 사용률이 얼마인가"를 처음부터 지표에 넣지 않으면, 잘 만든 도구가 조용히 방치되는 것을 아무도 알아채지 못합니다.

TAKEAWAY

응급실에 넣은 LLM 진료보조는 출력 100건 중 99건이 적절했지만 사용률은 4주 만에 68%에서 30%로 떨어졌고 체류시간은 4.9시간으로 변화가 없었다 — 임상 AI의 성패는 정확도보다 "계속 쓰게 만드는가"에 달려 있다.

대화형 AI · 정신건강 3군 무작위 대조시험 2026-04-01

Efficacy of a Conversational AI Agent for Psychiatric Symptoms and Digital Therapeutic Alliance: A Randomized Clinical Trial

Shoshani A(제1저자), Gurfinkel B, Kor A, Ben-Haim Y, Kanarek O, Segev R, Shafir O, Arbel R. JAMA Network Open 2026;9(4):e266713 · 라이히만대 바루흐 이브체르 심리학부(이스라엘)·히브리대·예일대 · 심리적 고통을 호소한 대학생 995명을 대화형 AI·대면 집단치료·대기자 대조군에 1:1:1 무작위 배정한 12주 시험(3개월 추적, ISRCTN61075527)

대화형 AI가 대면 집단치료보다 불안을 더 낮췄다 — 그리고 그 차이를 설명한 것은 알고리즘이 아니라 "치료적 동맹"이었다

챗봇형 정신건강 개입은 접근성이라는 명분이 뚜렷하지만, 근거의 대부분은 소규모이거나 비교 대상이 무처치·자가학습 자료였습니다. 이 시험은 그 비교를 한 칸 올렸습니다 — 사람이 진행하는 대면 집단치료를 능동 대조군으로 두었기 때문입니다. 2025년 4월 1일부터 10월 27일까지 심리적 고통을 보고한 대학생을 대화형 AI 플랫폼(336명)·대면 집단치료(331명)·대기자 대조군(328명)에 1:1:1로 배정해 12주간 개입하고, 총 995명(평균 23.1세, 여성 50.7%)을 치료의향 원칙으로 분석했습니다. 일차 결과는 불안(GAD-7)·우울(PHQ-9)·외상후스트레스(PCL-5)·웰빙(WHO-5)·삶의 만족도였고, 두 번째 질문은 "디지털 치료적 동맹(digital therapeutic alliance)", 즉 사용자가 AI와 맺었다고 느끼는 관계가 효과를 매개하는가였습니다.

불안에서 AI군이 가장 앞섰습니다 — 대면 집단치료 대비 평균차 −2.17점(95% CI −2.67 ~ −1.67), 대기자 대조군 대비 −2.15점(−2.65 ~ −1.65). 우울은 대조군 대비 −1.99점(−2.63 ~ −1.35)로 유의했고, 집단치료 대비 우울 차이는 초록에 제시되지 않았습니다. 외상후스트레스는 세 군 간 차이가 없었습니다. 웰빙(WHO-5)에서는 AI군이 집단치료보다 5.72점(2.71–8.73), 대조군보다 9.16점(6.14–12.18) 더 개선됐습니다. 구조방정식 모형에서 지각된 치료적 동맹은 참여도와(β=0.31, 0.16–0.43; P<.001), 증상 호전과(β=−0.58, −0.69 ~ −0.46; P<.001) 유의하게 연결돼 있었습니다.

해석은 조심스러워야 합니다. 대상이 대학생이고 진단 기준이 아니라 자가보고 고통으로 등록됐으므로, 이 결과를 정신과 외래 환자에게 그대로 옮길 수 없습니다. GAD-7에서 2점 차이는 통상 알려진 최소 임상적 중요차이(4점 안팎)에 못 미쳐 통계적 유의성과 임상적 의미가 같지 않고(원문 초록은 최소 임상적 중요차이를 언급하지 않으며, 이 비교는 리뷰어의 판단입니다), 개입 특성상 참가자 눈가림이 불가능해 기대 효과가 섞였을 수 있습니다. 무엇보다 대면 집단치료가 열등하게 나온 것을 "AI가 사람보다 낫다"로 읽으면 안 됩니다 — 집단치료는 시간·장소가 고정된 반면 AI는 언제든 접근할 수 있어, 측정된 것은 상당 부분 개입 형식(접근성)의 차이일 수 있습니다(이 지적은 원문의 결론이 아니라 리뷰어의 해석입니다). 국내에서도 불면·우울·공황 영역의 디지털치료기기 허가가 이어지고 있는데, 이 연구가 던지는 실무적 질문은 성능이 아니라 설계입니다 — "사용자가 관계를 느끼게 만드는 요소"를 제품에 얼마나 의도적으로 설계해 넣었는가가 참여도와 결과를 가른다는 뜻이기 때문입니다.

TAKEAWAY

대학생 995명 3군 무작위 시험에서 대화형 AI는 대면 집단치료보다 불안을 2.17점 더 낮췄고 그 효과는 "치료적 동맹" 지각과 강하게 연결돼 있었다 — 다만 대상이 대학생이고 효과 크기가 최소 임상적 중요차이에 못 미쳐, 임상 진료의 대체가 아니라 접근성 보완재로 읽는 것이 맞다.

영상 AI · 유전질환 진단보조 다기관 무작위 대조시험 2026-07-24

AI-based clinician decision support system for diagnosis of inherited retinal diseases: a multicenter, randomized trial

Jia H, Qian B, Qu Y, Wang J, …, Sheng B, Wong TY, Sun X (교신저자 3인, 총 37인). Nature Medicine 2026 (온라인 우선 공개 2026-07-24) · 상하이교통대 상하이제일인민병원·난징항공항천대·베이징 칭화창궁병원 등 · 중국·대한민국·폴란드 환자 1,843명(3,376안)으로 개발·검증한 뒤, 유전성 망막질환 의심자 300명을 1:1 무작위 배정한 대조시험(분석 295명, NCT06839170)

안저사진과 OCT만으로 원인 유전자를 좁혀 주는 AI를 안과 전문의 곁에 두었더니, 유전자 검사 전 예측 정확도가 67%에서 89%로 올랐다

유전성 망막질환(inherited retinal disease, IRD)은 원인 유전자가 수백 개에 달해, 확진까지 정밀 표현형 검사·다학제 판독·차세대염기서열분석(NGS)을 차례로 거쳐야 합니다. 시간과 비용이 크고 전문가가 있는 곳에서만 가능하다는 것이 오랜 병목이었습니다. 연구진은 안저 컬러사진과 빛간섭단층촬영(OCT)을 함께 넣어 17개 유전자 범주를 예측하는 임상의사결정지원 시스템 Retina4IRD를 만들었습니다. 모델은 안과 영상 기반 파운데이션 모델 RETFound로 사전학습한 Vision Transformer이며, 중국·한국·폴란드에서 유전자 확진된 환자 1,843명(3,376안)의 다기관 데이터로 학습·검증했습니다. 핵심 질문은 벤치마크 성능이 아니라 "전문의가 이 도구를 쓰면 실제 판단이 좋아지는가"였고, 그래서 별도의 무작위 대조시험을 붙였습니다.

먼저 모델 자체 성능은 상위 5개 후보 안에 정답 유전자가 들어가는 top-5 정확도 0.904(95% CI 0.896–0.912, 내부검증), 0.856(95% CI 0.850–0.863, 외부검증)이었습니다. 이어 IRD가 의심되는 300명을 전문의 단독군과 전문의 + Retina4IRD 보조군에 1:1 무작위 배정했고, NGS 결과가 확보된 295명(중앙값 33세, 여성 114명 38.6%)을 분석했습니다. 일차 결과인 top-5 유전자 정확도는 보조군 88.5% 대 단독군 67.3%(P<0.001)로 일차 목표를 충족했습니다. 이차 결과도 모두 보조군이 앞섰습니다 — top-1 37.8% 대 22.4%, top-4 81.8% 대 53.1%. 사후분석에서는 후속 진료 결정의 적절성을 점수화한 복합 지표가 37.7점 대 28.5점(P<0.001)으로 보조군에서 유의하게 높았습니다.

주목할 점은 이 연구가 AI를 유전자 검사의 대체재가 아니라 그 앞단의 분류기로 자리매김했다는 것입니다. 확진은 여전히 NGS가 하고, AI는 어느 유전자를 먼저 볼지 좁혀 검사 설계와 상담을 앞당깁니다 — 진단 경로에 AI를 끼워 넣는 방식으로는 현실적입니다. 다만 한계도 분명합니다. 예측 범위가 17개 유전자 범주로 한정돼 그 밖의 희귀 원인은 구조적으로 놓치고, top-1 정확도는 보조군에서도 37.8%에 그쳐 "AI가 짚은 첫 후보"를 그대로 믿을 단계는 아닙니다. 사후분석인 진료 결정 점수는 가설검정이 아니라 탐색적 근거로 읽어야 합니다. 국내 맥락에서는 학습·검증 데이터에 한국 환자가 포함됐다는 점이 실질적입니다(원문은 국가별 성능을 따로 제시하지 않으므로, 한국 데이터에서의 성능을 별도로 단정할 수는 없습니다 — 이 구분은 리뷰어의 지적입니다). 희귀질환 진단 인프라가 소수 3차병원에 몰려 있는 우리 현실에서, 안저·OCT만으로 1차 선별이 가능해지는 방향은 검토할 가치가 있습니다.

TAKEAWAY

안저사진·OCT로 17개 유전자 범주를 예측하는 AI를 전문의에게 붙였더니 유전자 검사 전 top-5 정확도가 67.3%에서 88.5%로 올랐다(무작위 배정 295명 분석, P<0.001) — AI를 확진 도구가 아니라 검사 앞단의 후보 압축 도구로 쓴 설계가 핵심이다.

중재시술 AI · 국내 연구 전향 다기관 진단정확도 검증 2026-08-20

Artificial Intelligence-Driven Angiographic Quantification of Fractional Flow Reserve: Proof-of-Concept Validation Study

Lee SH, Gim DH, Hwang D, Kim HK, …, Yoon HJ, Koo BK, Lee JM (교신저자). Journal of the American Heart Association 2026;e049331 (온라인 우선 공개 2026-08-20) · 전남대병원·삼성서울병원·서울대병원·조선대병원·인제대 일산백병원·계명대 동산병원(저자 소속) · 국내 5개 대학병원에서 전향 등록한 452명 599혈관, 침습 FFR을 기준으로 한 진단정확도 검증 + 2년 예후 추적(Multicenter QFR Registry, NCT03791788)

압력철선 없이 조영영상만으로 FFR을 자동 계산하는 국산 AI가 QFR과 대등한 정확도를 보였고, 2년 예후까지 갈라냈다

관상동맥 협착이 실제로 혈류를 제한하는지 판단하는 표준은 압력철선을 넣어 재는 분획혈류예비력(FFR)입니다. 침습적이고 시간과 약제(아데노신)가 필요해, 조영영상만으로 FFR을 추정하는 영상 기반 FFR이 대안으로 자리 잡아 왔습니다. 대표 격인 QFR은 정확도가 검증돼 있지만 혈관 윤곽 지정과 3차원 재구성에 사람 손이 많이 들어간다는 부담이 남습니다. 이 연구는 그 단계들 — 프레임 선택, 윤곽 검출, 두 조영각도 간 대응점 정합, 3차원 재구성, 혈역학 모델링 — 을 전 과정 자동화한 AI 기반 영상 FFR(medipixel FFR, MPFFR)을 QFR과 정면 비교했습니다. 국내 5개 대학병원에서 임상적 적응증으로 침습 FFR을 시행한 452명 599혈관을 전향 등록했고, 기준은 FFR ≤0.80이었습니다.

자동화의 실효는 시간에서 드러났습니다. MPFFR의 평균 분석시간은 12.5±1.7초였고, 사람이 손을 대야 했던 경우는 599혈관 중 32건(5.3%)에 그쳤습니다. 진단 성능은 QFR과 대등했습니다 — 침습 FFR과의 상관은 MPFFR R=0.885 대 QFR R=0.860으로 오히려 MPFFR이 근소하게 높았고(두 상관계수 비교 P=0.011), FFR ≤0.80 판별 AUC는 0.949 대 0.953으로 차이가 없었습니다(P=0.631). 예후는 중앙값 2년(사분위수 범위 1.6–2.6년) 추적했습니다. MPFFR ≤0.80인 환자는 그렇지 않은 환자보다 2년 표적혈관실패(심장사·표적혈관 심근경색·표적혈관 재관류의 복합)가 4.5% 대 0.8%로 높았고, 보정 위험비 5.94(95% CI 1.27–27.91, P=0.024)였습니다. 표적혈관실패 예측 C-index도 0.770 대 0.753으로 QFR과 비슷했습니다(P=0.469).

국내 독자에게 이 논문의 의미는 두 겹입니다. 첫째, 국산 심혈관 AI의 국내 다기관 전향 검증 결과가 국제 저널에 보고됐다는 사실 자체입니다. 국산 의료 AI의 약한 고리가 늘 "허가는 받았는데 다기관 전향 근거가 얇다"였다는 점을 생각하면, 5개 대학병원·599혈관·2년 추적이라는 설계는 근거 수준을 한 칸 올린 것입니다. 둘째, 12.5초라는 분석시간과 5.3%의 수동 보정률은 도관실 워크플로에 실제로 얹을 수 있는가라는 도입 판단에 직접 쓰이는 숫자입니다. 다만 제목이 밝히듯 이 연구는 개념증명(proof-of-concept) 검증입니다. 예후 분석의 신뢰구간이 1.27–27.91로 대단히 넓은데, 이는 사건 수가 적다는 뜻이며 위험비의 크기를 그대로 받아들여서는 안 된다는 신호입니다(신뢰구간 폭에 대한 이 해석은 리뷰어의 것입니다). 무엇보다 MPFFR을 보고 시술 여부를 정하는 것이 침습 FFR로 정하는 것과 대등한가는 이 설계로는 답할 수 없습니다 — 그 답은 치료 전략을 무작위 배정하는 시험에서만 나옵니다.

TAKEAWAY

국내 5개 대학병원 599혈관에서 전 과정 자동화된 AI 영상 FFR(MPFFR)이 평균 12.5초·수동보정 5.3%로 QFR과 대등한 판별력(AUC 0.949 대 0.953)을 보였고 2년 표적혈관실패도 갈라냈다 — 다만 개념증명 단계이며 치료 전략을 무작위 배정한 검정은 아직 없다.

선별검사 AI · 제품 비교·조달 상용 제품 정면 비교 진단정확도 2026-08-01

Head-to-Head Comparative Evaluation of Four Commercially Available Artificial Intelligence Systems for Detecting Referable Diabetic Retinopathy in a Tanzanian Population

Cleland CR, Bascaran C, Makupa WU, Shilio B, Tufail A, …, Macleod D, Burton MJ. Diabetes Care 2026;49(8):1451–1457 · 런던위생열대의학대학원 국제안보건센터·킬리만자로기독교의료센터(탄자니아)·무어필즈 안병원 · 탄자니아 당뇨망막병증 선별사업의 안저영상 689명분에 상용 AI 4종을 동일 데이터로 비교

상용 당뇨망막병증 AI 4종을 이름을 밝히고 같은 데이터에 돌려 봤다 — 민감도는 83.9~93.7%로 갈렸고, 특이도는 넷 다 70%대에 머물렀다

의료 AI 논문은 대부분 자기 모델 하나의 성능을 보고합니다. 그래서 병원이나 보건당국이 "그래서 어느 제품을 사야 하는가"를 물으면 답할 근거가 없습니다. 특히 상용 제품을 이름을 밝혀 같은 데이터에서 비교한 연구는 드뭅니다 — 기업 동의가 필요하고, 결과가 나쁘게 나온 쪽이 반발할 수 있기 때문입니다. 이 연구는 그 벽을 넘었습니다. 연구진은 스코핑 리뷰와 전문가 자문으로 저자원 환경에 적합한 상용 시스템을 추린 뒤, 참여에 동의한 4종(Medios AI/Remidio, MONA, Ophtai, SELENA+)을 탄자니아 당뇨망막병증 선별사업에서 수집한 동일한 안저영상 데이터셋에 적용했습니다. 일차 결과는 의뢰가 필요한 당뇨망막병증(referable DR) 검출의 민감도·특이도였습니다.

분석 대상 689명 중 379명(55.0%)이 referable DR, 93명(13.5%)이 증식성 당뇨망막병증이었습니다 — 선별 집단치고는 유병률이 매우 높은 데이터셋입니다. referable DR 민감도는 제품별로 83.9%에서 93.7%까지 벌어졌고, 특이도는 70.3%~79.0%로 넷 모두 민감도보다 낮았습니다. 반면 증식성 당뇨망막병증에 대한 민감도는 4종 모두 98%를 넘었습니다 — 시력을 당장 위협하는 중증 병변은 어느 제품이든 거의 놓치지 않았다는 뜻입니다. 조달 관점의 정보도 함께 수집했습니다. 4종 모두 CE 마크를 획득한 의료기기였고, 이 중 Medios AI/Remidio 한 종만 기본 사양에서 오프라인 작동이 가능했습니다. 저자들은 어느 하나를 우월하다고 선언하는 대신, 최소 성능 기준에 대한 합의와 규제 승인·오프라인 작동 같은 구현 요인을 함께 따져야 한다고 결론지었습니다.

이 논문의 값어치는 숫자보다 형식에 있습니다. 제품명을 밝힌 정면 비교는 그동안 학계가 회피해 온 형태이고, 바로 그래서 조달 담당자에게 실제로 쓰입니다. 국내에도 식약처 허가를 받은 안저·영상판독 AI가 여럿이지만, 같은 데이터셋에서 이름을 걸고 비교한 공개 연구는 사실상 없습니다. 상급종합병원과 보건소가 제품을 고를 때 기댈 것이 각 사가 제출한 자체 성능표뿐이라는 뜻입니다 — 국내에서도 이런 형식의 비교 연구가 필요하다는 것이 이 논문을 고른 이유입니다. 다만 해석에는 두 가지 유의가 필요합니다. 첫째, 이 데이터셋의 referable DR 유병률 55.0%는 일반 선별 인구보다 훨씬 높아, 여기서 얻은 민감도·특이도를 국내 검진 세팅의 양성예측도로 그대로 옮길 수 없습니다(유병률 의존성에 관한 이 지적은 리뷰어의 해석이며, 원문은 성능 자체를 저자원 환경 기준으로 제시합니다). 둘째, 참여에 동의한 기업의 제품만 평가됐으므로 시장 전체를 대표하지 않습니다.

TAKEAWAY

상용 당뇨망막병증 AI 4종을 이름을 밝혀 동일 데이터(689명, referable DR 55.0%)에 돌리니 민감도 83.9~93.7%·특이도 70.3~79.0%로 갈렸고 증식성 병변 민감도만 모두 98% 이상이었다 — 국내에도 제품명을 건 정면 비교 연구가 필요하다.

생성형 AI · 임상의사결정지원 실용적 군집 무작위 시험 2026-06-26

Generative AI-enabled clinical decision support system in primary care: a pragmatic, cluster-randomized trial

Agweyu A, Mwaniki P, Menon V, Korom R, …, Liu X, Mateen BA. Nature Medicine 2026;32(8):3032–3039 · 케냐의학연구소–웰컴트러스트 연구프로그램·버밍엄대학교·Penda Health·PATH · 케냐 1차의료기관 16곳 실용적 군집 무작위 시험, 환자 9,691명 등록·일차 결과 분석 9,347명, 임상관 103명

LLM 진료 보조는 안전했지만 14일 치료 실패를 유의하게 줄이지는 못했다 — 생성형 AI 의사결정지원의 첫 대규모 무작위 검정

지금까지 대형언어모델(LLM)의 임상 능력은 대부분 시험문항·가상증례·후향 기록을 대상으로 한 벤치마크로 평가돼 왔습니다. 실제 외래에서 의료진이 LLM을 곁에 두고 진료할 때 환자에게 돌아가는 결과가 달라지는가는 사실상 검정된 적이 없었습니다. 이 시험은 케냐의 민간 1차의료 네트워크(Penda Health) 16개 시설을 대상으로, 임상관(clinical officer)을 전자의무기록만 쓰는 군과 전자의무기록 + LLM 보조를 쓰는 군에 군집 무작위 배정했습니다. 일차 결과는 등록 후 14일 이내 발생한 치료 실패 사건의 복합 지표로, 전문가 패널이 눈가림 상태에서 판정했습니다.

2025년 4월 22일부터 7월 16일까지 환자 9,691명이 등록됐고 임상관 103명(중재군 52명, 대조군 51명)이 참여했습니다. 일차 결과가 분석된 인원은 두 군 합계 9,347명으로 등록 인원보다 344명 적으며, 초록만으로는 그 사유가 명시되지 않습니다. 치료 실패는 중재군 102/4,693명(2.2%), 대조군 94/4,654명(2.0%)으로, 보정 교차비 0.77(95% CI 0.55–1.08, P=0.13) — 통계적으로 유의한 차이가 없었습니다. 안전성 측면에서는 중재와 관련된 것으로 판정된 중대 이상반응이 없었고, 독립 검토에서도 안전성 신호는 확인되지 않았습니다. 저자들은 이득이 존재하더라도 그 크기는 크지 않을 것(probably modest)이라고 결론지었습니다.

임상의 입장에서 이 결과는 두 가지로 읽힙니다. 첫째, 점 추정치(OR 0.77)는 이득 방향이고 신뢰구간 상한이 1.08에 머무른다는 점에서 "효과 없음"보다 "이 표본으로는 판별되지 않음"에 가깝습니다. 일차 결과 발생률이 2% 수준으로 낮아 검정력이 제한됐을 가능성이 큽니다(원문이 명시한 해석은 여기까지이며, 검정력에 대한 이 이상의 추론은 리뷰어의 해석입니다). 둘째, 그럼에도 "안전했다"는 결과 자체가 이 분야에서는 새로운 정보입니다. 지금까지 LLM 임상 적용을 막아온 가장 큰 우려가 환각과 그로 인한 위해였기 때문입니다. 다만 이 시험의 무대는 자원이 제한된 케냐 1차의료이고 사용자는 의사가 아닌 임상관입니다. 기저 진료 수준이 다른 국내 상급종합병원이나 개원가로 결과를 그대로 옮기는 것은 무리이며, 오히려 국내에서 생성형 AI 진료보조를 도입한다면 어떤 결과 지표로, 어떤 진료 세팅에서 검정할 것인지를 설계 단계에서 정해야 한다는 점을 일깨웁니다.

TAKEAWAY

케냐 1차의료 16개 시설에 9,691명을 등록한 군집 무작위 시험(일차 결과 분석 9,347명)에서 LLM 진료보조는 14일 치료 실패를 유의하게 줄이지 못했으나(2.2% 대 2.0%, 보정 OR 0.77, 95% CI 0.55–1.08) 안전성 신호도 없었다 — 생성형 AI 임상 적용은 이제 벤치마크가 아니라 무작위 시험의 검정 대상이 됐다.

의료 AI 근거지형 · 순환기 체계적 문헌고찰·메타분석 2026-05-06

Impact of artificial intelligence on cardiovascular workflow, engagement, and outcomes: a systematic review

Lin YE, Yang SM, Huang CJ, Tsai YW, Cheng HM, Lee WC, Wang SJ. npj Digital Medicine 2026;9(1):536 · 타이베이 재향군인총병원(Taipei Veterans General Hospital) AI Impact Research Center·국립양명교통대학교 · 무작위 대조시험 32편에 대한 체계적 문헌고찰(27편 메타분석), 검색 종료 2026-01-16

심혈관 AI의 무작위 근거를 NICE 3단계로 정리하니 업무효율·환자참여·사망률 모두에서 이득이 확인됐다

의료 AI 논문은 넘치지만 "그래서 환자 결과가 좋아지는가"에 답하는 무작위 근거는 흩어져 있습니다. 이 리뷰는 규칙기반 시스템을 배제하고 기계학습·딥러닝 기반 중재를 전향적으로 적용한 무작위 대조시험만 골라, 종말점을 NICE 근거 등급 체계에 따라 세 층으로 분류했습니다 — Tier A 업무 효율, Tier B 환자 참여·건강증진, Tier C 임상 결과. PubMed·Embase·CINAHL과 시험등록부를 2026년 1월 16일까지 검색했고, 비뚤림은 RoB 2.0으로 평가했습니다. 근거를 "성능"이 아니라 "어느 층위의 이득인가"로 재배열한 것이 이 논문의 설계상 기여입니다.

최종 32편의 무작위 대조시험(그중 27편 메타분석)에서 세 층 모두 이득이 관찰됐습니다. Tier A: 업무 소요시간이 줄었고(SMD −0.71; 95% CI −1.04 ~ −0.39), 이는 진단 시간 30–120초 단축과 재원기간을 보고한 시험에서 1.0–4.2일 감소에 해당했습니다. Tier B: 행동 넛지가 복약순응도를 높였습니다(RR 1.59; 95% CI 1.01–2.50; NNT 12). Tier C: 의사결정지원 형태로 구현된 경우 전체 사망률이 감소했습니다(RR 0.84; 95% CI 0.75–0.94; I²=8%; NNT 32). 저자들이 명시한 한계는 눈가림의 제약과 sham-AI 대조군의 부재입니다.

Tier C의 사망률 감소는 눈에 띄는 숫자지만 해석에는 절제가 필요합니다. 이질성이 낮다는 것(I²=8%)은 결과가 일관됐다는 뜻이지 비뚤림이 없다는 뜻이 아니며, AI 자체가 아니라 "AI가 촉발한 진료 프로세스 변경"이 효과의 주체일 수 있습니다. 실제로 저자들도 이득이 "실행 가능한 의사결정지원과 결합됐을 때" 나타난다고 조건을 붙였습니다. sham-AI 대조군이 없다는 지적은 국내 임상시험 설계에도 그대로 적용됩니다 — 알고리즘을 보여주는 것만으로 술자의 주의가 달라진다면 그 효과는 알고리즘의 성능이 아니라 개입의 존재에서 나옵니다. 국내에서 심전도·관상동맥 영상 AI가 잇달아 허가·도입되는 지금, 수가 논의의 근거로 요구되는 것은 정확도 지표가 아니라 이 Tier A–C 중 어느 층의 결과인지라는 프레임은 그대로 활용할 만합니다.

TAKEAWAY

심혈관 AI 무작위 시험 32편을 NICE 3단계로 정리하니 업무시간 단축(SMD −0.71), 복약순응도 개선(RR 1.59), 그리고 의사결정지원 구현 시 전체 사망률 감소(RR 0.84, NNT 32)까지 확인됐다 — 다만 눈가림 제약과 sham-AI 대조군 부재가 공통된 약점이다.

디지털치료기기 · 국내 연구 횡단 설문 · 구조방정식 2026-08-05

Understanding hesitancy and decision postponement toward digital therapeutics for Insomnia: Roles of objective ambivalence and digital health literacy

Choi S, Zo H. International Journal of Medical Informatics 2026;220:106647 · KAIST 기술경영전문대학원·한국전자통신연구원(ETRI) · 온라인 패널 성인 500명 대상 횡단 설문(이해도 검증 통과 367명 분석), PLS-SEM

불면증 디지털치료기기에 대한 한국인의 주저는 거부보다 "미루기"와 더 강하게 연관돼 있었다

국내는 불면증 디지털치료기기(솜즈·슬립큐)를 세계에서 손꼽히게 이른 시기에 허가한 나라지만, 실제 처방과 사용은 기대에 못 미칩니다. 지금까지의 설명은 대체로 수가와 접근성이었습니다. 이 연구는 다른 각도에서 출발합니다 — 환자 쪽의 "주저(hesitancy)"를 거부와 구분되는 독립적 상태로 개념화하고, 백신 주저 연구와 태도 양가성 이론을 빌려와 그것이 어디서 오는지를 검정했습니다. 핵심 가설은 객관적 양가성(강한 긍정 평가와 강한 부정 평가가 동시에 존재하는 상태)이 주저와 연관되고, 그 주저가 낮은 사용 의도뿐 아니라 결정을 미루려는 의도와도 연관된다는 것입니다.

온라인 패널로 모집한 한국 성인 500명에게 처방형 불면증 DTx에 대한 표준화된 설명을 제시한 뒤, 이해도 확인 문항 두 개를 모두 맞힌 367명을 분석했습니다(PLS-SEM). 객관적 양가성은 DTx 주저와 양의 관련(β=0.279, p<0.001)을 보였고, 주저는 사용 의도와 음의 관련(β=−0.218, p<0.001)인 동시에 연기 의도와는 더 강한 양의 관련(β=0.427, p<0.001)을 나타냈습니다. 즉 주저 점수가 높은 응답자에서 나타난 것은 "안 쓰겠다"보다 "나중에 결정하겠다" 쪽이었습니다(모두 횡단 자료의 관련성이며 인과가 아닙니다). 디지털 헬스 리터러시(DHL)가 높을수록 주저가 사용 의도를 깎아내리는 정도와 연기로 이어지는 정도가 모두 약해졌고, 반대로 손익 계산 성향(calculation orientation)이 높을수록 주저–사용의도의 음의 관련은 더 강해졌습니다.

진료실에서 겪는 장면과 잘 들어맞는 결과입니다. 불면증 DTx를 권했을 때 환자가 대놓고 거절하는 일은 드물고 대개 "생각해 보겠다"로 끝나는데, 이 연구는 그 반응이 소극적 거절이 아니라 측정 가능한 별개의 심리 상태임을 보여줍니다. 실무적 함의는 분명합니다 — 효능 근거를 더 쌓는 것만으로는 이 지점을 넘지 못하며, 양가성을 줄이는 설명(무엇이 좋아지고 무엇은 안 되는지, 약물과의 관계, 중단 기준)과 리터러시를 고려한 안내가 처방 절차 안에 들어가야 합니다. 다만 이 연구는 실제 처방 경험자가 아니라 설명문을 읽은 일반 성인의 사전 채택 단계 의도를 본 횡단 설문이므로 인과를 말할 수 없고, 실제 처방·사용률로 이어지는지는 별도 검증이 필요합니다.

TAKEAWAY

한국 성인 367명 횡단 설문에서 불면증 DTx에 대한 양가성은 주저와 양의 관련(β=0.279)을 보였고, 주저는 사용 의도 감소(β=−0.218)보다 결정 연기 의도(β=0.427)와 더 강하게 관련됐다 — 인과는 검정되지 않았지만, 국내 DTx 확산을 볼 때 "거부"만이 아니라 "미루기"를 함께 측정해야 함을 시사한다.

내시경 AI · 암 감시 다기관 무작위 우월성 시험 2026-07-16

Artificial intelligence-assisted detection and optical differentiation of colorectal lesions in Lynch syndrome surveillance (CADLY2): a multicentre, open-label, randomised controlled superiority trial

Hüneburg R, van Bokhorst QNE, Pellisé M, Balaguer F, …, Dekker E, Nattermann J. The Lancet Gastroenterology & Hepatology 2026 (온라인 선공개) · 본대학병원 유전성종양센터 등 벨기에·독일·네덜란드·스페인 9개 전문센터 · 공개표지 무작위 우월성 시험, 757명 무작위 배정(전체분석군 733명)

일반 대장내시경에서 검증된 AI 병변 검출이 린치증후군 감시 내시경에서는 선종 발견율을 올리지 못했다

AI 기반 실시간 병변 검출(CADe)은 평균위험군 대장암 검진에서 선종발견율(ADR)을 높인다는 근거가 비교적 두텁게 쌓인 분야입니다. 그러나 린치증후군처럼 평평하고 작은 선종이 많고 이미 숙련된 내시경의가 짧은 간격으로 감시하는 집단에서도 같은 이득이 재현되는지는 자료가 드물고 일관되지 않았습니다. CADLY2는 유전자 검사로 확진된 린치증후군 성인을 고화질 백색광(HD-WL) 단독군과 HD-WL + CAD EYE(Fujifilm) 보조군에 1:1로 배정해, AI 보조가 ADR을 실제로 끌어올리는지를 검정한 국제 다기관 우월성 시험입니다. 부차적으로 병변 발견 후 종양성·비종양성을 실시간 감별하는 CADx 성능도 평가했습니다.

2023년 5월 9일부터 2025년 10월 30일까지 757명이 무작위 배정됐고 733명이 전체분석군에 포함됐습니다(HD-WL 369명, AI 보조 364명; 중앙연령 49세와 50세). 일차 결과인 ADR은 HD-WL 30.9%(114/369) 대 AI 보조 33.8%(123/364), 교차비 1.14(95% CI 0.83–1.57), p=0.41로 사전에 가정한 절대 개선폭을 보이지 못했습니다. CADx의 종양성 병변 감별 성능은 병리 판독을 기준으로 민감도 85.9%(95% CI 82.0–89.1), 특이도 91.4%(89.4–93.0)였으나, 전문가의 육안 광학진단을 뚜렷이 넘어서지는 못했습니다. 이상반응은 AI군에서 3건(경미한 용종절제 후 출혈 2건, 시술과 무관한 폐색전증/심부정맥혈전증 1건)이었고 HD-WL군은 없었습니다.

이 시험이 던지는 메시지는 AI 내시경이 쓸모없다는 것이 아니라 "어디서 검증됐는가"가 곧 "어디서 쓸 수 있는가"는 아니라는 것입니다. 평균위험군 검진에서 얻은 효과 크기는 기저 발견율이 이미 높고 술자 숙련도가 균질한 전문 감시 환경에서는 희석됩니다. 공개표지 설계라 대조군 내시경의가 더 꼼꼼해지는 호손 효과를 배제하기 어렵고, 사전 표본수 산출이 가정한 절대 개선폭이 컸다면 검정력 부족일 가능성도 남습니다(관찰된 신뢰구간은 임상적으로 의미 있는 이득도 배제하지 못합니다). 국내에서도 내시경 AI가 식약처 허가와 병원 도입 단계에 들어서 있는데, 검진센터에서 얻은 성능을 고위험 감시나 상급종합병원 전문의 진료로 그대로 옮겨 적기 어렵다는 점은 도입 근거를 어느 집단에서 만들 것인지를 미리 정해야 한다는 뜻이기도 합니다.

TAKEAWAY

린치증후군 감시 내시경 733명 무작위 시험에서 AI 보조는 선종발견율을 30.9%→33.8%(OR 1.14, p=0.41)로 유의하게 높이지 못했다 — 평균위험군 검진에서 검증된 AI 이득은 숙련자·고위험 감시 환경으로 자동 이전되지 않는다.

디지털치료기기 · 국내 연구 공개표지 무작위대조시험 2026-07-09

Efficacy and safety of a mobile app-based, flexible-schedule digital therapeutic intervention versus psychoeducation for panic disorder: An open-label randomized controlled trial

Kang DH, Hwang H, Kim DS, Kim H, Kwak S, Kim C, Choi SH. Internet Interventions 2026;45:100977 · 원광대 산본병원·중앙대 의대·서울대병원 정신건강의학과 · 공개표지 무작위대조시험, 52명(각군 26명), CRIS KCT0009912

공황장애 앱 기반 디지털치료기기가 심리교육 대조군보다 임상의 평가 공황 중증도를 더 낮췄다 — 다만 자기보고 지표에서는 차이가 없었다

공황장애의 표준 치료인 인지행동치료(CBT)는 효과가 확립돼 있지만 치료자 수와 접근성이 병목입니다. 디지털치료기기(DTx)는 이 병목을 푸는 수단으로 기대를 받아왔는데, 기존 시험 상당수가 대기자 명단이나 무처치를 대조군으로 삼아 "아무것도 안 하는 것보다 낫다"는 수준의 근거에 머물렀습니다. 이 연구는 구조화된 심리교육이라는 능동 대조군을 세우고, 알고리즘 기반 개인화와 유연한 일정 조절이 가능한 앱 기반 CBT 프로그램을 8~12주간 치료자 가이드와 함께 제공해 우월성을 검정했습니다(대조군은 12주간 격주 구조화 심리교육). 일차 결과는 임상의가 평가하는 공황장애 중증도 척도(PDSS)의 기저 대비 변화였습니다.

공황장애 환자 52명이 각 군 26명으로 무작위 배정됐습니다. 반복측정 혼합효과모형에서 DTx군의 PDSS 개선이 유의하게 컸고(최소제곱 평균차 −3.71, p=0.02), 치료 후 임상총괄인상-호전도(CGI-I)에서도 DTx군이 우세했습니다(t(39) = −2.78, p=0.008). DTx 배정군의 완료율은 80.8%(26명 중 21명), 평균 앱 사용시간은 주당 47.9분(±39.8)이었습니다. 반면 자기보고 척도들에서는 군간 차이가 관찰되지 않았고(양 군 모두 시간에 따른 군내 호전은 있었음), 중대한 이상반응은 없었습니다.

임상의 평가와 자기보고가 갈린 점이 이 시험의 핵심 해석 지점입니다. 공개표지 설계에서 평가자가 배정을 아는 상태로 매긴 척도가 유일하게 유의했다는 것은 기대 편향을 배제하기 어렵다는 뜻이고, 저자들도 신중한 해석을 요구합니다. 표본 52명은 이차 지표를 판정하기에 부족하고, 치료자 가이드가 함께 제공됐으므로 순수한 앱 단독 효과와는 구분해서 읽어야 합니다. 그럼에도 국내 맥락에서 의미가 작지 않습니다. 우리나라는 불면증·알코올사용장애·경도인지장애 등에서 DTx 허가가 이어졌지만 임시등재 이후의 실제 처방과 급여 근거는 여전히 얇고, 규제기관과 심평원이 요구하는 것은 바로 능동 대조군을 둔 국내 환자 대상 무작위 근거입니다. 이 연구는 그 형식을 갖춘 국내 시험이라는 점에서 규모의 한계와 별개로 참고 가치가 있습니다. (초록에는 제품명이 표기돼 있지 않아 특정 제품으로 특정하지 않았습니다.)

TAKEAWAY

국내 공황장애 환자 52명 무작위 시험에서 앱 기반 DTx는 심리교육 대조군보다 임상의 평가 PDSS를 3.71점 더 낮췄지만 자기보고 지표에서는 차이가 없었다 — 능동 대조군을 둔 국내 근거라는 점이 값지고, 공개표지·소표본이라는 점이 한계다.

원격의료 · 약물 최적화 다기관 무작위대조시험 2026-03-25

Remote digital intervention targeting heart failure medical therapy: a randomized controlled trial

DeVore AD, Green CL, Albert NM, Haghighat AR, …, Khan MS, Sauer AJ. Lancet Regional Health – Americas 2026;58:101457 · 듀크임상연구소·클리블랜드클리닉 등 미국 7개 기관 · 다기관 공개표지 무작위대조시험(VITAL-HF), 178명(중재 90 / 통상진료 88)

진료실 밖 비동기 원격 디지털 플랫폼이 심부전 약물 적정화 점수를 6개월에 0.78점 더 올렸다

박출률 감소 심부전(HFrEF)의 예후 개선 약제는 이미 네 계열이 확립돼 있지만, 실제 진료에서 목표 용량까지 올라가는 환자는 소수입니다. 병목은 근거가 아니라 적정화에 필요한 잦은 외래 방문과 활력징후·검사 확인입니다. VITAL-HF는 이 과정을 진료실 밖으로 옮겨, 셀룰러 연결 혈압계와 체중계로 매일 측정한 값과 증상 보고를 담당의에게 전송하고 개인화된 치료 권고와 건강코치 지원을 얹은 비동기 디지털 플랫폼이 약물 적정화를 실제로 앞당기는지 검정했습니다. 일차 결과는 HF Collaboratory가 개발한 심부전 약물치료 점수(0~12점)의 변화입니다.

미국 7개 기관에서 178명이 1:1 배정됐습니다(중앙연령 66.4세, 여성 39%, 흑인 17%, 중앙 좌심실 박출률 26%). 기저 약물은 베타차단제 84.8%, ARNI 48.9%, MRA 48.9%, SGLT2 억제제 47.2%였습니다. 6개월 시점에 약물치료 점수는 중재군에서 5.2±1.9 → 7.2±2.0(평균 변화 2.0±2.4), 통상진료군에서 4.8±2.5 → 6.3±2.1(평균 변화 1.4±2.2)로, 최소제곱 평균차 0.78점(95% CI 0.21–1.34, p=0.007)이었습니다. 안전성 관련 사건은 디지털군 4건, 통상진료군 7건으로 원격 적정화가 고칼륨혈증 등의 위험을 늘리지 않았습니다.

해석에서 과장하지 말아야 할 부분은 일차 결과가 대리지표라는 점입니다. 0.78점 차이는 사망·재입원 감소가 아니라 "권고 약제를 얼마나 올렸는가"의 차이이고, 178명·6개월 설계는 임상 사건을 볼 규모가 아닙니다. 다만 적정화 점수가 예후와 연결된다는 기존 근거를 감안하면, 원격 플랫폼이 안전하게 그리고 진료실 없이 적정화를 앞당길 수 있다는 것을 무작위로 보인 첫 축에 드는 자료입니다. 국내로 옮기면 걸림돌은 기술이 아니라 제도입니다. 비대면 진료가 아직 시범사업 틀 안에 있고 원격 모니터링·비동기 처방 조정에 붙는 수가가 제한적이어서, 같은 개입을 하려면 누가 매일 들어오는 혈압·체중을 보고 누가 그 시간에 대해 보상받는지를 먼저 정해야 합니다. 후원사(Story Health)가 플랫폼 제공자라는 점도 함께 읽을 대목입니다.

TAKEAWAY

HFrEF 178명 무작위 시험에서 비동기 원격 디지털 플랫폼은 6개월 약물치료 점수를 0.78점(95% CI 0.21–1.34) 더 높였고 안전성 신호는 없었다 — 임상 사건이 아니라 적정화 대리지표를 개선한 결과다.

생성형 AI · 진료기록 후향적 단면 관찰연구 2026-06-11

Medical Scribe and Ambient Artificial Intelligence Impact on Emergency Physician Documentation Burden and Clinical Productivity

Dutta S, You JG, Dunham L, Cash R, Meeker M, White BA, Joseph JW. Annals of Emergency Medicine 2026 (온라인 선공개) · 매사추세츠종합병원·Mass General Brigham Digital·하버드의대 · 4개 병원 응급실 후향적 단면 관찰연구, 198,178건

앰비언트 AI 서기는 응급의학과 의사의 기록 시간을 노트당 1.6분 줄였다 — 사람 서기의 절반, 생산성 변화는 없었다

진료기록 작성 부담은 의사 번아웃의 대표적 원인으로 꼽힙니다. 사람 서기(medical scribe)를 붙이면 부담이 줄어든다는 근거는 오래전부터 있었지만 비용과 인력 수급이 걸림돌이었고, 그 자리를 대신하겠다고 등장한 것이 진료 대화를 자동으로 노트로 바꾸는 앰비언트 AI 서기입니다. 다만 지금까지의 근거는 대부분 파일럿 규모의 만족도 설문이었고, "실제 기록 시간이 얼마나 줄고 진료량은 어떻게 되는가"를 대규모 실사용 데이터로 비교한 연구는 드물었습니다. 이 연구는 2025년 1월부터 9월까지 한 통합의료체계 산하 4개 병원 응급실 진료 건을 앰비언트 AI 서기·사람 서기·서기 없음 세 군으로 나눠 비교했습니다.

전체 198,178건 중 앰비언트 AI 서기 사용은 8,489건(4.3%), 사람 서기 15,947건(8.0%), 서기 없음 173,742건(87.7%)이었습니다(환자 중앙연령 49세, IQR 30–68세, 여성 53.1%). 의사 단위로 군집화한 중앙값 분위회귀 결과, 서기 없음 대비 앰비언트 AI 서기는 노트당 보정 기록시간 중앙값을 1.6분 단축(95% CI 0.3–2.9)했고 사람 서기는 3.3분 단축(95% CI 2.3–4.3)했습니다. 반면 근무 시간당 총 wRVU로 측정한 임상 생산성은 세 군 간 차이가 없었습니다.

시간은 줄었지만 그 시간이 더 많은 환자를 보는 데 쓰이지는 않았다는 것이 이 연구의 핵심입니다. 앰비언트 AI의 가치를 "생산성 향상"으로 홍보하는 논법은 이 데이터로는 뒷받침되지 않으며, 오히려 번아웃 완화·기록 품질 같은 다른 축에서 편익을 찾아야 한다는 뜻입니다. 효과 크기가 사람 서기의 절반에 그친 점, 사용률이 4.3%에 불과해 얼리어답터 편향이 남아 있는 점, 후향적 관찰연구라 도입 여부가 무작위가 아닌 점은 명확한 한계입니다. 국내에서도 주요 상급종합병원과 의료 AI 기업들이 음성인식 기반 진료기록 보조를 잇달아 내놓고 있는데, 한국어 의무기록·짧은 진료시간·상이한 수가 구조에서는 절대 이득의 크기가 달라질 수밖에 없습니다. 도입 효과는 "몇 분 줄었나"만이 아니라 "그 시간이 어디로 갔나"까지 같이 측정해야 합니다.

TAKEAWAY

응급실 19만여 건 실사용 데이터에서 앰비언트 AI 서기는 노트당 1.6분(사람 서기 3.3분)을 줄였지만 시간당 진료 생산성은 바뀌지 않았다 — 기록 부담 완화 도구이지 진료량 증대 도구가 아니다.

예측모델 · EHR 통합 무작위대조시험 2026-05-14

Randomized trial of electronic health record implemented AI risk prediction in kidney transplant care

Osmanodja B, Spencker JJ, Ömeroğlu ÖE, Sassi Z, Roller R, …, Budde K, Herrmann A. npj Digital Medicine 2026;9(1) · 샤리테 베를린 의대·독일인공지능연구센터(DFKI)·레겐스부르크대학교 · 단일기관 무작위대조시험, 신장이식 수혜자 76명(NCT0605651)

위험예측 AI를 전자의무기록에 띄워두기만 해서는 진료 대화도 공유의사결정도 달라지지 않았다

AI 위험예측 모델은 이미 여러 병원의 전자의무기록(EHR)에 들어가 있지만, 그것이 실제 의사–환자 소통과 공유의사결정(shared decision-making, SDM)을 바꾸는지에 대한 무작위 근거는 사실상 없었습니다. PRIMA-AI 시험은 추정사구체여과율 30 mL/min/1.73 m² 미만인 신장이식 수혜자 76명을 1:1로 무작위 배정해, 한쪽에는 통상진료만, 다른 쪽에는 통상진료에 더해 1년 내 이식신 소실 위험을 예측하는 머신러닝 모델을 EHR에 통합해 제공했습니다. 일차 종료점은 12개월간 "이식신 소실 이후의 치료 선택지에 대해 대화를 나눴다"고 환자가 보고한 비율이었습니다.

결과는 중재군 14/36명(39%) 대 대조군 16/40명(40%), p=1.00으로 차이가 없었습니다. 이차 종료점인 임상 결과, 공유의사결정 관련 지표, 의사–환자 관계, 심리적 고통 어느 것에서도 유의한 군간 차이가 관찰되지 않았습니다. 연구 종료 후 수집한 사용자 피드백에서는 도구 사용률 자체가 낮고 편차가 컸으며 진료 흐름에 끼어들지 못했다는 점이 반복적으로 지적됐습니다. 저자들의 결론은 명료합니다 — EHR에 위험값을 수동적으로 띄워두는 방식(passive availability)만으로는 소통 결과가 개선되지 않는다는 것입니다.

이 연구는 76명 단일기관 시험이라 임상 종료점을 볼 검정력이 없고, 일차 종료점이 환자 자가보고 대화 빈도라는 점에서 해석 범위가 좁습니다. 그럼에도 의미가 큰 이유는, 무작위 설계에서 효과가 나타나지 않았고 그 주된 설명으로 모델 성능이 아니라 워크플로 통합의 실패가 제시됐다는 점입니다. AUC를 올리는 경쟁과 임상에서 실제로 무언가를 바꾸는 일은 별개의 문제이며, 후자는 "언제·누구에게·어떤 행동을 촉발하도록" 설계했는지에 달려 있습니다. 국내에서도 패혈증 조기경보, 심정지 예측, 재입원 위험 같은 예측모델이 여러 병원 EHR에 탑재돼 있지만 도입 이후의 행동 변화와 결과를 검증한 국내 무작위 연구는 여전히 드뭅니다. 혁신의료기기 지정이나 수가 논의에서도 "예측 정확도"만이 아니라 "그 예측이 촉발한 행동"에 대한 근거를 요구할 시점입니다.

TAKEAWAY

EHR에 통합된 AI 위험예측은 대화 빈도(39% 대 40%, p=1.00)를 포함해 어떤 소통 지표도 바꾸지 못했다 — 예측모델의 임상 가치는 성능이 아니라 워크플로 설계에서 갈린다.

국내 연구 · 예측모델 코호트 기반 개발·외부검증 2026-08-07

Machine learning-assisted prediction of 5-year mortality in chronic kidney disease: the KoreaN cohort study for Outcome in patients With Chronic Kidney Disease (KNOW-CKD)

Suh SH, Choi HS, Kim CS, Lee S, Bae EH, Ma SK, Park SK, Oh KH, Kim SW. Kidney Research and Clinical Practice 2026 (온라인 선공개) · 전남대학교 의과대학·서울대학교 의과대학 등 국내 다기관 · 전향 코호트 1,858명(사망 94건) 기반 개발, 독립 코호트 348명 외부검증

혈액검사 다섯 가지로 만성콩팥병 5년 사망 위험을 가려내고, 그 근거를 SHAP으로 열어 보인 국내 코호트 연구

투석을 시작하지 않은 만성콩팥병(CKD) 환자의 사망 위험을 예측하는 모델은 임상적 필요에 비해 부족했습니다. 머신러닝은 정확도를 높일 여지를 주지만 "왜 그렇게 예측했는지 알 수 없다"는 블랙박스 문제가 임상 도입을 막아 왔습니다. 이 연구는 국내 대표 CKD 전향 코호트인 KNOW-CKD의 비투석 환자 1,858명(사망 94건)을 대상으로 5년 전체원인 사망을 예측하는 해석 가능한 머신러닝 모델을 개발하고, 웹 기반 위험층화 도구로 배포하는 것까지 목표로 삼았습니다.

CatBoost를 포함한 여러 알고리즘을 기존 로지스틱 회귀와 비교한 결과, CatBoost 모델의 AUC는 0.813(95% CI 0.737–0.888)으로 로지스틱 회귀의 0.747(95% CI 0.655–0.840)보다 유의하게 높았습니다(p=0.04). SHAP 분석으로 상위 5개 변수 — 연령·추정사구체여과율·혈청 알부민·요 단백/크레아티닌 비·혈청 총칼슘 — 만 남긴 간소화 모델도 독립 코호트 348명 외부검증에서 AUC 0.795를 유지했습니다. 특히 SHAP 시각화에서 혈청 칼슘이 U자형 관계를 보여, 그동안 충분히 주목받지 못한 저칼슘혈증이 사망 위험 예측에 기여하는 신호로 드러난 점이 눈에 띕니다.

사건 수가 94건이라 변수당 사건 수 기준으로는 여유가 크지 않고, 외부검증 코호트도 348명 규모여서 신뢰구간이 넓습니다. 보정(calibration)과 임상적 유용성(decision curve) 지표가 판별력만큼 강조되지 않은 점, 전향적 실사용 검증이 아직 남아 있는 점도 감안해야 합니다. 그럼에도 국내 다기관 전향 코호트에서 개발해 독립 코호트로 외부검증하고, 어디서나 뽑는 다섯 가지 값만으로 성능을 유지했다는 점은 실용성 면에서 분명한 강점입니다. 해외 데이터로 학습된 모델을 국내에 그대로 가져다 쓰는 관행의 대안으로서, 국내 코호트 자산을 예측모델로 전환한 사례라는 의미도 있습니다. SHAP이 만들어낸 저칼슘혈증 가설처럼, 예측모델이 새로운 임상 질문을 되돌려주는 방식도 함께 볼 만합니다.

TAKEAWAY

KNOW-CKD 코호트 기반 CatBoost 모델이 비투석 CKD 환자의 5년 사망을 AUC 0.813으로 예측했고, 변수 5개로 줄인 간소화 모델도 외부검증에서 AUC 0.795를 유지했다 — 국내 코호트로 만든, 설명 가능한 예측모델의 실용 사례.

영상진단 AI · 유방검진 무작위대조 비열등성 시험 2026-01-31

Interval cancer, sensitivity, and specificity comparing AI-supported mammography screening with standard double reading without AI in the MASAI study: a randomised, controlled, non-inferiority, single-blinded, population-based, screening-accuracy trial

Gommers J, Hernström V, Josefsson V, …, Lång K. Lancet 2026;407(10527):505-514 · 룬드대학교·스코네대학병원(스웨덴), 라드바우드대학병원(네덜란드) 등 · 인구기반 무작위대조 비열등성 단일맹검 시험, 105,934명(NCT04838756)

AI가 유방촬영 판독을 도우면 놓친 암(중간암)이 늘어날까 — 4년을 기다린 답은 "늘지 않았고, 민감도는 오히려 올랐다"

AI 보조 유방촬영 검진이 암 발견율을 높이고 판독 부담을 줄인다는 근거는 이미 나와 있었습니다. 문제는 중간암(interval cancer)이었습니다 — 검진에서 정상으로 판정된 뒤 다음 검진 전에 발견되는 암으로, 검진이 실제로 안전한지를 가리는 가장 냉정한 지표입니다. 발견율이 올라도 중간암이 함께 늘면 그 검진은 그저 조기 발견을 앞당긴 것이 아니라 놓친 암을 만든 것이기 때문입니다. MASAI 시험은 스웨덴에서 검진 대상 여성 105,934명을 1:1로 무작위 배정해(19명 분석 제외) AI 보조군(판독 건수를 단독·이중으로 분류하는 트리아지 + 검출 보조)과 표준 이중판독군을 비교하고, 20% 비열등성 여유를 사전 규정한 뒤 중간암 발생률을 일차 종료점으로 측정했습니다.

중간암 발생률은 AI 보조군 1,000명당 1.55건(95% CI 1.23–1.92), 대조군 1.76건(1.42–2.15)으로 비율비 0.88(95% CI 0.65–1.18, P=0.41) — 비열등성을 충족했습니다. 기술적 비교에서 AI 보조군의 중간암은 침윤암(75건 대 89건), T2 이상(38건 대 48건), 비-luminal A형(43건 대 59건)이 모두 더 적었습니다. 민감도는 80.5%(95% CI 76.4–84.2) 대 73.8%(68.9–78.3)로 AI 보조군이 유의하게 높았고(P=0.031), 이 차이는 연령대와 유방 밀도를 가로질러 일관됐습니다. 침윤암에서는 개선이 확인됐으나 상피내암에서는 그렇지 않았습니다. 특이도는 양군 모두 98.5%로 동일했습니다(P=0.88).

"AI를 쓰면 판독 인력을 줄이면서도 안전성이 유지되는가"라는 질문에 인구 기반 무작위 시험이 중간암이라는 안전성 지표로 답을 내놓은 드문 사례입니다. 판독량 감소라는 운영 이득과 민감도 상승이 동시에 확인됐고, 특이도가 유지됐다는 점에서 위양성 확대라는 흔한 대가도 치르지 않았습니다. 다만 검진 인프라가 잘 갖춰진 스웨덴의 이중판독 체계가 비교 기준이라는 점, 관찰 기간이 한 차례 검진 주기라는 점은 감안해야 합니다. 국내 유방촬영 검진은 스웨덴식 전수 이중판독을 전제로 운영되지 않아 비교 기준 자체가 다르므로, 결과를 그대로 옮겨 적용하기보다 국내 검진 체계에서의 별도 검증이 필요합니다. 반대로 판독 인력이 부족한 지역·기관에서는 AI 트리아지의 상대적 이득이 더 클 수 있다는 가설도 함께 세울 수 있습니다.

TAKEAWAY

AI 보조 유방촬영 검진은 중간암을 늘리지 않으면서(비율비 0.88) 민감도를 73.8%→80.5%로 끌어올렸고 특이도는 그대로였다 — 검진 AI의 안전성을 중간암이라는 지표로 확인한 무작위 근거다.

영상 AI · 실배치 다기관 전향·후향 연구 2026-03-10

Diagnostic accuracy, fairness and clinical implementation of AI for breast cancer screening: results of multicenter retrospective and prospective technical feasibility studies

Kelly CJ, Wilson M, …, Cunningham D. Nature Cancer 2026;7(3):494-506 · Google Research·영국 NHS 다기관 · 후향 115,973건 + 전향 2개 검진 서비스·12개 site 9,266건

성능은 좋았지만, 실제 병원에 넣자 데이터 분포가 달라져 임계값을 다시 맞춰야 했다

앞의 MASAI가 "AI를 쓰면 좋은가"에 답했다면, 이 연구는 "그 AI를 우리 병원에 실제로 넣으면 어떻게 되는가"를 다룹니다. Google의 유방촬영 AI를 영국 NHS 검진 5개 기관의 후향 데이터 115,973건으로 검증한 뒤, 2개 검진 서비스 산하 12개 site에서 전향적 비중재 배치까지 진행했습니다.

후향 분석에서 AI는 1차 판독의보다 민감도가 높았고(0.541 vs 0.437, p<0.001) 특이도는 비열등했으며, 암 검출률은 1,000명당 7.54건에서 9.33건으로 올랐습니다. 후향 분석에서 이후 중간암으로 판명될 사례의 25.0%를 AI가 양성으로 표시했습니다. 체계적인 인구집단별 격차는 관찰되지 않았지만, 일부 소표본 하위군에서는 민감도 비열등성이 불확실했습니다. 2차 판독자를 대체하는 시뮬레이션에서는 판독 시간 32% 감소와 검출 17.7% 증가가 동시에 나타났습니다. 그런데 실제 배치 단계에서 문제가 드러났습니다 — 데이터 분포가 달라져(distribution shift) 임계값을 다시 조정해야 했습니다.

이 마지막 문장이 이 논문의 진짜 기여입니다. 논문에 실린 성능 수치는 그 데이터셋에서의 값이고, 장비·촬영 프로토콜·환자 구성이 다른 병원에 그대로 옮기면 같은 임계값이 같은 성능을 내지 않습니다. 저자들이 "적응형 보정과 지속적 모니터링이 필요하다"고 맺은 이유죠. 마침 국내에서도 식약처가 2026년 6월 26일 '디지털 의료기기 변경관리 계획서 허가·심사 가이드라인'을 제정해, 허가 후 예상되는 변경을 사전 승인 범위 안에서 처리할 길이 열렸습니다. 규제와 현장의 문제의식이 같은 곳을 향하고 있는 셈입니다.

TAKEAWAY

논문 속 성능은 그 데이터셋의 성능일 뿐 — 도입 논의는 '정확도 몇 %'가 아니라 '누가 언제 재보정할 것인가'로 넘어가야 한다.

임상의사결정지원 · 뇌졸중 군집 무작위 임상시험 2026-03-20

Effect of a clinical decision support system on stroke care quality and outcomes in patients with acute ischaemic stroke (GOLDEN BRIDGE II): cluster randomised clinical trial

Zhang X, Ding L, Jing J, …, Wang Y, Li Z. BMJ 2026;392:e085810 · 베이징 톈탄병원·수도의과대학, 중국 국가신경질환임상연구센터 등 · 다기관 군집 무작위 임상시험, 77개 병원·21,603명(NCT04524624)

AI 기반 의사결정지원 시스템을 병원 단위로 무작위 배정했더니, 3개월 내 새 혈관사건이 2.9% 대 3.9%로 줄었다

의료 AI 연구의 절대다수는 정확도(AUC)에서 멈춥니다. "판독을 잘한다"와 "환자가 덜 죽는다" 사이의 간극을 메우려면 임상 결과를 일차 종료점으로 삼은 무작위 시험이 필요한데, 그런 연구는 손에 꼽습니다. GOLDEN BRIDGE II는 중국 77개 병원을 병원 단위로 무작위 배정(중재 38 · 대조 39)해, AI 기반 영상분석·뇌졸중 원인 분류·근거기반 치료 권고를 묶은 임상의사결정지원 시스템(CDSS)이 급성 허혈성 뇌졸중 환자의 결과를 바꾸는지 물었습니다. 2021년 1월–2023년 6월 발병 7일 이내 입원 환자 21,603명(중재 11,054 · 대조 10,549)이 등록됐습니다.

일차 종료점인 3개월 내 새 혈관사건(허혈성 뇌졸중·출혈성 뇌졸중·심근경색·혈관성 사망의 복합)은 중재군 2.9%(320/11,054) 대 대조군 3.9%(416/10,549), 보정 위험비 0.74(95% CI 0.58–0.93, P=0.01)였습니다. 이 차이는 12개월까지 유지됐고(4.0% 대 5.5%, 보정 HR 0.73, 95% CI 0.56–0.95, P=0.02), 진료의 질 지표도 함께 올라갔습니다(복합 수행지표 91.4% 대 89.8%, 보정 오즈비 1.21, 95% CI 1.17–1.26, P<0.001). 반면 장애(mRS 3–6)와 전체 사망률에는 유의한 차이가 없었고, 중등도 이상 출혈을 포함한 안전성 지표도 양군이 다르지 않았습니다.

해석은 신중해야 합니다. 이 시험은 CDSS라는 복합 개입을 평가한 것이지 특정 AI 알고리즘의 성능을 잰 것이 아니며, 이득의 상당 부분은 근거기반 진료 준수율 상승이라는 경로로 설명됩니다. 병원 단위 배정이라 개별 의료진의 행동 변화(호손 효과)도 배제하기 어렵고, 중국 의료체계에서의 기저 진료 질이 결과 크기를 좌우합니다. 그럼에도 AI를 포함한 의사결정지원이 하드 엔드포인트를 움직인 대규모 무작위 근거라는 점에서 무게가 다릅니다. 국내에도 뇌졸중 영상 AI와 진료지침 기반 권고 시스템이 병원별로 도입되고 있지만, 정확도 검증을 넘어 결과 개선을 증명한 국내 시험은 아직 없습니다. 신의료기술·수가 논의가 "임상적 유용성"을 요구하는 국면에서 이 논문은 참고할 설계 원형에 가깝습니다.

TAKEAWAY

AI 기반 뇌졸중 CDSS가 3개월 새 혈관사건을 26% 낮췄다(2.9% 대 3.9%) — 다만 장애·사망은 변하지 않았고, 이득의 경로는 근거기반 진료 준수율 상승이었다.

웨어러블 · 예측모델 다기관 코호트 · 딥러닝 2026-06-03

Week-ahead prediction of depressive episodes using wearable-derived circadian biomarkers: A multicenter deep learning study with risk-based operating thresholds

Kim B, Chae M, Seo H, …, Lee HJ, Lee H. Journal of Affective Disorders 2026;412:122076 · 고려대학교 의과대학 의생명정보학교실·정신건강의학교실, 선문대학교 · 다기관 실사용 기분장애 코호트, 144명·90,281 환자-일

손목에 찬 웨어러블의 심박·수면 리듬만으로 일주일 뒤 우울삽화를 미리 가려낼 수 있는가 — 국내 연구팀의 대답은 "선별은 되지만 확진은 아니다"

우울증 치료는 미치료 기간이 짧을수록 예후가 좋지만, 실제 진료는 환자가 나빠진 뒤에 찾아와 지난 2주를 회상해 보고하는 반응형(reactive) 구조에 머물러 있습니다. 웨어러블은 이 공백을 메울 후보지만, 기존 연구는 예측 시점이 하루 앞으로 짧거나 일주기 리듬을 지나치게 단순한 대리지표로 다뤄 임상 해석이 어려웠습니다. 연구팀은 웨어러블 한 대에서 얻은 두 가지 상보적 일주기 지표 — 심박에서 유도한 코사인 acrophase와 수면 시각 기반의 DLMO(멜라토닌 분비 개시) 대리지표 — 를 결합해, 7일치 기록으로 일주일 뒤의 임상의 확인 우울삽화를 예측하는 시계열 딥러닝 모델을 만들었습니다.

다기관 실사용 기분장애 코호트 144명(90,281 환자-일)에서 참가자 단위로 6:2:2 분할하고 홀드아웃을 10회 반복한 결과, 두 지표를 합친 모델의 평균 AUROC는 0.772(95% CI 0.750–0.794)였습니다. 임상에서 더 중요한 것은 운영 기준점 성능인데, 위험 순위 상위 20%의 환자-일이 실제 우울삽화 일의 63.5%를 포착했습니다. 기저 유병률 5.3% 조건에서 이 구간의 양성예측도는 16.7%로, 무작위 대비 3.2배의 예후 이득(lift)에 해당합니다. 대신 100 환자-일당 20건을 검토해야 하는 부담이 따릅니다. 저자들은 멜라토닌을 직접 측정하지 않았음을 명시하고 해당 지표를 어디까지나 대리 측정으로 한정했습니다.

숫자를 뒤집어 읽으면 상위 20% 경보 중 약 여섯 건에 다섯 건은 헛경보라는 뜻입니다. 그래서 이 모델의 자리는 진단이 아니라 외래 사이 기간의 우선순위 배정입니다 — 전화를 먼저 걸 대상, 예약을 앞당길 대상을 고르는 용도입니다. 저자들도 외부 검증·확률 보정·이식성 평가·전향적 삽화 발생 평가가 임상 도입 전에 필요하다고 못 박습니다. 국내 맥락에서는 시사점이 분명합니다. 정신건강 영역은 이미 국내 디지털치료기기 허가가 나와 있는 몇 안 되는 분야이고, 웨어러블 상시 수집 데이터는 국내 병원들이 비교적 쉽게 축적할 수 있는 자산입니다. 다만 예측모델을 의료기기로 끌고 가려면 검토 부담과 오경보 비용을 함께 제시하는 이런 형태의 보고가 표준이 되어야 합니다.

TAKEAWAY

웨어러블 일주기 지표로 일주일 앞 우울삽화 위험을 3.2배 농축할 수 있지만(PPV 16.7%), 이는 진단이 아니라 "누구에게 먼저 연락할지"를 정하는 선별 도구다.

LLM · 근거지형 체계적 문헌고찰 2026-03-03

LLM-assisted systematic review of large language models in clinical medicine

Chen SF, Alyakin A, …, Oermann EK. Nature Medicine 2026;32(3):1152-1159 · NYU Langone·Duke 등 · LLM 보조 체계적 문헌고찰, 4,609편

의학 LLM 논문 4,609편을 훑어보니, 실제 환자 데이터로 한 무작위 임상시험은 단 19편이었다

의학 분야 LLM 연구는 2022년 이후 폭발적으로 늘었지만, 그 근거의 질이 어떤지는 아무도 전체를 조망하지 못했습니다. 연구팀은 LLM 자체를 도구로 써서 2022년 1월–2025년 9월 사이 출판된 동료심사 논문 4,609편을 분류했습니다. 하루 3.2편꼴로 쏟아진 셈입니다.

결과는 냉정합니다. 실제 환자 데이터를 사용한 연구는 1,048편(23%)에 그쳤고, 그중 전향적 무작위 임상시험은 단 19편이었습니다. 대부분은 가상 시나리오(1,857편)나 시험문제 풀이(1,704편)였습니다. 평가 대상 모델의 65.7%가 ChatGPT 계열이었고, 표본 크기가 30명 미만인 연구가 최소 25%였습니다. 1,046건의 인간 대 LLM 직접 비교에서 LLM이 이긴 것은 33%였는데, 과제가 현실에 가까울수록·비교 대상의 숙련도가 높을수록 그 비율은 떨어졌습니다.

이 논문의 가치는 개별 성능 수치가 아니라 "근거의 지형도" 자체를 그렸다는 데 있습니다. 규제 측면에서도 시사점이 큽니다 — 식약처가 생성형 AI·LLM 가이드라인을 세계 최초로 내놓은 지금, 정작 그 심사의 토대가 될 임상근거는 아직 얇다는 뜻이기 때문입니다. 논문을 읽을 때 "실제 환자 데이터인가, 전향적인가"를 먼저 확인하라는 실용적 기준을 제공합니다.

TAKEAWAY

LLM 의학 논문은 하루 3편씩 쏟아지지만 전향적 RCT는 19편뿐 — 도입 논의보다 근거 생산이 한참 뒤처져 있다.

LLM · 성능평가 벤치마크 2026-04-01

Large Language Model Performance and Clinical Reasoning Tasks

Rao AS, Esmail KP, …, Succi MD. JAMA Network Open 2026;9(4):e264003 · Harvard Medical School·Mass General Brigham · 단면연구, 21개 모델 16,254건 응답

최신 LLM 21종을 진료 흐름대로 평가했더니, 최종진단은 잘하는데 감별진단에서 무너졌다

기존 LLM 평가는 대부분 객관식 시험 점수에 의존해 왔습니다. 실제 진료는 환자를 만나 감별진단을 세우고, 검사를 고르고, 최종진단을 내리고, 치료를 결정하는 순차적 과정인데 말이죠. 연구팀은 MSD 매뉴얼 임상 증례 29개를 이 5단계 진료 흐름대로 쪼개어 GPT-5, Claude 4.5 Opus, Gemini 3.0, Grok 4 등 21개 모델을 평가하고, 균형 정확도를 면적으로 환산한 PrIME-LLM 지표를 제안했습니다.

PrIME-LLM 점수는 0.64(Gemini 1.5 Flash)에서 0.78(Grok 4) 범위였고, 추론 최적화 모델이 일반 모델보다 우수했습니다. 흥미로운 것은 단계별 편차입니다 — 최종진단 실패율은 0.09~0.39에 그친 반면, 감별진단 실패율은 모든 모델에서 0.80을 넘었습니다(0.90~1.00). 답이 정해진 문제는 잘 맞히지만, 여러 가능성을 늘어놓고 불확실성을 다루는 일에는 약하다는 뜻입니다.

임상의에게 이 결과는 직관적으로 와닿습니다. 진료의 어려움은 진단명을 아는 데 있지 않고 "무엇을 놓치지 않았는가"를 점검하는 데 있기 때문입니다. 저자들의 결론은 단호합니다 — 버전이 올라가며 성능이 개선되고는 있으나, 기성 LLM은 아직 안전한 임상 배치에 필요한 수준에 이르지 못했다는 것. 벤치마크 점수만 보고 도입을 논하는 흐름에 제동을 거는 데이터입니다.

TAKEAWAY

LLM은 정답 맞히기에 강하고 감별진단에 약하다 — 임상 배치 논의는 "정확도"가 아니라 "불확실성을 다루는 능력"으로 옮겨가야 한다.

LLM · 인간-AI 협업 메타분석 2026-01-28

Human–large language model collaboration in clinical medicine: a systematic review and meta-analysis

Wang G, Zhang K, …, Yang X. npj Digital Medicine 2026;9(1) · 중국의학과학원·푸단대·홍콩중문대 · 체계적 문헌고찰 및 메타분석, 10편

"의사 + AI"가 의사 단독보다 나은가? 아직은 자신 있게 그렇다고 말할 수 없다

의료 AI 도입 논리의 핵심은 "AI가 의사를 대체한다"가 아니라 "의사와 AI가 함께하면 더 낫다"입니다. 이 메타분석은 그 전제를 실제로 검증했습니다. PRISMA 2020에 따라 네 개 데이터베이스를 검색해, 인간+LLM(H+AI) 워크플로와 인간 단독(H)을 직접 비교한 동료심사 연구 10편을 모았습니다.

진단·판독 정확도는 H+AI가 나은 경향을 보였지만 통계적으로 유의하지 않았고 신뢰구간이 극단적으로 넓었습니다(RR 1.59, 95% CI 0.08–32.74). 복합 진단·처치 점수는 유의한 개선을 보였으나(+4.88%p, 95% CI 0.65–9.12) 예측구간이 −31.65~41.42로, 실제 현장에서는 정반대 결과도 가능하다는 뜻입니다. 시간 효율은 차이가 없었고(+0.4분), 문서 작성 품질은 개선됐지만 사실 오류율이 26~36%로 남아 그 이득을 갉아먹었습니다. 세 팔 비교에서는 H+AI가 AI 단독을 늘 이기지도 못했습니다.

"인간-AI 협업이 최선"이라는 통념이 아직 근거로 뒷받침되지 않는다는 점을 보여주는, 불편하지만 중요한 결과입니다. 저자들은 실제 워크플로에 이식된 사전등록·실용적 다기관 시험과 안전성·오류 지표를 우선하는 표준화된 결과변수, 그리고 불확실성을 드러내고 검증을 돕는 인터페이스 설계를 요구합니다. 병원 도입을 검토 중이라면 "속도가 빨라지는가"보다 "오류가 줄어드는가"를 물어야 한다는 실무적 함의가 있습니다.

TAKEAWAY

"의사+AI가 낫다"는 전제는 아직 검증되지 않았다 — 문서 품질은 올라도 사실 오류 26~36%가 남고, 시간은 절약되지 않았다.