본문으로 건너뛰기
LangChain조회 2

Abridge의 헬스케어 AI 에이전트 구축 및 평가 전략

Abridge는 LangGraph와 LangSmith를 활용해 임상 환경에서 안전하고 빠르게 AI 에이전트를 배포하는 평가 및 테스트 파이프라인을 구축했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Abridge는 임상 환경에서 안전하고 빠르게 AI 에이전트를 배포하기 위해 LangGraph와 LangSmith를 기반으로 통합 평가 파이프라인을 구축했다. 이 시스템은 reference-free 및 reference-based 평가자를 활용해 모델의 정확도와 완성도를 각각 17%, 19% 향상시켰으며, APO를 통해 평가자 보정 시간을 며칠에서 몇 시간으로 단축했다. 또한, 계층적 배포 모델과 A/B 테스트를 도입하여 임상 안전성을 유지하면서도 배포 주기를 수개월에서 며칠 단위로 개선했다. 이러한 접근 방식은 의료 현장의 높은 신뢰 요구사항을 충족하며, 임상 워크플로 전반에 걸쳐 일관된 AI 경험을 제공한다.

챕터별 상세

00:00

Abridge의 임상 AI 플랫폼

Abridge는 임상 지능 플랫폼을 통해 의료진의 워크플로를 자동화한다. 매년 미국에서 발생하는 20억 건 이상의 환자-의료진 대화를 분석하여 진료 효율성을 높이는 도구를 개발한다.
01:45

헬스케어의 핵심 워크플로

환자와 의료진의 대화는 진료 기록, 청구 코드, 처방 등 모든 의료 서비스의 출발점이다. 이 대화 데이터는 비정조화된 형태로 존재하며, 임상 워크플로에서 가장 중요한 데이터 소스이다.
03:22

의료 AI의 신뢰 문제

의료 환경에서 신뢰는 점진적으로 쌓이지만, 단 한 번의 잘못된 모델 배포로도 완전히 무너질 수 있다. 환자 안전과 직결된 도메인이므로 모델의 정확성과 안전성이 최우선이다.
04:27

임상 노트 사례 연구

임상 노트는 단순 요약이 아니라 청구 및 진료 기록의 근거가 된다. 잘못된 증상 기재나 처방 용량 오류는 법적, 임상적 책임을 초래하므로 높은 정확도가 요구된다.
05:45

모델 오류의 위험성

잘못된 증상 귀속, 환각, 청구 코드 오류(upcoding/downcoding)는 심각한 임상적 결과를 초래한다. 환자의 증상과 의료진의 진단이 불일치할 경우 의료 서비스의 질이 저하된다.
06:55

배포 주기 단축

Abridge는 평가 프로세스를 개선하여 모델 배포 주기를 1~2개월에서 며칠 단위로 단축했다. 기존의 파편화된 도구들을 통합하여 개발 속도와 품질을 동시에 확보했다.
07:23

LangGraph와 LangSmith 도입

데이터셋, 주석, 추적, 평가를 통합하기 위해 LangGraph와 LangSmith로 마이그레이션했다. 이를 통해 엔터프라이즈 수준의 보안과 감사 기능을 갖춘 자체 호스팅 환경을 구축했다.
08:03

APO를 활용한 LLM 평가자 보정

APO 프레임워크를 사용하여 임상 주석과 피드백을 기반으로 LLM 평가자를 자동으로 보정한다. 평가자 생성 시간을 며칠에서 몇 시간으로 줄여 모델 개선 속도를 높였다.
09:42

평가자 유형 비교

Reference-free 평가자는 모든 대화에 일반화가 가능하여 실시간 온라인 평가에 사용된다. Reference-based 평가자는 특정 전문 분야의 고충실도 오프라인 평가를 위해 보완적으로 사용된다.
10:55

A/B 테스트 접근 방식

의료 파트너들과의 신뢰를 바탕으로 계층적 배포 모델을 운영한다. 10~15%의 고객을 대상으로 사일런트 릴리스(silent release)를 진행하여 실시간 피드백을 수집한다.
12:38

Abridge Assistant 에이전트

Abridge Assistant는 진료 전, 중, 후에 걸쳐 지속적으로 작동하는 통합 에이전트이다. 환자 컨텍스트 검색, 노트 편집, 처방 등 다양한 기능을 컴포저블하게 제공한다.
13:37

설계 원칙

에이전트 설계 원칙으로 에어컨처럼 배경에서 작동하는 투명성, 의료진의 통제권을 보장하는 에이전시, 피드백에 즉각 반응하는 대응성을 강조한다.
15:22

임상 환경의 평가 기준

임상용 다단계 에이전트 평가 기준은 임상 품질(루브릭 기반), 임상 안전성, 경계 및 적대적 테스트, 도구 선택의 어조와 스타일을 포함한다.
16:39

결론 및 시사점

속도와 품질은 상충 관계가 아니며, 적절한 평가 인프라에 투자하면 두 가지를 동시에 달성할 수 있다. 헬스케어는 가장 중요한 문제를 해결하는 분야이므로 우수한 빌더들의 참여가 필요하다.

용어 해설

앰비언트 AI(Ambient AI)
임상 현장에서 의료진과 환자의 대화를 실시간으로 기록하고 자동으로 진료 기록을 생성하는 기술이다. 의료진의 문서 작업 부담을 줄이고 진료 효율성을 높이는 데 핵심적인 역할을 한다.
자동 프롬프트 최적화(APO)
Automatic Prompt Optimization의 약자로, LLM의 프롬프트를 자동으로 조정하여 성능을 개선하는 기법이다. Abridge는 이를 통해 LLM 기반 평가자(judge)를 자동으로 보정하고 최적화한다.
참조 없는 평가자(Reference-free Judges)
정답(Gold standard) 없이 모델의 출력물만으로 품질을 평가하는 기법이다. 실시간 온라인 평가가 가능하여 모델의 성능을 지속적으로 모니터링하는 데 유용하다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 17.수집 2026. 07. 17.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.