TL;DR
전문 신경과 의사가 부족한 저자원 환경에서는 현지 처방 관행과 약물 가용성이 표준 공개 데이터와 달라 LLM의 직접 적용이 오히려 오도될 수 있다. 이 논문은 LLM의 가중치를 변경하지 않고 사례 단위의 텍스트 학습 조각을 누적·정제해 현지 처방 규칙을 복원하는 실무 지향적 대안을 제시한다. 또한 학습 과정에서 생성된 메모리 궤적을 베이지안 평균화해 예측 신뢰도를 산출하고, 이를 근거로 자동처리와 전문의 이양을 체계적으로 분리할 수 있음을 보였다.
왜 중요한가
전문 신경과 의사가 부족한 저자원 환경에서는 현지 처방 관행과 약물 가용성이 표준 공개 데이터와 달라 LLM의 직접 적용이 오히려 오도될 수 있다. 이 논문은 LLM의 가중치를 변경하지 않고 사례 단위의 텍스트 학습 조각을 누적·정제해 현지 처방 규칙을 복원하는 실무 지향적 대안을 제시한다. 또한 학습 과정에서 생성된 메모리 궤적을 베이지안 평균화해 예측 신뢰도를 산출하고, 이를 근거로 자동처리와 전문의 이양을 체계적으로 분리할 수 있음을 보였다.
핵심 기여
Manana: 오류 기반의 비모수적 프롬프트 학습 프레임워크
Manana는 예측자, 인스펙터, 아키텍트의 루프를 통해 사례별 오류 진단을 후보 학습으로 기록하고 에비던스 버퍼에서 반복 신호만을 아키텍트가 메모리로 합의하는 방식으로 동작한다. 이 과정은 LLM 가중치 업데이트 없이 프롬프트 기반 메모리 상태 m0…mT의 궤적을 생성하며 각 상태가 다른 예측 분포를 만든다. 이렇게 얻은 텍스트 기반 메모리는 감사 가능하고 사례 출처가 보존되어 현지 규칙을 해석 가능하게 만든다.
Single·Multi 변형을 통한 규칙 목록과 전문화 에이전트 학습
Manana-Single은 재현되는 후보 학습이 두 건 이상일 때 교정 규칙을 리스트로 추가하는 방식으로 작동해 간결한 규칙 집합을 형성한다. Manana-Multi는 최대 수의 전문화 에이전트를 스폰·편집·가지치기하여 각 에이전트가 케이스별 관찰값을 추출하도록 설계해 사례별 맥락을 풍부하게 반영한다. 두 변형 모두 메모리 궤적을 생성하므로 서로 다른 학습 라운드가 상호보완적인 예측기를 제공할 수 있다.
Bayesian Prompt Averaging을 통한 불확실성 정량화 및 이양 신호
BPA는 학습 과정에서 얻은 메모리 상태들을 후보 모델로 간주하고 검증세트 우도 기반 가중치로 예측을 평균화해 예측 확률을 산출한다. LLM이 제공한 세 후보 위치에 대해 후보 위치 사전 π=(0.85,0.11,0.04)를 도입해 position-based 예측 우도와 베타-빈 노미얼식 검증 우도를 결합했다. 이 결과는 각 방문별 후방 질량(posterior predictive mass)을 신뢰도로 사용해 낮은 신뢰도 사례를 전문의에게 이양하는 운영 지표로 활용되었다.
실제 우간다 소아 간질 코호트에서의 검증과 선택적 예측 운영근거 제시
Cohort A와 Cohort B의 독립적 자료를 사용해 Manana가 고정 크기 학습 풀(학습 50명, 검증 20명)에서도 직접 프롬프트 및 기존 프롬프트 최적화 기법을 능가함이 확인되었다. 특히 BPA를 적용한 Manana-Multi는 독립 보류 코호트에서 상위 25% 자신도에서 Top-1 정밀도 99%를 달성하는 등 선택적 예측으로 임상적 운용이 가능함을 보였다. 이 연구는 가중치 재학습 없이 지역적 처방 편향을 보정하고 희소한 전문의 자원 배분을 정량화할 수 있음을 실증했다.
핵심 아이디어 이해하기
출발점과 기존 한계점은 다음과 같다. 장기 추적 임상노트로부터 항경련제 처방을 예측하는 문제는 표준 공개 EHR 기반 학습과 달리 현지 처방 관행, 약물 가용성, 추적 관행이 달라 모델이 외부 선험(prior)을 그대로 적용할 때 분포 불일치가 발생한다. 단일 LLM 프롬프트는 지식은 갖추었으나 잘못된 선험에 의해 반복적 오류를 만들었고, 파라미터 재학습은 데이터·검증·감사 비용 때문에 저자원 현장에 현실적이지 않다. 본 논문은 이러한 상황에서 가중치 업데이트 없이 프롬프트 수준의 텍스트 메모리를 단계적으로 구축하는 접근이 유용하다는 점을 출발점으로 삼았다. 이 논문의 해결 원리는 사례별 오류를 텍스트 단위의 후보 학습으로 기록하고, 그 후보들이 여러 환자에서 반복적으로 등장할 때만 메모리로 통합하는 것이다. 구체적으로 예측자(Predictor)가 세 후보 처방을 제안하면 인스펙터(Inspector)가 실제 의사 처방과 비교한 보고서와 후보 학습을 생성하고, 이 후보들은 에비던스 버퍼에 누적된다. 아키텍트(Architect)는 이 버퍼와 배치 리포트를 입력으로 받아 증거가 충분한 반복 신호만을 단일 규칙 목록으로 추가하거나 전문화 에이전트 집합으로 스폰·편집·가지치기한다. 달라지는 점은 두 축에서 나타난다. 첫째, 업데이트 단위가 문장 수준의 '학습 후보'와 그 출처이기 때문에 잘못된 개별 사례가 즉시 전체 메모리를 오염시키지 않는다; 반복적 지지가 필요하다. 둘째, 메모리 궤적 자체를 후보 모델 집합으로 사용해 검증 성능 기반 가중치를 부여하면 각 메모리 상태의 불확실성 분포를 산출할 수 있고, 이 분포는 임상적 이양 정책의 근거가 된다. 이 결과는 적은 수의 지역 사례로도 현지 처방 규칙 보정과 선택적 자동처리가 가능함을 보여준다.
방법론
전체 접근 방식과 핵심 아이디어는 프롬프트 기반 LLM 호출을 반복해 비모수적 메모리 궤적을 학습하는 것이다. 학습 과정은 초기 빈 메모리 m0로 시작해 라운드 t마다 현재 메모리 mt-1로 배치 ℬt의 환자들을 처리하고, Predictor가 각 방문에 대해 세 개의 후보 ŷi,1:3을 산출하면 Inspector가 보고서 ρi와 후보 학습 ci를 생성해 에비던스 버퍼 𝒞t에 누적한다. 아키텍트는 에비던스 버퍼와 배치 리포트 ℛt를 참조해 메모리 업데이트 규칙을 적용하고 단일 규칙 목록(Single) 또는 전문화 에이전트 집합(Multi)을 생성한다. 핵심 메커니즘의 상세는 두 메모리 변형의 동작 규칙에 있다. Manana-Single은 메모리에 새로운 규칙을 추가할 때 서로 다른 방문에서 유래한 최소 N=2개의 후보 학습이 필요하도록 제약해 규칙의 반복 지지를 보장한다. Manana-Multi는 각 스페셜리스트 에이전트 sℓ,t를 케이스별 관찰자 함수를 제공하는 형태로 유지하며 스폰·편집·가지치기 연산을 통해 최대 예산 𝒜max(실험에서는 5) 내에서 전문화된 신호를 추출하도록 설계되었다. 각 라운드에서 에이전트 집합은 케이스별로 관찰값 oi,ℓ,t를 생성하고 Predictor는 이 관찰값을 문맥으로 받아 처방 후보를 산출한다. BPA의 수리적 구성은 검증세트 기반의 가중치 계산과 후보 위치 사전 결합으로 이루어졌다. 학습 궤적에서 상위 K 상태를 검증 우도 log p(𝒟val∣mk)로 재색인하고 온도 τ로 평활화한 후 정규화 지수 wk를 계산한다. 각 상태의 메모리 기반 예측 확률 p(y∣x,mk)는 LLM이 반환한 3개 후보의 위치별 사전 π를 이용해 position-weighted indicator 합으로 근사했다. 검증 우도 계산에는 위치별 적중 수 c_{k,1}, c_{k,>1}와 실패 수 uk를 사용한 베타-빈 노미얼식 통합 우도를 적용해 실용적 후방 가중치를 얻었다.
관련 Figure

이 그림은 학습 단계에서 에비던스 버퍼에 후보 학습이 누적되고 아키텍트가 이를 검토해 단일 규칙이나 전문 에이전트를 생성하는 절차를 구조적으로 제시한다. 또한 추론 단계에서는 메모리 궤적을 후보 모델군으로 취급해 Bayesian prompt averaging을 통해 처방 확률과 이양 신호를 산출하는 흐름을 연결해 보여주어 본문의 방법론과 불확실성 구축 방식을 시각적으로 보강한다.
Manana의 전체 학습·추론 워크플로를 도식화한 다이어그램으로 Predictor, Inspector, Architect의 루프와 Single/Multi 메모리 변형, 그리고 BPA 기반 배포 흐름을 보여준다.
주요 결과
메인 벤치마크 결과는 두 독립 코호트에서 Manana 변형이 직접 프롬프트 및 여러 프롬프트 최적화·기계학습 기반 비교군을 능가했음을 보였다. Cohort A, Cohort B 모두에서 Manana-Multi는 단일 약제(monotherapy)와 복수 약제(polytherapy) 모두에서 전반적으로 높은 EM@3을 기록했으며 표에서 제시된 복수의 열에서 최고 성능을 보였다. 특히 표준 프롬프트 최적화 기법과 비교할 때 Manana는 반복되는 사례 근거에 기반한 규칙·에이전트 산출로 더 안정적이고 해석 가능한 산출을 낸 것으로 보고되었다. 불확실성·이양 성능에서 BPA는 메모리 궤적을 평균화해 Top-1 정확도와 정답·오답 간 신뢰도 격차를 늘렸다. 논문은 Cohort B에서 Manana-Multi+BPA가 상위 25% 자신도에서 Top-1 정밀도 99%를, 상위 50% 자신도에서 95% 정확도를 달성했다고 보고했다. 신뢰도-정밀 곡선과 리라이어빌리티 다이어그램은 높은 후방 질량이 실제 정확도와 일관되게 대응함을 보여 선택적 예측 운영에 실용적 근거를 제공했다. 추가로 수행된 절제 실험과 비교군 분석에서 Manana의 설계 결정, 특히 후보 학습과 메모리 업데이트 분리의 중요성이 확인되었다. 대체 BPA 가중치, LLM 백본 교체, MIMIC-IV로의 일반화 실험 등에서 주요 결론은 전반적으로 견고했으며 부록에서 자세한 수치와 민감도 분석이 보고되었다.
관련 Figure

왼쪽 패널은 BPA 후방 질량으로 분류한 신뢰도 빈의 경험적 Top-1 정확도를 표시해 높은 신뢰도에서 실제 정확도가 높게 나타남을 보여준다. 오른쪽 패널은 이양률을 높여 낮은 신뢰도 사례를 제거했을 때 남은 사례의 정밀도가 상승함을 보여주어 BPA 기반 신뢰도가 실용적 이양 정책으로 활용 가능함을 정량적으로 뒷받침한다.
리라이어빌리티 다이어그램과 이양 비율 대 정밀도 곡선을 포함한 실험 결과 도표로 BPA 신뢰도와 선택적 예측 운영을 시각화했다.
기술 상세
전체 아키텍처는 Predictor-Inspector-Architect의 세 구성요소가 LLM 호출을 통해 역할화된 파이프라인으로 구성되어 메모리 상태를 텍스트로 저장·갱신한다. Predictor는 환자 사전 기록과 현재 메모리 상태를 입력으로 세 개의 처방 후보를 반환하고 Inspector는 이 후보와 실제 의사 처방을 비교해 구조화된 보고서와 하나의 후보 학습을 생성한다. 후보 학습은 출처 인덱스와 함께 에비던스 버퍼에 append-only로 누적되며 아키텍트는 배치 리포트와 누적 버퍼를 참조해 메모리 업데이트 규칙을 적용한다.
한계점
논문에서 명시된 제한점 중 하나는 BPA가 사후 검증 기반의 신뢰도 산출이라는 점으로, 실제 배포에서는 사전 설정된 이양 임계치를 사전 정하고 지속 모니터링을 통해 조정해야 한다는 점이다. 또한 평가 기준이 '의사가 실제 선택한 ASM 처방과의 일치'이므로 지역 처방 관행을 그대로 모사하는 것이 임상적으로 최적의 치료를 보장하지 않는 점이 명시되어 있다. 마지막으로 연구는 두 개의 우간다 코호트로 검증했으나 더 넓은 지리적·제도적 맥락에서는 추가 임상 검토와 외부 검증이 필요하다.
실무 활용
Manana의 구현과 코드가 공개되어 있어 적은 수의 지역 환자 사례로 현지 처방 관행을 반영하는 보조시스템을 구축할 수 있다. BPA 기반의 후방 질량은 임상 운영에서 자동처리 범위를 정하고 낮은 신뢰도 사례를 전문의로 이양하는 정책 근거로 활용할 수 있다. 다만 논문 자체에서 제시된 이양 임계치는 보류 데이터에서 선택된 값이므로 실제 도입 전에는 사전 정립된 임계치 검증과 운용 워크플로 결합이 필요하다.
- 일차 진료 환경에서 제한된 전문의 자원을 효율적으로 배정하기 위해 가장 자신 있는 사례를 자동처리하고 나머지를 전문의 검토로 이양하는 운영 정책을 구현하는 데 활용할 수 있다.
- 현지 문서화 관행과 약물 가용성이 공개 데이터와 다를 때, 소수의 환자 사례로 LLM 출력을 지역 규칙에 맞게 보정해 지역 적합성 있는 처방 보조를 구축하는 데 사용할 수 있다.
- 의료 연구에서 지역별 처방 편향을 분석하고 에비던스 버퍼에 쌓인 후보 학습을 감사용 산출물로 활용해 규정 준수·해석성 확보에 기여할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Prompt Learning
- — 프롬프트 학습은 LLM의 가중치를 변경하지 않고 입력 프롬프트 또는 보조 텍스트를 학습 가능한 또는 규칙기반으로 구성하여 특정 작업에 적응시키는 접근법이다. 이 논문에서는 사례별로 생성된 텍스트 '학습 단위'를 버퍼에 쌓고 아키텍트가 반복적으로 이를 메모리로 통합하는 방식으로 현지 처방 규칙을 학습하는 맥락에서 사용된다.
- Bayesian Model Averaging
- — 베이지안 모델 평균화는 여러 후보 모델의 예측을 검증 데이터의 우도에 따라 가중합하여 최종 예측 확률을 산출하는 기법이다. 본문에서는 학습 라운드별로 생성된 메모리 상태를 후보 모델로 보고 검증세트 기반 우도로 가중치를 부여하는 방식으로 불확실성 추정에 활용했다.
- Selective Prediction
- — 선택적 예측은 모델이 예측 불확실성이 높을 때 예측을 보류하고 사람에게 이양하는 전략을 뜻한다. 이 논문에서는 BPA의 후방 확률을 신뢰도로 사용해 낮은 신뢰도 사례를 전문의에게 이양하는 운용 정책으로 구현했다.
- Candidate-Position Prior
- — 후보 위치 사전은 LLM이 반환한 상위 후보들의 순위별 실제 정답 포함 확률을 미리 추정한 분포이다. 본문에서는 3개 후보의 위치별 확률 π=(0.85,0.11,0.04)를 사용해 LLM 출력을 확률화하는 실용적 근사로 사용되었다.
- Evidence Buffer
- — 에비던스 버퍼는 인스펙터가 생성한 사례 단위의 후보 학습(like rule proposal)을 출처 정보와 함께 순차적으로 저장하는 비가역적 누적 구조이다. 아키텍트는 이 버퍼에서 반복적으로 등장하는 신호를 추출해 메모리 상태로 전환해 지역 규칙을 학습한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
