본문으로 건너뛰기
HF Daily Papers조회 4

대화형 방사선 보고서 초안 작성을 위한 이산 확산 언어 모델

의료용 대규모 모델은 주로 autoregressive 생성 방식으로 구축되어 임의 위치에서의 편집·완성이 제한적이었다. 본 논문은 이산 확산 언어 모델이 의료 VQA 성능에서 동일하거나 우수하며 인퍼런스가 3.5–4.4배 빠르다는 실증적 근거를 제시한다. 또한 양방향 복원 특성으로 임상의가 보고서 일부를 고정하면 좌우 문맥을 동시에 반영해 간격을 채우는 any-order infill을 지원함으로써 실제 판독 워크플로에 적합한 초안 작성 도구를 가능하게 한다.

용어 해설

이산 확산(Discrete Diffusion)
이산 확산은 고정된 토큰 캔버스에서 무작위로 일부 토큰을 교란하고 반복적 복원을 통해 원문을 복원하는 방식으로 텍스트를 생성한다. 각 복원 단계에서 캔버스의 모든 위치가 양방향으로 서로를 참조하므로 문맥의 좌우 양쪽 정보를 동시에 활용할 수 있다. 본 논문에서는 이 특성이 임의 위치 인필(any-order infill)을 가능하게 하는 핵심 메커니즘으로 활용된다.
임의 위치 인필(Any-Order Infill)
임의 위치 인필은 문서의 임의 구간을 고정된 텍스트 양쪽 문맥을 조건으로 채우는 작업이다. 확산 디코더는 고정된 토큰을 매 단계 재고정(re-clamp)하면서 캔버스의 남은 위치를 양방향 정보를 바탕으로 복원한다. 이 능력은 좌→우로만 조건하는 autoregressive 모델이 본질적으로 갖지 못하는 상·하위 맥락 동시 반영을 가능하게 한다.
전문가 혼합(MoE)(Mixture-of-Experts)
Mixture-of-Experts는 거대한 파라미터 풀을 여러 전문가(expert)로 분할하고 입력마다 일부 전문가만 활성화하여 계산 비용을 절감하는 구조이다. 본 연구에서 사용된 백본은 약 25.2B 파라미터 규모이며 활성화되는 파라미터는 3.8B 수준으로 표기된다. 이 구성은 모델 크기를 키우면서도 실용적 학습·추론 비용을 유지하도록 설계되었다.
LLM 심판(LLM Judge)
LLM 심판은 생성된 자연어 응답의 의미적 동치성을 판단하기 위해 다른 대형 언어 모델(본 논문에서는 Claude Sonnet 4.6)을 활용한 평가 방식이다. 정답의 어구나 문장 표기 차이로 인한 불이익을 줄이고 패러프레이즈를 허용하는 의미 기반 이진 판정을 제공한다. 의료 VQA처럼 자유응답 형식에서 휴리스틱 정확도보다 더 안정적인 비교 지표를 제공한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 01.수집 2026. 07. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.