TL;DR
질병별 생물학적 맥락은 동일 표적이라도 작용 기전과 치료적 결과를 달라지게 하므로 이를 무시한 표적 기반 분자 설계는 한계가 있다. DrugGen-2는 MeSH 온톨로지와 단백질 서열을 생성 조건으로 포함하여 질병 의존적 분자 특성을 반영함으로써 질병 특이적 약물 설계 가능성을 높였다. 이 접근은 후보물질의 발견 단계에서 질병-표적 상호작용을 컨텍스트로 반영해 임상 전환 가능성을 개선할 수 있다는 점에서 의미가 있다.
왜 중요한가
질병별 생물학적 맥락은 동일 표적이라도 작용 기전과 치료적 결과를 달라지게 하므로 이를 무시한 표적 기반 분자 설계는 한계가 있다. DrugGen-2는 MeSH 온톨로지와 단백질 서열을 생성 조건으로 포함하여 질병 의존적 분자 특성을 반영함으로써 질병 특이적 약물 설계 가능성을 높였다. 이 접근은 후보물질의 발견 단계에서 질병-표적 상호작용을 컨텍스트로 반영해 임상 전환 가능성을 개선할 수 있다는 점에서 의미가 있다.
핵심 기여
질병 온톨로지(MeSH DAG)와 표적 서열을 결합한 분자 조건 생성 프롬프트 구축
모델 입력으로 MeSH DAG 식별자와 단백질 아미노산 서열을 연이어 배치한 토큰화된 문자열(<D>MeSH + <P>Sequence + <L>SMILES)을 사용했다. 이 데이터 구성은 질병 계층 정보를 모델 내부에 직접 주입하여 동일 표적이라도 질병 맥락에 따라 다른 분자 패턴을 학습하게 했다. 최종 학습 데이터는 13,908개의 직접 연관된 MeSH–sequence–SMILES 문자열로 구성되어 supervised fine-tuning에 사용되었다.
SFT 후 GRPO를 이용한 보상기반 분자 최적화 파이프라인 설계
사전학습된 DrugGPT를 먼저 supervised fine-tuning으로 6 에폭까지 조정한 뒤 group relative policy optimization(GRPO)으로 정책을 추가 최적화했다. GRPO는 각 프롬프트에 대해 그룹 크기 G의 완성물을 생성하고 그룹 평균을 기준선으로 토큰별 advantage를 계산해 클리핑된 비율과 KL 페널티(β)로 안정적으로 파라미터를 갱신했다. 학습 동안 보상은 화학적 유효성, 배치 내 다양성, 신규성, PLAPT 기반 예측 결합친화도를 복합적으로 반영했다.
PLAPT 기반 결합친화도 보상과 RDKit 유효성 검사 통합
생성된 SMILES의 화학적 유효성은 RDKit 파이프라인으로 판별하고 유효하지 않은 SMILES에는 보상 0을 할당했다. 유효한 SMILES에 대해서는 입력 프롬프트에서 단백질 서열을 추출해 PLAPT에 입력함으로써 예측 pKd를 보상으로 사용했다. 이 구조는 모델이 화학적으로 타당하면서도 표적 결합 가능성이 높은 분자 분포를 학습하도록 유인했다.
대상 질환(당뇨성 신병증) 관련 5개 표적에 대한 비교평가와 도킹 검증
당뇨성 신병증 관련 타깃 ACE, PPARγ, NOS3, PAI-1, TGFB1을 대상으로 DrugGen-2, DrugGen, DrugGPT의 생성 능력과 유효성, 유사도, PLAPT 예측 결합친화도로 비교했다. DrugGen-2는 고유 생성 수에서 409–444 범위를 보였고 유효성은 99–100%에 도달했으며 유사도 중앙값은 0.70으로 보고되었다. 추가적으로 ACE와 PPARγ에 대해 GLIDE XP 도킹을 수행해 일부 설계 분자가 기준 약물보다 더 낮은(강한) 도킹 스코어를 획득함을 확인했다.
핵심 아이디어 이해하기
분자 생성 문제는 언어모델이 시퀀셜한 분자 표기법(SMILES)을 학습해 새로운 분자를 샘플링하도록 설계할 수 있다는 관점에서 출발한다. 기존의 표적-조건 생성 모델은 단백질 서열이나 타깃 식별자만을 입력으로 삼아 목표 결합특성을 반영하려 했으나 질병별 경로 변화나 병태생리적 맥락은 반영하지 못했다. 이로 인해 동일 타깃이라도 질병에 따라 필요한 분자 특성이 달라지는 상황에서 적합한 후보를 찾기 어려웠다.
방법론
DrugGen-2는 사전학습된 DrugGPT(GPT-2 기반)를 출발점으로 삼아 두 단계 학습 전략을 적용했다. 첫 단계로 supervised fine-tuning(SFT)을 수행해 MeSH DAG, 단백질 서열, SMILES의 연속 표현을 모델에 적합시키고 모델의 출력 분포를 도메인에 맞추었다. 두 번째 단계로는 group relative policy optimization(GRPO)을 적용해 보상 신호에 기반한 정책 최적화를 수행했고, 이때 보상은 RDKit 유효성 체크, 데이터셋 대비 신규성, 배치 내 다양성, PLAPT 예측 pKd를 결합한 형태였다.
관련 Figure

해당 도식은 MeSH DAG와 단백질 서열을 입력으로 받아 확장된 토크나이저와 SFT를 거친 뒤 GRPO 기반 보상최적화를 수행하는 전체 처리 흐름을 시각적으로 요약하고 있다. 도식은 또한 RDKit 유효성 검사와 PLAPT 기반 보상, 그리고 GLIDE 도킹을 통한 최종 평가 단계를 포함해 데이터와 보상 신호가 학습에 어떻게 통합되는지를 명확히 보여준다.
데이터 수집, 모델 개발(SFT → GRPO), 그리고 생성 평가(고유성·유효성·유사도·결합친화도)로 구성된 DrugGen-2 파이프라인을 도식화한 플로우차트이다.
주요 결과
약물 설계 성능 비교에서 DrugGen-2는 500 샘플링 시도에 대해 타깃별로 409–444개의 고유 분자를 생성해 DrugGen(50) 및 DrugGPT(219)에 비해 현저히 많은 고유 분자를 산출했다. 화학적 유효성 측정에서는 각 타깃에 대해 중위값 99–100%로 거의 완전한 유효성 달성이 보고되었고 생성 분자의 승인 약물과의 유사도 중앙값은 0.70으로 다른 모델보다 높았다. PLAPT 기반 예측 결합친화도에서도 DrugGen-2 변형들은 모든 표적에서 중위값 9.26–9.97을 보였으며 이는 DrugGPT(5.86–6.22)와 DrugGen(7.15–8.49)을 상회하는 결과였다.
관련 Figure

이 Figure는 GRPO 학습 동안 보상 함수들이 수렴했음을 에폭별 보상 그래프로 제시하고 모델별로 생성 고유성·유효성·유사도·PLAPT 예측치가 어떻게 분포하는지를 시각적으로 비교한다. 또한 ACE와 PPARγ에 대한 대표 도킹 포즈 패널을 통해 특정 설계 분자가 기준 약물보다 더 낮은 GLIDE XP 점수를 획득했음을 공간적 정렬과 수치로 보강한다.
학습 보상 수렴, 고유 생성 수, 유효성, 유사도 분포, 예측 결합친화도 분포 및 대표적 도킹 포즈를 포함한 실험 결과를 다패널로 제시한 Figure이다.
기술 상세
전체 아키텍처는 GPT-2 기반의 DrugGPT를 출발점으로 사용하고 토크나이저를 확장해 특수 토큰 D, P, L을 추가하여 입력을 <|startoftext|>MeSHSequenceSMILES<|endoftext|> 형태로 구성했다. 시퀀스는 토큰 길이 768로 패딩·절단되었고 전체 어휘는 53,086개로 보고되었다. SFT 단계는 TRL의 SFT 트레이너를 이용해 13,908개의 MeSH–sequence–SMILES 문자열로 학습을 진행했으며 선택된 SFT 체크포인트은 에폭 6이었다.
한계점
논문에서 명시된 한계로는 PLAPT 예측과 GLIDE 도킹은 in silico 지표에 불과하므로 in vitro·in vivo 검증이 필요하다고 명시되어 있다. 단백질 서열의 길이를 768 토큰으로 절단해 학습하였기 때문에 장거리 도메인이나 원격(allosteric) 부위의 정보가 손실될 가능성이 존재한다. 또한 논문에서는 신규성 보상을 이진 방식으로 처리했기 때문에 미묘한 구조적 혁신을 충분히 장려하지 못할 위험을 인정했다.
실무 활용
DrugGen-2는 질병 온톨로지와 표적 서열을 함께 입력으로 받아 질병 특이적 후보 분자 라이브러리를 대량으로 생성할 수 있어 스크리닝 초기 단계의 hit 발굴에 실무적 가치를 제공한다. PLAPT와 도킹 기반 필터를 결합하면 in silico 우선순위화된 후보를 도출해 실험적 검증 리소스 사용을 효율화할 수 있다. 공개된 코드와 체크포인트가 존재하므로 연구실 수준에서 재현과 확장이 가능하다.
- 당뇨성 신병증과 같이 질병별 경로가 중요한 적응증에서 질병-표적 쌍을 입력해 후보물질 라이브러리를 대량 생성하는 초기사용 사례이다.
- 기존 승인약의 약물재창출을 목적으로 질병 맥락을 반영한 유사 scaffold 탐색과 후보 우선순위화에 활용할 수 있다.
- 드럭디스커버리 파이프라인에서 PLAPT 등 예측모델과 결합해 in silico 우선 스크리닝을 수행하고 상위 후보를 도킹 및 실험으로 파이프라인 연계할 때 사용 가능하다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- SMILES
- — 분자의 원자와 결합을 문자로 순차적으로 표현한 표준 표기법이다. 본 논문에서는 SMILES가 모델 출력 형식으로 사용되어 언어모델이 분자 구조를 문장처럼 생성하도록 한다. SMILES 유효성 검사는 RDKit 기반 파이프라인으로 수행되어 화학적으로 해석 가능한 분자만 보상 대상이 되었다.
- MeSH DAG
- — Medical Subject Headings의 계층적 표현을 DAG 형태로 표현한 것이다. 논문에서는 질병 맥락을 캡처하기 위해 MeSH DAG 식별자를 모델 입력으로 포함시켜 질병-표적 의존적 분자 생성을 유도했다. 각 MeSH DAG는 모델의 조건문(prompt) 내 <D> 토큰으로 구분되어 학습과 생성 시 질병 정보를 제공했다.
- GRPO
- — 그룹 수준 통계로 advantage를 계산해 정책을 최적화하는 강화학습 방법이다. 본 논문에서는 각 프롬프트에 대해 그룹 크기 G의 완성물을 생성하고 그룹 평균 보상을 기준선으로 삼아 토큰별 advantage를 산출한 뒤 클리핑된 확률비와 KL 페널티로 안정적으로 정책을 갱신했다. GRPO는 별도 가치함수가 필요 없어 메모리와 계산 효율성이 향상되었다.
- PLAPT
- — 사전학습된 변환기 기반의 단백질-리간드 결합친화도 예측 모델이다. 본 연구에서는 생성된 SMILES와 입력된 단백질 서열을 PLAPT에 입력해 예측된 pKd(−log10 Kd)를 보상 신호로 사용했다. PLAPT 점수는 GRPO의 핵심 보상 항목으로서 후보 분자의 결합친화도 최적화를 유도했다.
- GLIDE XP
- — Schrödinger의 GLIDE 알고리즘 중 고정밀도 평가 모드로서 리간드의 공간적 적합성과 상호작용을 정량화한다. 본 논문에서는 GLIDE XP 점수를 활용해 ACE와 PPARγ에 대해 도킹 비교를 수행하고 일부 설계 분자가 기준 약물보다 더 낮은(강한) 점수를 보였음을 보고했다. 도킹 그리드는 40×40×40 Å3로 설정되어 전 영역 블라인드 도킹을 수행했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
