본문으로 건너뛰기

NeurIPS - 오픈 고분자 예측 2025 대회 1위 솔루션 발표

BERT, AutoGluon, Uni-Mol 앙상블과 정교한 의사 라벨링 및 분포 보정 사후 처리를 통해 고분자 물성 예측 대회에서 우승한 James Day의 기술적 접근법이다.

챕터별 상세

01:20

솔루션 아키텍처 개요

최종 예측은 BERT, AutoGluon, Uni-Mol 모델의 앙상블로 구성됐다. BERT 모델은 SMILES 화학 시퀀스 문자열을 직접 입력으로 사용하며, AutoGluon은 수치형 분자 기술자(Descriptors)와 지문을 활용한다. Uni-Mol은 고분자 반복 단위의 3D 구조 정보를 바탕으로 예측을 수행한다. 특히 대규모 가상 고분자 데이터셋에 대한 의사 라벨링(Pseudo-labeling) 사전 학습이 성능 향상에 기여했다.
02:36

피처 엔지니어링 및 선택

예측 대상 물성에 따라 중요한 피처가 크게 달랐으나, 전반적으로 BERT 임베딩 피처가 가장 높은 중요도를 보였다. 상위 50개 피처 중 35개가 BERT 임베딩이었으며, RDKit 라이브러리를 통해 추출한 원자 쌍 지문(Atom pair fingerprint)과 모건 지문(Morgan fingerprint)도 활용됐다. 또한 약 1,000건의 분자 동역학 시뮬레이션을 로컬에서 실행하여 얻은 결과값을 XGboost 모델로 예측해 추가 피처로 사용했다.
06:14

BERT 모델 학습 전략

BERT 모델은 2단계 학습 과정을 거쳤다. 먼저 100만 개의 가상 고분자 데이터에 대해 두 고분자 중 어느 쪽의 물성 수치가 더 높은지 예측하는 랭킹 분류 작업으로 사전 학습을 진행했다. 이후 실제 대회 데이터와 외부 데이터셋을 결합하여 수치값을 직접 예측하는 회귀 작업으로 파인튜닝했다. SMILES 문자열을 무작위로 변형하는 데이터 증강 기법을 학습과 테스트 시점 모두에 적용하여 모델의 견고함을 높였다.
09:40

AutoGluon 및 Uni-Mol 활용

AutoGluon 모델은 외부 데이터셋의 노이즈를 처리하는 데 집중했다. 외부 데이터의 레이블이 대회 데이터와 편향이 있는 경우, Isotonic Regression을 사용하여 레이블 스케일을 조정했다. Uni-Mol은 3D 구조를 다루는 가장 단순한 모델로 참여했으며, Optuna를 통해 하이퍼파라미터를 튜닝했다. 다만 Uni-Mol은 원자 수가 많은 특정 물성(FFV)에서는 메모리 문제로 인해 성능이 낮아 제외됐다.
python
from rdkit import Chem

def augment_smiles(smiles):
    mol = Chem.MolFromSmiles(smiles)
    return Chem.MolToSmiles(
        mol, 
        canonical=False, 
        doRandom=True, 
        isomericSmiles=True
    )

RDKit을 사용하여 SMILES 문자열을 무작위로 변형하여 데이터를 증강하는 코드

15:09

분포 변화 발견 및 사후 처리

대회 과정에서 학습 데이터와 리더보드 데이터 사이에 유의미한 분포 변화(Distribution Shift)가 있음을 발견했다. 특히 유리 전이 온도(Tg) 예측값에 표준 편차의 약 0.56배에 해당하는 상수를 더했을 때 리더보드 점수가 크게 향상됐다. 이러한 보정은 교차 검증(CV) 점수는 악화시켰으나, 실제 리더보드(Public/Private)에서는 결정적인 성능 향상을 가져왔다. 이는 리더보드 데이터를 직접 프로빙(Probing)하여 최적의 오프셋 값을 찾아낸 결과였다.
18:30

기초 모델 비교 및 결론

화학 도메인 특화 모델인 ChemBERTa나 polyBERT보다 일반적인 ModernBERT-base 모델의 성능이 더 우수했다. 또한 자연어보다 코드 데이터로 사전 학습된 모델(CodeBERT)이 화학 시퀀스 이해에 더 효과적임을 확인했다. 최종적으로는 BERT 모델 단독으로도 전체 앙상블과 대등하거나 더 나은 성능을 보였으며, 이는 강력한 사전 학습과 사후 처리의 중요성을 입증한다.
python
submission_df['Tg'] += (
    submission_df['Tg'].std() * 0.5644
)

리더보드 데이터의 분포 변화를 보정하기 위해 유리 전이 온도(Tg) 예측값에 상수를 더하는 사후 처리 코드

용어 해설

화학 구조 표기법(SMILES)
분자의 구조를 짧은 ASCII 문자열로 나타내는 선형 표기법이다. 고분자의 반복 단위를 텍스트 데이터로 변환하여 BERT와 같은 자연어 처리 모델이 화학적 구조를 학습할 수 있게 하는 핵심 데이터 형식이다.
의사 라벨링(Pseudo-labeling)
레이블이 없는 데이터에 대해 학습된 모델의 예측값을 임시 레이블로 부여하여 다시 학습에 사용하는 준지도 학습 기법이다. 이 대회에서는 대규모 가상 고분자 데이터셋에 레이블을 달아 모델의 일반화 성능을 높이는 데 사용됐다.
분포 변화(Distribution Shift)
모델을 학습시킨 데이터와 실제 테스트 데이터의 통계적 특성이 달라지는 현상이다. 이 차이를 정확히 파악하고 사후 처리를 통해 보정하는 것이 리더보드 점수를 올리는 결정적인 요인이 된다.
분자 동역학 시뮬레이션(Molecular Dynamics Simulation)
원자와 분자의 물리적 움직임을 컴퓨터로 모사하여 물질의 거동을 예측하는 방법이다. 실험 데이터가 부족한 고분자 물성 예측에서 추가적인 피처를 생성하거나 데이터를 증강하는 용도로 활용된다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 20.수집 2026. 02. 21.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.