TL;DR
텍스트 기반 BERT 모델이 고분자 특성 추출에 매우 강력하며, 특히 학습 데이터와 테스트 데이터 간의 분포 차이를 보정하는 사후 처리가 우승의 핵심이었다.
배경
NeurIPS 2025에서 개최된 오픈 고분자 예측 대회는 지속 가능한 소재 개발을 위해 고분자의 물리적 성질을 AI로 예측하는 과제였다.
대상 독자
화학/재료 과학 분야의 AI 적용에 관심 있는 데이터 과학자 및 ML 엔지니어
의미 / 영향
이 솔루션은 고분자 과학 분야에서 실험 데이터 부족 문제를 의사 라벨링과 시뮬레이션 데이터로 극복할 수 있음을 보여주었다. 특히 텍스트 기반 BERT 모델이 복잡한 화학 구조를 효과적으로 임베딩할 수 있음을 증명하여 신소재 개발을 위한 AI 프레임워크의 표준을 제시했다.
챕터별 상세
솔루션 아키텍처 개요
피처 엔지니어링 및 선택
BERT 모델 학습 전략
AutoGluon 및 Uni-Mol 활용
from rdkit import Chem
def augment_smiles(smiles):
mol = Chem.MolFromSmiles(smiles)
return Chem.MolToSmiles(
mol,
canonical=False,
doRandom=True,
isomericSmiles=True
)RDKit을 사용하여 SMILES 문자열을 무작위로 변형하여 데이터를 증강하는 코드
분포 변화 발견 및 사후 처리
기초 모델 비교 및 결론
submission_df['Tg'] += (
submission_df['Tg'].std() * 0.5644
)리더보드 데이터의 분포 변화를 보정하기 위해 유리 전이 온도(Tg) 예측값에 상수를 더하는 사후 처리 코드
용어 해설
- SMILES
- — 분자의 구조를 짧은 ASCII 문자열로 나타내는 선형 표기법이다. 고분자의 반복 단위를 텍스트 데이터로 변환하여 BERT와 같은 자연어 처리 모델이 화학적 구조를 학습할 수 있게 하는 핵심 데이터 형식이다.
- Pseudo-labeling
- — 레이블이 없는 데이터에 대해 학습된 모델의 예측값을 임시 레이블로 부여하여 다시 학습에 사용하는 준지도 학습 기법이다. 이 대회에서는 대규모 가상 고분자 데이터셋에 레이블을 달아 모델의 일반화 성능을 높이는 데 사용됐다.
- Distribution Shift
- — 모델을 학습시킨 데이터와 실제 테스트 데이터의 통계적 특성이 달라지는 현상이다. 이 차이를 정확히 파악하고 사후 처리를 통해 보정하는 것이 리더보드 점수를 올리는 결정적인 요인이 된다.
- Molecular Dynamics Simulation
- — 원자와 분자의 물리적 움직임을 컴퓨터로 모사하여 물질의 거동을 예측하는 방법이다. 실험 데이터가 부족한 고분자 물성 예측에서 추가적인 피처를 생성하거나 데이터를 증강하는 용도로 활용된다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.