왜 중요한가
과학적 특성은 공간적·화학적·주기적 구조에서 기인하므로 구조 증거를 보존하고 그 근거를 추적하는 예측 모델이 필요하다. SciReasoner는 구조 정보를 토큰 단위로 다루어 모델 내부에서 근거를 주소 지정 가능한 형태로 유지함으로써 예측의 해석성을 확보했다. 이 접근은 상동성이 낮은 단백질 주석, 조각 단위 역합성, 재료 상 분리 등 도메인별 어려운 문제들에서 성능 향상과 근거 추적을 동시에 가능하게 했다.
핵심 기여
구조 인식 토큰화로 좌표·토폴로지·주기성 통합
연속적 좌표와 결합 위상, 결정의 주기적 연결성을 이산 구조 토큰으로 변환하는 통일된 어휘를 제시했다. 이 구조 토큰은 모델 내부에서 근거 단위로 주소 지정되어 추론 과정에서 직접 참조될 수 있다. 결과적으로 서로 다른 과학 도메인에서 동일한 구조적 표현으로 학습·추론이 가능해졌다.
상동성 제어 기반 Gene Ontology 예측 성능 향상
상동성이 낮거나 고아 단백질에 대해 Cellular Component 주석 정확도를 개선했다. 해당 실험에서 F_{max}가 0.42에서 0.55로 상승한 것으로 보고되었다. 이 결과는 구조 근거를 보존하면서도 유사성 부족이 초래하는 성능 저하를 완화할 수 있음을 시사한다.
조각 수준 절단과 전구체 검증 흔적을 포함한 역합성 생성
단일 단계 역합성 정확도를 기존 0.63에서 0.72로 향상시켰다. 모델은 단순 정답 예측뿐 아니라 결합 절단 지점의 조각 수준 흔적과 전구체 검증(trace)을 함께 생성하여 합성 경로의 타당성을 지원했다. 이 출력은 합성 계획의 해석성과 검증 가능성을 동시에 높인다.
재료 표현으로 상(phase) 분리와 밴드갭 체계화
재료 과학 도메인에서 원소·화합물 상을 분리하고 고·저 밴드갭 영역을 구분할 수 있는 표현을 확보했다. 주기적 연결성 정보를 구조 토큰에 통합함으로써 결정 기반 특성 차이를 반영할 수 있었다. 이로 인해 물질 상태와 전자 구조 관련 예측에 의미 있는 표현 구획이 형성되었다.
광범위 벤치마크와 전문가 이중맹검 평가에서의 우수성
총 86개 벤치마크에서 평가하여 67개 과제에서 state-of-the-art 성능을 기록했다. 전문가 이중맹검 평가에서는 생성된 추론 흔적이 최첨단 대형 언어모델의 흔적보다 우세하거나 동등한 것으로 98%의 사례에서 나타났다. 이는 모델의 예측 정확성과 해석 가능성 양쪽에서 균형을 이룬 결과이다.
핵심 아이디어 이해하기
과학적 구조-성질 관계는 공간 좌표, 결합 토폴로지, 그리고 결정의 주기적 배열 같은 도메인 특유의 신호에 의해 결정된다. 기존의 텍스트 중심 또는 비구조화된 표현은 이런 세부 구조 정보를 잃기 쉬워서, 구조적 근거를 요구하는 예측 문제에서 설명 가능성 및 신뢰성 확보가 어렵다. 따라서 구조 정보를 기계가 직접 읽을 수 있는 형태로 유지하는 것이 핵심 출발점이다. SciReasoner는 연속적·위상적·주기적 특성을 이산 토큰 어휘로 변환하여 모델 입력으로 제공한다. 이러한 구조 토큰은 단일 기호로서 위치와 연결성 정보를 담고, 모델은 이 토큰들을 근거 단위로 주소 지정하여 추론 과정에서 직접 참조한다. 이 방식은 단편적 특징 대신 구조 전체를 근거로 삼는 추론 흐름을 가능하게 한다. 구조 토큰을 증거 단위로 다루면 두 가지 실용적 이점이 생긴다. 첫째, 상동성이 낮은 단백질이나 고유 구조를 가진 분자에서 구조적 근거에 근거한 예측이 가능해져 기존 유사도 기반 접근의 약점을 보완한다. 둘째, 합성 경로나 재료 상 예측처럼 구체적 결단(어떤 결합을 끊을지, 어떤 결정 연결이 중요한지)이 필요한 문제에서 모델 출력이 조각 수준의 근거와 함께 제공되어 인간의 검증과 결합하기 쉬워진다.
방법론
전체 접근은 구조 정보를 보존하는 전처리와 그 이산 표현을 활용한 추론 파이프라인으로 구성된다. 연속 좌표는 이산 토큰으로 양자화되고, 결합 토폴로지와 주기적 연결성은 별도의 토큰 체계로 표상되어 단일 통합 어휘에 편입된다. 이렇게 만든 구조 토큰 세트가 입력으로 들어가면 모델은 토큰을 근거 단위로 주소 지정하여 추론 경로를 구성한다. 핵심 메커니즘은 구조 토큰을 증거 주소로 사용하는 이유추적(trace) 생성 과정이다. 모델은 예측 결과와 함께 어떤 구조 토큰들이 근거로 참조되었는지를 출력하여, 예측에 기여한 원자 배열이나 결합 패턴을 식별 가능하게 만든다. 이 출력에는 조각 수준 분리 지점과 전구체 검증에 필요한 흔적이 포함되어 합성 계획의 해석성을 확보한다. 학습과정 및 적용은 다중도메인 설정을 전제로 한다. 단백질의 Gene Ontology 예측, 유기 분자의 single-step retrosynthesis, 무기물의 상 분류 등 서로 다른 목적의 데이터와 평가기준을 통해 모델을 튜닝하고 검증했다. 논문은 이러한 도메인들을 공통의 구조 어휘 위에서 학습시키는 것이 서로 다른 과학 문제들 사이에서 일반화와 설명 가능성을 높인다고 보고했다.
주요 결과
단백질 도메인에서 상동성 제어 Gene Ontology 예측 실험은 특히 저유사성 및 고아 단백질에서 성능 향상이 관찰되었다. Cellular Component 주석의 F_{max}가 0.42에서 0.55로 상승한 것이 보고되었고, 이는 구조 기반 근거가 유사도 의존적 한계를 완화했음을 시사한다. 이 수치는 동종 과제 대비 의미 있는 개선으로 제시되었다. 화학 분야에서는 단일 단계 역합성 정확도가 0.63에서 0.72로 증가했으며 모델이 조각 수준 절단과 전구체 검증 흔적을 함께 생성한 점이 강조되었다. 이러한 출력은 단순한 반응 예측을 넘어 합성 계획의 검증 가능성을 제공함으로써 실무적 활용 가치가 증가했다. 결과는 합성 정확도 향상뿐 아니라 생성된 근거가 합성 타당성 판단에 기여함을 보여준다. 재료 과학 실험에서는 모델의 표현이 원소와 화합물 상을 분리하고 고·저 밴드갭 영역을 구분하는 구조적 구획을 형성했다. 전 분야 종합 평가에서 총 86개 벤치마크 중 67개 과제에서 state-of-the-art 성능을 달성했다. 또한 이중맹검 전문가 평가에서 생성된 추론 흔적이 최첨단 LLM의 흔적보다 선호되거나 동등한 것으로 98% 사례에서 나타나 해석 가능성과 인간 수용성 측면에서도 강점을 보였다.
기술 상세
전체 아키텍처는 구조 정보를 이산 토큰 어휘로 변환하는 전처리 모듈과 이 토큰들을 입력으로 하는 다중모달 추론 모델로 구성된다. 전처리는 좌표의 격자화, 결합 위상 표상, 결정격자의 주기적 연결성을 각각 토큰화하여 공통 어휘로 통합하는 단계를 포함한다. 이 통합 어휘가 모델의 입력 공간을 이루며 구조 단위가 직접 근거로 사용될 수 있게 한다. 핵심 알고리즘적 기반은 구조 토큰을 '주소 가능한 근거 단위'로 취급하여 예측 시 어떤 토큰들이 참조되었는지를 함께 출력하는 점이다. 이 과정은 예측값과 함께 추론 흔적(trace)을 생성하여 어떤 공간적·토폴로지적 근거가 결정에 기여했는지를 가시화한다. 결과 출력에는 분해 지점과 전구체 검증에 필요한 정보가 포함되어 합성 및 검증 흐름과 결합 가능하도록 설계되었다. 기술적 차별점은 단일 통합 어휘 위에서 단백질, 유기 분자, 무기 결정이라는 서로 다른 구조적 도메인을 동일한 방식으로 표현하여 학습하는 점이다. 이로 인해 도메인 간 표현의 공유와 전이 학습 가능성이 생기며, 특히 상동성 부족 상황에서 구조 근거가 직접 성능 향상으로 이어졌다. 논문은 이러한 표현 설계가 해석 가능성과 예측 성능을 동시에 끌어올린 사례들을 실험 결과로 제시했다.
실무 활용
실무적으로 SciReasoner의 구조 토큰화와 근거 출력은 단백질 주석, 합성 계획 지원, 재료 탐색 등에서 인간 전문가의 판단을 보조할 수 있다. 생성된 조각 수준 흔적과 전구체 검증 로그는 실험 설계 단계에서 합성 가능성 평가에 직접 활용 가능하다. GitHub 저장소가 공개되어 있어 모델·코드 접근성을 확보할 수 있다.
- 저유사성 단백질의 Cellular Component 주석을 보완하는 기능적 우선순위 설정에 활용할 수 있다.
- 단일 단계 역합성 제안의 타당성 검토를 위해 조각 수준 절단 및 전구체 검증 흔적을 실험 계획에 통합할 수 있다.
- 재료 후보 물질의 상(phase) 및 밴드갭 특성 분류에서 초기 필터링 목적으로 모델 표현을 사용할 수 있다.
- 연구팀이 제시한 구조 근거를 바탕으로 인간 전문가가 후속 실험을 설계하고 우선순위를 정하는 워크플로에 통합할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 구조 토크나이제이션(Structure Tokenization)
- — 구조 토크나이제이션은 연속 좌표·결합 위상·주기적 연결성을 이산 토큰 열로 변환하는 처리 방식이다. 이 과정은 공간적·화학적 정보를 기계가 처리할 수 있는 기호 단위로 만든다. 구조 기반 추론에서 근거 단위를 직접 주소 지정할 수 있게 하는 것이 핵심이다.
- 상동성 제어 예측(Homology-Controlled Prediction)
- — 상동성 제어 예측은 서열 유사도(또는 그 부재)를 모델 입력에 반영하여 예측 신뢰성과 편향을 조절하는 접근법이다. 유사성이 낮은 단백질에 대해 별도의 처리 또는 가중치를 적용해 성능 저하를 완화한다. SciReasoner 맥락에서는 저유사성 단백질의 Cellular Component 예측 개선이 목적이다.
- 역합성(레트로시세시스)(Retrosynthesis)
- — Retrosynthesis는 목표 분자를 더 간단한 전구체로 분해하는 화학적 계획 문제이다. 모델은 적절한 결단 지점과 생성될 전구체를 예측하여 합성 경로를 구성한다. SciReasoner는 단일 단계 역합성 정확도와 조각 단위 분리(trace) 출력을 다루었다.
- 조각 수준 절단(Fragment-level Disconnection)
- — 조각 수준 절단은 분자 구조를 합리적인 전구체 단위로 분리하는 작업을 뜻한다. 이 방식은 합성 경로에서 어떤 결합을 끊어야 하는지를 구체적으로 나타낸다. SciReasoner는 조각 수준 절단과 함께 전구체 검증 흔적을 생성하여 합성 타당성을 보강했다.
- 주기적 연결성(Periodic Connectivity)
- — 주기적 연결성은 결정 격자에서 원자들이 반복적으로 연결되는 구조적 성질을 가리킨다. 이 정보는 무기물의 상(phase)과 전자 밴드 구조와 밀접한 관련이 있다. 논문 문맥에서는 주기적 연결성을 토큰화해 재료 도메인에서 상 분리와 밴드갭 구분을 가능하게 했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
