본문으로 건너뛰기

MLIP Arena 공동 1위에 오른 PFP v9

PFP v9이 MLIP Arena에서 MACE-MPA와 공동 1위를 기록하고 r2SCAN 반응열 평가에서도 최저 오차를 냈다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Preferred Networks는 Matlantis-PFP v9을 MLIP Arena의 다섯 과제에서 평가해 MACE-MPA와 공동 전체 1위를 기록했다. PFP v9은 동핵 이원자, 상태방정식, 안정성에서 1위를 차지했고 에너지 부피 스캔에서는 5위, 연소에서는 4위를 기록했다. 연소 반응열을 결정론적으로 비교한 추가 실험에서는 PFPv9 r2SCAN이 RMSE 3.10 kcal/mol로 가장 낮았고 PFPv9 PBE도 7.88 kcal/mol로 MACE-MPA의 11.15 kcal/mol보다 약 29% 낮았다. 속도 지표를 제외한 평가에서도 상위 순위가 유지돼 PFP v9의 종합 성능이 하드웨어별 실행 속도에만 좌우되지 않았음을 확인했다.

섹션별 상세

Preferred Networks는 Matlantis-PFP v9을 PBE 계산 모드로 실행해 Chiang 등의 MLIP Arena 공개 벤치마크에서 평가했다. MLIP Arena는 에너지와 힘의 정적 오차만 비교하지 않고, 실제 원자 시뮬레이션에서 물리적으로 의미 있는 거동을 재현하는지 측정한다. PFP v9은 동핵 이원자, 상태방정식, 에너지 부피 스캔, 안정성, 연소의 다섯 과제에서 비교됐으며 전체 순위에서 MACE-MPA와 공동 1위를 기록했다.
MLIP Arena 전체 순위에서 PFPv9과 MACE-MPA가 공동 1위로 표시된 표다.
Chart표는 diatomics, eos_bulk, wbm_ev, stability, combustion 다섯 과제의 순위와 집계 순위를 비교한다. PFPv9은 전체 집계 순위 12로 MACE-MPA와 동률이며, 개별 과제에서는 diatomics·eos_bulk·stability에서 1위를 기록한다. MACE-MPA는 wbm_ev에서 2위, combustion에서 2위를 기록해 두 모델의 강점이 과제별로 나뉜다.
근거
  • PFP v9은 MLIP Arena 전체 순위에서 MACE-MPA와 공동 1위를 기록했다. Table 1의 Overall ranking 표에서 PFP v9과 MACE-MPA가 Rank 1로 표시됨 출처
PFP v9은 MACE-MPA와의 일대일 비교에서 다섯 과제 중 세 과제의 1위를 차지했다. 따라서 한 모델이 나머지 두 과제를 모두 이기더라도 PFP v9의 과반 승리를 막을 수 없는 구조이며, 글은 이를 근거로 경기장에 있는 어떤 모델도 일대일 평가에서 PFP v9을 앞설 수 없다고 설명한다. 두 모델의 집계 순위는 각각 7과 8로 나타났다.
PFPv9과 MACE-MPA의 다섯 과제 일대일 비교에서 두 모델의 집계 순위가 7과 8로 나타난 표다.
ChartPFPv9은 diatomics, eos_bulk, stability에서 1위를 차지하고 MACE-MPA는 wbm_ev와 combustion에서 1위를 차지한다. 다섯 과제 중 세 과제의 승리로 PFPv9이 일대일 비교에서 과반을 확보한다는 글의 논리를 시각적으로 뒷받침한다.
근거
  • PFP v9은 다섯 과제 중 세 과제에서 1위를 차지해 모든 모델과의 일대일 비교에서 과반 승리를 확보했다. Table 2의 Head-to-head comparison 및 해당 설명에서 집계 순위 7 대 8과 세 과제 1위가 제시됨 출처
동핵 이원자 과제에서 PFP v9은 평가된 모든 지표에서 가장 좋은 성능을 냈다. 96개 원소를 지원하는 PFP v9은 보존 편차와 에너지 점프가 가장 작고, tortuosity가 이상적인 값에 가까우며, 반발 에너지와 하강 힘의 순위 상관도도 가장 강했다. 이는 단순한 집계 점수뿐 아니라 에너지 힘 곡선의 매끄러움과 물리적 순서에서도 일관된 성능을 보였다는 의미다.
동핵 이원자 과제에서 18개 모델의 물리적 일관성 관련 지표와 순위를 비교한 표다.
ChartPFPv9은 Rank 1과 집계 순위 1을 기록하고 보존 편차 0.0122396, 반발·하강 추세의 Spearman 계수 약 -0.999, 에너지 점프 0.00336253을 보인다. 다른 모델과 비교해 곡선의 물리적 순서와 수치적 매끄러움을 함께 평가하는 과제의 성격이 드러난다.
근거
  • 동핵 이원자 과제에서 PFP v9은 보존 편차, 에너지 점프, tortuosity와 두 Spearman 지표를 포함한 모든 평가 지표에서 최고 성능을 기록했다. Table 3의 Homonuclear diatomics benchmark result 출처
eos_bulk 과제에서 PFP v9은 에너지 차이의 flip 지표 1.032, tortuosity 1.005, 압축 에너지 Spearman 상관계수 -1.000, 압축 미분 상관계수 0.998, 인장 에너지 상관계수 0.987을 기록하며 1위를 차지했다. MACE-MPA는 인장 에너지 상관계수에서 PFP v9보다 약간 높았지만, PFP v9은 곡선의 매끄러움과 압축 관련 지표에서 더 강했다. 따라서 한 지표의 압도적 우위보다 압축과 인장 전반의 균형이 집계 순위를 결정했다.
eos_bulk 과제에서 PFPv9, MACE-MPA, ORBv2의 에너지 부피 곡선을 비교한 그래프다.
Chart세 모델의 곡선은 V/V₀가 1인 기준 부피에서 에너지 차이가 0으로 모이며 압축·인장 구간의 형태가 비교된다. PFPv9은 기준점 주변에서 상대적으로 매끄러운 곡선을 보이며, 글이 언급한 낮은 flip count와 tortuosity를 시각적으로 확인하게 한다.
eos_bulk 과제의 파생 flip, tortuosity, 압축·인장 Spearman 지표와 순위를 비교한 표다.
ChartPFPv9은 Rank 1, 집계 순위 10으로 표시되며 derivative flips 1.032, tortuosity 1.005, 압축 상관계수 -1, 압축 미분 상관계수 0.998, 인장 상관계수 0.987을 기록한다. MACE-MPA는 인장 상관계수에서 0.993으로 더 높지만, PFPv9은 압축과 곡선 매끄러움 지표를 포함한 종합 평가에서 앞선다.
근거
  • PFP v9은 eos_bulk 과제에서 energy-difference flip 1.032와 tortuosity 1.005를 기록하며 집계 1위를 차지했다. Table 4와 Figure 1의 Bulk equation-of-state curves 출처
PFP v9은 에너지 부피 스캔 과제에서는 5위였지만 1000개 구조를 모두 완료했고, 에너지 차이 flip 점수가 1에 가깝고 tortuosity도 매우 낮았다. 이 과제는 격자를 ±20% 조정했을 때 에너지 부피 곡선의 단조성, 순위 상관, 수치적 규칙성을 평가한다. 최고 순위는 아니었지만 넓은 무기 구조 집합에서 물리적으로 타당하고 수치적으로 안정된 추세를 유지했다.
안정성 과제에서 PFP v9은 가열 AUC와 압축 AUC를 모두 높은 수준으로 유지하고 가열·압축 scaling exponent도 낮게 기록해 1위를 차지했다. ORBv2는 가열 AUC 0.985로 PFP v9의 0.981보다 높았지만 압축 AUC가 0.772로 낮았고, PFP v9은 두 스트레스 조건에서 균형을 유지했다. 이는 시뮬레이션 조건이 어려워질수록 성능이 급격히 악화되는 정도가 작았다는 뜻이다.
가열·압축 안정성 과제의 AUC와 scaling exponent를 모델별로 비교한 표다.
ChartPFPv9은 가열 AUC 0.981, 압축 AUC 0.962, 가열 scaling exponent 0.201, 압축 scaling exponent 0.188을 기록하며 전체 1위다. ORBv2는 가열 AUC 0.985로 더 높지만 압축 AUC가 0.772에 그쳐, PFPv9이 두 조건에서 균형을 유지한다는 결론을 뒷받침한다.
연소 과제에서 PFP v9은 다섯 번의 시험 평균으로 4위를 기록했지만 최종 중심질량 drift는 비교 모델 중 가장 작았다. 수소 화염 온도 범위인 2380–3000 K 구간의 후반부터 물 생성을 시작해 이후에도 생성물을 늘렸으나, 최종 수율은 최고 수율 모델보다 낮았다. 반응 분자 동역학 궤적은 작은 수치 차이에도 달라질 수 있으므로, 글은 PFP v9의 수치 안정성과 반응 에너지 정확도를 별도로 해석했다.
고온 수소 연소 과제에서 반응 엔탈피 오차, 중심질량 drift, 초당 스텝 수, 수율을 비교한 표다.
ChartPFPv9은 최종 중심질량 drift 1.258e-06 Å로 가장 작아 수치 안정성에서 강점을 보인다. 반면 반응 엔탈피 오차 21.532 kcal/mol과 수율 66.875%로 종합 순위는 4위이며, MACE-MP(M)는 수율 89.062%와 1위를 기록한다.
분자 동역학 timestep에 따른 모델별 총 중심질량 drift를 로그 스케일로 나타낸 그래프다.
Chart갈색 점선으로 표시된 PFPv9의 평균 drift는 전체 구간에서 다른 모델보다 낮은 수준에 머물고, 음영은 다섯 번의 시험에서 얻은 표준편차를 나타낸다. 이 그래프는 연소 시뮬레이션에서 PFPv9의 궤적이 수치적으로 잘 제어됐다는 평가와 연결된다.
수소 연소 시뮬레이션에서 timestep에 따른 물 분자 수의 변화를 모델별로 나타낸 그래프다.
Chart파란 음영 구간은 처방 온도가 실험적 수소 화염 온도 범위인 2380–3000 K에 해당하는 시점을 뜻한다. PFPv9의 갈색 점선은 해당 구간 후반부터 물 생성이 증가하고 이후에도 반응이 진행되지만, 최종 수율은 일부 모델보다 낮게 나타난다.
확률적 궤적의 영향을 줄이기 위해 원 논문의 수소 연소 벤치마크를 사용해 19개 기본 반응의 반응열을 결정론적으로 비교했다. PFPv9 r2SCAN은 RMSE 3.10 kcal/mol, PFPv9 PBE는 7.88 kcal/mol, MACE-MPA는 11.15 kcal/mol을 기록했으며, PFPv9 PBE도 MACE-MPA보다 약 29% 낮은 오차를 보였다. r2SCAN은 PBE 대비 오차를 56% 줄여 반응열 예측에서는 계산 함수 선택이 큰 영향을 미친다는 결과를 냈다.
19개 수소 연소 기본 반응의 실험 반응열과 세 계산 방법의 예측값을 막대그래프로 비교한 그림이다.
ChartPFPv9 r2SCAN, PFPv9 PBE, MACE-MPA의 예측 반응열이 실험 기준값과 반응별로 비교된다. 본문에 따르면 전체 RMSE는 각각 3.10, 7.88, 11.15 kcal/mol이며, r2SCAN이 PBE와 MACE-MPA보다 실험값에 더 가깝다.
근거
  • 수소 연소 반응열 RMSE는 PFPv9 r2SCAN 3.10 kcal/mol, PFPv9 PBE 7.88 kcal/mol, MACE-MPA 11.15 kcal/mol 순이었다. Figure 4의 heats of reaction 비교와 Additional benchmark of Hydrogen Combustion 본문 출처
하드웨어 차이로 속도 지표가 공정하지 않을 수 있다는 우려를 반영해 안정성과 연소 과제에서 speed metric을 제외한 순위도 별도로 계산했다. 이 대체 평가에서도 상위 방법의 순서는 바뀌지 않았다. 따라서 전체 순위가 단순한 계산 속도 차이에 의해 좌우되지 않았다는 점을 확인했다.
속도 지표를 제외한 MLIP Arena 전체 순위를 나타낸 표다.
ChartPFPv9과 MACE-MPA가 여전히 공동 1위로 표시되며, MatterSim이 3위, MACE-MP(M)과 CHGNet이 그 뒤를 잇는다. 안정성과 연소 과제에서 speed metric을 제거해도 상위 모델 순서가 유지된다는 글의 보조 검증에 해당한다.
속도 지표를 제외한 대체 평가에서 각 모델의 과제별 순위를 비교한 표다.
ChartPFPv9은 diatomics, eos_bulk, stability no speed에서 1위이며 MACE-MPA와 전체 집계 순위 11로 동률이다. speed metric을 제거한 뒤에도 핵심 과제의 순위와 상위권 구조가 크게 바뀌지 않아 계산 속도가 전체 결과의 주된 원인이 아니라는 점을 보여준다.
근거
  • speed metric을 제외해도 상위 방법의 순서는 유지됐다. Table 8의 Overall ranking without speed metrics

용어 해설

머신러닝 원자간 포텐셜(Machine-Learning Interatomic Potential)
머신러닝 원자간 포텐셜은 원자 구조를 입력받아 에너지와 힘을 예측하고, 이를 원자 시뮬레이션에 활용하는 모델이다. 정적 예측 오차뿐 아니라 에너지 곡선의 연속성, 물리적 안정성, 반응 거동까지 평가하는 것이 실제 계산 신뢰도에 중요하다.
상태방정식(Equation of State)
상태방정식은 물질의 부피 변화에 따른 에너지와 물리량의 관계를 나타낸다. MLIP Arena의 eos_bulk 과제에서는 압축과 인장에 따른 에너지 부피 곡선이 매끄럽고 단조적인지, 에너지 차이의 부호 전환과 곡선 왜곡이 적은지를 측정한다.
곡선 굴곡도(Tortuosity)
Tortuosity는 예측 곡선이 이상적인 단조 경로에서 얼마나 불필요하게 구불거리는지를 나타내는 지표다. 값이 1에 가까울수록 에너지 또는 힘의 변화가 매끄럽고 물리적으로 일관된 형태에 가깝다는 뜻으로 사용된다.
Spearman 상관계수(Spearman Correlation)
Spearman 상관계수는 두 변수의 순위 관계가 얼마나 일치하는지 측정한다. 이 글에서는 에너지와 힘이 압축·인장 또는 반발·하강 구간에서 기대되는 방향으로 변하는지 평가하는 데 활용되며, 부호와 절댓값을 함께 해석해야 한다.
r2SCAN
r2SCAN은 원자 및 분자 에너지 계산에 사용되는 밀도범함수 계산 모드다. 글의 수소 연소 반응 비교에서는 PFP v9의 계산 모드를 PBE에서 r2SCAN으로 바꿔 실험 반응열과의 RMSE를 비교했으며, r2SCAN이 더 낮은 오차를 기록했다.

기술

  • Matlantis-PFP v9
  • PFP v9
  • MLIP Arena
  • MACE-MPA
  • PBE
  • r2SCAN
  • ORBv2
  • MatterSim

활용 사례

  • 원자 구조의 에너지와 힘 예측
  • 상태방정식 및 에너지 부피 곡선 검증
  • 고온 반응성 분자 동역학
  • 수소 연소 반응열 예측
  • 재료 발견용 원자 시뮬레이션
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 17.수집 2026. 08. 17.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.