본문으로 건너뛰기

IBM, 상용 활용 가능한 Granite 시계열 PatchTST-FM-r2 공개

IBM의 PatchTST-FM-r2가 GIFT-Eval Zero-shot 시계열 예측에서 상용 친화적 라이선스로 2위에 올랐습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

IBM이 약 3억 8,500만 개 파라미터를 가진 시계열 Foundation Model PatchTST-FM-r2를 공개했으며, 별도 Fine-tuning 없이 수요·가격·에너지 부하·교통량·Telemetry 등 다양한 시계열의 Zero-shot Forecasting에 사용할 수 있습니다. 이 모델은 Multi-head Self-Attention과 Temporal Convolution을 결합한 Conformer 블록, 50% 겹침 패치, Hamming-window weighting, overlap-and-add Forecasting을 사용하고 최대 8,192개 시점의 문맥과 99개 분위수 출력을 지원합니다. 2026년 9월 8일 기준 GIFT-Eval의 Zero-shot·재현 가능 모델 부문에서 CRPS 0.467과 MASE 0.6846으로 두 지표 모두 2위를 기록했으며, 허용적 상용 라이선스 모델 가운데 가장 높은 성능을 냈습니다. 모델 가중치와 Architecture, 추론 파이프라인, 재현 코드가 공개됐고 Apache 2.0과 OpenMDW 1.0 중 하나를 선택할 수 있습니다. IBM은 Confluent Cloud의 Apache Flink 기반 스트리밍 환경에서 Granite Time Series 모델을 실시간 Forecasting과 이상 탐지에 연결하는 Early Access도 함께 소개했습니다.

섹션별 상세

01
시계열별로 별도 모델을 학습하던 Forecasting 방식은 데이터셋이 늘어날수록 구축과 유지보수 부담이 커지므로, PatchTST-FM-r2는 사전 학습된 모델에 최근 시계열 기록만 넣어 새로운 데이터셋의 미래 구간을 예측합니다. 약 3억 8,500만 개 파라미터와 최대 8,192개 시점의 문맥을 사용하며, 수요·가격·에너지 부하·교통량·Telemetry 등 여러 유형의 입력을 처리합니다. Fine-tuning이나 작업별 모델 적합 없이 유연한 예측 길이와 확률 분포를 얻을 수 있다는 점에서 범용 Forecasting 파이프라인 구축에 적합합니다.
02
GIFT-Eval은 서로 다른 데이터셋과 Forecasting 시나리오에서 모델을 비교하는 종합 벤치마크이며, CRPS와 MASE는 모두 낮을수록 우수합니다. 2026년 9월 8일 기준 Zero-shot·재현 가능·테스트 누수 없음 조건에서 PatchTST-FM-r2는 CRPS 0.467과 MASE 0.6846으로 두 지표 모두 2위를 기록했습니다. Apache 2.0 또는 OpenMDW 1.0을 적용한 모델 중에서는 두 지표 모두 가장 높은 순위였고, pretrained 모델까지 포함하면 CRPS 3위와 MASE 4위를 기록했습니다.
GIFT-Eval의 Zero-shot·재현 가능 모델별 CRPS 비교 차트입니다.
Chart차트에서 PatchTST-FM-r2의 CRPS는 0.4672로 표시되며 TimesFM-3 다음 순위에 놓여 있습니다. 본문이 제시한 기하평균 CRPS 0.467과 일치하고, 파란색 IBM 계열 모델 가운데 가장 낮은 값으로 나타납니다.
GIFT-Eval의 Zero-shot·재현 가능 모델별 MASE 비교 차트입니다.
ChartPatchTST-FM-r2의 MASE는 0.6846으로 표시되며 TimesFM-3 다음에 위치합니다. 본문 수치인 기하평균 MASE 0.6846을 시각적으로 확인할 수 있고, 값이 낮을수록 우수하다는 비교 기준도 적용됩니다.
Zero-shot 모델과 pretrained 모델을 함께 비교한 GIFT-Eval CRPS 차트입니다.
ChartPatchTST-FM-r2는 차트에서 CRPS 0.467로 표시되며 비교 대상 가운데 낮은 값에 속합니다. 본문은 pretrained 모델까지 포함했을 때 PatchTST-FM-r2가 재현 가능한 모델 기준 CRPS 3위라고 기술합니다.
Zero-shot 모델과 pretrained 모델을 함께 비교한 GIFT-Eval MASE 차트입니다.
ChartPatchTST-FM-r2의 MASE는 0.6846으로 표시되며 일부 pretrained 모델보다 낮습니다. 본문은 이 조건에서 PatchTST-FM-r2가 재현 가능한 모델 기준 MASE 4위이며, 더 큰 일부 모델도 앞선다고 설명합니다.
03
PatchTST-FM-r2는 PatchTST-FM-r1의 표준 Transformer 블록을 Conformer 스타일 블록으로 교체해 장거리와 단거리 시간 관계를 나눠 처리합니다. 각 블록은 두 개의 절반 단계 Feed-Forward 층 사이에 Multi-head Self-Attention과 Temporal Convolution을 배치하며, Convolution 커널 크기 5와 3을 반복하는 패턴을 사용합니다. Attention이 패치 사이의 장거리 관계에 집중하는 동안 Convolution이 짧은 구간의 상호작용을 처리해, 기존 Transformer에서 대각선 부근에 몰리던 Attention 패턴이 더 먼 위치까지 확장됩니다.
PatchTST-FM-r1과 PatchTST-FM-r2의 블록 구성과 입력 패치 구조를 비교한 Architecture 다이어그램입니다.
Diagramr1은 Multi-head Self-Attention과 Feed-Forward Network를 결합한 블록과 비중첩 입력 패치를 사용합니다. r2는 겹치는 입력 패치와 함께 절반 단계 Feed-Forward 층 두 개, Multi-head Self-Attention, Convolution을 결합한 Conformer 스타일 블록을 사용하고 블록 수를 20개에서 30개로 확장합니다.
Transformer Layer와 Conformer Layer의 Attention 패턴을 나란히 비교한 시각화입니다.
DiagramTransformer의 Attention은 대각선 주변에 상대적으로 집중되어 국소 관계를 많이 처리하는 형태를 보입니다. Conformer에서는 Temporal Convolution이 짧은 거리 패턴을 맡으면서 Attention이 대각선에서 먼 패치 간 관계까지 향하는 패턴이 나타나며, 이는 본문이 설명한 장거리·단거리 역할 분담과 연결됩니다.
04
모델은 50% 겹침 패치와 Hamming-window weighting을 사용하고 overlap-and-add 방식으로 패치 경계를 부드럽게 연결합니다. 여기에 안정화를 위한 Normalization과 20개에서 30개로 늘어난 블록을 적용해 약 3억 8,500만 개 파라미터 규모를 구성했으며, 99개 분위수 Prediction Head로 점 예측과 불확실성 구간을 함께 출력합니다. 이 구조는 최근 관측 구간만으로 단일 예측값뿐 아니라 예측 분포를 생성해야 하는 운영 Forecasting에 연결됩니다.
05
사전 학습 데이터는 GiftEvalPretrain의 일부 데이터셋, 수정된 주기성 커널을 사용한 KernelSynth 기반 합성 데이터, GIFT-Eval 평가 세트를 제외한 데이터로 만든 TSMixup 코퍼스, 길이 4,096의 합성 CauKer 시퀀스 약 50만 개로 구성됩니다. 데이터 출처와 벤치마크 누수 여부를 확인할 수 있는 정보가 제공되어 기업의 모델 거버넌스와 라이선스 검토에 활용할 근거가 늘어났습니다. 모델 가중치·Architecture·추론 파이프라인·벤치마크 재현 코드가 공개되고 Apache 2.0과 OpenMDW 1.0 중 하나를 선택할 수 있어 연구와 상용 배포의 진입 장벽을 낮춥니다.
bash
pip install "granite-tsfm>=0.3.9"

Granite TSFM 패키지를 설치합니다.

python
import pandas as pd
from tsfm_public import PatchTSTFMForPrediction, TimeSeriesForecastingPipeline

# Load model weights
model = PatchTSTFMForPrediction.from_pretrained(
    "ibm-granite/granite-timeseries-patchtst-fm-r2"
)
# Read some sample data from ETTh
df = pd.read_csv(
    "https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv",
    parse_dates=["date"],
)
# Set up the forecasting pipeline
pipe = TimeSeriesForecastingPipeline(
    model=model,
    id_columns=[],
    timestamp_column="date",
    target_columns=["HUFL"],
    max_context_length=model.config.context_length,
    context_length=512,
    prediction_length=64,
    impute_method=None,
    quantile_levels=[0.1, 0.5, 0.9],
    explode_forecasts=True,
    freq="1h",
)
# Create a forecast from the last 512 samples of the input dataframe
forecast = pipe(df.iloc[-512:])

Hugging Face Hub에서 PatchTST-FM-r2를 불러와 ETTh1 데이터의 최근 512개 시점으로 64개 시점의 예측과 0.1·0.5·0.9 분위수를 생성합니다.

06
Python에서는 `granite-tsfm>=0.3.9`를 설치한 뒤 `PatchTSTFMForPrediction.from_pretrained`로 `ibm-granite/granite-timeseries-patchtst-fm-r2`를 불러오고 `TimeSeriesForecastingPipeline`에 입력 시계열과 문맥 길이 512, 예측 길이 64, 분위수 `[0.1, 0.5, 0.9]`를 지정합니다. 파이프라인은 ETTh1 데이터의 마지막 512개 샘플을 받아 다음 64개 시점의 Forecast를 생성하며, 별도의 Fine-tuning이나 작업별 모델 학습을 요구하지 않습니다. 같은 흐름을 수요·센서 Telemetry·CPU 사용률·에너지 소비·거래량·교통량·가격처럼 정기적으로 샘플링된 자체 시계열에도 적용할 수 있습니다.
07
정적인 DataFrame을 넘어 지속적으로 데이터가 들어오는 환경에서는 IBM과 Confluent의 Early Access 프로그램을 통해 Granite Time Series 모델을 Apache Flink 기반 Confluent Cloud 스트림에 연결할 수 있습니다. 이 통합은 별도 ML 환경으로 데이터를 이동하지 않고 라이브 스트림에서 Forecast와 이상 탐지 결과를 생성하는 경로를 제공합니다. 초기 포트폴리오에는 PatchTST-FM-r1, FlowState-r1.1, TTM-r3, TSPulse가 포함됐으며, PatchTST-FM-r2 공개는 Notebook 기반 실험에서 실시간 운영 처리로 확장되는 활용 경로를 추가합니다.

용어 해설

Zero-shot Forecasting
특정 데이터셋으로 별도 학습하거나 Fine-tuning하지 않고, 사전 학습된 시계열 Foundation Model에 최근 관측값만 입력해 미래를 예측하는 방식입니다. 입력 시계열의 패턴을 사전 학습 지식과 연결해 새로운 데이터셋에도 Forecast를 생성하므로, 데이터셋별 모델 구축과 유지보수 부담을 줄이는 데 의미가 있습니다.
시계열 Foundation Model(Time-Series Foundation Model)
여러 출처의 시계열 데이터를 이용해 사전 학습한 범용 모델로, 수요·가격·에너지 부하·교통량처럼 서로 다른 시계열에 공통 구조를 적용합니다. PatchTST-FM-r2는 최대 8,192개 시점의 문맥과 유연한 예측 길이를 사용해 Zero-shot Forecasting과 불확실성 추정을 함께 수행합니다.
Conformer
Multi-head Self-Attention과 Temporal Convolution을 한 블록에 결합한 Architecture입니다. Attention은 패치 사이의 장거리 관계를 처리하고 Convolution은 국소적인 시간 패턴을 포착해, PatchTST-FM-r2가 짧은 구간과 긴 시계열 의존성을 함께 학습하도록 구성합니다.
CRPS
확률적 Forecasting의 예측 분포가 실제 관측값과 얼마나 일치하는지 측정하는 평가 지표입니다. GIFT-Eval에서는 값이 낮을수록 성능이 좋으며, PatchTST-FM-r2는 Zero-shot·재현 가능 모델 비교에서 기하평균 CRPS 0.467을 기록했습니다.
MASE
시계열 예측 오차를 기준 시계열의 단순한 예측 오차와 비교해 정규화하는 지표입니다. GIFT-Eval에서 낮은 값이 우수한 성능을 뜻하며, PatchTST-FM-r2는 Zero-shot·재현 가능 모델 비교에서 기하평균 MASE 0.6846을 기록했습니다.

기술

  • PatchTST-FM-r2
  • PatchTST-FM-r1
  • Conformer
  • Transformer
  • Multi-head Self-Attention
  • Temporal Convolution
  • Hamming-window weighting
  • overlap-and-add forecasting
  • KernelSynth
  • TSMixup
  • CauKer
  • Python
  • pandas
  • granite-tsfm
  • TimeSeriesForecastingPipeline
  • Hugging Face Hub
  • Apache Flink
  • Confluent Cloud
  • Apache 2.0
  • OpenMDW 1.0

활용 사례

  • 수요 예측
  • 가격 예측
  • 에너지 부하 예측
  • 교통량 예측
  • 센서 Telemetry 예측
  • CPU 사용률 예측
  • 거래량 예측
  • 실시간 이상 탐지
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 10.수집 2026. 09. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.