영상·음성·텍스트를 통합해 피질 표면 fMRI 반응을 예측하는 TRIBE v2
LLaMA 3.2, V-JEPA2, Wav2Vec-BERT의 특징을 통합한 Transformer로 자연 자극(비디오·오디오·텍스트)에 대한 평균 피험자의 fsaverage5 피질 fMRI 반응을 예측한다.
TL;DR
TRIBE v2는 영상·음성·텍스트 등 자연적 자극으로부터 인간 뇌의 fMRI 반응을 예측하도록 설계된 멀티모달 파운데이션 모델이다. 모델은 사전학습된 텍스트(LLaMA 3.2), 비디오(V-JEPA2), 오디오(Wav2Vec-BERT) 인코더의 출력을 단일 Transformer 기반 FmriEncoder로 통합해 시간축별 입력을 피질 표면 응답으로 매핑한다. 모델은 이벤트 추출 및 단어 수준 타이밍 정렬을 지원하는 도구(get_events_dataframe)를 제공하며, 예측 결과는 fsaverage5 표준 피질 메시(약 20k 정점)에 대응하는 행렬(n_timesteps × n_vertices)로 출력된다. 학습용 파이프라인은 PyTorch Lightning과 Slurm 그리드를 통해 다중 연구 로딩, 데이터 분할, subject weighting 등의 기능을 사용해 대규모 실험을 구성하도록 설계되었다. TRIBE v2는 뇌 인코딩 워크플로를 엔드투엔드로 제공해 시각화와 재학습 루트를 함께 지원하지만, 텍스트 인코더로 LLaMA 3.2 접근을 위해 HuggingFace 인증 토큰이 필요하고 출력은 'average' subject 기준으로 제공되어 개별 피험자 수준의 예측·해석에는 추가 절차가 요구된다. 라이선스는 CC BY-NC 4.0으로 상업적 사용에 제약이 있다.
핵심 역량
- 비디오·오디오·텍스트 입력으로부터 시간-정점(n_timesteps × n_vertices) 형식의 fMRI 예측값 생성
- 비디오·오디오·텍스트로부터 이벤트 타임라인을 생성(get_events_dataframe)하고 단어 수준 타이밍을 정렬
- 예측 결과를 fsaverage5 피질 메시(약 20k 정점)로 투사하여 뇌 표면 시각화에 사용
- 사전학습된 텍스트·비디오·오디오 인코더를 결합한 멀티모달 추론 파이프라인 제공
- 학습 파이프라인(슬럼 그리드, PyTorch Lightning)과 시각화 도구(PyVista·Nilearn) 통합
훈련 방식
기반으로 LLaMA 3.2(텍스트), V-JEPA2(비디오), Wav2Vec-BERT(오디오) 사전학습 인코더를 결합해 Transformer 기반의 FmriEncoder를 학습했으며 PyTorch Lightning과 Slurm 그리드(search)로 다중 연구(multi-study) 로딩·분할·주제 가중화 방식으로 훈련한다.
알아두면 좋은 것
- 텍스트 인코더로 LLaMA 3.2 사용 — 학습/재학습 시 HuggingFace 인증 토큰 필요(gated 모델 접근)
- 출력은 'average' subject 기준이며 fsaverage5 표준 피질 메시(~20k 정점)에 매핑되어 제공
- 전체 학습 파이프라인(그리드 검색 포함)은 PyTorch Lightning 기반이며 Slurm 실행을 지원
- 시각화 모듈(plotting/)은 PyVista와 Nilearn 백엔드를 통해 뇌 표면 결과를 렌더링
기술적 특징
- 사전학습된 모달별 특징 추출기(LLaMA 3.2, V-JEPA2, Wav2Vec-BERT)를 그대로 활용해 각 입력의 고품질 표현을 얻고, 이들을 단일 Transformer 형태의 FmriEncoder로 통합해 뇌 반응 공간으로 매핑한다. 이렇게 하면 모달 간 표현 차이를 조정하면서도 개별 인코더의 표현력을 유지할 수 있다.
- 예측 출력은 fsaverage5 표준 피질 메시(~20k 정점)로 직접 매핑되며, model.get_events_dataframe와 같은 유틸로 비디오/오디오/텍스트에서 이벤트 타이밍을 추출해 시간 정렬된 입력-응답 쌍을 구성한다. 이 과정으로 단어 수준의 시간 정렬이 가능해 연속적 자연 자극과 fMRI의 시계열 정렬이 수월하다.
- 학습 파이프라인은 PyTorch Lightning 기반으로 구성되어 Slurm 그리드(run_cortical·run_subcortical)를 통해 대규모 실험 탐색을 지원하며, utils.py에서 multi-study 로딩·데이터 분할·subject weighting 기능을 제공해 다중 연구 데이터 통합과 가중치 조정이 가능하다.
- 데모 및 시각화 도구(plotting/)가 통합되어 있어 예측 결과를 PyVista·Nilearn 백엔드로 바로 렌더링하고 분석 가능한 형태로 출력한다. 이로써 모델 출력의 해석과 시각적 검증이 워크플로 수준에서 지원된다.
차별점
- 피처 추출에 최신 사전학습 인코더(LLaMA 3.2·V-JEPA2·Wav2Vec-BERT)를 조합해 텍스트·비디오·오디오를 같은 Transformer로 통합해 fMRI로 매핑한다는 점
- 출력이 fsaverage5 피질 메시(약 20k 정점)로 바로 제공되어 뇌 표면 단위 분석·시각화 파이프라인과 즉시 연동된다
- 학습 실행 스크립트와 그리드 설정이 포함되어 Slurm 기반 대규모 실험 탐색(피질/피하구조)을 쉽게 수행할 수 있도록 구성되어 있다
494
Likes
202.4k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.