facebook/tribev2
LLaMA 3.2, V-JEPA2, Wav2Vec-BERT의 특징을 통합한 Transformer로 자연 자극(비디오·오디오·텍스트)에 대한 평균 피험자의 fsaverage5 피질 fMRI 반응을 예측한다.
학습 방식 · 기반으로 LLaMA 3.2(텍스트), V-JEPA2(비디오), Wav2Vec-BERT(오디오) 사전학습 인코더를 결합해 Transformer 기반의 FmriEncoder를 학습했으며 PyTorch Lightning과 Slurm 그리드(search)로 다중 연구(multi-study) 로딩·분할·주제 가중화 방식으로 훈련한다.
TL;DR
TRIBE v2는 영상·음성·텍스트 등 자연적 자극으로부터 인간 뇌의 fMRI 반응을 예측하도록 설계된 멀티모달 파운데이션 모델이다. 모델은 사전학습된 텍스트(LLaMA 3.2), 비디오(V-JEPA2), 오디오(Wav2Vec-BERT) 인코더의 출력을 단일 Transformer 기반 FmriEncoder로 통합해 시간축별 입력을 피질 표면 응답으로 매핑한다. 모델은 이벤트 추출 및 단어 수준 타이밍 정렬을 지원하는 도구(get_events_dataframe)를 제공하며, 예측 결과는 fsaverage5 표준 피질 메시(약 20k 정점)에 대응하는 행렬(n_timesteps × n_vertices)로 출력된다. 학습용 파이프라인은 PyTorch Lightning과 Slurm 그리드를 통해 다중 연구 로딩, 데이터 분할, subject weighting 등의 기능을 사용해 대규모 실험을 구성하도록 설계되었다. TRIBE v2는 뇌 인코딩 워크플로를 엔드투엔드로 제공해 시각화와 재학습 루트를 함께 지원하지만, 텍스트 인코더로 LLaMA 3.2 접근을 위해 HuggingFace 인증 토큰이 필요하고 출력은 'average' subject 기준으로 제공되어 개별 피험자 수준의 예측·해석에는 추가 절차가 요구된다. 라이선스는 CC BY-NC 4.0으로 상업적 사용에 제약이 있다.
핵심 포인트
- 피처 추출에 최신 사전학습 인코더(LLaMA 3.2·V-JEPA2·Wav2Vec-BERT)를 조합해 텍스트·비디오·오디오를 같은 Transformer로 통합해 fMRI로 매핑한다는 점
- 출력이 fsaverage5 피질 메시(약 20k 정점)로 바로 제공되어 뇌 표면 단위 분석·시각화 파이프라인과 즉시 연동된다
- 학습 실행 스크립트와 그리드 설정이 포함되어 Slurm 기반 대규모 실험 탐색(피질/피하구조)을 쉽게 수행할 수 있도록 구성되어 있다
- 비디오·오디오·텍스트 입력으로부터 시간-정점(n_timesteps × n_vertices) 형식의 fMRI 예측값 생성
494
LIKES
202.4k
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.