본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

TenStrip/10Eros-Max

image-text-to-video 모델 분석minimax-h3-community-license-agreement

MiniMax-H3 기반으로 LTX/Wan/Krea 가중치를 블록별로 보강한 실험적 텍스트·이미지→비디오 모델

학습 방식 · 기본 MiniMaxAI/MiniMax-H3 모델을 출발점으로 하여 다른 diffusion 모델들(LTX 2.3, Wan 2.2, Krea 2)의 학습 패턴을 블록별·헤드별로 선별적으로 주입하는 병합형 파인튜닝 실험적 접근을 사용합니다. 각 주입은 orthogonal projection 방식으로 기존 가중치 공간에 새로운 방향 성분을 더하는 형태로 이루어졌고, LTX 패스는 전방 블록, Wan 패스는 중간~후방 블록(및 광범위한 FFN 수정), Krea 패스는 attention의 query와 일부 key/value, 그리고 gated MLP 입력측만 좁게 적용하는 방식으로 구분되어 적용되었습니다. 이렇게 모듈 경계(입력/출력 프로젝터 및 헤드)를 그대로 두고 transformer 내부의 attention·FFN 가중치만 보강함으로써 모달리티 처리 로직의 변경 없이 시각적·운동적 특성 이식을 시도합니다.

TL;DR

MiniMaxAI/MiniMax-H3를 기반으로 LTX 2.3·Wan 2.2의 비디오 특성과 Krea 2의 이미지 특성을 블록별·헤드별로 선별적으로 주입한 실험적 merge형 텍스트·이미지→비디오 모델입니다. 52-block transformer(2 token_refiner + 50 메인 블록) 위에 modality-specific input projectors와 output heads를 유지한 채 attention 및 FFN 가중치에 orthogonal projection으로 추가 성분을 넣어 donor 모델의 시각적·운동적 캐릭터를 보강합니다. 라이선스는 MiniMax H3 커뮤니티 라이선스가 기본이며, 주입된 부분에 대해서는 donor 모델들의 커뮤니티 라이선스도 적용되며 README에는 성능 수치가 없어 별도 실험이 필요합니다.

핵심 포인트

  • MiniMaxAI/MiniMax-H3를 기반으로 한 실험적 병합·파인튜닝 릴리스로, 다른 비디오/이미지 diffusion 모델들의 학습 패턴을 H3의 transformer 블록에 단계적으로 주입하여 미적·운동 특성을 변경하고자 합니다. 모델은 52-block transformer 스택(2-block token_refiner + 50 main blocks)과 모달리티별 입력 프로젝터(video, audio, condition) 및 출력 헤드를 유지합니다. 주입 방식은 블록 범위를 정해 LTX 2.3을 전방 블록에, Wan 2.2를 중간~후방 블록에 적용하고 Krea 2는 공간적 패턴을 담당하는 attention 투영(특히 query)과 일부 FFN 입력만 좁게 주입하는 형태로 이루어졌습니다.
  • Transformer 내부의 attention과 feed-forward 계층이 모달리티 특화 구조를 포함하지 않는 H3 아키텍처적 특성 때문에 이들 계층이 타 모델의 캐릭터를 전달하기에 적합한 대상으로 선택되었습니다. 주입 수학은 orthogonal projection을 사용하여 기존 H3의 사용 방향과 거의 수직인 새로운 가중치 성분을 추가함으로써 기존 방향을 덮어쓰기보다는 보강하도록 설계되었습니다. Krea 2의 교차 도메인 주입은 공간적 세부 묘사를 강화하면서도 시간 일관성을 해치지 않도록 출력 프로젝션과 오디오 관련 헤드 슬롯은 건드리지 않거나 범위를 좁혀서 적용했습니다.
  • 구체적 적용 순서는 LTX가 먼저 전방 블록에 패스된 후 Wan이 중간~후방 블록에 패스되었고, Wan 패스는 attention뿐 아니라 feed-forward 층에도 더 넓은 범위로 변형을 가했습니다. 이후 Krea 2 패스는 이미지 모델이 학습한 단일 프레임 공간 관계를 H3의 attention query(주로)와 일부 key/value 위치, 그리고 gated MLP의 입력측 일부에만 주입하여 디테일과 시각적 캐릭터를 보강하도록 한 설계적 선택이었습니다. 이러한 블록별·헤드별 선별적 주입과 orthogonal projection의 조합으로 H3의 오디오·비디오 처리 능력과 안전성 관련 구조는 유지되면서 시각적 스타일과 모션 특질이 기여 모델 쪽으로 변하도록 만들었습니다.
  • 라이선스 측면에서는 MiniMax H3 community license가 기본으로 적용되며, 이번 릴리스에 주입된 LTX 2.3, Wan 2.2, Krea 2의 커뮤니티 라이선스 조건도 각 모델에서 전달된 부분에 대해 적용됩니다. README에는 라이선스 링크가 포함되어 있고 pipeline_tag는 image-text-to-video로 명시되어 있습니다. 메타데이터 기준으로는 좋아요 80, 다운로드 0으로 표기되어 있으며 README 내에는 성능 벤치마크나 정량적 수치가 제공되지 않아 성능 평가는 별도 실험이 필요합니다.

제한사항

  • README에는 정량적 벤치마크나 샘플 기반 평가 수치가 제공되어 있지 않아 실제 합성 결과의 품질, 안정성, 또는 파라미터·속도 영향에 대한 객관적 판단이 불가능합니다. 설명된 주입 방식은 블록·헤드 선택과 orthogonal projection에 크게 의존하므로 이 선택지가 달라지면 결과가 크게 변할 가능성이 있습니다. 교차 도메인(이미지→비디오) 주입은 출력 프로젝션을 제외하는 등 신중하게 범위를 제한했으나, 이로 인해 어떤 세부 패턴은 반영되지 않거나 예기치 않은 상호작용이 남을 여지가 있습니다.

80

Likes

0

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.