본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Mixture-of-Experts(MoE) 모델은 활성화되는 파라미터보다 훨씬 더 많은 파라미터를 보유한다
SkewAdam: MoE 학습에서 옵티마이저 상태 메모리를 계층적으로 줄여 6.78B 모델을 단일 40GB GPU에 탑재한 옵티마이저
Loopie: 루프드 Transformer 계열의 고성능 MoE 모델
LingBot-Video: DiT 기반 로봇 지향 대규모 MoE 비디오 파운데이션 모델이다. Mixture-of-Experts 아키텍처를 채택해 용량과 추론 효율의 균형을 맞추었다. 로봇 중심 데이터 프로파일링과 다차원 보상체계를 결합해 물리적 합리성과 작업 완수 능력을 학습하게 설계되었다.
Amazon Bedrock에서 제공되는 MiniMax M2 계열과 M2.5의 에이전트·장문맥 최적화 특징을 중심으로 한 기술 개요이다. 이 글은 Bedrock이 오픈 웨이트 MiniMax 모델을 관리형으로 제공하며 프롬프트와 완성물이 모델 학습에 사용되지 않는 보안·규정 준수 보장을 포함한다. 또한 MiniMax M2 계열의 MoE 아키텍처와 1,000,000 토큰 문맥 창 등 핵심 기술적 특징이 제시되어 있다.
Cursor Composer: RL과 MoE로 구현한 초고속 AI 코딩 에이전트의 비밀
미스트랄 AI, 10종의 오픈 웨이트 모델 '미스트랄 3' 제품군 출시
Gemma 4 기술 보고서: 멀티모달·장문 맥락·효율성 강화를 위한 Dense 및 MoE 모델군
H64LM: PyTorch로 처음부터 구현한 249M 파라미터 Transformer와 체크포인트 공개
ec75hash/moe-routing — Qwen3.5-35B의 전문가 114 신호와 반성적 세계관 활성화
Token-Superposition Training으로 효율적인 프리트레이닝
Federation of Experts(FoE): 대형 언어 모델의 통신 효율적 분산 추론
로봇 AI의 새로운 패러다임: Rhoda AI의 DVA와 Sharpa의 MoDE-VLA 기술 분석
← 피드로 돌아가기
Mixture-of-Experts (MoE)
Architecture (AI 아키텍처)
약 14개 아티클
관련 태그:
MoE
Amazon Bedrock
Encoder-free Architecture
Cursor
Cursor Composer
DiT
CLIP ViT-B/32
Federation of Experts
LingBot-Video
AdamW