관련 기사 바로가기
DeepSeek-V2의 핵심 기술인 Multihead Latent Attention(MLA)의 원리와 구현.LLM Creator Studio 공개 레포Text-LLM-Training-from-scratch: PyTorch 원시 연산으로 구현한 텍스트 LLM 학습 파이프라인RoPE 인식 기반 비트 할당을 통한 KV-캐시 양자화 (RoPE-Aware Bit Allocation for KV-Cache Quantization)HDD-RoPE — 누적 행렬곱을 위치 임베딩으로 재활용한 고차원 RoPE스탠포드 CME 296 강좌 5: 확산 모델 및 대규모 비전 모델 아키텍처Three-Phase Transformer: 전기 공학의 3상 전력 원리를 적용한 새로운 신경망 아키텍처DreamID-Omni: 제어 가능한 인간 중심 오디오-비디오 생성을 위한 통합 프레임워크Yale/UNC-CH 지구물리학적 파형 역산 경진대회 1위 솔루션 분석Echo-Forcing: 인터랙티브한 롱비디오 생성을 위한 Scene Memory 프레임워크Vision Transformer의 위치 인코딩이 내부 표현 기하학 및 강건성에 미치는 영향 연구LLM의 구성적 추론 한계: 규모의 문제인가 기하학적 구조의 문제인가?Three-Phase Transformer: 신경망에 전기 그리드의 3상 기하학 구조를 주입하다Transformer의 위치 정보 주입: RoPE의 원리와 장점곱셈 격자: 위치 인코딩을 위한 자연스러운 산술적 기저Dot-Product Attention을 거리 기반 RBF-Attention으로 교체한 실험기DroPE: 사전 학습된 LLM의 위치 임베딩 제거를 통한 컨텍스트 확장Utonia: 모든 포인트 클라우드를 위한 단일 인코더를 향하여Proact-VL: 실시간 AI 컴패니언을 위한 능동형 비디오 LLMID-LoRA: In-Context LoRA를 활용한 아이덴티티 기반 오디오-비디오 개인화
← 피드로 돌아가기
RoPE
약 28개 아티클
관심 태그 추가
관련 태그:Three-Phase TransformerAnthropicPyTorchTransformerllama.cppVision TransformerDiTDINOv3Block-GTQDroPE
TIMEHEADLINE