본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Triton 플러그인 확장으로 TLX와 커스텀 컴파일러 패스 기본 제공
RcCaMoE: 다층 가역 셀룰러 오토마타 기반의 자원 효율적 MoE 라우팅
OCTOPUS: Optimized KV Cache for Transformers via Octahedral Parametrization Under optimal Squared error quantization
OmniStack-RS: 추천 시스템을 위한 KV 캐시 압축 및 개인화 추론 실험
SSM이 파라미터 골프 대회에서 Transformer보다 불리한 이유
L4 GPU에서 커스텀 Triton 커널로 Qwen Image Edit 2511 최적화하기
Screening Is Enough 논문을 GBDT에 적용한 새로운 라이브러리 ibu-boost 공개
Triton 커널을 활용한 MoE 추론 최적화: Mixtral-8x7B에서 최대 6.5배 성능 향상
Kernel-Smith: 진화적 커널 최적화를 위한 통합 레시피
Import AI 439: AI 커널 최적화, 분산 학습의 급성장, 그리고 과학 모델의 보편적 표현
7900 XTX에서 실행되는 LTX Desktop: NVIDIA 전용 제한을 우회하여 AMD에서 구동 성공
KernelBench-X: LLM 생성 GPU 커널 평가를 위한 종합 벤치마크
ComfyUI용 Z-Image S3-DiT 가속 노드: Triton 및 INT8 양자화 적용
Dot-Product Attention을 거리 기반 RBF-Attention으로 교체한 실험기
PentaNet: BitNet을 넘어선 네이티브 5진 {-2, -1, 0, 1, 2} 양자화 (124M, 곱셈 연산 없는 추론)
DoRA 확장: 인수 분해 노름 및 퓨즈드 커널을 통한 고순위 적응 기법
FlashSampling: 빠르고 메모리 효율적인 정확한 샘플링 기법
SageBwd: 학습 가능한 저비트 어텐션 메커니즘
FlashAttention을 능가하는 Triton 커널: 40배 빠른 속도와 90% VRAM 절감 달성
← 피드로 돌아가기
Triton
Libraries (AI 라이브러리)
약 23개 아티클
관련 태그:
PyTorch
Flash Attention
Mixtral 8x7B
MoE
Quantization
H100
GQA
GBDT
ComfyUI
KernelEvolve