본문으로 건너뛰기

관련 기사 바로가기

KV Cache 압축 평가를 부풀리는 법트랜스포머 성능을 높이는 동적 단기 컨볼루션 기법FBTriton 인프라의 업스트림 동기화와 검증 계층OCV-Researcher의 Falcon158-Triton: Falcon3-10B를 위한 packed-ternary Triton GPU 추론 백엔드LLM 추론을 위한 API 게이트웨이와 워커 아키텍처 설계. 인메모리 큐와 동적 배처로 GPU 활용을 최적화한다. 토큰 스트리밍으로 Time-To-First-Token을 줄이는 방식을 제시한다.RcCaMoE: 다층 가역 셀룰러 오토마타 기반의 자원 효율적 MoE 라우팅SSM이 파라미터 골프 대회에서 Transformer보다 불리한 이유L4 GPU에서 커스텀 Triton 커널로 Qwen Image Edit 2511 최적화하기Triton 커널을 활용한 MoE 추론 최적화: Mixtral-8x7B에서 최대 6.5배 성능 향상Kernel-Smith: 진화적 커널 최적화를 위한 통합 레시피DoRA 확장: 인수 분해 노름 및 퓨즈드 커널을 통한 고순위 적응 기법Triton 플러그인 확장으로 TLX와 커스텀 컴파일러 패스 기본 제공OCTOPUS: Optimized KV Cache for Transformers via Octahedral Parametrization Under optimal Squared error quantizationKernelBench-X: LLM 생성 GPU 커널 평가를 위한 종합 벤치마크OmniStack-RS: 추천 시스템을 위한 KV 캐시 압축 및 개인화 추론 실험Screening Is Enough 논문을 GBDT에 적용한 새로운 라이브러리 ibu-boost 공개ComfyUI용 Z-Image S3-DiT 가속 노드: Triton 및 INT8 양자화 적용Dot-Product Attention을 거리 기반 RBF-Attention으로 교체한 실험기PentaNet: BitNet을 넘어선 네이티브 5진 {-2, -1, 0, 1, 2} 양자화 (124M, 곱셈 연산 없는 추론)FlashSampling: 빠르고 메모리 효율적인 정확한 샘플링 기법
← 피드로 돌아가기

Triton

Libraries (AI 라이브러리)

28개 아티클

관심 태그 추가
TIMEHEADLINE