본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
FlashAttention 핵심 해독을 위한 펜앤페이퍼 수학
제한된 자원에서의 LLM 학습 최적화 기술 보고서 및 arXiv 추천 요청
범용 내적 어텐션(GDPA): 실제 추천 시스템 학습 부하를 위한 커널 최적화
PyTorch FlexAttention, FlashAttention-4 백엔드 도입으로 성능 최대 3.2배 향상
아마존, 2025년 봄 아마존 연구상(ARA) 수상자 63명 발표
시청하며 생각하기: 멀티모달 대형 언어 모델의 멀티턴 비디오 추론을 위한 온라인 스트리밍 세그먼트 수준 메모리
True Positive Weekly #157: 2026 AI 인덱스 보고서와 주요 기술 업데이트
연구 우선 코딩 에이전트가 코드 전용 에이전트보다 뛰어난 성능을 보이다
FlashAttention-1부터 4까지의 발전 과정을 PyTorch로 구현한 교육용 저장소
Together AI 커널 랩: 하드웨어와 AI 모델 사이의 간극을 좁히는 기술
Dot-Product Attention을 거리 기반 RBF-Attention으로 교체한 실험기
Flash Attention: GPU 메모리 병목을 해결하는 어텐션 최적화 기법
FlashSampling: 빠르고 메모리 효율적인 정확한 샘플링 기법
GPT-OSS를 위한 에이전트형 강화학습(Agentic RL) 학습 활성화: 실전 회고록
허깅페이스 커널: 딥러닝 최적화 커널의 빌드와 배포 단순화
Softmax 구현의 비밀: 왜 최댓값을 빼는가?
FlashPrefill: 초고속 롱 컨텍스트 프리필링을 위한 즉각적 패턴 발견 및 임계값 설정
PRISM-∆: 대형 언어 모델의 프롬프트 하이라이팅을 위한 차분 서브스페이스 스티어링
OpenLanguageModel (OLM): 단순함과 성능을 모두 잡은 오픈소스 PyTorch LLM 학습 라이브러리
FlashAttention을 능가하는 Triton 커널: 40배 빠른 속도와 90% VRAM 절감 달성
← 피드로 돌아가기
Flash Attention
Architecture (AI 아키텍처)
약 23개 아티클
관련 태그:
PyTorch
Triton
Transformer
vLLM
Blackwell
Chain of Thought
AWS Trainium
Gemini
BAAI
FlashPrefill