본문으로 건너뛰기

트랜스포머 이후의 LLM 설계 경쟁

MIT Technology Review가 트랜스포머의 한계를 해결하려는 희소 어텐션·리퀴드 네트워크·디퓨전·상태공간 네 가지 전략을 정리했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기사는 트랜스포머의 밀집 어텐션이 긴 입력을 처리할 때 연산·전력 비용과 컨텍스트 한계로 병목이 됐다고 지적하며 이를 해결하려는 네 가지 접근을 정리합니다. 첫째, 희소 어텐션과 롤링 요약 같은 어텐션 대체 기법이 계산을 줄여 긴 문맥을 처리하려 하고 둘째, Liquid AI의 리퀴드 네트워크는 모델을 작게 만들어 엣지에서 실행 가능하게 만듭니다. 셋째, 디퓨전 기반 텍스트 생성은 블록 단위 출력을 통해 추론을 가속화하고 넷째, 상태 공간 방식은 언어가 아닌 추상 상태로 사고하는 유형의 문제를 더 잘 다룹니다. 이들 접근은 비용과 속도, 그리고 일부 추론 과제에서 현재 LLM 한계를 약화시킬 잠재력이 있습니다.

섹션별 상세

트랜스포머의 핵심 강점은 밀집 어텐션을 통해 문맥의 의미를 정확히 인코딩하는 능력이나, 입력 길이가 길어질수록 연산량이 급증해 비용과 전력 소비 문제가 심각해졌습니다. 예컨대 1만 단어짜리 문서는 수천만 건의 곱셈을 요구하며, 기사에서는 OpenAI의 연간 컴퓨팅 비용 500억 달러와 데이터센터 전력 수요가 2030년까지 두 배가 될 수 있다는 수치를 근거로 제시합니다. 이런 구조적 제약 때문에 LLM이 더 긴 문서나 코드베이스, 에이전트 간 통신 같은 대규모 입력을 처리하는 데 병목이 생겨 새로운 아키텍처 탐색이 필요해졌습니다.
근거
  • 밀집 어텐션은 입력 길이에 따라 연산량이 급증해 예컨대 1만 단어 문서는 수천만 번의 곱셈이 필요하다. 본문 서두에서 transformer의 dense attention과 10,000단어 예시를 다룬 단락
어텐션을 근본부터 바꾸려는 접근은 계산을 줄이면서 의미 보존을 유지하는 데 초점을 둡니다. Subquadratic은 입력마다 중요한 토큰 쌍을 동적으로 골라 계산하는 희소 어텐션 방식인 SubQ를 내세워 검색과 코딩 과제에서 기존 LLM과 경쟁할 수 있다고 주장하며, Manifest AI는 밀집 어텐션을 요약과 유지 전략으로 대체하는 power retention을 도입해 StarCoder를 PowerCoder로 변환하는 시연을 공개했습니다. 두 회사의 전략은 계산 대상을 선택적으로 줄이거나 문맥을 롤링 요약으로 압축해 긴 입력을 처리 가능한 상태로 유지한다는 점에서 비용과 지연을 줄이는 실용적 대안이 될 가능성이 있습니다.
근거
  • Subquadratic은 희소 어텐션 기반 모델 SubQ가 검색과 코딩 과제에서 주류 LLM과 경쟁할 수 있다고 주장한다. ‘Rethinking attention’ 섹션에서 Subquadratic의 SubQ 성능 주장과 대기자 명단 언급
  • Manifest AI는 StarCoder를 power retention으로 바꾼 PowerCoder를 공개했으며, 롤링 요약 방식으로 문맥 크기를 제한한다고 밝혔다. 같은 섹션에서 Manifest AI의 power retention 개념과 PowerCoder 변환 사례
모델을 근본적으로 작게 만들고 실행 환경을 확장하는 방향으로 Liquid AI는 liquid neural networks를 트랜스포머와 결합한 LFMs를 제시합니다. 이 회사는 내부 설계 AI로 서로 다른 네트워크 조합을 탐색해 20% 트랜스포머와 80% 리퀴드 구성으로 성능과 효율의 절충점을 찾았고, 그 결과 라즈베리파이 같은 저전력 기기에서도 동작하는 모델과 연간 매출 1,000만 달러 미만 기업에 무료 배포라는 실용적 옵션을 마련했다고 밝힙니다. 기사에는 다운로드 수 약 3,400만 건과 자동차 내장 칩에서의 적용 사례를 근거로 들며, 경량 모델이 엣지·임베디드 환경에서 활용될 여지를 강조합니다.
근거
  • Liquid AI의 LFMs는 20% 트랜스포머와 80% 리퀴드 신경망 구성으로 설계되며, 라즈베리파이에서 동작할 정도로 경량화되었다고 회사가 밝혔다. ‘Making models smaller and more flexible’ 섹션에서 LFMs 구성비와 Raspberry Pi 동작, 다운로드 수 언급
텍스트를 토큰 단위로 순차 생성하지 않고 한꺼번에 생성하는 접근은 추론 속도와 비용을 크게 낮출 수 있습니다. Inception은 이미지 생성에 쓰이는 diffusion 방식을 텍스트에 적용해 랜덤 단어열에서 문장 블록을 복원하는 방식으로 학습시켜 GPT-2 수준을 10배 빠르게 구현했고, 최신 Mercury 2는 일부 GPT-4 버전과 성능을 견줄 만큼 발전했다고 주장합니다. 이미지 디퓨전과 달리 텍스트 중간 상태가 명확치 않다는 수학적 난제를 지난 연구에서 해결한 점을 근거로 들며, 블록 단위 생성이 동일한 트랜스포머를 더 효율적으로 이용하는 경로임을 보였습니다.
근거
  • Inception은 디퓨전 기반 텍스트 모델이 GPT-2 수준과 성능이 유사하면서 10배 빠르게 동작한다고 보고했으며, Mercury 2는 일부 GPT-4 버전과 견줄 만하다고 주장한다. ‘Generating text all at once’ 섹션의 Inception 성능·속도 주장과 Stanford 연구 언급
언어가 아닌 추상 상태로 정보를 표현하려는 시도는 특정 유형의 문제에서 LLM을 넘어서는 결과를 낳습니다. Pathway는 어텐션을 상태 공간(state space) 구조로 대체해 언어 순서 대신 압축된 상태로 계산을 수행하는 Dragon Hatchling을 내놓았고, 25만 개 이상의 난제형 스도쿠 벤치마크에서 상위 97% 성적을 기록해 전통적 LLM이 실패하는 영역에서 강점을 보였습니다. 이 접근은 퍼즐, 수학, 체스처럼 직관적 추론이나 비언어적 사고가 중요한 과제에서 언어 기반 표현의 제약을 우회해 더 효율적이고 다른 유형의 추론을 가능하게 합니다.
근거
  • Pathway의 Dragon Hatchling은 25만 개 이상의 어려운 스도쿠 퍼즐 벤치에서 상위 97% 성적을 기록했다고 회사 측이 발표했다. ‘Moving beyond words’ 섹션의 Dragon Hatchling 스도쿠 벤치마크 결과

용어 해설

트랜스포머(Transformer)
트랜스포머는 입력 토큰들 사이의 상호작용을 행렬곱 기반의 attention으로 계산해 긴 문맥을 처리하는 신경망 구조로, 현대 LLM의 핵심 아키텍처로 사용됩니다.
밀집 어텐션(Dense attention)
밀집 어텐션은 문장의 모든 토큰 쌍을 비교해 의미를 인코딩하는 방식으로 정확도가 높지만 입력 길이가 길어질수록 연산량이 제곱으로 커져 비용과 지연이 급증합니다.
희소 어텐션(Sparse attention)
희소 어텐션은 모든 토큰 쌍을 계산하지 않고 일부 상호작용만 선택적으로 계산해 연산을 절감하는 기법으로, 과거에는 의미 보존 측면에서 한계가 있었습니다.
디퓨전 모델(Diffusion models)
디퓨전 모델은 노이즈가 섞인 상태에서 점차 구조를 복원하는 방식으로 이미지를 생성하며, 최근에는 텍스트를 한 번에 생성하는 방식으로 LLM에도 응용되고 있습니다.
리퀴드 신경망(Liquid neural networks)
리퀴드 신경망은 입력 변화에 따라 내부 역학을 조정해 실행 중 행동을 바꿀 수 있는 네트워크로, 학습 후에도 상태 적응을 통해 작동 방식을 계속 조정할 수 있습니다.
상태 공간 모델(State space models)
상태 공간 모델은 시퀀스 전체를 단어 단위가 아닌 추상 상태로 압축해 처리하는 수학적 구조로, 언어 기반 표현의 한계를 넘는 형태의 연산을 지원합니다.

기술

  • transformers
  • sparse attention
  • power retention
  • liquid neural networks
  • diffusion
  • state space models
  • StarCoder
  • Qwen
  • Gemma
  • GPT-2
  • GPT-4

활용 사례

  • 몇 시간 분량의 영상이나 대규모 문서 라이브러리 분석
  • 여러 LLM과 상호작용하는 에이전트가 수주간 상태를 유지하며 작업 수행
  • 대규모 코드베이스 검색·분석과 자동 완성·리팩터링
  • 자동차 내부 칩이나 라즈베리파이 같은 저전력 엣지 기기에서의 추론
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 10.수집 2026. 08. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.