섹션별 상세
Andrew Ng는 AI 코딩 에이전트가 구식 코드 예제에서 벗어나 최신 API 문서를 참조하고, 실행 과정에서 발견한 버그나 개선 사항을 서로 공유할 수 있는 'Context Hub(chub)'의 비전을 제시했다. chub은 CLI 도구로서 최신 문서를 에이전트에게 제공하며, 일주일 만에 GitHub 스타 5,000개를 돌파하고 문서 보유량을 1,000개로 확대하는 등 빠른 성장세를 보였다.
yaml
feedback: falsechub 설정 파일(~/.chub/config.yaml)에서 에이전트의 피드백 공유 기능을 비활성화하는 방법
OpenAI가 출시한 GPT-5.4는 Thinking과 Pro 두 가지 변체로 구성되며, 105만 토큰의 입력 컨텍스트와 12.8만 토큰의 출력 용량을 지원한다. 이 모델은 컴퓨터를 네이티브하게 조작하고 필요한 도구를 효율적으로 검색하는 '도구 검색(Tool Search)' 기능을 탑재했으며, GDPval 83%, OSWorld-Verified 75%의 성공률을 기록하며 인간 전문가 수준의 사무 자동화 능력을 입증했다.
GPT-5.4 Pro 모델은 100만 토큰당 입력 $30, 출력 $180라는 고가 정책을 채택했음에도 불구하고, 복잡한 법률 브리핑이나 고객 지원 업무에서 높은 효율성을 보여 인간 노동 비용 대비 경제성을 확보했다. 특히 코딩 및 에이전트 지표에서 Claude 4.6 Opus와 Gemini 3.1 Pro를 제치고 1위를 차지했으나, 구글의 Gemini 대비 토큰 효율성은 여전히 낮은 것으로 나타났다.

2025년 모바일 AI 시장은 매출 50억 달러 돌파 및 다운로드 38억 건을 기록하며 폭발적으로 성장했으며, 비게임 앱 매출이 게임 매출을 처음으로 추월하는 역사적 전환점을 맞이했다. ChatGPT와 Gemini가 시장을 주도하는 가운데, 미국 챗봇 사용자의 절반 이상이 모바일 앱을 통해서만 AI를 이용하는 등 사용자 행동 패턴이 데스크톱에서 모바일로 급격히 이동했다.

메타, OpenAI, 마이크로소프트 등 빅테크 기업들은 AI 데이터 센터의 막대한 전력 수요를 감당하기 위해 기존 전력망을 우회하는 자체 가스 발전소 건설에 착수했다. 2025년 발표된 민간 발전 프로젝트 46개 중 대부분이 천연가스를 주 연료로 사용하고 있으며, 이는 전력 가격 안정화에는 기여할 수 있으나 기업들의 탄소 중립 목표 달성에는 부정적인 영향을 미칠 것으로 분석된다.

애플 연구진이 제안한 Feature Auto-Encoder(FAE)는 시각 인코더인 DINOv2의 풍부한 임베딩을 축소된 공간에서 재구성하도록 학습함으로써 확산 모델의 학습 효율을 극대화했다. 이 방식은 기존 RAE 기법보다 7배 빠른 학습 속도를 기록하면서도 FID 1.29라는 우수한 이미지 품질을 유지하여, 고성능 시각 인코더의 지식을 생성 모델에 효율적으로 이식하는 방법을 증명했다.
용어 해설
- 전문가 혼합(Mixture-of-Experts)
- — 모델 전체 가중치를 사용하는 대신 입력값에 따라 필요한 소수의 '전문가' 네트워크만 활성화하여 연산 효율성을 높이는 아키텍처이다. 거대 모델의 파라미터 수를 늘리면서도 추론 비용을 통제할 수 있어 최신 LLM의 핵심 구조로 자리 잡았다.
- 잠재 확산 모델(Latent Diffusion Model)
- — 고해상도 이미지 픽셀 자체를 직접 다루는 대신, 오토인코더를 통해 압축된 저차원의 잠재 공간에서 노이즈를 제거하며 이미지를 생성하는 방식이다. 연산량을 획기적으로 줄이면서도 고품질 이미지를 생성할 수 있어 Stable Diffusion 등 현대 이미지 생성 AI의 표준이 되었다.
- FID 점수(FID Score)
- — 실제 이미지 집합과 생성된 이미지 집합의 통계적 유사성을 측정하여 생성 모델의 성능을 평가하는 지표이다. Inception-V3 네트워크의 임베딩 공간에서 두 분포 사이의 거리를 계산하며, 점수가 낮을수록 실제 이미지와 시각적으로 유사하고 다양성이 높음을 의미한다.
- 컨텍스트 창(Context Window)
- — AI 모델이 한 번의 추론 과정에서 동시에 기억하고 처리할 수 있는 텍스트 데이터의 최대 범위를 의미한다. 이 창이 클수록 긴 문서 분석이나 복잡한 대화 흐름 유지가 가능하며, GPT-5.4는 최대 105만 토큰의 방대한 입력을 지원한다.
- 에이전트 워크플로우(Agentic Workflow)
- — 단순한 일회성 질의응답을 넘어 AI가 스스로 계획을 수립하고, 필요한 도구를 선택해 실행하며, 결과를 검토하고 수정하는 다단계 자율 작업 방식이다. 반성(Reflection), 도구 사용, 계획 수립 등을 통해 복잡한 문제를 해결하는 능력을 극대화한다.
기술
- GPT-5.4
- DINOv2
- Context Hub (chub)
- SigLIP 2
- Mixture-of-Experts
활용 사례
- 사무 자동화
- 코딩 에이전트
- 모바일 AI 비서
- 고속 이미지 생성 학습
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 13.수집 2026. 03. 14.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.