챕터별 상세
OpenAI Codex: 컴퓨터를 직접 조작하는 에이전트의 진화
OpenAI가 Codex 앱을 업데이트하며 단순 코드 생성을 넘어선 시스템 제어 기능을 강화했다. Codex는 이제 사용자의 컴퓨터 화면을 보고, 클릭하고, 타이핑하는 백그라운드 작업을 수행하며 사용자의 업무와 병렬로 실행 가능하다. 특히 웹 브라우저 내에서 직접 주석을 달아 디자인 수정을 요청하면 실시간으로 코드를 반영하는 기능을 제공한다. 이는 AI가 단순한 도구를 넘어 운영체제 수준에서 협업하는 슈퍼 앱으로 진화하고 있음을 보여준다.
Codex는 OpenAI가 개발한 코딩 특화 모델로, GitHub Copilot의 기반이 된 기술이다.
Claude Code: 데스크톱 환경을 위한 에이전트 재설계
Anthropic은 Claude Code 데스크톱 앱의 인터페이스를 에이전트 중심의 워크플로에 최적화하여 개편했다. 가장 큰 변화는 여러 리포지토리에 걸친 작업을 병렬로 실행하고 세션 간을 자유롭게 이동할 수 있는 기능이다. 앱 내에 통합 터미널, 파일 에디터, 향상된 Diff 뷰어를 탑재하여 개발자가 CLI를 벗어나지 않고도 모든 작업을 완수할 수 있도록 설계했다. 이를 통해 복잡한 소프트웨어 엔지니어링 작업을 에이전트에게 맡기고 결과만 검토하는 방식이 가능해졌다.
Google Gemini: 데스크톱 및 브라우저 통합 강화
Google은 Gemini 데스크톱 앱을 Windows와 Mac 사용자 모두에게 글로벌 출시하며 접근성을 높였다. Chrome 브라우저에는 'Skills' 기능을 추가하여 자주 사용하는 프롬프트를 슬래시(/) 명령어로 저장하고 웹페이지 컨텍스트와 함께 즉시 실행할 수 있게 했다. 또한 Gemini 3.1 Flash TTS 모델을 공개하여 호흡음이나 웃음소리까지 재현하는 극도로 자연스러운 음성 합성 기능을 선보였다. 이는 Google 생태계 전반에 AI 에이전트가 깊숙이 통합되고 있음을 시사한다.
TTS(Text-to-Speech)는 텍스트를 음성으로 변환하는 기술이다.
Perplexity Personal Computer: 로컬 파일 기반의 지능형 비서
Perplexity는 사용자의 로컬 파일과 네이티브 애플리케이션을 통합 관리하는 'Personal Computer' 기능을 발표했다. 이 시스템은 사용자의 노트를 읽고 할 일을 추론하며, 이메일이나 메시지 앱과 연동하여 복잡한 워크플로를 자동화한다. 모든 작업은 샌드박스 환경에서 안전하게 실행되며 사용자가 언제든 작업을 감사하고 되돌릴 수 있는 투명성을 제공한다. 클라우드 기반의 지능과 로컬 데이터의 보안을 결합한 새로운 형태의 개인용 AI 비서 모델이다.
Claude Opus 4.7: 코딩 벤치마크의 새로운 정점
Anthropic이 공개한 Claude Opus 4.7은 특히 소프트웨어 엔지니어링 역량에서 비약적인 발전을 이루었다. SWE-bench Verified 평가에서 64.3%를 기록하며 기존 Opus 4.6(53.4%)과 GPT-4o(51.4%)를 크게 앞질렀다. 지시 이행 능력이 대폭 개선되어 복잡한 프롬프트 엔지니어링 없이도 의도에 맞는 결과를 한 번에 도출할 가능성이 높아졌다. 멀티모달 성능 또한 강화되어 고해상도 이미지 이해 및 복잡한 도표 분석에서 높은 정확도를 보여준다.
SWE-bench는 AI 모델의 실제 소프트웨어 개발 문제 해결 능력을 측정하는 벤치마크이다.
오픈소스 모델의 약진: MiniMax 및 Qwen 업데이트
MiniMax M2.7 모델이 오픈소스로 공개되었으며, SWE-bench Pro에서 56.22%의 높은 성능을 기록했다. Alibaba의 Qwen3.6-35B 모델 또한 출시되어 350억 개의 파라미터로 효율적인 성능을 제공하며 오픈소스 생태계를 확장하고 있다. 이러한 모델들은 상용 모델인 GPT-4o나 Gemini 1.5 Pro와 대등하거나 특정 지표에서 앞서는 성능을 보여준다. 개발자들은 이제 고성능의 코딩 에이전트를 로컬 환경이나 자체 서버에서 구축할 수 있는 더 많은 선택지를 갖게 되었다.
로봇 공학의 진화: Boston Dynamics와 Gemini의 결합
Boston Dynamics의 로봇 Spot이 Gemini Robotics 기술을 활용하여 화이트보드에 적힌 할 일 목록을 직접 읽고 수행하는 데모가 공개되었다. 로봇은 시각 정보를 통해 텍스트를 인식하고, 신발 정리, 캔 재활용, 빨래 바구니 옮기기 등의 작업을 자율적으로 판단하여 실행했다. 이는 LLM의 추론 능력이 물리적 세계를 조작하는 로봇 하드웨어와 결합되어 실질적인 가사 및 산업 자동화로 이어질 수 있음을 증명한다. AI가 디지털 세계를 넘어 물리적 공간의 에이전트로 확장되는 중요한 이정표이다.
용어 해설
- 에이전트 기반 코딩(Agentic Coding)
- — AI가 단순히 코드 조각을 생성하는 것을 넘어, 파일 시스템 접근, 도구 실행, 테스트 수행 등 소프트웨어 개발 전 과정을 자율적으로 수행하는 방식이다. 개발자의 지시에 따라 복잡한 리팩터링이나 기능 구현을 독립적으로 완수할 수 있어 생산성을 극대화한다.
- 음성 합성 기술(Text-to-Speech)
- — 텍스트 데이터를 인간의 목소리와 유사한 오디오 신호로 변환하는 기술이다. 최근에는 감정 표현, 호흡음 삽입, 대화 맥락에 따른 억양 조절 등이 가능해져 실제 사람과 구분이 어려울 정도로 발전했다.
- 소프트웨어 엔지니어링 벤치마크(SWE-bench)
- — LLM이 실제 GitHub 이슈를 해결하는 능력을 평가하는 벤치마크이다. 코드 수정, 환경 구축, 테스트 통과 등 실무적인 소프트웨어 개발 역량을 측정하는 지표로 널리 사용된다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 18.수집 2026. 04. 18.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
