본문으로 건너뛰기
Matt Wolfe조회 1

Claude Fable 5.1과 Gemini 3.8 Flash 출시 및 OpenAI Astra 공개

최신 AI 모델들의 지능 향상과 비용 효율성을 분석하고 OpenAI Astra의 새로운 학습 기술인 Recurrent Depth를 소개한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

최근 Anthropic의 Claude Fable 5.1과 Google의 Gemini 3.8 Flash 등 고성능 AI 모델들이 잇따라 출시되며 지능과 효율성 면에서 큰 진전을 보였다. Fable 5.1은 현존 모델 중 가장 높은 지능 지수를 기록했으나 실제 게임 코딩 테스트에서 100달러 이상의 비용이 발생하는 등 경제성 문제를 드러낸 반면, Gemini 3.8 Flash는 최상위 모델급 코딩 성능을 유지하면서도 비용을 10분의 1 수준으로 낮췄다. OpenAI는 사이버 보안에 특화된 Astra 모델을 예고하며 내부 사고 과정을 숨기는 Recurrent Depth 기술을 도입해 지능을 높였으나, 이는 투명성 저하라는 새로운 안전성 우려를 낳고 있다.

챕터별 상세

00:20

Claude Fable 5.1의 성능 향상

Anthropic이 출시한 Claude Fable 5.1은 에이전트 기반 과학 연구 및 코딩 벤치마크에서 이전 모델인 5.6 Sol 대비 약 2배의 성능 향상을 기록했다. 사이버 보안 가드레일을 정교화하여 프롬프트 거절 빈도를 60% 줄였으며, 타 모델 학습에 자사 모델의 사고 과정을 활용하지 못하도록 하는 Anti-distillation 메커니즘을 도입했다. 가격은 100만 토큰당 입력 10달러, 출력 50달러로 유지하면서도 Artificial Analysis 지능 지수에서 66점을 기록해 현존 모델 중 가장 높은 지능을 입증했다. 이는 지능 향상에도 불구하고 비용 부담이 여전히 크다는 한계를 동시에 보여준다.

Anti-distillation은 경쟁사가 자사 모델의 출력물을 학습 데이터로 써서 성능을 모방하는 것을 막는 보안 기술이다.

07:50

Fable 5.1의 실제 코딩 테스트

실제 MegaBonk 게임 클론 제작 테스트에서 Fable 5.1은 매우 상세한 캐릭터와 완성도 높은 코드를 생성했지만, 제작 과정에서 114달러 이상의 API 비용이 발생했다. BuseyBench SVG 이미지 생성 테스트에서도 고품질 결과물을 냈으나 처리 시간이 18분이나 소요되어 실시간 활용에는 부적합한 모습을 보였다. 모델의 지능은 압도적이지만 작업당 비용이 3.69달러에 달해 일반적인 사용자가 지속적으로 사용하기에는 경제적 장벽이 높다. 결과적으로 최상위 지능이 필요한 특수 목적에는 적합하나 범용적인 코딩 도구로는 비용 효율성이 떨어진다.

BuseyBench는 AI 모델의 SVG(벡터 그래픽) 생성 능력을 평가하는 벤치마크 도구이다.

11:07

Gemini 3.8 Flash의 효율성

Google의 Gemini 3.8 Flash는 코딩 성능 지표인 DeepSWE에서 73.7점을 기록하며 Claude Opus 5와 대등한 수준의 지능을 보여주었다. 이는 불과 몇 달 전 최고 모델이었던 Fable 5의 성능을 뛰어넘는 수치임에도 불구하고, 작업당 비용은 약 10분의 1 수준으로 매우 저렴하다. 코딩 작업에 최적화된 효율성을 갖추어 고성능 모델의 지능을 유지하면서도 경제적인 운영이 가능하다는 점이 핵심이다. 특히 대규모 코드베이스를 처리해야 하는 개발 환경에서 비용 대비 성능비가 가장 뛰어난 모델로 평가받는다.

DeepSWE는 실제 소프트웨어 엔지니어링 문제를 해결하는 능력을 측정하는 고난도 벤치마크이다.

13:58

Gemini 3.8 Flash 테스트 결과

Gemini 3.8 Flash는 작업당 평균 비용 0.58달러, 처리 시간 2.5분을 기록하며 Fable 5.1(3.69달러, 7.4분) 대비 압도적인 속도와 경제성을 증명했다. MegaBonk 클론 제작 테스트에서도 Fable 5.1보다는 디테일이 부족하지만 Fable 5의 초기 버전보다는 훨씬 우수한 결과물을 생성했다. Artificial Analysis 데이터에 따르면 지능 지수는 59점으로 중간 수준이지만, 코딩 작업에 한해서는 최상위 모델들과 경쟁할 수 있는 실질적인 역량을 갖췄다. 이는 고비용 모델을 대체하여 실무 코딩 에이전트로 활용하기에 가장 적합한 대안임을 시사한다.

작업당 비용(Cost per Task)은 특정 벤치마크 문제를 해결하는 데 소요된 전체 토큰 비용의 평균이다.

18:40

OpenAI Astra의 보안 역량

OpenAI가 공개를 예고한 Astra 모델은 알려지지 않은 보안 취약점을 스스로 찾아내고 익스플로잇 코드를 개발하는 능력을 갖추고 있다. 내부 테스트 결과 취약점 탐지 성공률이 GPT-5.6 Sol보다 월등히 높으며, 훨씬 적은 토큰 사용량으로도 복잡한 보안 공격 체인을 구성할 수 있음이 확인됐다. OpenAI는 이 모델의 위험성을 인지하고 안전한 배포를 위해 출시를 늦추며 가드레일을 강화하고 있다고 밝혔다. 이는 AI가 단순한 코딩 보조를 넘어 고도의 사이버 보안 공격 및 방어 도구로 진화하고 있음을 의미한다.

익스플로잇(Exploit)은 시스템의 취약점을 이용하여 공격자가 의도한 동작을 수행하게 하는 명령어나 코드를 말한다.

20:41

Recurrent Depth 기술의 명암

Astra는 Recurrent Depth 또는 Looped Transformer라 불리는 신기술을 사용하여 동일한 텍스트를 반복 처리함으로써 지능을 극대화했다. 하지만 이 방식은 모델의 사고 과정(Chain of Thought)을 외부에서 읽기 어렵게 은폐하여 인간이 모델의 논리를 감사하는 것을 방해한다. OpenAI는 사고 과정 모니터링이 해킹 방지에 필수적이라고 주장해왔으나, 신기술 적용으로 인해 투명성과 지능 사이의 상충 관계에 직면하게 됐다. 이러한 기술적 변화는 향후 AI 모델의 안전성 검증 방식을 더욱 복잡하게 만들 것으로 전망된다.

Looped Transformer는 트랜스포머 계층을 반복적으로 통과시켜 모델의 깊이를 가상으로 늘리는 아키텍처이다.

용어 해설

지식 증류(Distillation)
거대 모델(Teacher)의 지식을 작은 모델(Student)로 전이시켜 성능을 유지하면서 효율성을 높이는 기법이다. Anthropic은 자사 모델의 사고 과정을 타사가 증류하여 학습에 활용하는 것을 방지하기 위해 Anti-distillation 메커니즘을 도입했다.
DeepSWE 벤치마크(DeepSWE)
소프트웨어 엔지니어링 역량을 측정하는 벤치마크로, AI 모델이 실제 코딩 프로젝트를 얼마나 잘 수행하는지 평가한다. Gemini 3.8 Flash는 이 지표에서 73.7점을 기록하며 최상위 모델인 Claude Opus 5와 대등한 성능을 입증했다.
사고의 사슬(Chain of Thought)
모델이 최종 답변을 내놓기 전 단계별 추론 과정을 거치도록 유도하는 기법이다. 사용자는 이를 통해 모델의 논리 구조를 검토할 수 있으나, Astra에 적용된 Recurrent Depth 기술은 이 과정을 은폐하여 투명성 문제를 야기할 수 있다.
순환 깊이(Recurrent Depth)
동일한 텍스트를 여러 번 반복 처리하여 모델의 답변 품질을 높이는 아키텍처 기술이다. OpenAI Astra에 적용된 이 방식은 지능을 향상시키지만, 내부 사고 과정을 인간이 읽기 어렵게 만들어 모델의 안전성 감사를 방해할 우려가 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 03.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.