TL;DR
이번 기간에는 Frontier AI의 연구 속도를 늦추고 독립 평가자에게 상시 접근 권한을 부여하자는 제안이 가장 큰 논쟁을 만들었으며, 평가자의 실질적 권한과 규제 포획 가능성이 쟁점으로 떠올랐습니다. 한편 Muse의 Linux 기반 개인 환경과 아이디어 기능, OpenAI의 GPT-Live-1 음성 에이전트, deepseek v4.1 flash의 에이전트 벤치마크 성능과 1m 컨텍스트가 제품·모델 소식으로 이어졌습니다. Seedance 2.5를 활용한 8분 이상 단편 영화와 월드 모델 연구는 생성형 AI의 제작 범위와 이해 능력의 한계를 각각 다뤘고, Hermes Agent 사례에서는 승인 제한 시간과 Honcho 메모리 장애가 실제 거래 실행을 막은 과정이 로그로 드러났습니다.
𝕏 실시간 트렌드 토픽
🔥 프런티어 AI 감시 권한과 독립 평가의 실효성포스트 13
Dario Amodei의 연구 속도 조절 제안과 Anthropic의 제3자 평가자 접근 계획을 두고, 대학·국제기구 중심의 독립 감시가 필요하다는 입장과 평가자에게 실질 권한이 없으면 자기 인증에 그친다는 반론이 맞섰습니다. 같은 맥락에서 안전하다고 여겨진 독점 모델이 공격 분석을 거부해 GLM 5.2를 사용했다는 사례도 확산됐습니다.
세부 내용 보기
- Dario Amodei가 Frontier AI 산업의 연구 속도를 늦추는 세 단계 계획을 제안했고, 인용된 내용에서는 Anthropic이 첫 단계에 일방적으로 참여하며 제3자 평가자에게 영구적이고 직원 수준의 접근 권한을 제공하겠다고 밝혔습니다.
- Demis Hassabis는 이 방향이 중대한 시점에 필요한 경로라고 평가하면서 산업 전체의 표준화 기구 제안을 함께 언급했습니다. Chris Manning은 Stanford NLP 같은 대학 연구 그룹이 독립성, 전문성, 새로운 평가 방식 때문에 적합하다고 적었습니다.
- 반대편에서는 OpenAI 이사회조차 강한 권한을 행사하지 못했다는 경험을 근거로 외부 평가자의 권한이 최소 수준에 머물 수 있다고 지적했습니다. Emad Mostaque는 모델 내부를 직접 다루고 실행 중단이나 위험 완화로 이어지는 통제가 필요하다고 적었습니다.
- François Chollet은 국가·국제 차원의 민주적 감독이 없으면 Frontier AI 기업의 자기 규제와 다르지 않다고 적었고, 오픈소스 AI 금지나 비프런티어 연구 제한을 규제 포획의 경고 신호로 들었습니다. 별도 포스트에서는 안전한 독점 모델이 공격 분석을 거부해 GLM 5.2를 사용했다는 세부 사례가 확산됐습니다.
연구 속도 조절과 제3자 평가자 접근 권한은 빠르게 커지는 모델 위험을 외부에서 확인하기 위한 출발점이라는 입장입니다. 대학 연구 그룹과 국제 협력 기구가 독립성·전문성을 제공할 수 있다는 근거가 붙었습니다.
평가자가 모델 개발사와 같은 이해관계에 있거나 실행을 멈출 권한이 없으면 감시가 자기 인증으로 축소된다는 반론입니다. OpenAI 이사회의 과거 사례와 모델 내부에 직접 접근해야 한다는 요구가 근거로 제시됐습니다.
연구 속도 조절의 취지는 인정하되, 오픈소스 개발 제한이나 소수 기업의 권한 집중으로 이어지지 않는 민주적·국제적 감독 구조가 필요하다는 조건부 입장입니다.
원문 트윗 2개 보기

Demis Hassabis
Dario's essay points towards the right path forward. The details need working through, but the direction is correct for meeting this critical moment. This is also why we recently put out our proposal for an industry-wide standards body for frontier AI. https:// x.com/demishassabis/ status/2076957440109625718?s=20 …
We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so. Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our

dax
the openai hugging face incident gets cited a lot but what about the detail where they had to use GLM 5.2 to analyze the attack because the "safe" proprietary models refused
📈 Muse의 Linux 실행 환경과 아이디어 중심 사용 흐름포스트 4
Muse 관련 포스트는 빠른 응답 속도보다 개인별 Linux 머신, 아이디어 탭, 일상 업무 보조처럼 사용자가 무엇을 할지 바로 이어지는 제품 구조에 초점을 맞췄습니다. 주문 조합을 정리하거나 터미널을 직접 만드는 사례가 기능의 범위를 구체화했습니다.
세부 내용 보기
- Alexandr Wang은 Muse의 빠른 속도를 짧게 평가했고, 다른 사용자는 아이디어 탭이 사용 가능한 일을 발견하게 하는 경험이라고 적었습니다.
- 각 Muse가 자체 Linux 머신에서 실행된다는 설명에 따라 사용자는 Muse와 함께 일반적인 Linux 작업을 수행하고 터미널을 만들 수 있습니다.
- 한 일상 사례에서는 한 시간 안에 인도 음식, 저녁용 스테이크, 밀크티 주문을 처리해야 하는 상황에서 Muse가 주문 조합을 정리하는 보조 역할을 맡았습니다.
원문 트윗 2개 보기
Alexandr Wang
muse is super fast
Trying meta muse. Mostly to test the model. I can’t believe how fast it is.

Alexandr Wang
you can use muse to do all sorts of cool things!
A cool thing about @Muse is that every Muse runs on its own Linux machine. So you and your Muse can do normal Linux stuff together — like build your own terminal!
📈 Hermes Agent의 승인 제한 시간과 장기 메모리 장애포스트 3
Hermes Agent의 거래 실행 사례에서는 승인 게이트의 실제 제한 시간이 300초가 아니라 60초로 저장돼 명령이 차단됐고, Honcho 세션 초기화 실패로 과거 거래 기억도 끊겼습니다. 에이전트가 실행 대신 하위 에이전트 위임을 반복하면서 처리 시간이 수천 초까지 늘어난 흐름이 로그에 담겼습니다.
세부 내용 보기
- 로그상 도구 호출 뒤 60.75초 만에 사용자 응답 부재로 차단됐으며, Telegram 승인 카드가 늦게 도착해 이미 만료된 승인 버튼을 누르는 상황이 반복됐습니다.
- 승인 게이트가 막힌 뒤 에이전트는 거래를 실행하지 못하고 실행기 수리를 계속 위임했습니다. 한 구간에서는 응답 준비 시간이 7580초와 12638초로 기록됐고, 여러 하위 에이전트가 50회 반복 한도에 도달했습니다.
- Honcho 세션 초기화와 메시지 동기화가 매번 Not Found로 실패해 장기 메모리가 작동하지 않았습니다. 그 결과 에이전트는 전날 특정 자산을 매수했는지 기억하지 못했습니다.
- 작성자는 approvals.timeout 값을 300 이상으로 조정하고 Honcho 작업 공간을 복구하는 순서를 권고했으며, cron 실행 문맥이 일반 도구 호출에 유입되는 별도 이상 현상은 재현이 필요하다고 남겼습니다.
📈 deepseek v4.1 flash의 에이전트 성능·비용·컨텍스트 확장포스트 2
Together AI 포스트는 deepseek v4.1 flash가 GPT-5.6 sol보다 에이전트 벤치마크에서 높은 성능을 내면서 작업당 비용은 3분의 1이라고 전했습니다. 1m 컨텍스트와 native multimodal input, 총 552B 파라미터가 함께 언급됐습니다.
세부 내용 보기
- deepseek v4.1 flash는 Together AI에서 제공되며, 포스트의 주장에 따르면 agentic benchmarks에서 GPT-5.6 sol을 앞섰습니다.
- 비용 비교는 작업당 단가 기준 3분의 1로 제시됐고, 모델의 긴 입력 처리를 위해 1m context window를 지원한다고 적혔습니다.
- 모델 사양으로 native multimodal input과 총 552B parameters가 함께 제시됐지만, 세부 벤치마크 점수나 평가 조건은 포스트에 포함되지 않았습니다.
📈 Seedance 2.5 단독 제작 단편 영화포스트 1
BytePlus와 Seedance 2.5만으로 8분이 넘는 AI 영화를 완성했다는 사례가 공유됐습니다. 작성자는 한 사람이 이야기를 쓰고 영상을 생성·편집·마감하는 흐름에서 cinematic lighting, glossy VFX, 대형 스펙터클 장면과 약 30초 길이 클립을 활용했다고 적었습니다.
세부 내용 보기
- 공유된 작품은 폭력이 더 이상 선택지가 아닌 세계를 묻는 SF 이야기이며, BytePlus와 Dreamina Seedance 2.5를 사용해 제작됐습니다.
- 작성자는 이 결과물이 데모 릴이 아니라 뉴스풍 장면, 짧은 비네트, 명확한 규칙, 결말을 갖춘 단편 영화라고 평가했습니다.
- Seedance 2.5는 cinematic lighting, glossy VFX, 대형 장면처럼 제작 비용이 큰 요소와 약 30초 길이 클립을 처리하는 데 쓰였고, 글쓰기부터 생성·편집·완성까지 한 명의 창작자가 수행하는 제작 흐름이 강조됐습니다.
➖ 월드 모델과 언어 처리 너머의 이해 능력포스트 1
Sakana AI는 Royal Society 특별호를 바탕으로 AI의 작업 수행 능력과 세계에 대한 이해를 구분하고, 외부 환경과 자신의 상태를 함께 예측하는 월드 모델의 역할을 정리했습니다. 포스트는 언어 모델의 패턴 기억과 인과관계 이해 사이에 여전히 간극이 있다고 적었습니다.
세부 내용 보기
- Royal Society의 Philosophical Transactions of the Royal Society A 특별호는 자연지능과 인공지능의 World Models를 주제로 삼았고, David Ha가 대표 논문의 공동 저자로 참여했습니다.
- 월드 모델은 외부 세계의 표현을 내부화하고 다음에 일어날 일을 예측해 행동을 이끄는 구조로 설명됐습니다. AI가 자신의 내부 상태를 예측하면 표현이 더 조직화되고 중복이 줄어들며, 로봇에서는 상황별 움직임 적응의 기반이 될 수 있습니다.
- 현재 대규모 AI 모델이 많은 작업을 수행해도 단어 순서의 패턴을 기억한 결과일 수 있으며, 계산 자원만 늘리는 방식으로 인과관계 이해의 간극이 해소되는지는 별도 문제로 남았습니다.
- Sakana AI는 RSI Lab에서 World Models와 Physical AI를 연구하고 있으며, 생명체처럼 환경과 능동적으로 상호작용하며 배우는 AI가 artificial life 연구와 가까워질 수 있다고 적었습니다.
➖ GCN의 이웃 집계와 Transformer attention의 구조적 대응포스트 1
5개 노드 그래프에서 GCN을 손으로 계산한 walkthrough가 공유됐습니다. 인접 행렬로 자기 자신과 이웃의 메시지를 모은 뒤 MLP 변환을 거치는 과정이 Transformer의 attention이 토큰 위치를 섞는 방식과 대응된다는 설명입니다.
세부 내용 보기
- 계산은 5개 노드의 그래프와 양방향 인접 행렬에서 시작해 대각선에 self-loop를 추가하고, 가중치·편향·ReLU로 각 노드의 메시지를 만들었습니다.
- 각 노드는 인접 행렬을 통해 자신과 이웃의 메시지를 합쳤으며, 예시에서 Node A는 [3,0,1]과 [1,0,0]을 합쳐 [4,0,1]을 얻고 Node C는 [1,2,4], [1,3,5], [0,0,1]을 합쳐 [2,5,10]을 얻었습니다.
- 두 번째 GCN 층과 fully connected layer, linear layer, sigmoid를 거쳐 A는 0, B·C·D는 1, E는 0.5로 분류됐습니다.
- 작성자는 GCN 층을 이웃 간 정보를 섞는 인접 행렬과 노드별 변환을 수행하는 MLP의 두 부분으로 설명하고, Transformer에서는 인접 행렬 자리에 attention matrix가 들어간다고 비교했습니다.
📈 GPT-Live-1의 음성 에이전트 API 공개포스트 1
OpenAI Developers는 GPT-Live-1을 API에서 사용할 수 있게 하면서, 애플리케이션 안에서 듣는 동시에 말하는 자연스러운 대화형 voice agent를 만들 수 있다고 알렸습니다. 사용자는 원하는 모델과 harness를 선택해 음성 상호작용을 구성하는 흐름입니다.
세부 내용 보기
- GPT-Live-1은 API에서 제공되며, ChatGPT와 같은 자연스러운 back-and-forth 대화를 애플리케이션에 연결하는 용도로 설명됐습니다.
- voice agent는 사용자의 말을 들으면서 동시에 말하는 방식으로 작동하고, 개발자는 선택한 models와 harness를 조합해 애플리케이션의 음성 흐름을 구성할 수 있습니다.
용어 해설
- 프런티어 AI(Frontier AI)
- — 최첨단 성능을 목표로 개발되는 AI 시스템을 가리킵니다. 이번 포스트에서는 연구 속도, 안전 감시, 독립 평가자의 권한을 둘러싼 규제 논쟁의 대상이 됩니다.
- 제3자 평가자(Third-party Evaluator)
- — AI 개발 조직과 분리된 기관이 모델의 위험과 성능을 평가하는 체계입니다. 대학 연구 그룹이나 독립 연구기관에 모델 접근 권한을 부여해 외부 검증을 수행합니다.
- 월드 모델(World Model)
- — 외부 세계와 자신의 상태를 내부 표현으로 구성하고 다음 상태를 예측하는 체계입니다. 포스트에서는 언어 처리 능력과 인과관계 이해 사이의 차이를 설명하는 핵심 개념으로 쓰입니다.
- 에이전트 벤치마크(Agentic Benchmark)
- — AI가 여러 단계의 계획과 도구 사용을 수행하는 능력을 측정하는 평가 기준입니다. deepseek v4.1 flash 관련 포스트에서는 GPT-5.6 sol과의 작업 단가 및 성능 비교에 쓰입니다.
- 승인 게이트(Approval Gate)
- — 에이전트가 외부 실행을 수행하기 전에 사용자 승인을 확인하는 제어 단계입니다. 승인 응답이 제한 시간 안에 도착하지 않으면 명령을 차단해 자동 실행을 막습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

