본문으로 건너뛰기

프런티어 AI 안전 평가, 에이전트 실행 인프라와 반복형 추론 연구

외부 평가자에게 열린 프런티어 AI 안전 체계와 장기 실행 에이전트 인프라, 반복형 추론 연구

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 프런티어 AI 개발 속도를 늦추고 외부 평가자에게 직원 수준의 시스템 접근 권한을 부여하자는 Anthropic의 계획에 OpenAI와 여러 관계자가 호응했지만, 평가자의 독립성과 사이버보안 역량을 둘러싼 반론도 함께 나왔습니다. 개발 측면에서는 OpenAI의 Agents API가 장기 세션, 도구 사용, 병렬 하위 에이전트, MCP, 샌드박스를 하나의 실행 구조로 묶었고, 도메인별 harness가 에이전트 제품의 경쟁력을 좌우할 수 있다는 실무 관점이 확산됐습니다. 연구 포스트에서는 반복형 추론을 위한 Looped flows 학습법과 월드 모델의 카메라 제어 방식이 다뤄졌습니다. Code Arena의 WebDev 순위와 Fugu 계열 시스템은 에이전트·코딩 성능 경쟁이 실제 사용자 선호와 복합 작업 벤치마크로 측정되는 흐름을 드러냈습니다.

𝕏 실시간 트렌드 토픽

🔥 프런티어 AI 속도 조절과 외부 평가자 체계포스트 15

Anthropic이 AI 개발 속도를 늦추고 제3자 평가자에게 영구적인 직원 수준 접근 권한을 부여하겠다고 밝힌 뒤, OpenAI도 같은 방향에 동참했습니다. 평가자의 독립성, 사이버보안 전문성, 경쟁력 저하 가능성을 둘러싼 반응이 함께 나타났습니다.

세부 내용 보기
  • Anthropic의 계획은 프런티어 AI 시스템을 기업 내부의 제한된 인력만 평가하는 구조에서 벗어나게 하려는 시도입니다. 제3자 평가자는 시스템에 상시 접근해 안전 조치 준수 여부를 확인하고 사고를 보고하며 학습 중 모델의 정렬 상태를 평가합니다. Sam Altman은 OpenAI 내부에서 같은 주제를 다뤄 왔다며 독립 평가자에게 직원 수준 접근 권한을 부여하겠다고 밝혔습니다.
  • 평가 체계의 실효성을 두고는 독립성 기준이 핵심 쟁점으로 떠올랐습니다. 일부 포스트는 평가자가 같은 Effective Altruism 계열 조직이나 자금원에 의존하면 독립 평가로 보기 어렵다고 지적했고, METR만으로는 충분하지 않으며 실제 사이버보안 엔지니어가 필요하다는 요구도 나왔습니다.
  • 안전 평가를 강화하면 경쟁 속도가 떨어지고 관료주의가 미국의 기술 우위를 약화할 수 있다는 반론도 제기됐습니다. 반대 측은 경쟁국이 공격 기술과 데이터를 보유한 상황에서 내부 평가자 제도가 공격을 늦추지 못할 수 있다고 봤고, EMostaque는 일반 목적 모델의 사이버 공격·비표준 의료 생물학 데이터 학습을 제한하되 통제된 전문 변형은 허용하자는 구체적 기준을 거론했습니다.
찬성다수

Anthropic의 외부 평가자 제도와 OpenAI의 동참은 안전 평가를 소수의 프런티어 연구소 내부에 가두지 않고 투명성을 높이는 장치라는 입장입니다. Open Alignment Initiative도 평가자 프로그램 참여를 요청하며 공개성을 확대하려 했습니다.

반대소수

평가자가 특정 운동이나 동일한 자금원에 편중되면 독립성을 확보할 수 없고, 사이버보안 전문성이 부족하면 실제 위험을 측정하기 어렵다는 입장입니다. 안전 절차가 경쟁국의 공격을 막지 못한 채 개발 속도만 낮출 수 있다는 우려도 포함됩니다.

중립소수

AI 경쟁을 유지하면서도 외부 평가와 안전 조치를 결합할 균형점이 필요하다는 입장입니다. 평가자의 접근 권한, 독립성, 전문성, 데이터 제한 범위를 구체화해야 실효성을 판단할 수 있습니다.

원문 트윗 2개 보기

📈 Agents API와 도메인별 harness 설계포스트 5

OpenAI의 Agents API가 Codex harness의 실행 구조를 공개 베타로 제공하면서 에이전트 개발의 기본 단위를 모델 호출에서 장기 작업 환경으로 확장했습니다. 동시에 OpenCode Go의 손익분기와 도메인별 harness의 중요성이 에이전트 서비스 운영 모델의 변화로 묶였습니다.

세부 내용 보기
  • Agents API는 작업, 모델, 도구, 실행 환경을 입력으로 받아 클라우드 에이전트를 실행하고, 장기 세션과 자동 컨텍스트 압축, 병렬 하위 에이전트, MCP, 내장 도구, OpenAI 호스팅 샌드박스를 제공합니다. 에이전트는 파일을 다루고 코드를 실행하며 도구를 호출하고 여러 컨텍스트 윈도우에 걸쳐 작업을 이어가므로 단순한 모델 호출과 구분됩니다.
  • 도메인별 harness는 사용자의 업무 흐름에 맞춰 도구 사용과 상태 관리, 작업 규칙을 묶는 프레임워크로 제시됐습니다. 특정 분야에서 반복적으로 문제를 해결할수록 도메인 지식과 실행 관행을 harness에 축적할 수 있고, 이 구조가 에이전트 제품의 지능 스택과 사용자 경험을 함께 구성합니다.
  • OpenCode Go가 2주 연속 손익분기점에 도달했다는 포스트는 같은 유형의 제품이 적자를 감수하거나 사용자 데이터를 판매하는 방식에 의존한다는 비판과 대비됐습니다. 에이전트 실행 구조가 확산될수록 모델 성능뿐 아니라 비용 구조, 데이터 처리 방식, 도구·환경 통합이 제품 지속성을 좌우합니다.
원문 트윗 2개 보기

Min Choi

@minchoi

2일 전

OpenAI just made it stupidly easy to build real AI agents. The new Agents API basically gives developers the Codex harness as an API: • One call → cloud agent • Long-running sessions • Automatic context compaction • Parallel subagents • MCP + built-in tools • OpenAI-hosted sandboxes • Or run on your own infra This is way more than "call a model and hope." You give it a task, model, tools + environment. It can work across files, run code, use tools, delegate work to subagents and keep going across multiple context windows. Public beta is live for all developers. No extra Agents API fee - you pay for the models + tools your agent uses. This is basically Codex infrastructure for anyone building agents.

OpenAI Developers

Go from idea to a working agent faster with the Agents API. Build and run cloud agents with the Codex harness, fully managed by OpenAI. We handle orchestration, long-running sessions, and context management. You focus on what makes your agent unique. Available in public beta.

💬 5 1 9👁 1499

elvis

@omarsar0

2일 전

Learn to build a harness, folks. It's not surprising to me that so many YC builders want to build domain-specific harnesses. If you work long enough on a domain-specific problem, you quickly realize the opportunity. But you also realize how important that harness will be to stay competitive in the agentic era. From a product perspective, harnesses open up interesting new surface areas and experiences for the services/products you provide. From a technical perspective, harnesses are how you build and maintain a framework and set of best practices for how your users/customers interact with what you offer. Understanding how to build and design a harness means you can build much stronger intelligence stacks, given that you can customize it and understand the domain well. That's extremely valuable. It may not seem apparent yet, but a harness wave is coming. If you are getting started, give this list of harness papers to your agents and start upskilling: https:// academy.dair.ai/papers/collect ions/harness-engineering … If you are already a builder, try building one for your specific domain. It's a lot of fun, and you learn a lot of interesting things to enhance your current agentic tools.

Garry Tan

Either you die a system of record or you live long enough to become a domain-specific harness x.com/goodhartproof/…

💬 1 2 5👁 885

📈 Looped flows를 이용한 반복형 추론 학습포스트 1

Looped models가 추론 시 은닉 상태를 반복 갱신해 파라미터를 늘리지 않고 계산량을 확장하는 가운데, Looped flows는 초기 반복 단계까지 학습되도록 국소 denoising 목적 함수를 적용했습니다. 포스트에 따르면 기존 looped 모델 대비 6개 추론 벤치마크 중 5개에서 성능 우위가 보고됐습니다.

세부 내용 보기
  • 반복형 모델은 추론 때 은닉 상태를 여러 번 업데이트하지만, 일반적인 학습에서는 gradient가 마지막 한두 번의 업데이트에만 주로 흐르기 때문에 초기 단계가 이후 계산을 준비하는 법을 배우기 어렵습니다. Looped flows는 이 학습 병목을 반복 과정 자체의 국소 목적 함수로 다룹니다.
  • 학습 과정에서는 flow model과 유사하게 단계별 noise level을 낮추고 같은 noise sample을 공유해 각 업데이트가 다음 업데이트와 연결되도록 합니다. 추론 시에는 probability flow를 따라 상태를 갱신하며, 더 촘촘한 time grid를 사용하면 계산량이 늘어나고 여러 정답이 가능한 작업에서는 시작 noise에 따라 유효한 답이 달라질 수 있습니다.
  • 포스트는 해당 방식이 기존 looped models보다 6개 reasoning benchmark 중 5개에서 우세했다고 전했습니다. 파라미터 수를 추가하지 않고 추론 단계의 반복 계산으로 reasoning을 늘리는 접근이 학습 안정화 기법과 함께 연구되고 있다는 점이 핵심입니다.
원문 트윗 1개 보기

코딩 에이전트 성능 경쟁과 Fugu 시스템포스트 3

Code Arena의 WebDev 순위에서 최근 1년간 선두 모델 점수가 340포인트 상승하고 경쟁 frontier lab 수가 6곳에서 10곳으로 늘어난 가운데, Fugu 계열 시스템은 복합 추론과 자율 연구, full-stack software development를 겨냥했습니다. 평가 기준은 실제 프런트엔드 작업의 사용자 간 선호와 여러 에이전트 벤치마크 점수로 이동했습니다.

세부 내용 보기
  • Code Arena: WebDev는 실제 프런트엔드 웹 개발 작업에서 사용자가 모델을 직접 비교한 선호 투표로 순위를 산출합니다. 포스트에 따르면 최근 1년 동안 선두 점수는 340포인트 상승했고 경쟁 frontier lab 수는 6곳에서 10곳으로 증가했으며, 당시 GPT-6 Astra가 1796점으로 1위, claudeai Fable 5.1이 1764점, Alibaba Qwen이 1685점으로 뒤를 이었습니다.
  • SakanaAILabs의 Fugu Max는 DeepSWE, Chartography, Toolathon, GDP.pdf, SWEFish 등 8개 벤치마크 가운데 5개에서 최고 또는 공동 최고 성능을 기록했고, Chartography 48.3과 DeepSWE 74.3이 제시됐습니다. 해당 결과는 Fable 5, Fable 5.1, GPT-6-Astra를 에이전트 풀에 넣지 않은 조건에서 나온 수치입니다.
  • Fugu Ultra v2는 OpenRouter에서 복합적인 다단계 추론, 자율 연구, full-stack software development를 위한 orchestration engine으로 제공됐습니다. 사용자 선호 기반 WebDev 순위와 특정 작업 벤치마크가 함께 확산되면서 코딩 에이전트 경쟁은 단일 모델 점수보다 실제 작업 수행과 오케스트레이션 능력을 비교하는 방향으로 이동하고 있습니다.
원문 트윗 2개 보기

월드 모델의 학습 없는 카메라 시점 제어포스트 1

한 연구는 고정된 월드 모델을 다시 학습하거나 작업별 adapter를 추가하지 않고, 원본 프레임과 기하 정보, 과거 생성 상태를 시각 증거로 주입해 카메라 시점을 제어했습니다. 포스트는 이 방식이 긴 rollout의 일관성, 보지 못한 시점의 장면 완성, 카메라 오차에서 기존 방법보다 나은 결과를 냈다고 전했습니다.

세부 내용 보기
  • 기존 video world model은 긴 장면 전개를 생성할 수 있지만 새로운 카메라 시점을 제어하려면 작업별 학습이나 adapter가 필요한 경우가 있습니다. 이 연구는 source frame, geometry, 과거에 생성된 state를 frozen world model이 self-attention으로 직접 읽을 수 있는 시각 정보로 변환해 추가 학습 없이 시점을 지정합니다.
  • 입력에 포함된 시각 증거가 모델의 self-attention 안에서 기존 장면 상태와 결합되고, 그 결과 카메라 이동에 맞춘 장면 재생성이 이뤄집니다. 포스트는 이 처리 방식이 긴 시간 범위의 일관성, unseen-view completion, camera error에서 이전 방식보다 개선됐다고 전했습니다.
  • 모델 가중치를 다시 학습하지 않고 입력 표현과 attention 경로를 조정하는 방식은 새로운 시점 제어를 특정 작업별 adapter에 덜 의존하게 합니다. 다만 포스트에는 구체적인 수치가 제시되지 않아 정량적인 개선 폭은 확인되지 않았습니다.
원문 트윗 1개 보기

용어 해설

내부 상주형 독립 평가자(Embedded Evaluators)
AI 기업 내부 시스템에 상시 접근하면서 안전 조치 준수 여부를 확인하고, 사고를 보고하며, 학습 중인 모델의 정렬 상태를 평가하는 외부 평가자입니다. 접근 권한이 실제 직원 수준으로 부여된다는 점이 핵심입니다.
프런티어 AI(Frontier AI)
현재 가장 높은 성능과 능력 확장을 목표로 개발되는 최첨단 AI 시스템을 뜻합니다. 이번 포스트에서는 개발 속도와 안전 평가 체계를 함께 관리해야 하는 대상으로 다뤄졌습니다.
컨텍스트 압축(Context Compaction)
장시간 실행되는 에이전트가 대화와 작업 기록을 압축해 다음 처리 단계에 필요한 정보만 유지하는 방식입니다. Agents API는 이를 자동화해 여러 컨텍스트 윈도우에 걸친 작업을 지원합니다.
에이전트 하네스(Harness)
모델이 도구와 실행 환경을 사용해 특정 업무를 수행하도록 연결하는 프레임워크입니다. 작업 정의, 도구 호출, 상태 유지, 하위 에이전트 위임을 묶어 도메인별 에이전트 경험을 구성합니다.
반복형 추론(Looped Reasoning)
모델이 추론 시점에 은닉 상태를 여러 차례 갱신해 추가 파라미터 없이 더 많은 계산을 수행하는 방식입니다. 반복 단계마다 상태를 업데이트하고, 학습 때 각 단계가 다음 단계에 기여하도록 별도 목적 함수를 사용합니다.
월드 모델(World Model)
환경의 시각 정보와 상태 변화를 내부적으로 표현해 미래 장면을 생성하는 모델입니다. 이번 연구에서는 원본 프레임과 기하 정보, 과거 생성 상태를 모델 입력의 시각 증거로 사용해 카메라 시점을 조절합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 13.수집 2026. 09. 13.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.