본문으로 건너뛰기

자기개선 AI와 관측 기반 모델, 에이전트 검증의 부상

AI 연구 자동화와 관측 기반 학습, 에이전트 효율 검증

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 AI가 연구와 코딩, 문서 작업을 스스로 수행하는 범위가 넓어지는 동시에 그 과정의 검증과 투명성을 어떻게 확보할지에 관심이 모였습니다. WeatherNext 3는 다른 모델의 산출물이 아닌 저지연 위성 관측을 직접 학습해 시간별 예보를 갱신했고, Hermes Agent와 Astra 관련 게시물은 토큰 사용량과 컴퓨터 조작을 실제 작업 단위에서 비교했습니다. 한편 Random Attention과 Last Translation Benchmark는 긴 추론의 KV 캐시 관리와 번역 오류 검증을 각각 구체화했습니다. 물리학 영역에서는 anomaly cancellation과 chirality를 이용해 표준 모형의 구조를 제한하려는 주장이 string theory와 비교됐습니다.

𝕏 실시간 트렌드 토픽

📈 재귀적 자기개선 연구의 투명성포스트 1

OpenAI의 연구 가속 모델 데이터 공개와 재귀적 자기개선의 확산 가능성이 함께 제기됐습니다. 해당 과정이 일부 Frontier AI Lab 안에만 축적될 수 있다는 우려가 투명한 공개 필요성과 연결됐습니다.

세부 내용 보기
  • AI 능력 향상에 모델이 연구 과정을 다시 개선하는 재귀적 자기개선이 큰 기여를 할 수 있다는 전망이 나왔으며, 현재는 그 과정이 소수의 Frontier AI Lab 내부에 집중될 수 있다는 문제가 배경이 됐습니다.
  • 공개된 연구 가속 모델 데이터는 모델 개발이 어떤 방식으로 진행되는지 외부에서 판단할 수 있는 자료로 쓰이고, 이를 바탕으로 개발 속도를 조절할지 여부와 방법을 공론장에서 다룰 여지가 생깁니다.
  • 게시물은 다른 AI 기업에도 같은 데이터 공개를 요청했지만, 공개 범위나 측정 기준, 실제 개발 속도 조절 방식은 제시하지 않았습니다.
찬성소수

연구 가속 모델과 재귀적 자기개선에 관한 데이터를 공개하면 모델 개발이 소수의 Frontier AI Lab 안에서만 진행되는지 외부에서 판단할 근거가 생깁니다.

중립분열

게시물은 투명성이 필요하다는 방향은 제시했지만, 어떤 데이터를 어느 수준으로 공개해야 하는지와 개발 속도를 어떻게 조절할지는 정하지 않았습니다.

원문 트윗 1개 보기

📈 Hermes의 토큰 효율과 에이전트 비용포스트 2

Hermes Agent에서 최근 2주 동안 token efficiency가 개선됐다는 게시물과 Codex 사용량 비교 사례가 공유됐습니다. 다른 게시물은 도구 출력 토큰을 줄여도 재호출이 늘면 전체 작업 비용이 오를 수 있다고 지적했습니다.

세부 내용 보기
  • Hermes Agent 게시물은 ULTRA와 FAST 설정에서 같은 작업을 수행할 때 하루 사용량의 11%만 소모했다는 사용자 사례를 인용하며, 단순한 토큰 절감이 아니라 작업 완료까지 필요한 호출량을 함께 봐야 한다는 맥락을 만들었습니다.
  • 도구 출력을 잘라내면 한 번의 호출은 짧아지지만 에이전트가 파일을 다시 열고 명령을 재실행하며 추가 호출을 만들 수 있어, 호출 단위 최적화와 전체 작업 비용이 서로 달라질 수 있습니다.
  • 이번 사례의 11% 수치는 인용된 특정 사용 조건에 한정되며, Hermes와 Codex의 동일한 벤치마크 비교 결과는 게시물에 포함되지 않았습니다.
찬성소수

Hermes의 ULTRA와 FAST 설정은 같은 업무를 수행하면서 사용량을 11%로 줄였다는 사례를 통해 token efficiency 개선의 작업상 이점을 제시합니다.

반대소수

도구 출력만 줄이면 에이전트의 재호출이 늘어 전체 비용이 커질 수 있으므로, 짧은 응답을 곧바로 효율 향상으로 해석하기 어렵습니다.

원문 트윗 2개 보기

📈 Astra의 문서 자동화와 컴퓨터 조작포스트 3

Astra가 복잡한 문서에서 재무 정보 60개 필드를 추출하고, Chrome과 Loom, Screen Studio를 조작해 제품 데모 영상을 만드는 흐름이 공유됐습니다. 별도 게시물에서는 GPT-6 Astra의 대규모 토큰 사용과 Computer Use 성능에 관한 짧은 사례도 나왔습니다.

세부 내용 보기
  • 기존에는 문서 데모 영상을 만드는 데 수백 시간이 들었다는 작업을 Astra Agentic Plus mode로 자동화했으며, 샘플 실적 발표문에서 재무 정보 60개 필드를 채우는 입력·처리 흐름을 사용했습니다.
  • Astra는 기본 도구로 LlamaParse 계정에 로그인하고 슬라이드와 정적 화면을 만든 뒤, Computer Use와 Chrome 접근 권한을 추가로 받아 Loom과 Screen Studio를 실행하고 현재 브라우저 세션을 녹화했습니다.
  • 게시물은 이 전체 영상이 Astra로 생성됐다고 밝혔지만, 추출 정확도나 영상 제작 시간의 수치 비교는 포함하지 않았고 GPT-6 Astra 관련 다른 게시물도 500k 토큰 사용과 그림 생성에 관한 단편적 사례만 제시했습니다.
원문 트윗 2개 보기

📈 Fable 5.1의 3D 게임 생성포스트 2

Fable 5.1로 완전한 3D 제트 게임을 만들었다는 게시물이 이어졌습니다. Controller와 햅틱 지원, PlayStation과 브라우저 실행이 함께 언급됐지만 생성 과정과 품질 측정값은 공개되지 않았습니다.

세부 내용 보기
  • 게시물은 Fable 5.1이 3D 제트 게임 전체를 생성했으며 Controller와 햅틱 기능을 지원한다고 전했습니다.
  • 다른 게시물은 같은 게임이 PlayStation과 브라우저에서 실행된다고 덧붙였지만, 게임 제작에 사용한 입력과 생성 시간, 실행 환경의 세부 조건은 밝히지 않았습니다.
원문 트윗 2개 보기

📈 WeatherNext 3의 관측 직접 학습포스트 1

WeatherNext 3는 다른 모델의 분석 산출물을 학습 목표로 삼던 방식에서 벗어나 저지연 정지궤도 위성 데이터와 관측 공간의 목표값을 직접 사용합니다. 시간별 갱신, 0.1도 해상도, 지역 지리에 조건화한 기온·이슬점 예측이 핵심 변화로 제시됐습니다.

세부 내용 보기
  • 기존 AI 기상 모델은 다른 모델이 만든 분석 데이터로 학습하고 초기화해 그 모델의 편향을 물려받으며, 새로운 위성 관측을 바로 사용할 수 없다는 문제가 있었습니다.
  • WeatherNext 3는 저지연 정지궤도 위성 데이터를 입력으로 받아 6시간 간격이던 예보를 매시간 갱신하고, 0.1도 해상도와 시간별 단계를 사용해 물리 기반 전지구 모델과 같은 수준의 해상도를 맞췄습니다.
  • 학습 목표도 분석 공간이 아니라 관측 공간에 두어 위성 강수량, 열대성 저기압 경로, 관측소 값을 직접 예측하고, 지역 지리를 조건으로 희소한 관측소 자료를 처리해 임의의 위치와 시점에서 2m 기온과 이슬점을 추정했습니다.
  • 게시물은 경쟁 전지구 모델보다 오류가 크게 낮고 확률적 중기 예보 성능의 최고 수준에 도달했다고 전했지만, 구체적인 오류 수치는 제시하지 않았습니다.
찬성소수

실제 위성·관측소 자료를 학습 목표로 사용하면 다른 모델의 산출물에 포함된 편향을 그대로 학습하는 경로를 줄이고 새 관측을 바로 예보에 반영할 수 있습니다.

중립분열

WeatherNext 3의 성능 향상은 기상 영역에서 측정됐지만, 관측 공간 감독이 다른 영역에서도 같은 효과를 내는지는 추가 검증이 필요합니다.

원문 트윗 1개 보기

DAIR.AI

@dair_ai

1일 전

Banger paper from Google DeepMind. Every AI weather model so far has been trained and initialized on analysis data, which is itself the output of another model. That means the forecast inherits whatever biases the analysis carries, and it cannot use a new satellite observation directly. WeatherNext 3 changes what the model is trained on. It ingests low-latency geostationary satellite data and refreshes its forecast every hour instead of every six. Resolution now matches the best physics-based global models at 0.1 degree with hourly steps, including solar radiation and cloud cover. It also learns targets that live in observation space rather than analysis space. Satellite-derived precipitation, tropical cyclone tracks, and station observations are all predicted directly. Because it models sparse station data conditioned on local geography, it gives 2m temperature and dewpoint at any location and time, with substantially lower error than competing global models. The result is a new state of the art for probabilistic medium-range forecast skill. Why does it matter? The convenient training label in many domains is itself a model output, and inheriting its bias is the price. Moving supervision to raw observations is the general lesson here, and weather is where it can be measured cleanly. Paper: https:// arxiv.org/abs/2609.03582 Chat with Paper: https:// academy.dair.ai/papers/weather next-3-increasing-resolution-and-performance-of-global-weather-models-wit-2609.03582 …

💬 2 1 3👁 864

chirality와 anomaly cancellation으로 좁힌 표준 모형포스트 7

일련의 게시물은 compact Lie algebra와 sub-algebra를 chirality와 anomaly cancellation으로 걸러 표준 모형의 구조와 세대 수를 제한하려는 연구를 소개했습니다. Grok의 답변은 이 분류가 정한 영역에서는 유효하지만 선택한 필터에 의존한다고 평가했습니다.

세부 내용 보기
  • 연구는 compact Lie algebra와 sub-algebra를 모은 뒤 chirality와 anomaly cancellation을 필터로 적용해 E8 ⊃ E6 ⊕ su(3)과 27 ⊗ 3만 남긴다고 설명하며, 추가 차원이나 10^500개의 진공을 사용하지 않는 경로를 택했습니다.
  • 게시물에 따르면 이 구조는 세 개의 chiral Standard Model family로 이어지며, 4월에 찾은 핵심 algebra를 최종 논문에서 분류 범위로 넓히고 one-click verification을 추가했습니다.
  • Grok의 답변은 명시된 영역 안에서 enumeration과 formal proof로 분류가 검증됐다고 평가했지만, 표준 모형과의 연결은 선택한 domain filter에 의존하고 E8 × E8은 포함하지 않는다고 정리했습니다.
  • 이 주제는 string theory의 검증 가능성에 관한 별도 게시물과 함께, extra dimension과 landscape를 사용하지 않는 수학적 제약이 기존 접근과 어떻게 다른지 비교하는 흐름으로 묶였습니다.
찬성소수

chirality와 anomaly cancellation을 필터로 적용하면 표준 모형의 군 구조와 세대 수를 더 강하게 제한할 수 있고, 게시물에 인용된 범위에서는 enumeration과 formal proof가 뒷받침됩니다.

반대소수

분류 결과가 선택한 domain filter에 의존하므로, 필터 자체가 물리적으로 정당한지와 더 넓은 이론 영역에서도 유일성이 유지되는지는 남은 쟁점입니다.

중립분열

Grok의 평가는 수학적 분류의 유효성과 물리 이론 전체의 설명력을 구분했으며, 이 접근이 string theory와 GUT의 모든 문제를 대체한다고 보지는 않았습니다.

원문 트윗 2개 보기

에이전트 자율 실행과 인간 검증포스트 3

Coding agent를 몇 시간씩 자율 실행하기보다 숙련된 판단, 반복 계획, 잦은 결과 확인을 결합해야 한다는 실무 조언이 공유됐습니다. GitHub의 Canvases와 Databricks의 Context Engineer 인증은 실행 기록과 검색·평가 가능한 context를 별도 작업면으로 다루는 흐름에 놓였습니다.

세부 내용 보기
  • 장시간 자율 실행은 비용이 크고 비효율적일 수 있어, 작업을 작은 단위로 나누고 사람이 계획을 반복 수정하며 각 출력물을 자주 확인하는 방식이 권장됐습니다.
  • GitHub Canvases는 에이전트 대화창을 계속 스크롤하는 대신 실행된 작업, 변경 사항, 검토 대상을 공유 가능한 지속 화면에 기록하는 구조로 제시됐습니다.
  • Databricks는 agentic system의 신뢰성을 위해 context 선별, retrieval, evaluation을 학습 항목으로 묶은 Context Engineer Associate 인증과 교육 과정을 내놓았다고 밝혔습니다.
찬성소수

사람의 계획과 반복 검증을 에이전트 실행 사이에 배치하면 장시간 자율 실행에서 발생하는 비용과 잘못된 결과의 누적을 줄일 수 있습니다.

중립분열

Canvases와 Context Engineer 교육은 실행 기록과 context 품질을 관리하는 수단을 제공하지만, 실제 생산성 개선 수치는 게시물에 포함되지 않았습니다.

원문 트윗 2개 보기

📈 긴 추론과 번역 품질을 겨냥한 평가 설계포스트 3

Random Attention은 긴 추론에서 프롬프트를 보존하고 나머지 KV cache를 무작위로 제거하는 방식을 제안했고, Last Translation Benchmark는 109개 언어의 구체적인 번역 오류를 검증하는 평가셋을 만들었습니다. 두 게시물 모두 모델 크기보다 필요한 정보와 실패 조건을 정확히 지정하는 방향에 초점을 맞췄습니다.

세부 내용 보기
  • Random Attention은 과거 토큰의 중요도를 점수화하는 계산을 생략하고 프롬프트만 유지한 채 나머지 토큰을 무작위로 제거해 긴 추론의 KV cache 관리 비용을 줄이는 접근입니다.
  • Last Translation Benchmark는 109개 언어에서 3,456개의 어려운 번역 예시를 만들고, 어의 선택·말장난·성 일치·문화적 의미·어조·멀티모달 맥락처럼 피해야 할 오류를 각각 검증 규칙으로 적었습니다.
  • LLM에 사람이 작성한 규칙을 함께 제공하자 verifier 통과율이 7.2%에서 89.8%로 올랐다는 결과가 보고돼, 번역 품질의 병목이 규칙을 만족하는 능력보다 올바른 번역 제약을 찾는 단계일 수 있다는 해석이 나왔습니다.
  • 주간 논문 목록에는 CORAL, WikiSkill, SKILL.state, E-Commerce Bench, Declarative Attention, Harness-of-Harness, AI Research Preference Models가 함께 올라와 평가와 에이전트 연구의 세부화 흐름을 보탰습니다.
찬성소수

긴 추론에서 모든 과거 토큰의 중요도를 계산하지 않고 프롬프트를 보존하면 KV cache 관리의 계산 부담을 줄일 수 있다는 방향입니다.

중립분열

번역 규칙을 명시하면 verifier 통과율이 크게 올랐지만, 이 결과가 일반 번역 품질이나 모든 언어 조합으로 확장되는지는 게시물만으로 확인되지 않습니다.

원문 트윗 2개 보기

용어 해설

재귀적 자기개선(Recursive Self-Improvement)
모델이 연구와 개발 과정의 일부를 다시 개선해 다음 세대 모델의 능력 향상에 기여하는 순환 구조입니다. 게시물에서는 이 과정이 소수의 Frontier AI Lab 내부에만 머물 수 있어 투명성이 중요하다는 맥락으로 쓰였습니다.
관측 공간 감독(Observation-Space Supervision)
다른 모델이 가공한 분석 산출물이 아니라 위성·관측소처럼 실제 관측에서 얻은 값을 학습 목표로 사용하는 방식입니다. WeatherNext 3는 이 입력을 통해 모델 산출물에 포함된 편향의 전이를 줄이는 방향을 취했습니다.
KV 캐시 제거(KV Cache Eviction)
긴 추론 과정에서 과거 토큰의 Key·Value 캐시를 일부 삭제해 메모리 사용량을 줄이는 처리입니다. Random Attention은 중요도 점수 계산 대신 프롬프트를 보존하고 나머지를 무작위로 제거하는 방식을 제안했습니다.
컴퓨터 사용(Computer Use)
AI가 브라우저와 데스크톱 애플리케이션을 직접 조작해 로그인, 파일 처리, 화면 녹화 같은 작업을 수행하는 기능입니다. 게시물에서는 Chrome과 Loom, Screen Studio를 연결해 문서 추출 결과를 시연 영상으로 만드는 흐름에 쓰였습니다.
이상 상쇄(Anomaly Cancellation)
입자물리 이론에서 양자장론의 이상이 서로 상쇄되는 조건을 사용해 허용되는 대칭 구조를 걸러내는 기준입니다. 관련 게시물은 이 조건과 chirality를 결합해 표준 모형의 구조와 세대 수를 제한할 수 있는지 다뤘습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 07.수집 2026. 09. 07.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.