본문으로 건너뛰기
X (Twitter)조회 1

이미지 생성 고도화, 개인 에이전트 확장, 수학 추론 비용과 에이전트 실행 구조

이미지 편집·개인 에이전트·수학 추론·에이전트 실행 기반의 동시 확장

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 이미지 생성 편집 기능, 개인용 에이전트, 수학 증명에 투입되는 추론 자원, 에이전트의 컨텍스트와 인증 구조가 함께 부상했습니다. ChatGPT Images 2.5는 생성 속도와 세부 묘사, 여러 번의 편집 과정에서 세부 일관성을 높였고, Text-to-Image·Image Edit·Multi-Image Edit Arena에서는 GPT-Image-2.5-Sunburst와 Flare가 상위권을 차지했습니다. Muse는 브라우저와 연결된 앱을 사용해 쇼핑·예약·금융 같은 여러 단계 작업을 백그라운드에서 이어가는 개인 에이전트로 출시됐으며, 안전한 장기 컨텍스트 관리가 핵심 과제로 부각됐습니다. Navier–Stokes 해법에는 수천억 개의 출력 토큰과 수백만 달러에서 수천만 달러 규모의 비용 추정이 따라붙었고, 동시에 장기 과제용 RL credit 배정과 에이전트 인증·컨텍스트 전달을 줄이는 개발 도구가 등장했습니다.

𝕏 실시간 트렌드 토픽

🔥 ChatGPT Images 2.5와 Sunburst·Flare의 이미지 생성 경쟁포스트 5

ChatGPT Images 2.5가 더 빠른 생성, 선명한 세부 묘사, 정밀 편집, 반복 편집에서의 일관성을 내세웠습니다. Arena 포스트에서는 GPT-Image-2.5-Sunburst와 Flare가 세 가지 이미지 평가 부문에서 상위권으로 집계됐습니다.

세부 내용 보기
  • 기존 이미지 생성 흐름에서 사용자가 기다리는 시간과 편집을 반복할수록 흔들리는 세부 요소가 문제로 남았고, ChatGPT Images 2.5는 생성 속도와 인식 가능한 형태의 충실도, 여러 편집 사이의 세부 일관성을 함께 높이는 방향을 취했습니다. 댓글 기반 도구와 공유 기능도 제작 과정에 포함됐습니다.
  • GPT-Image-2.5-Sunburst와 Flare는 Text-to-Image Arena, Image Edit Arena, Multi-Image Edit Arena에서 각각 1위와 2위로 언급됐으며, GPT-Image-2 대비 세 부문 모두 개선된 결과로 제시됐습니다. 게임 개발자와 디자이너가 투명 이미지 기능을 활용할 가능성도 포스트에서 거론됐습니다.
  • 생성 자체뿐 아니라 이미지 편집과 반복 수정의 안정성이 함께 개선되면서, 한 번의 출력보다 여러 단계의 제작 작업을 수행하는 사용자에게 의미가 커졌습니다.
원문 트윗 2개 보기

🔥 Muse의 앱 연동형 개인 에이전트 출시포스트 5

Muse가 브라우저와 연결된 앱을 사용해 여러 단계의 작업을 백그라운드에서 수행하는 개인용 AI 에이전트로 출시됐습니다. Instagram의 친구 관계망, 이메일 등 외부 서비스의 컨텍스트, Facebook Marketplace가 초기 확산 경로로 거론됐습니다.

세부 내용 보기
  • 기존 챗봇이 사용자의 요청에 답한 뒤 멈추는 흐름과 달리 Muse는 예약, 금융, 쇼핑, 엔터테인먼트, 웰니스처럼 여러 단계가 이어지는 작업을 시작부터 완료까지 처리하도록 설계됐습니다.
  • Muse는 브라우저를 사용하고 사용자가 연결한 앱과 서비스의 정보를 조합하며, Facebook Marketplace에서는 상품 검색, 가격 협상, 픽업 조율까지 이어지는 사용 사례가 제시됐습니다. 1Password와의 협력으로 기존 로그인 정보를 활용하는 연결도 추가됐습니다.
  • 시간이 지나며 개인 컨텍스트를 더 많이 보유할수록 유용성이 커지는 구조인 만큼, Meta는 에이전트 시스템에 안전장치를 내장했다고 밝혔습니다. 유통 경로와 장기 컨텍스트 관리가 제품 확장의 핵심 조건으로 자리 잡았습니다.
원문 트윗 2개 보기

🔥 Navier–Stokes 증명과 대규모 추론 비용포스트 4

OpenAI의 Navier–Stokes 해법을 둘러싸고 증명에 사용된 추론 자원과 비용, 장기 수학 벤치마크의 난도가 함께 화제가 됐습니다. 추정치에는 1300억 출력 토큰과 API 기준 650만 달러가 포함됐습니다.

세부 내용 보기
  • 수학 문제를 에이전트 집단과 차세대 모델로 풀 때 성능만으로는 충분하지 않고, 모델 인스턴스 수와 입력·출력 토큰 규모가 전체 비용을 좌우하는 구조가 드러났습니다. 한 포스트는 GPT-6와 비슷한 규모라는 가정 아래 계산을 확장했습니다.
  • 제시된 추정은 1300억 출력 토큰에 API 가격 기준 650만 달러이며, 입력 토큰까지 합친 총비용은 1000만 달러보다 조금 낮은 수준에서 3000만~4000만 달러까지로 계산됐습니다. 이는 모델 규모와 추가 RL 적용이 같다는 가정에 따른 수치입니다.
  • Millennium Prize Problems는 너무 어려워 포화까지 100년이 걸릴 벤치마크의 예로 언급됐다가, 2028년 말까지 완전히 포화될 수 있다는 전망으로 바뀌었습니다. 고난도 수학 문제를 평가 기준으로 삼는 방식과 실제 추론 자원의 경제성이 함께 쟁점이 됐습니다.
찬성소수

Millennium Prize Problems 같은 고난도 문제를 벤치마크로 쓰면 장기 추론 능력의 상한을 측정할 수 있다는 입장입니다. 2028년 말까지 해당 세트가 완전히 포화될 수 있다는 전망이 제시됐습니다.

반대소수

Navier–Stokes 해법에 수천억 개 출력 토큰과 수백만 달러가 필요하다는 추정은 성능 비교에 비해 비용과 재현성 부담이 크다는 우려를 낳습니다.

원문 트윗 2개 보기

📈 에이전트의 컨텍스트 전달과 인증 추상화포스트 6

에이전트가 긴 작업을 이어가려면 하위 에이전트에 어떤 컨텍스트를 전달할지, 외부 서비스에 누구의 권한으로 접근할지를 단순화해야 한다는 실무 흐름이 나타났습니다. GitHub Copilot의 불필요한 작업 축소와 Managed Connections가 같은 문제를 서로 다른 층위에서 다뤘습니다.

세부 내용 보기
  • 토큰을 많이 쓰는 것보다 에이전트가 작업을 계속 진행하는 데 필요한 컨텍스트만 보유하는 편이 효율적이라는 관점이 제시됐습니다. 하위 에이전트 실행에서는 완전히 새 프롬프트를 받는 isolated 모드와 기존 메시지 기록을 복사하는 forked 모드가 구분됐습니다.
  • 인증에서는 에이전트 자체 token과 사용자 token을 선택하고, 필요한 경우 동의 흐름을 안내해야 했습니다. Managed Connections는 OAuth 앱, token 저장, 갱신, consent flow를 코드의 단일 인자로 감싸 외부 서비스 연결에 필요한 반복 구현을 줄이는 방식입니다.
  • GitHub Copilot의 사례는 작업 품질을 유지하면서 불필요한 작업을 줄이는 방향을, subagent 컨텍스트 모드와 Managed Deep Agents 0.7의 Connections는 에이전트 오케스트레이션과 권한 처리를 표준화하는 방향을 취했습니다. 장기 작업의 안정성은 모델 능력뿐 아니라 컨텍스트와 권한의 경계 설정에 달려 있습니다.
원문 트윗 2개 보기

📈 Progressive Point Matching의 장기 과제용 RL credit 배정포스트 1

Progressive Point Matching이 RL과 imitation learning 사이의 방식으로 긴 궤적에 토큰 단위 credit를 촘촘히 배정하는 접근으로 소개됐습니다. 포스트는 표준 GRPO보다 장기 과제의 학습 효율이 지수적으로 높아졌다고 주장했습니다.

세부 내용 보기
  • 긴 작업에서는 최종 결과만으로 각 토큰의 기여도를 판단하기 어려워 보상 신호가 희소해지는 문제가 생깁니다. Progressive Point Matching은 긴 궤적의 각 지점에 dense credit를 배정해 학습 신호를 더 세밀하게 만드는 구조입니다.
  • 이 방식은 RL의 보상 학습과 imitation learning의 단계별 신호 사이에 위치하며, 장기 작업을 토큰 수준의 기여도 계산으로 나눕니다. 포스트는 표준 GRPO와 비교해 학습 효율이 지수적으로 개선됐다고 밝혔습니다.
  • 장기 계획과 도구 사용이 필요한 LLM RL에서는 최종 성공 여부만 보는 방식보다 중간 단계별 credit 배정이 학습 효율을 좌우할 수 있다는 점이 핵심입니다.
원문 트윗 1개 보기

📈 Runway 모델의 Premiere Pro·After Effects 통합포스트 1

Runway가 Adobe Premiere Pro와 After Effects 안에서 모델을 직접 사용하도록 Plugins를 출시했습니다. 사용자는 타임라인을 벗어나지 않고 영상을 생성·편집·업스케일할 수 있습니다.

세부 내용 보기
  • 생성형 영상 작업에서는 편집 도구와 모델 사이를 오가며 파일을 옮기는 과정이 작업 흐름을 끊습니다. Runway Plugins는 Premiere Pro와 After Effects 내부에서 모델을 호출해 이 이동 단계를 줄이는 방식입니다.
  • 플러그인은 타임라인을 유지한 채 영상 생성, 편집, 업스케일을 수행하도록 연결됩니다. 별도 애플리케이션에서 결과를 만든 뒤 다시 가져오는 대신 기존 편집 환경을 입력과 결과 확인의 중심으로 둡니다.
  • 모델 접근성이 편집 소프트웨어 안으로 이동하면서 생성형 영상 기능의 경쟁 지점이 독립 서비스에서 기존 제작 도구와의 통합성으로 넓어졌습니다.
원문 트윗 1개 보기

용어 해설

Vending-Bench
AI 모델이 판매·거래 상황에서 수익을 만들고 의사결정을 수행하는 능력을 평가하는 벤치마크입니다. 수익성뿐 아니라 윤리성까지 함께 비교하는 맥락에서 사용됐습니다.
나비에–스토크스 방정식(Navier–Stokes equations)
유체의 흐름을 기술하는 편미분방정식으로, 이번 포스트에서는 해의 존재와 매끄러움을 다루는 밀레니엄 문제의 대상으로 언급됐습니다.
점진적 포인트 매칭(Progressive Point Matching)
긴 궤적을 처리하는 RL에서 각 토큰에 촘촘한 credit를 배정하는 방법입니다. 표준 GRPO보다 장기 과제의 학습 효율을 높이는 방식으로 소개됐습니다.
Managed Connections
에이전트가 자체 identity 또는 사용자 identity로 외부 서비스에 접근하도록 OAuth 앱, 토큰 저장, 갱신, 동의 절차를 묶어 처리하는 연결 방식입니다.
컨텍스트 포킹(context forking)
주 에이전트의 메시지 기록을 복사해 하위 에이전트가 이어받도록 하는 실행 방식입니다. 독립된 새 프롬프트를 쓰는 isolated 모드와 구분됩니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 09.수집 2026. 09. 09.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.