본문으로 건너뛰기

로그인 브라우저 에이전트, 과학 연구 자동화, H3-Max 영상 생성, 에이전트형 추론

웹 작업을 끝까지 수행하는 에이전트와 연구·영상·추론 모델의 새 수치

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 포스트에서는 로그인된 브라우저와 cloud browser를 통해 예약·구매 같은 웹 작업을 끝까지 수행하는 에이전트 기능이 가장 큰 반응을 얻었다. 과학 영역에서는 Terminal-Bench-Science가 연구 workflow 평가를 70개 task로 확장했고, Claude Team for scientists와 Model Hardware Standard가 연구자·물리 장비로 적용 범위를 넓혔다. MiniMax H3-Max는 독립 평가에서 영상 품질·prompt understanding·aesthetics 1위를 내세우면서 5초 720p 생성을 3보다 짧은 시간에 처리한다고 발표됐다. AgentX, GLM 5.3 Flash, DeepSeek V4 Flash처럼 에이전트형 추론과 모델 성능·비용을 함께 재는 흐름도 이어졌다.

𝕏 실시간 트렌드 토픽

🔥 로그인 상태로 예약·구매까지 수행하는 브라우저 에이전트포스트 5

ChatGPT Work와 Hermes Agent가 사용자의 로그인 상태를 활용해 웹사이트 작업을 처음부터 끝까지 수행하는 기능을 내놨다.

세부 내용 보기
  • 기존 챗봇은 로그인 뒤에 있는 예약·구매 작업을 직접 처리하기 어려웠지만, ChatGPT Work는 cloud browser 안에 사용자가 안전하게 로그인할 수 있는 form과 이후 세션에서 유지되는 인증 상태를 추가해 utilities 설정, DMV·passport 예약, reimbursement 확인 같은 작업으로 범위를 넓혔다. 같은 방식으로 실제 계정이 필요한 미용실 예약이 완료된 사례가 포스트에 등장해 단순 답변에서 웹 실행으로 입력과 결과의 경로가 바뀌었음을 확인했다.
  • Hermes Agent는 managed copy of the existing Chrome profile을 browser tool에 연결하고, real-profile browsing을 켜면 사용자의 로그인 상태로 웹을 탐색한다. ChatGPT Work는 credential 자체를 보지 않는다고 밝혔고 Hermes Agent는 기존 Chrome profile의 복사본을 사용한다고 밝혀, 두 접근 모두 비밀번호를 매번 모델에 전달하는 대신 브라우저 세션을 작업 실행 계층에 두는 구조이다.
원문 트윗 2개 보기

📈 과학 연구 에이전트의 평가·실험·물리 장비 연결포스트 5

과학 workflow를 평가하는 benchmark, 연구자용 Claude 접근권, 논문 재현 에이전트, 물리 장비 조작 표준이 한 흐름으로 묶였다.

세부 내용 보기
  • Terminal-Bench-Science는 여러 과학 분야의 research workflow를 평가하는 benchmark로 공개됐으며 v0.1에 70 tasks가 들어갔다. Stanford 주도 community effort와 과학 domain experts가 함께 만들었고 Claude Opus 5의 해결률은 only ~30%로 제시돼, 과학 에이전트가 실제 연구 절차를 얼마나 완수하는지 측정할 기준이 필요함을 드러냈다.
  • alphaXiv와 OpenResearch는 정적인 arXiv 논문을 에이전트가 실험하고 분기하는 live research로 바꾸며, Claude/Codex agents가 논문 재현과 실험을 수행하도록 구성했다. Tinker를 통한 concurrent RL runs도 실험 트리에서 추적할 수 있어 논문 읽기에서 재현·변형 실험으로 입력과 출력의 범위가 확장됐다.
  • Claude Team for scientists는 수학·화학·물리 등 분야의 과학자 10,000명에게 제공되며 standard seats는 free, premium seats는 월 $15로 1년간 80% discount가 적용된다. Principal investigator가 가입한 뒤 연구 그룹을 추가하는 방식이라 연구용 모델 접근을 개인 단위가 아닌 기관·그룹 단위로 배포하는 구조이다.
  • Model Hardware Standard는 AI 에이전트가 scientific research와 advanced manufacturing의 physical equipment를 안전하게 조작하도록 기준을 만드는 research preview이다. 과학·로보틱스·전자·제조 이해관계자의 피드백을 받는 단계라, 소프트웨어 에이전트의 작업 범위가 장비 제어로 이동할 때 필요한 공통 규격을 먼저 마련하는 접근이다.
원문 트윗 2개 보기

📈 MiniMax H3-Max의 영상 품질·속도 동시 최적화포스트 3

MiniMax H3-Max가 영상 품질과 prompt understanding·aesthetics 평가에서 선두를 내세우며 post-training과 inference optimization의 결합을 부각했다.

세부 내용 보기
  • fal Research의 H3 Max는 leading video models와 비교한 first-party·third-party independent evaluations에서 overall quality, prompt understanding, aesthetics 1위로 소개됐다. 5-second 720p video를 under 3으로 생성한다는 수치가 함께 제시돼, 평가 점수뿐 아니라 실제 생성 시간까지 경쟁 기준에 포함됐다.
  • MiniMax_AI는 MiniMax H3 Max의 post-training이 새로운 capability를 마법처럼 만드는 과정이 아니라 base model weights에 있던 ceiling을 끌어내는 단계라고 설명했다. SGLang의 miles pipeline은 RL + LoRA SFT trainer와 data pipeline·recipe·export 절차를 제공하고, Sol-Attention과 Sol Engine은 end-to-end speedup 3.95×를 기록해 학습 후 처리와 serving 최적화를 한 경로로 연결했다.
  • open weights를 기반으로 third-party post-train을 재현할 수 있다는 점이 이 흐름의 핵심이다. 강한 base model, RL + LoRA SFT, few-step distillation, inference kernel 최적화를 묶어 모델 품질의 상한과 실제 latency를 함께 다루는 개발 방식이다.
원문 트윗 2개 보기

Leanna Ren

@RenLeanna

1일 전

MiniMax H3-Max combines SOTA video quality with a step-change in generation speed, making high-quality video practical for many more real-world applications at scale. H3-Max also demonstrates the potential of Miniax H3 base model while pushing the frontier of open multimodal models forward. We’ve worked closely with @fal since day 1. @fal brings deep expertise in generative AI infrastructure and the ability to bring frontier models into production quickly and reliably. We’re excited to bring MiniMax H3-Max to developers, creators, and businesses worldwide together with @fal ~ Keep rolling!

fal

Introducing H3 Max, new post-trained video model by fal Research. H3 Max ranks #1 for overall quality, prompt understanding, and aesthetics against leading video models, on both first-party and third-party independent evaluations while generating a 5-second 720p video under 3

인용 트윗 보기
💬 7 8 50👁 2800

MiniMax (official)

@MiniMax_AI

1일 전

Congrats to the fal team on MiniMax H3 Max - fantastic work! A quick note on what’s actually happening under the hood: post-training doesn't magically create new capability; it elicits what's already there. The fact that MiniMax H3 Max tops these leaderboards after a post-training pass is the hallmark of a strong base model. The underlying quality, prompt understanding, and aesthetic ceiling were already embedded in the weights, and releasing that ceiling is precisely why we open-sourced H3. What makes this exciting is that the ecosystem makes this performance reproducible for anyone: Training Pipeline: SGLang’s miles pipeline provides a complete RL + LoRA SFT trainer alongside a step-by-step guide - from data pipeline and recipe straight through to export - loading directly into sgl-diffusion for serving. Inference Speed: Sol-Attention and Sol Engine deliver a 3.95× end-to-end speedup. Combined with few-step distillation, latency drops even further. Third-party post-trains like MiniMax H3 Max showcase what happens when a base model’s true potential is unlocked. This is exactly why we build with open weights-keep them coming!

fal

Introducing H3 Max, new post-trained video model by fal Research. H3 Max ranks #1 for overall quality, prompt understanding, and aesthetics against leading video models, on both first-party and third-party independent evaluations while generating a 5-second 720p video under 3

인용 트윗 보기
💬 1 0 6👁 809

AI를 활용한 글로벌 사이버 방어 연합포스트 2

OpenAI와 주요 기술 기업들이 AI 발전을 방어 인프라 보호에 연결하기 위한 공동 대응을 촉구했다.

세부 내용 보기
  • Sam Altman은 AI를 활용한 cyber defense가 critically important moment에 있으며 행동할 시간이 많지 않다고 밝혔다. 특정 회사에 한정하지 않고 competitors와 partners를 포함한 collective response를 요구해, 공격·방어 역량의 변화가 개별 기업의 보안 기능이 아니라 공동 대응 문제로 다뤄졌다.
  • OpenAI는 AnthropicAI, AWS, Google, Microsoft, Oracle과 함께 defenders에게 tools, resources, support를 제공하는 global effort를 요청했다. 보호 대상은 모두가 의존하는 infrastructure이며, 여러 기업이 방어 도구와 지원을 묶어 digital security를 강화하는 협력 구조이다.
찬성다수

AI 발전 속도가 사이버 방어의 대응 시간을 줄이므로 기업 간 도구·자원·지원의 공동 대응이 필요하다는 입장이다.

중립소수

공동 대응의 필요성은 제기됐지만 구체적인 도구, 운영 방식, 성과 수치는 포스트에 제시되지 않았다.

원문 트윗 2개 보기

📈 에이전트형 추론을 겨냥한 실행 인프라와 모델 benchmark포스트 3

긴 context와 도구 호출을 처리하는 inference benchmark가 등장했고, 효율형 모델들은 문서·수학·비용 성능을 겨뤘다.

세부 내용 보기
  • Agentic inference는 multi-turn 요청, highly variable sequence lengths, long contexts, tool-call delays, bursts of sub-agent activity를 포함해 일반적인 단일 응답 benchmark와 다른 부하를 만든다. NVIDIAAIInfra는 SemiAnalysis_의 InferenceX가 이 조건을 포착하도록 AgentX benchmark로 발전했다고 밝혀, 모델 점수뿐 아니라 실제 에이전트 실행 패턴을 측정하는 방향을 제시했다.
  • GLM 5.3 Flash는 OfficeQA Pro와 Pro V2에서 DeepSeek V4 Flash 0731과 GPT 5.6 Luna보다 높은 성능을 기록했다고 소개됐다. 내부 enterprise document parsing benchmark에서는 structured documents와 tables에서 Gemini 3.6 Flash에 가까운 결과를 냈다고 밝혀, 효율형 모델의 비교 기준이 일반 QA에서 기업 문서 처리로 넓어졌다.
  • DeepSeek V4 Flash는 Cline에서 무료로 제공되며 International Math Olympiad에서 gold medal을 받았고 human median score를 almost 2배로 기록했다는 포스트가 나왔다. Cline 설치와 provider 선택만으로 접근하는 배포 방식과 함께 12 cents라는 비용이 제시돼 수학 성능과 사용 단가를 동시에 비교하게 했다.
원문 트윗 2개 보기

시뮬레이션 학습과 에이전트형 생산성 도구의 확장포스트 4

로봇은 sim2real loop와 오픈소스 RL stack으로 실제 동작을 학습하고, Gemini·Cursor는 음성 작업과 앱 배포로 사용 범위를 넓혔다.

세부 내용 보기
  • Microduck은 sim에서 학습하고 real에서 실행한 뒤 새로운 동작을 가르치는 sim2real loop를 사용한다. Pollen Robotics는 RL stack을 open source로 공개하고 GitHub repository와 판매 페이지를 함께 연결해, 시뮬레이션 입력을 실제 로봇 동작으로 옮기는 학습·배포 경로를 한 제품 흐름으로 묶었다.
  • Gemini Live는 voice interaction으로 Daily Brief 청취와 email triage를 수행하는 agentic capabilities를 추가했고, Gemini in Chrome의 Personal Intelligence는 Connected Apps 설정을 통해 기능을 켜는 방식이다. Gemini Notebook은 책에서 시작해 third-party subscriptions, business research reports, textbooks로 source 범위를 늘릴 계획을 밝혀, 음성·브라우저·문서가 각각 행동과 지식 입력의 인터페이스로 확장됐다.
  • Cursor는 새 web app을 만들고 Origin에 code를 저장한 뒤 Vercel에 deploy하는 경로를 제공한다. 생성·저장·배포를 한 작업 흐름에 붙여 코드 작성 도구가 편집 단계에 머무르지 않고 실행 가능한 web app의 배포까지 이어지는 구조이다.
원문 트윗 2개 보기

용어 해설

브라우저 에이전트(Browser Agent)
웹 브라우저를 직접 조작해 로그인, 예약, 장바구니 작성 같은 작업을 수행하는 에이전트입니다. 사용자의 인증 상태나 관리형 프로필을 활용해 여러 웹사이트의 입력과 클릭을 자동화하는 방식입니다.
에이전트형 추론(Agentic Inference)
단일 요청의 응답 생성보다 여러 차례의 추론과 도구 호출을 처리하는 추론 방식입니다. 가변적인 시퀀스 길이, 긴 context, 도구 지연, 하위 에이전트 활동을 함께 고려해야 합니다.
사후 학습(Post-Training)
사전 학습이 끝난 모델에 추가 학습을 적용해 특정 작업의 출력 방식이나 성능을 조정하는 과정입니다. MiniMax H3 Max 관련 포스트는 이 단계가 기반 모델에 내재한 능력을 끌어내는 역할을 한다고 설명합니다.
시뮬레이션-현실 전이(Sim2Real)
시뮬레이션 환경에서 학습한 정책을 실제 로봇에 적용하고, 실제 실행 결과로 다시 동작을 개선하는 반복 방식입니다. Microduck은 이 순환 구조와 오픈소스 RL stack을 사용합니다.
모델 하드웨어 표준(Model Hardware Standard)
AI 에이전트가 과학 연구와 첨단 제조 현장의 물리 장비를 안전하게 조작하도록 하드웨어와 에이전트 사이의 기준을 정립하는 표준입니다. 현재 research preview 단계로 이해관계자의 참여를 받고 있습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.