TL;DR
이번 포스트 묶음에서는 에이전트가 사람의 지속적인 확인 없이 실제 업무를 수행하는 방식과 그 성과를 측정하는 방법이 함께 부상했다. ACES는 145개 스킬의 구조 스캔 점수와 LLM 평가 품질의 상관계수가 Spearman rho 0.14에 그쳤다고 보고하고, 스킬 적용 전후의 작업 완료 차이를 측정하는 Skill Lift를 대안으로 제시했다. 동시에 LongCat-2.0, Shieldstral, Ox Alpha, GLM-4.7-Flash처럼 오픈 또는 로컬 실행을 내세운 모델 접근성이 넓어졌고, Wan 3.0은 여러 영상 플랫폼으로 배포 범위를 확장했다. 보안 측면에서는 장기 API 키 대신 신원 확인과 단기 자격 증명을 연결하는 Identity-Based Access가 실무 방식으로 부각됐으며, Hugging Face의 매각 가능성은 모델·데이터 플랫폼의 산업적 가치가 커지고 있음을 보여주는 사례로 다뤄졌다.
𝕏 실시간 트렌드 토픽
🔥 Grok의 Cursor 장시간 무인 작업포스트 1
Grok 4.6을 Cursor 안에서 두 가지 작업에 투입한 뒤 사용자가 잠든 동안 모델이 웹사이트 재설계 결과를 완성했다는 사례가 공유됐다. 반복적인 생성 확인 없이 실제 작업을 수시간 지속하는 사용 방식이 핵심이다.
세부 내용 보기
- Grok 4.6을 Cursor 내부의 두 작업에 배치하고 사용자가 별도로 결과를 확인하거나 각 생성 과정을 지켜보지 않는 방식으로 운용했다.
- 인용된 사례에서는 00:42에 Grok이 재설계한 웹사이트를 공개했고, 23:21 시점에 다음 날 결과를 확인하는 흐름이 제시됐다.
- Elon Musk는 이 사례를 두고 Grok이 24시간 작동한다고 짧게 언급했으며, 게시물은 251,176회 조회와 114개의 좋아요를 기록했다.
📈 ACES의 에이전트 스킬 실적 평가포스트 1
NVIDIA의 새 논문은 공유 스킬 라이브러리의 구조 스캔 점수가 실제 에이전트 품질을 얼마나 예측하는지 측정했다. 145개 스킬에서 상관성이 낮게 나타나자, 같은 모델·작업·환경에서 스킬 적용 전후의 완료 결과 차이를 재는 Skill Lift를 대안으로 사용했다.
세부 내용 보기
- 기업의 공유 스킬 라이브러리에서는 구조·스타일·보안을 확인하는 리뷰 게이트가 흔하지만, 145개 내부·공개 스킬의 구조 스캔 점수와 LLM-judge 품질의 Spearman rho는 0.14였다.
- ACES는 같은 모델, 작업, 샌드박스, 워크스페이스, 평가기를 고정한 뒤 스킬을 넣은 실행과 넣지 않은 실행을 비교해 Skill Lift를 계산한다.
- 58개 운영 스킬에서 나온 947개 쌍의 사례를 네 개 하니스로 평가하고 실행 경로를 Agent Trajectory Interchange Format으로 정규화했으며, 스킬 실행·행동 점검·스킬 효율에서 가장 큰 과정 지표 개선이 나타났다.
📈 오픈·로컬 모델 실행 경로 확대포스트 5
LongCat-2.0의 Go 공개, Shieldstral의 정책 기반 moderation cookbook, Codex 안의 Ox Alpha, RTX 4090에서 구동되는 GLM-4.7-Flash가 한 묶음으로 등장했다. 모델을 직접 실행하거나 기존 개발 도구 안에서 선택하는 경로가 동시에 넓어지는 흐름이다.
세부 내용 보기
- LongCat-2.0은 1.6T/48B 규모, 1M context, fully open source 조건으로 Go에서 사용할 수 있게 됐다.
- Shieldstral은 정책 기반 moderation을 수행하는 open model로 소개됐고, MistralDevs는 사용 절차를 cookbook으로 연결했다.
- Ox Alpha는 Codex의 모델 선택기에 들어가며 1 million token context, vision, zero data retention, API key와 billing 불필요 조건이 제시됐다. GLM-4.7-Flash는 RTX 4090에서 198K context와 bash·파일 편집·git 실행을 지원하는 로컬 에이전트로 소개됐다.
원문 트윗 2개 보기
➖ Wan 3.0의 영상 플랫폼 배포 확장포스트 2
Wan 3.0이 RunningHub와 Leonardo.Ai에서 제공되며 30초 생성, 다중 모달 참조 입력, 시간적 일관성을 내세웠다. 웹 UI와 API를 함께 제공해 기존 영상 제작 작업에 연결하는 배포 방식이다.
세부 내용 보기
- RunningHub에서는 Wan 3.0을 사용해 native 30-second generation과 multimodal references를 이용하고, 웹 UI 또는 API로 접근할 수 있다.
- Leonardo.Ai에서도 Wan 3.0이 제공되며 게시물은 더 선명하고 제어 가능하다는 특성을 내세웠다.
- Alibaba Cloud는 Model Studio와 Qwen Cloud의 추가 API 접근 경로도 함께 연결했으며, 이번 기간 두 게시물이 각각 RunningHub와 Leonardo.Ai 배포를 알렸다.
원문 트윗 2개 보기
Alibaba Cloud
Wan 3.0 is now live on @RunningHub_ai Native 30-second generation, multimodal references, and stronger temporal consistency. Available on RunningHub via Web UI and API. More API access: • Model Studio: https:// click.alibabacloud.com/m/20000002017/ • Qwen Cloud: https:// click.qwencloud.com/m/20000002025/
Wan 3.0 lands on RunningHub Pro‑grade text‑to‑video: 30‑sec generation, multi‑modal reference inputs, better temporal consistency. Access via web UI or API for your video workflows. https:// runninghub.ai #Wan3 #RunningHub #AIvideo
Alibaba Cloud
Wan 3.0 is now on @LeonardoAi ! Sharper. More controllable. More capable. Now available on Leonardo. More API access: • Model Studio: https:// click.alibabacloud.com/m/20000002017/ • Qwen Cloud: https:// click.qwencloud.com/m/20000002025/
The model you already love, one level up. Wan 3.0 has arrived, making video creation easier, sharper and more controllable. Available now on Leo.

➖ 장기 키를 대체하는 Identity-Based Access포스트 1
API 토큰과 SSH 키를 .env 파일에 공유하는 방식의 위험을 지적하며, 신원 확인 뒤 권한별 단기 자격 증명을 발급하는 접근 모델이 제시됐다. 사람은 passkey·SSO·MFA로, 컴퓨터는 AWS IAM·Kubernetes·cloud service account로 신원을 증명하는 구조다.
세부 내용 보기
- 기존 방식은 API key, password, SSH key 같은 장기 키를 비밀로 보관해야 하며, 키가 탈취되면 공격자가 동일한 권한으로 사용자를 가장할 수 있다.
- Identity-Based Access는 신원을 증명한 뒤 권한을 확인하고 단기 자격 증명을 발급하는 순서로 작동한다. 게시물은 이를 “Prove identity → Permissions → Short-lived credential → Access”로 정리했다.
- 발급된 자격 증명은 짧은 수명, 특정 신원 연결, 제한된 권한 범위, 자동 만료, 감사 용이성을 갖추며, Teleport 연동이 실무 구현 경로로 제시됐다.
📈 Observe MCP의 LLM 중간 계층 제거포스트 1
Observe가 MCP 서버에서 LLM 중간 계층을 제거하고 에이전트가 context graph를 조회한 뒤 데이터셋을 선택해 OPAL을 직접 작성하는 구조를 GA로 배포했다. 같은 REST API를 사용하면서 지연과 Observe 측 inference cost를 줄이는 방식이다.
세부 내용 보기
- 에이전트는 Observe의 context graph를 조회하고 필요한 dataset을 선택한 뒤 OPAL을 직접 작성한다.
- 작성된 OPAL은 Observe UI를 구동하는 동일한 REST APIs에 전달되며, MCP 서버 내부에서 별도의 LLM 추론 계층을 거치지 않는다.
- 게시물은 이 구조의 결과로 지연과 Observe 측 inference cost가 줄어든다고 밝히고, CLI는 full parity 상태로 함께 제공된다고 전했다.
📈 Hugging Face 매각 가능성과 130억 달러 가치포스트 2
Hugging Face가 약 130억 달러 이상의 기업가치를 기준으로 매각 제안을 검토하고 있다는 보도가 두 포스트에서 반복됐다. 창업자들이 커뮤니티에 대한 책임을 중시한다는 점과 2023년 투자 당시 45억 달러 가치의 차이가 함께 제시됐다.
세부 내용 보기
- TechCrunch는 Hugging Face가 약 130억 달러 수준의 인수 제안을 받고 있다고 전했지만, 창업자들의 커뮤니티 책임 의식 때문에 실제 매각 여부에는 불확실성이 남는다고 했다.
- tldrnewsletter는 회사가 은행과 함께 인수 희망자의 관심을 확인하고 있으며, 아직 구매자는 정해지지 않았다고 전했다.
- 이번 보도에 따르면 130억 달러 이상 평가는 Google, Amazon, NVIDIA가 참여한 2023년 투자 당시의 45억 달러 가치보다 거의 세 배 높은 수준이다.
원문 트윗 2개 보기
TechCrunch
Hugging Face has reportedly been fielding acquisition offers that would value the company at around $13B. But with the founders' feeling of responsibility to community, doubts arise as to whether a sale will happen.
TLDR Newsletter
Hugging Face is exploring a sale that could value the AI model-hosting platform at $13 billion or more, per Business Insider, nearly triple its $4.5 billion valuation from a 2023 round backed by Google, Amazon, and NVIDIA. The company is working with a bank to gauge bidder interest, and no buyer has been named.
📈 언어 모델을 위한 continuous diffusion 연구 재부상포스트 1
언어 생성에 continuous diffusion을 적용하는 연구 방향이 한동안 배경으로 물러났다가 올해 다시 관심을 얻고 있다는 역사적 관점이 공유됐다. 게시물은 최근 부활의 맥락을 정리한 글로 연결된다.
세부 내용 보기
- 게시자는 continuous diffusion for language가 과거에는 관심의 중심에서 멀어졌지만 올해 다시 hot topic이 됐다고 전했다.
- 공유된 글은 이 연구 방향의 역사와 최근 재부상에 대한 관점을 정리한 자료이며, 구체적인 모델 수치나 벤치마크는 포스트에 제시되지 않았다.
용어 해설
- 스킬 기여도 측정(Skill Lift)
- — 에이전트 스킬을 적용한 경우와 적용하지 않은 경우에 같은 작업을 수행시켜 완료 결과의 차이를 측정하는 평가 방식이다. 구조·스타일·보안 스캔 점수 대신 실제 작업 성과의 증분을 기준으로 삼는다.
- 에이전트 궤적 상호운용 형식(Agent Trajectory Interchange Format)
- — 서로 다른 에이전트 평가 하니스에서 나온 실행 경로를 공통 형식으로 정규화하는 포맷이다. ACES는 이 형식을 사용해 하니스 간 결과 비교가 가능하도록 구성했다.
- 신원 기반 접근 제어(Identity-Based Access)
- — API 키나 SSH 키를 장기간 보관하는 대신 사용자의 신원을 먼저 확인하고 권한에 맞는 단기 자격 증명을 발급하는 접근 제어 방식이다. 자격 증명을 특정 신원과 권한 범위에 묶고 자동 만료시킨다.
- 연속 확산 언어 모델(continuous diffusion)
- — 언어 생성에 diffusion 과정을 적용하는 연구 방향이다. 한동안 관심이 줄었다가 올해 다시 주목받기 시작했다는 연구 흐름과 역사적 맥락이 공유됐다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

