TL;DR
이번 기간에는 AI 작업을 클라우드 밖으로 옮기는 실행 환경, 에이전트 운영을 위한 평가 체계와 기업용 배포, 모델 추론 비용을 낮추는 인프라 경쟁이 함께 부상했습니다. Perplexity의 Portable Computer는 NVIDIA RTX가 탑재된 Windows PC에서 하니스와 모델을 실행하고 로컬 파일·연결 앱을 사용한 뒤 필요할 때 클라우드 모델로 전환합니다. Hermes Agent는 팀별 에이전트와 공유 잔액·기술을 묶은 기업용 운영 구조를 내놓았고, vLLM은 TPU 지원과 최적화된 커널을 통해 에이전트형 서빙 범위를 넓히고 있습니다. Agent Arena에서는 DeepSeek-V4.1-Flash (Max)가 작업당 비용과 성능을 함께 비교하는 경쟁에 들어섰으며, 평가 데이터와 내부 평가자에 대한 통제권도 계속 중요한 쟁점으로 남았습니다.
𝕏 실시간 트렌드 토픽
🔥 Windows PC 안으로 들어온 Perplexity 에이전트포스트 2
Perplexity의 Portable Computer가 NVIDIA RTX GPU를 사용하는 Windows PC에서 하니스·에이전트·모델을 실행하고 로컬 파일과 연결 앱을 다루는 형태로 제공됩니다. 클라우드 모델은 필요한 순간에 선택하는 보완 경로로 남았습니다.
세부 내용 보기
- 기존 AI 작업이 클라우드 전송을 전제로 했다면, Portable Computer는 Windows PC의 NVIDIA RTX GPU를 실행 기반으로 삼아 작업 위치를 기기 가까이 옮겼습니다. 로컬 파일과 연결 앱을 직접 다루므로 클라우드 전송 없이 처리할 수 있는 작업 범위가 커지고, 필요한 경우에만 frontier cloud models를 호출하는 구조입니다.
- 사용자는 PC에서 harness, agents, models를 실행하고 로컬 자원으로 작업을 처리합니다. 입력은 로컬 파일과 연결 앱이며, 처리 과정은 기기 내 모델 실행과 에이전트 도구 사용으로 이어지고, 출력은 작업 결과로 반환되거나 클라우드 모델 호출로 보완됩니다. Windows와 NVIDIA RTX GPU 지원이 명시됐습니다.
- Windows 공식 계정은 이 출시를 기기 가까이 이동하는 AI 경험과 연결했고, @radbackwards는 private/local AI를 핵심 목표로 삼아야 한다고 적었습니다. 두 포스트는 로컬 연산이 단순한 실행 옵션을 넘어 제품 설계의 기준으로 떠오르는 흐름을 함께 드러냅니다.
원문 트윗 2개 보기
Windows
Great to see Perplexity bring Portable Computer to Windows. As more AI experiences move closer to the device, we're excited to see developers build new experiences that take advantage of local AI compute.
Portable Computer is now available on Windows PCs with @NVIDIA RTX GPUs. Run the harness, agents, and models locally on your PC. Work with local files and connected apps without sending tasks to the cloud. Use frontier cloud models when needed.

dar
Apple should be hyper obsessed with creating great private/local AI— that should be the only goal.
📈 팀 단위로 묶이는 Hermes Agent 운영 스택포스트 1
Nous Research가 Hermes Agent를 팀과 기업용으로 확장해 여러 채널의 에이전트, 중앙 잔액, 구성원별 한도, 공유 기술을 하나의 계정 구조에 묶었습니다. 온프레미스와 선택한 클라우드 배포도 지원 대상으로 제시됐습니다.
세부 내용 보기
- 개인용 에이전트는 사용자가 직접 관리하지만, 팀 환경에서는 비용 분배와 기술 공유가 운영 병목이 됩니다. Nous Portal은 동료 초대, 중앙 잔액, 구성원별 사용 한도, 공유 skills를 제공해 팀이 에이전트를 함께 운용하는 입력·권한·자원 구조를 만들었습니다.
- Hermes Enterprise는 같은 기능을 on-prem 또는 사용자가 선택한 cloud에 배치하는 방식입니다. 여러 채널의 agents가 공유 계정 자원과 skills를 사용하고, 팀이 축적한 기술을 proprietary IP로 전환하는 흐름을 전제로 합니다.
- 원문은 이 스택을 self-improving·sovereign AI stack으로 표현하고, 일부 대기업이 이미 신뢰하고 있다고 밝혔습니다. 다만 구체적인 고객명이나 성능 수치는 제시하지 않았으므로, 이번 포스트에서 확인되는 변화는 기능과 배포 모델의 기업화입니다.
📈 TPU와 SM 직접 연산을 겨냥한 추론 경로포스트 3
Inferact와 Google Cloud가 TPU를 vLLM의 핵심 지원 대상으로 만들기 위한 협력을 시작했습니다. 같은 기간에는 NVIDIA SM 내부 가속기에 직접 연산을 발행하는 inline assembly·SASS/PTX 방식도 공유되며, 모델 성능보다 실행 경로 최적화에 관심이 모였습니다.
세부 내용 보기
- vLLM의 기존 확장 과제는 다양한 하드웨어에서 에이전트형 production serving을 안정적으로 제공하는 일입니다. 이번 협력은 TPU용 production serving 기능과 optimized kernels를 만들고, TorchTPU를 통한 native PyTorch 경로를 추가해 open model 생태계가 TPU를 사용할 수 있게 하는 방향입니다.
- 처리 경로는 TPU에 맞춘 커널과 TorchTPU 경로를 vLLM에 결합하고, frontier model release에 day-0 지원을 목표로 삼는 방식입니다. 동시에 오픈소스 기여자에게 공유 TPU 용량과 vLLM maintainer의 설계 검토를 제공해 하드웨어 지원을 코드와 커뮤니티 양쪽에서 확장합니다.
- 별도 포스트에서는 inline assembly 또는 SASS/PTX가 각 SM의 Tensor Cores와 다른 가속기에 직접 연산을 발행해 추상화 계층을 건너뛴다고 설명했습니다. 두 흐름 모두 같은 모델을 더 빠르고 효율적으로 서비스하려면 런타임·커널·가속기 접근 경로가 중요하다는 점을 담고 있습니다.
원문 트윗 2개 보기
Inferact
@googlecloud and Inferact are announcing today a partnership to make TPU a first-class citizen in @vllm_project . This partnership puts both teams on one engineering roadmap to bring TPU to the broader open model ecosystem, optimizing vLLM as the agentic production serving engine for TPU: • Production serving features and optimized kernels • A native PyTorch path via TorchTPU • Moving towards day-0 support for frontier model releases We're also launching a community program: shared TPU capacity for open-source contributors, plus dedicated review and design help from the core vLLM maintainers at Inferact. Everything this collaboration produces is open source. Read the full announcement: https:// inferact.ai/news/google-tp u-partnership …

Elon Musk
And assembly with direct calls to hardware accelerators in the NVidia SMs
➖ 에이전트 평가를 업무 환경과 데이터 파이프라인에 연결포스트 2
LangChain 관련 포스트는 에이전트 평가를 단순한 프롬프트 입력·출력 비교에서 실제 업무 환경과 장기 작업 측정으로 확장해야 한다고 설명합니다. OpenClaw의 suggested task 기능은 범위가 분명한 작업을 별도 세션으로 위임하는 운영 패턴을 더했습니다.
세부 내용 보기
- 자율 작업이 늘면서 기존의 prompt in/out 평가는 도구 사용과 환경 상호작용을 충분히 측정하지 못합니다. Evals는 에이전트가 수행할 Tasks/Tests와 실제 업무를 재현하는 Environments를 묶어, 관심 있는 작업을 얼마나 수행하는지 측정하는 구조로 바뀌고 있습니다.
- LangChain 측 설명에 따르면 팀은 자체 데이터를 evals로 전환해 에이전트 개선을 측정해야 합니다. 평가 결과를 학습하거나 harness-engineering으로 반복 최적화하면 평가에 담긴 행동이 에이전트로 이전되므로, 데이터와 평가의 품질이 최종 행동을 좌우합니다.
- OpenClaw의 suggested task는 에이전트가 충분히 범위가 정해진 작업을 발견하면 새 세션을 시작하도록 권하는 기능입니다. 에이전트가 큰 작업을 세분화하고 별도 실행으로 넘기는 입력·판단·위임 흐름이 평가 대상에 포함되면서, 실행 환경 자체가 품질 측정의 일부가 됩니다.
원문 트윗 2개 보기

Viv
Alex & the Tenex team rock Evals & Environments & Data are driving a huge chunk of the world’s AI progress from the frontier labs, to open source, to every company serving agents to real users. At @LangChain we want to help every team own the process of turning their valuable data into evals that improve their agents over time - Evals are basically Tasks/Tests that help you measure how an agent does on work you care about - Evals today look different than 3 years ago (no more prompt in/out). Today’s agents do much more autonomous work and we need Environments that faithfully capture the real work they do - Building good evals today is still hard, this is why frontier companies pay millions to acquire them across domains - Every team looking to Own their Intelligence will need to own their Evals. Both so they can measure the progress of agents on their tasks and also because Evals are literally the thing that shapes what your agent will become. - When you train on Evals or hill-climb them with harness-engineering, you transfer the behaviors from the eval into your agent. Garbage in garbage out - the inescapable lesson of machine learning there’s so much to gain from helping every team own their Data to Eval pipeline, let’s cook
A few of my smartest friends in AI called me a "idiot" for not deeply understanding evals. So...I found the smartest person I know on evals & made them teach me. @Vtrivedy10 (leads Labs at @LangChain) took me from easy mode to god mode for a 38-minute masterclass on all

Patrick Erichsen
as you become more ambitious with coding agents, delegation becomes increasingly important the new "suggested task" feature in @openclaw gives your agent a tool to do this for you if the agent identifies a sufficiently well-scoped piece of work, it will recommend kicking off a new session to work on it
📈 작업당 비용으로 다시 짜이는 오픈 모델 경쟁포스트 1
Agent Arena에서 DeepSeek-V4.1-Flash (Max)가 +4.87%의 net improvement와 $0.07의 median cost per task로 오픈 모델 상위권에 올랐습니다. 성능 순위만이 아니라 동일 작업을 수행하는 비용이 모델 선택의 핵심 기준으로 제시됐습니다.
세부 내용 보기
- 에이전트 모델 비교는 최대 성능만으로 결정되지 않고 작업당 비용과 함께 평가됩니다. DeepSeek-V4.1-Flash (Max)는 Agent Arena 기준 +4.87% net improvement와 $0.07 median cost per task를 기록해 오픈 모델 상위 3개 중 가장 낮은 median task cost로 표시됐습니다.
- 비교표에서 Kimi K3 (Max)는 +6.39%·$0.77, Hy4 preview는 +4.96%·$0.22였고, DeepSeek-V4.1-Flash (Max)는 Hy4 preview net improvement의 98%를 73% 낮은 비용으로 유지한다고 제시됐습니다. 더 높은 성능의 일부 모델과 비교할 때는 35–54%의 net improvement를 97–99% 낮은 비용으로 유지한다고 적혔습니다.
- 이 결과로 GPT-5.6 Luna (xHigh), GLM-5.3-Flash, DeepSeek-V4-Flash가 Agent Arena의 Pareto frontier에서 제외됐다고 원문은 밝혔습니다. 모델 선택이 절대 성능의 단일 순위에서 성능·비용 조합의 경계선 비교로 이동한 사례입니다.
➖ 훈련 파이프라인까지 들어가는 AI 안전 평가포스트 2
AI 안전 논의에서 완성된 모델만 점검하는 방식보다 학습 데이터·훈련 과정·내부 배포를 직접 확인하는 평가 구조가 부각됐습니다. Embedded Evaluators와 데이터 공개 요구가 서로 다른 경로에서 같은 감독 범위를 가리킵니다.
세부 내용 보기
- 모델 출시 후 결과만 보는 평가는 훈련 과정에서 형성된 위험 행동과 내부 배포 단계의 문제를 놓칠 수 있습니다. Apollo Research는 embedded evaluators가 AI 기업 내부에서 직원과 유사한 접근 권한을 갖고 안전 실천과 사고를 확인해야 하며, 모델뿐 아니라 training pipelines와 processes도 평가해야 한다고 밝혔습니다.
- 이 방식에서는 평가자가 내부 훈련 파이프라인과 배포 관행에 직접 접근해 안전 약속 준수 여부를 확인하고 incident를 보고합니다. 결과물은 완성된 모델의 점수에 그치지 않고 학습·배포 과정에서 발견한 위험과 대응 기록까지 포함합니다.
- EMostaque는 학습에 사용한 datasets를 기업이 100% 투명하게 공개해야 alignment 문제가 줄어든다고 주장했고, cyber·biological data의 base model 사용 제한과 tuned version의 공개·모니터링을 제안했습니다. 두 포스트 모두 감독 단위를 모델 바깥의 데이터와 개발 과정으로 넓히지만, 구체적인 정책 합의나 실행 결과까지는 제시하지 않았습니다.
Apollo Research는 내부 훈련 파이프라인과 배포 관행에 직접 접근하는 평가자가 있어야 scheming과 내부 배포 위험을 제대로 확인할 수 있다고 봅니다. EMostaque도 학습 데이터 공개와 tuned version 모니터링이 alignment 문제를 줄이는 장치라고 주장합니다.
이 기간 포스트에는 내부 접근형 평가나 학습 데이터 공개에 대한 직접적인 반대 근거가 충분히 나타나지 않았습니다. 다만 Cohere CEO는 AI의 실존 위험 논의가 ‘Terminator’식 시나리오로 치우친다고 말해 위험 담론의 범위에 이견을 보였습니다.
원문 트윗 2개 보기
Apollo Research
We’re excited to see Dario and Sam commit to “embedded evaluators who have employee-like access to verify safety practices and report incidents.” [...] “whose role is to verify adherence to safety practices and commitments, report incidents, and help assess the alignment of not just completed AI models but training pipelines and processes.” We’ve long advocated for third-party evaluators to have deep access. Risks from internal deployment and scheming cannot be appropriately assessed without direct insight into the training pipelines and internal deployment practices. Apollo is looking forward to working on Embedded Evaluations with all Frontier AI developers. 1/3
Emad
A lot of alignment issues would be sorted if companies had to be 100% transparent on datasets used for training models. No cyber or biological (outside standard medical) data allowed for base models Tuned versions with that data shown to and monitored by evaluators
용어 해설
- 로컬 AI(Local AI)
- — 클라우드 서버로 작업을 보내지 않고 PC나 기기 내부의 연산 자원으로 AI 모델과 에이전트를 실행하는 방식입니다. 파일 접근성과 개인정보 보호를 높이고 네트워크 의존성을 줄이는 대신, 로컬 GPU 성능과 메모리가 처리 범위를 좌우합니다.
- 에이전트형 서빙(Agentic Serving)
- — 단순한 모델 응답이 아니라 에이전트의 도구 호출과 장시간 작업을 안정적으로 처리하도록 추론 시스템을 구성하는 방식입니다. 실행 지연, 커널 최적화, 작업별 처리량을 함께 관리해야 실제 서비스 운영이 가능합니다.
- 에이전트 평가(Evals)
- — 에이전트가 실제 업무에 가까운 과제를 얼마나 잘 수행하는지 측정하는 테스트와 작업 모음입니다. 입력과 출력만 비교하는 평가에서 벗어나 환경 상호작용, 도구 사용, 장기 작업 결과까지 측정하며, 평가 데이터가 에이전트의 개선 방향을 결정합니다.
- 오픈 웨이트(Open Weights)
- — 학습된 모델 가중치를 외부 개발자가 내려받아 실행하거나 조정할 수 있도록 공개하는 배포 방식입니다. 기업은 자체 인프라와 도구를 결합할 수 있지만, 운영 비용과 안전성 검증을 직접 부담해야 합니다.
- 내부 접근형 평가자(Embedded Evaluators)
- — AI 기업 내부의 학습 파이프라인과 배포 과정에 직원과 유사한 접근 권한을 갖고 안전 실천과 사고를 확인하는 평가자입니다. 완성된 모델만 보는 대신 훈련 데이터와 내부 운영 과정까지 살펴 위험 평가의 범위를 넓힙니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.