TL;DR
이번 포스트에서는 모델을 더 크게 만드는 방식보다 추론 시점에 연산과 학습을 추가하는 Test-time training, 검색, 잠재 공간 기반 비디오 학습이 주목받았다. Hermes Agent와 Grok Bot 계열 게시물은 로그인, 이메일 작성, 도구 연결, 다단계 업무 실행을 자동화하는 에이전트의 실제 작업 범위를 넓혔고, Alibaba Cloud는 Trace·도구 검증·Skill guardrails·회귀 평가를 묶은 AgentLoop를 제시했다. Claude Code 2.1.231과 Kimi Code 0.36.0에서는 MCP OAuth 수정, 플러그인 표면 변경, 후보 모델 풀, Fullscreen TUI 같은 세부 업데이트가 이어졌다. DeepSeek V4 Flash는 NVMe에서 필요한 가중치만 읽는 방식으로 8GB RAM CPU 실행과 12GB RAM 휴대전화 실행 사례가 공유되며 모델 크기와 메모리 용량의 관계를 성능 문제로 바꿨다.
𝕏 실시간 트렌드 토픽
📈 Test-time training과 ARC Prize 성능 축포스트 4
Test-time compute를 자연어 추론 기반 검색만이 아니라 추론 중 Gradient를 쓰는 Test-time training으로 확장하려는 관점이 모였다. ARC 1-2에서의 성능 우위와 연속 잠재 공간 적응이 근거로 제시됐다.
세부 내용 보기
- 대형 LLM의 사전학습 규모를 계속 키우는 접근이 한계에 가까워지면서, 추론 시점 연산을 어디에 배분할지가 핵심 쟁점으로 떠올랐다. Test-time compute는 검증기와 함께 후보를 탐색하는 test-time search, 입력에 맞춰 모델을 조정하는 Test-time training으로 나뉘며, 후자는 Gradient를 직접 활용해 연속적인 latent space에서 적응한다. ARC 1-2에서는 Test-time training이 강한 성능 우위를 보였고, ARC Prize 2024에서 state-of-the-art가 33%에서 55.5%로 상승했다는 수치가 함께 언급됐다. 다만 게시물에서는 현재 TTT의 뚜렷한 우위가 ARC 1-2에 집중돼 있어 다른 평가 영역으로의 확산 여부가 남은 과제로 제시됐다.
Test-time training은 사전학습 모델을 더 크게 만드는 대신 추론 중 Gradient를 사용해 입력에 맞춰 연속적인 잠재 표현을 조정한다. ARC 1-2에서 강한 성능 우위가 관찰됐고, 추론 시점 적응의 주요 경로가 될 가능성이 제기됐다.
현재 Test-time training의 뚜렷한 성능 우위는 ARC 1-2에 집중돼 있다. 다른 데이터셋에서도 같은 효과가 이어질지는 아직 확인되지 않았다.
원문 트윗 2개 보기
François Chollet
Test-time training was popularized during the ARC Prize 2024 competition, after being explored in particular by @MindsAI_Jack and team. To date, I believe ARC 1-2 are the only datasets where TTT strongly outperforms. It would be interesting if TTT started becoming more mainstream. I believe it has great potential.
Today we're announcing the winners of ARC Prize 2024. We're also publishing an extensive technical report on what we learned from the competition (link in the next tweet). The state-of-the-art went from 33% to 55.5%, the largest single-year increase we've seen since 2020. The
François Chollet
The way most people leverage test-time compute today is via a form of test-time NL reasoning that is computationally equivalent to test-time search (sometimes with a verifier / grader in the loop). The other major avenue to leverage test-time compute is test-time training. Gradients are a precious signal, there's no reason not to use it at test time (other than the fact that it would be difficult / expensive from an engineering standpoint).
Anyway, glad to see that the whole "let's just pretrain a bigger LLM" paradigm is dead. Model size is stagnating or even decreasing, while researchers are now looking at the right problems -- either test-time training or neurosymbolic approaches like test-time search, program
📈 JEPA와 비디오 잠재 공간 학습포스트 1
비디오 자기지도학습에서 픽셀 공간을 직접 다루는 방식에서 latent space를 예측하는 방식으로 이동하는 흐름이 제기됐다. JEPA가 이러한 전환을 이해하는 핵심 용어로 부상했다.
세부 내용 보기
- 비디오 모델은 프레임의 모든 픽셀을 직접 예측하는 pixel-space modeling과 인코더가 만든 표현을 예측하는 latent-space modeling 사이에서 학습 단위를 바꾸고 있다. JEPA는 입력의 표면적 픽셀 복원보다 잠재 표현 사이의 관계를 학습하는 방향에 놓이며, 게시물은 이 전환을 비디오 자기지도학습의 변화로 연결했다. 원문에는 특정 벤치마크나 수치가 포함되지 않아 성능 우위의 규모는 확인되지 않았다. 따라서 이번 포스트의 핵심은 모델 출시보다 비디오 표현 학습의 목표 공간이 바뀌는 연구 방향이다.
📈 업무형 에이전트의 도구 실행과 운영 평가포스트 7
Hermes Agent와 Grok Bot 계열 게시물은 에이전트가 클라우드 컴퓨터에서 도구에 로그인하고 이메일·콘텐츠·다단계 업무를 처리하는 흐름을 제시했다. Alibaba Cloud는 게임 에이전트의 데모와 운영 성능 사이를 줄이기 위한 7단계 AgentLoop를 내놓았다.
세부 내용 보기
- 에이전트의 역할이 대화 응답에서 외부 도구를 직접 조작하는 업무 실행으로 이동하고 있다. 게시물 속 시스템은 클라우드 컴퓨터에서 도구에 로그인하고, 이메일을 작성하거나 콘텐츠를 재가공하며, 다른 봇과 대화하고, 사용자가 오프라인인 동안 다단계 작업을 이어간다. Hermes Agent Desktop은 플러그인의 위치와 형태, 한계를 다루고 Bot Mode 도입 가능성이 언급됐으며, Tencent의 WorkBuddy는 HTML을 생성한 뒤 사용자와 에이전트가 같은 파일의 블록을 번갈아 편집하고 기기 간 작업·대화·파일을 동기화한다. Alibaba Cloud의 AgentLoop는 주장보다 Trace 증거를 수집하고, 도구와 API 사실을 평가하며, Skill guardrails로 원인을 수정한 뒤 데이터셋과 알림으로 회귀하는 순서를 제시해 데모 이후의 운영 검증을 핵심 조건으로 삼았다.
도구 로그인과 다단계 워크플로 실행을 결합하면 에이전트가 사용자의 지속적인 입력 없이 실제 업무를 처리할 수 있다. 이메일 작성, 콘텐츠 재가공, HTML 공동 편집 같은 사례가 업무 범위를 구체화했다.
게임 에이전트와 업무형 에이전트는 데모와 운영 환경 사이에 차이가 있으므로 Trace, 도구 검증, Skill guardrails, 데이터셋 회귀 평가가 필요하다.
원문 트윗 2개 보기
Alibaba Cloud
Game agents can demo well but fail in production. A 3-day, 7-step AgentLoop method: • Trace evidence, not claims • Evaluate tools & API facts • Fix root causes with Skill guardrails • Regress with datasets & alerts https:// click.alibabacloud.com/m/20000002266/ #AIAgent #GameDev #AgentLoop #LLMOps #CodingAgent
Md Ismail Šojal
The great unlock in AI agents, Grok Bot can: - Sign into your tools - Draft emails - Repurpose content - Run multi-step workflows without constant human input. This is what autonomous AI looks like. Actual work getting done. Early access is open.
➖ Claude Code와 Kimi Code의 개발 도구 업데이트포스트 6
Claude Code 2.1.231은 사전 등록 클라이언트의 MCP OAuth 로그인 오류를 수정했고 플러그인 관련 CLI 표면을 변경했다. Kimi Code 0.36.0은 작업별 후보 모델 선택과 Fullscreen TUI, Unicode 수식 렌더링을 실험 기능으로 추가했다.
세부 내용 보기
- 개발 에이전트의 성능 경쟁이 모델 자체뿐 아니라 인증, 플러그인 표면, 모델 선택, 터미널 인터페이스의 세부 구현으로 확장되고 있다. Claude Code 2.1.231은 Slack 같은 사전 등록 OAuth 클라이언트에서 redirect URI 불일치로 실패하던 MCP 로그인을 복원했고, 플러그인 매니저와 오류 추적 관련 모델 항목을 추가·삭제했다. 같은 릴리스의 메타데이터에서는 2.1.229 이후 13시간 44분 49초가 지났고 prompt tokens가 10,771개, 8.1% 증가했으며 tools 비중이 23.6%에서 24.2%로 바뀌었다. Kimi Code 0.36.0은 secondary_model에 후보 모델 집합과 설명을 저장해 main agent가 spawn마다 작업에 맞는 모델을 고르게 하고, KIMI_CODE_TUI_FULL_SCREEN=1로 Fullscreen TUI를 켜며 LaTeX 수식을 Unicode 형태로 렌더링한다.
원문 트윗 2개 보기
Claude Code Changelog
Claude Code 2.1.231 has been released. 1 CLI change Highlights: • MCP OAuth sign-in restored for pre-registered clients (e.g., Slack) by fixing a redirect URI mismatch Full details are in thread ↓

Kimi Developers
Kimi Code Changelog 0.36.0 Upgrade the experimental subagent model setting to a model pool: the [secondary_model] section can now hold a set of candidate models with descriptions, and the main agent picks from them per spawn based on the task.
📈 DeepSeek V4 Flash의 저장장치 기반 로컬 추론포스트 2
DeepSeek V4 Flash를 GPU 없이 CPU와 제한된 메모리에서 실행한 두 사례가 공유됐다. memory-mapped와 expert streaming으로 필요한 가중치만 NVMe 또는 플래시 저장장치에서 읽어 모델 크기와 RAM 용량의 관계를 재구성했다.
세부 내용 보기
- 대형 MoE 모델의 로컬 실행에서 전체 가중치를 RAM이나 VRAM에 올리는 대신 저장장치를 메모리 계층의 일부로 사용하는 방식이 등장했다. 한 사례는 DeepSeek V4 Flash 33B MoE를 8GB RAM CPU 환경에서 실행해 첫 토큰까지 5.33초, 최대 RSS 5.9-6.2 GiB, process swaps 0을 기록했고, Linux demand paging이 필요한 가중치만 NVMe에서 RAM으로 가져왔다. 다른 사례는 284B MoE를 12GB RAM 휴대전화에서 CPU만으로 실행하며 1 token/second를 기록했고, 플래시 저장장치에서 전문가 가중치를 스트리밍했다. 두 사례 모두 빠른 운영 환경이나 production 용도는 아니지만, 게시물은 모델 크기와 RAM 용량의 관계가 절대 장벽이 아니라 성능·지연 문제로 이동했음을 근거로 들었다.
NVMe와 플래시 저장장치를 가중치 공급원으로 활용하면 전체 모델을 RAM이나 VRAM에 적재하지 않고도 대형 MoE 모델을 실행할 수 있다. 8GB RAM CPU와 12GB RAM 휴대전화 사례가 가능성을 뒷받침했다.
게시물의 두 실행은 첫 토큰 지연과 1 token/second라는 제약이 있으며 production 용도가 아니라고 명시됐다. 따라서 메모리 장벽의 완화와 실사용 성능은 구분해야 한다.
원문 트윗 2개 보기
Md Ismail Šojal
You can Run DeepSeek V4 Flash (33B MoE) running on 8 GB RAM, CPU-only, zero GPU. - Cold first-token: 5.33s - Max RSS: 5.9-6.2 GiB - Process swaps: 0 The entire model stayed memory-mapped on NVMe. Linux demand-paged only the needed weights into RAM. This is not fast, It’s not production. But it proves something important: Model size vs RAM is now a performance problem, not a hard barrier. VRAM, RAM, NVMe is becoming a real memory hierarchy for local AI. - http:// github.com/baker27727/ds4 -8gb-cpu …
Md Ismail Šojal
You can run locally DeepSeek V4 Flash (284B MoE) on a 12 GB RAM Phone - CPU only. - 1 token/second. - Zero GPU. - Just clever expert streaming from flash storage. - https:// github.com/Helldez/BigMoe OnEdge …
➖ ChatGPT 데스크톱 앱의 Linux 배포포스트 1
OpenAI가 ChatGPT 데스크톱 앱의 Linux 미리보기 배포 범위를 Ubuntu, Debian, Fedora로 확장했다. x64와 ARM64용 .deb·.rpm 패키지가 제공됐다.
세부 내용 보기
- Linux 사용자는 배포판과 CPU 아키텍처에 맞는 패키지를 내려받아 ChatGPT 데스크톱 앱 미리보기를 설치할 수 있게 됐다. 지원 대상은 Ubuntu 24.04 LTS와 26.04 LTS, Debian 13, Fedora 43과 44이며, x64와 ARM64용 .deb 또는 .rpm 패키지가 안내됐다. 게시물에 사용성 수치나 기능 세부사항은 포함되지 않아, 이번 변화는 모델 기능보다 데스크톱 접근 경로의 확대라는 제품 배포 변화로 한정된다.
용어 해설
- 테스트 시점 학습(Test-time training)
- — 모델이 추론 단계에서 입력에 맞춰 내부 표현이나 가중치를 조정하는 방식이다. 일반적인 test-time search가 기호 공간에서 후보를 탐색하는 데 비해, Test-time training은 연속적인 잠재 공간에서 Gradient를 활용해 적응한다.
- 테스트 시점 연산(Test-time compute)
- — 모델이 답변을 생성하는 순간 추가 연산을 투입하는 접근이다. 게시물에서는 자연어 추론과 검증기를 포함한 검색, 그리고 입력에 맞춰 학습하는 Test-time training을 주요 경로로 구분하며, 모델 크기 확대와 다른 성능 개선 축으로 다뤄졌다.
- JEPA
- — 입력 영상의 픽셀을 직접 예측하기보다 잠재 공간의 표현을 예측하는 자기지도학습 계열이다. 게시물에서는 비디오 모델의 학습이 pixel-space modeling에서 latent-space modeling으로 이동하는 맥락에서 언급됐다.
- 잠재 공간 모델링(latent-space modeling)
- — 원본 픽셀을 바로 복원하지 않고 인코더가 만든 압축 표현을 대상으로 예측과 학습을 수행하는 방식이다. 비디오 자기지도학습에서는 픽셀 단위의 세부 복원 부담을 줄이고 표현 수준의 학습에 초점을 맞추는 구조로 제시됐다.
- 모델 풀(model pool)
- — 여러 후보 모델을 하나의 선택 집합으로 묶는 구성이다. Kimi Code에서는 secondary_model에 후보 모델과 설명을 저장하고, 주 에이전트가 생성되는 작업마다 적합한 모델을 고르는 실험 기능으로 적용됐다.
- MCP OAuth
- — MCP 서버에 OAuth 방식으로 인증하는 연결 절차다. Claude Code 2.1.231에서는 사전 등록된 OAuth 클라이언트가 Slack 같은 서버에 로그인할 때 발생하던 redirect URI 불일치를 고쳐 인증을 복원했다.
- 메모리 계층(memory hierarchy)
- — 모델 추론에 VRAM, RAM, NVMe 같은 저장·메모리 자원을 계층적으로 사용하는 구조다. 게시물에서는 필요한 가중치만 저장장치에서 RAM으로 읽는 memory-mapped와 demand paging을 통해 큰 모델을 제한된 RAM에서 실행하는 사례가 제시됐다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.