TL;DR
이번 기간에는 GPT-6 Astra의 구독 사용량 절감과 브라우저 안에서 게임·3D 장면을 만드는 실행형 기능이 함께 확산됐습니다. Codex는 문서에 크게 드러나지 않았던 Remote Control 기능을 통해 모바일 앱에서 SSH 접속 서버의 작업을 다루는 흐름이 공유됐습니다. 연구 측면에서는 희귀한 고보상 샘플에 집중하는 TailRL과 모델 가중치뿐 아니라 실행 가능한 harness까지 번갈아 최적화하는 WHALE이 등장했습니다. 초파리 뇌 연결망의 WebGPU 시뮬레이션, 45억 개 TikTok 영상의 메타데이터 데이터셋, 대규모 AI 인프라 계약도 기술 관련 포스트로 묶였습니다.
𝕏 실시간 트렌드 토픽
🔥 Astra의 사용량 절감과 브라우저 실행 확장포스트 9
Astra 로그인 사용자의 장기 꼬리 구간에서 구독 사용량을 최대 3~4배 줄였다는 설명과 함께, 한 번의 프롬프트로 게임·3D 장면·컴퓨터 사용 작업을 만드는 사례가 이어졌습니다. 일부 포스트는 GPT-6 Astra의 AGI 도달 선언과 모델 전환 비용까지 연결했습니다.
세부 내용 보기
- Astra 운영 관련 포스트는 품질 변화 없이 장기 꼬리 사용자의 구독 소모량을 최대 3~4배 낮추는 개선을 설명했습니다. 같은 기간 사용자들은 GPT-6 Astra에 기존 기술과 대화 맥락을 옮겼다고 밝혀, 성능뿐 아니라 전환 비용도 새 모델 선택의 기준으로 다뤘습니다.
- 브라우저 제작 사례에서는 한 프롬프트 뒤 70초 만에 Three.js 기반 CS2 스타일 게임이 생성됐고, 맵·무기 모델·설치·멀티킬·HUD가 포함됐다고 전했습니다. 별도 게시물에는 Taxi 스타일 게임, Minecraft에서의 컴퓨터 사용, 3D 인체 해부와 ISS 우주 유영 생성 사례가 나왔습니다.
- GPT-6 Astra를 둘러싼 인용 포스트에서는 약 10만 개 이상의 NVIDIA Grace Blackwell NVLink72로 학습했다는 설명과 40만 개 GPU의 추가 가동 계획이 공유됐습니다. @gdb는 이를 AGI 시대로의 진입과 연결했지만, 이 기간의 게시물은 성능 수치보다 사용량·제작 범위·컴퓨트 규모를 중심으로 구성됐습니다.
원문 트윗 2개 보기
Tibo
We've made some improvements that improve usage on the long tail for power users of Astra when logged in with your ChatGPT account. No change in quality and a pure win that on the long tail can result in up to 3-4X less usage being drawn from the subscription.
Md Ismail Šojal 🕷️
This is the prompt that broke game development: “hey gpt-6 astra, make me cs2 in three.js, make no mistakes.” 70 seconds later you’re watching a based browser CS2 clone with Three.js The output includes maps, weapon models, planting, multi-kills, and a full HUD. https:// x.com/om_patel5/stat us/2096431838960971880/video/1 …
📈 Codex Remote Control의 모바일-서버 연결포스트 1
Codex의 별도 Remote Control 기능을 이용해 모바일 앱에서 SSH로 연결된 GPU 클러스터의 작업을 관리하는 방법이 공유됐습니다. 서버 명령 실행, 페어링 코드 생성, 앱의 수동 연결이 하나의 절차로 이어집니다.
세부 내용 보기
- 한 사용자는 GPU Slurm 클러스터에 SSH로 접속한 뒤 휴대폰에서 Codex를 실행하려는 문제를 제기했고, ChatGPT Desktop의 SSH 연결과 별개인 Remote Control 기능을 발견했습니다. 서버에서 시작 명령과 페어링 명령을 차례로 실행한 뒤 모바일 앱에서 Remote·Add connection·Pair manually를 선택하는 흐름입니다.
- 공유된 명령은 서버에서 `codex remote-control start`를 실행하고 이어 `codex remote-control pair`로 페어링 코드를 받는 방식입니다. 모바일 앱은 이 코드를 입력해 연결을 만들며, 작성자는 이 기능을 GPU 클러스터의 autoresearch 실험과 학습 실행 관리에 매일 사용한다고 밝혔습니다.
📈 희귀 고보상 샘플을 겨냥한 RL 최적화포스트 2
TailRL은 평균 보상 대신 상위 보상 구간의 확률에 집중하도록 advantage function을 바꾸는 강화학습 방법입니다. WHALE은 모델 학습과 실행 가능한 harness 탐색을 번갈아 수행해 가중치만 조정하는 방식보다 높은 정확도를 냈다고 보고했습니다.
세부 내용 보기
- TailRL은 이진 보상에 머물던 maximum-likelihood RL을 연속 보상으로 확장하고, 높은 보상을 얻는 rollout의 상위 꼬리 확률 로그 기대값을 최대화합니다. 이 과정은 Best-of-(k) gradient의 혼합으로도 해석되며, advantage function을 간단히 바꾸는 방식이라 기존 RL 파이프라인에 연결됩니다.
- 게시물에 인용된 실험 범위는 객체 위치 지정, 미로 탐색, GUI grounding, 코드 최적화였습니다. TailRL은 희귀한 고보상 샘플을 활용하고 추론 시 샘플링 수가 늘어날 때 더 잘 확장된다고 보고됐지만, 구체적인 수치 표는 포스트에 제시되지 않았습니다.
- WHALE은 모델 가중치와 실행 가능한 harness를 번갈아 탐색하는 구조입니다. 검색·수학·체스에서 가중치만, harness만, 프롬프트와 가중치를 함께 최적화하는 방식보다 최대 24.4% 높은 정확도를 기록했다는 결과가 공유됐습니다.
원문 트윗 2개 보기
Russ Salakhutdinov
Check out our new work on Tail-Likelihood Reinforcement Learning (TailRL), extending maximum-likelihood RL from binary to continuous rewards. https:// arxiv.org/abs/2609.02987 Rather than optimizing only mean reward, TailRL maximizes the expected log of upper-tail probabilities, naturally placing more weight on rare, high-reward rollouts. Its gradient can also be interpreted as a mixture of Best-of-(k) gradients. TailRL requires only a simple modification to the advantage function, making it easy to integrate into existing RL pipelines. Across object localization, maze navigation, GUI grounding, and code optimization, TailRL effectively exploits rare high-reward samples and scales better with increased inference-time sampling. Check out a detailed thread by @stablegradients .
Is RL optimizing the right objective? 🤔 Should we maximize mean reward? Best-of-k? Which k? Standard RL pulls on the mean and often the distribution collapses to a spike. The tail dies 🥲 We introduce Tail-Likelihood Reinforcement Learning (TailRL). It maximizes the mean
alphaXiv
“WHALE: A Simple Recipe for Joint Harness-Weight Optimization” This paper alternates between training the model and searching for a better executable harness, letting both continuously adapt to each other. Small alternating updates beat weight-only, harness-only, and joint prompt-weight optimization across search, math, and chess, with up to 24.4% higher accuracy. http:// alphaxiv.org/abs/2609.00196
📈 초파리 커넥톰의 브라우저 시뮬레이션포스트 1
성체 수컷 초파리의 뇌와 중추신경계 연결 지도를 바탕으로, 뉴런을 조작하면 몸이 움직이는 WebGPU 시뮬레이션이 만들어졌습니다. 실제 연결 구조는 유지하되 활동과 운동 지도를 단순화한 구현입니다.
세부 내용 보기
- 한 게시물은 Google Research와 HHMI Janelia Research Campus 등이 성체 수컷 초파리의 전체 뇌와 중추신경계 연결을 매핑했다는 소식을 바탕으로 후속 구현을 만들었습니다. 커넥톰을 로컬 WebGPU 시뮬레이션에 연결해 브라우저에서 뉴런을 칠하고 자극하는 입력을 받습니다.
- 시뮬레이션은 뉴런 활동을 단순화하고 운동 지도를 프로그래밍한 뒤, 입력에 따라 초파리가 걷고 방향을 바꾸거나 도망가도록 출력합니다. 게시물은 논문 발표 후 3일 만에 브라우저에서 실행되는 형태를 만들었다고 밝혔습니다.
➖ 45억 개 TikTok 영상 메타데이터 공개포스트 1
Hugging Face에 45억 개 TikTok 영상의 캡션·조회수·좋아요·사운드·타임스탬프가 포함된 데이터셋이 올라왔습니다. MP4 파일과 프로필은 포함하지 않고 통계·메타데이터를 제공하는 구조입니다.
세부 내용 보기
- 공유된 데이터셋은 실제 영상 파일 없이 45억 개 영상의 캡션, 조회수, 좋아요, 사운드, 타임스탬프를 담습니다. 따라서 원본 영상 저장소라기보다 대규모 TikTok 통계와 메타데이터를 모은 공개 데이터셋에 해당합니다.
- 게시물은 이 자료의 가능한 활용처로 대규모 영상 데이터 수집과 자체 Sora 학습을 거론했습니다. 다만 실제 학습 가능성이나 데이터 사용 조건에 관한 추가 정보는 원문에 포함되지 않았습니다.
➖ 250MW·12만 칩 규모의 오픈소스 인프라 계약포스트 1
TogetherCompute가 250MW 데이터센터와 12만 개 칩, 연간 약 50억 달러 규모의 오픈소스 인프라 계약을 체결했다고 밝혔습니다. 수치상 모델 기능보다 AI 컴퓨트 공급 확대에 초점이 맞춰진 소식입니다.
세부 내용 보기
- 공개된 계약 규모는 250MW 데이터센터, 120,000개 칩, 연간 약 50억 달러의 사업입니다. 게시물은 이를 업계 최대급 오픈소스 인프라 계약 가운데 하나로 표현했지만, 칩 종류와 데이터센터 위치는 밝히지 않았습니다.
- 이 포스트는 개별 모델의 벤치마크보다 오픈소스 생태계에 투입되는 연산 인프라의 규모를 수치로 드러냅니다. 계약의 고객, 가동 일정, 실제 학습·추론 배분은 원문에 제시되지 않았습니다.
➖ 표·필기·수식까지 처리하는 OCR 모델포스트 1
한 OCR 모델이 olmOCR 기준 85.9% SOTA와 90개 이상의 언어 벤치마크를 기록했다는 정보가 공유됐습니다. 레이아웃을 유지한 채 표·양식·필기·수식·이미지와 도표 캡션을 추출하는 기능이 핵심입니다.
세부 내용 보기
- 게시물에 따르면 이 OCR 모델은 복잡한 표와 양식, 필기 문서를 전체 레이아웃과 함께 처리합니다. 입력 문서에서 텍스트뿐 아니라 이미지와 도표를 찾아 캡션으로 추출하는 출력 구조를 갖췄다고 설명됐습니다.
- 성능 근거로 olmOCR 기준 85.9% SOTA와 90개 이상의 언어에 대한 공개 벤치마크가 제시됐습니다. 수식·표·필기 처리 강점은 문서 종류별 구조를 보존해야 하는 OCR 작업에 직접 연결됩니다.
용어 해설
- 범용 인공지능(AGI)
- — 특정 작업을 넘어 폭넓은 지적 작업을 수행하는 인공지능을 뜻합니다. 이번 포스트에서는 GPT-6 Astra의 성능과 컴퓨트 규모를 근거로 AGI 도달 여부를 평가하는 맥락에서 쓰였습니다.
- 꼬리 가능도 강화학습(Tail-Likelihood Reinforcement Learning)
- — 평균 보상만 높이는 대신 높은 보상이 발생하는 상위 꼬리 구간의 확률을 키우는 강화학습 방식입니다. TailRL은 보상 분포의 희귀한 고성과 샘플에 더 큰 가중치를 둡니다.
- 어드밴티지 함수(advantage function)
- — 특정 행동이 현재 상태에서 기대되는 기준값보다 얼마나 나은지를 나타내는 강화학습 구성 요소입니다. TailRL은 기존 RL 파이프라인에서 이 함수만 간단히 수정해 적용하도록 설계됐습니다.
- WebGPU
- — 브라우저에서 GPU 연산을 실행할 수 있도록 하는 웹 그래픽 API입니다. 한 포스트에서는 초파리 신경 연결망을 WebGPU 기반 로컬 시뮬레이션에 연결해 몸의 움직임을 재현했습니다.
- 커넥톰(connectome)
- — 신경계의 뉴런과 연결 관계를 지도처럼 나타낸 구조입니다. 초파리 사례에서는 실제 연결 구조를 단순화한 활동 모델과 결합해 브라우저 안에서 걷기와 방향 전환을 구현했습니다.
- 전환 비용(switching costs)
- — 기존 서비스에서 다른 모델이나 도구로 옮길 때 잃는 작업 습관, 시스템 지침, 대화 맥락 같은 비용입니다. 한 포스트는 새 모델로 이동하면서 기존 기술과 대화 맥락을 Codex로 옮겼다고 밝혔습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.