본문으로 건너뛰기
X (Twitter)조회 1

Grok 4.6 출시와 에이전트 성능, Android 수어 입력, 오픈 웨이트 모델 실행 경로

Grok 4.6의 비용 대비 성능 경쟁, Android 수어 입력, 대형 오픈 모델의 로컬 실행

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 Grok 4.6 출시 포스트가 가장 큰 반응을 모았고, 같은 가격에서 Grok 4.5보다 개선된 지능·속도·비용 조합과 GDPVal-AA 1,753 ELO 기록이 핵심 근거로 제시됐다. Google DeepMind의 SL2T는 Pixel 11과 Android의 Gboard·Live Transcribe에 수어 입력을 연결하며, 기기 내 자세 추적과 서버 변환을 결합한 접근성을 택했다. 오픈 웨이트 모델 쪽에서는 Qwen3.8-2.4T-A95B, NVIDIA Nemotron 3.5 Lightning, North Micro Vision 등이 공개됐고, Dynamic 1-bit와 vLLM 통합이 대형 모델의 로컬·고속 실행 경로를 넓혔다. Keras 3의 ranking 모델 전환, Conceptual Reasoning Index, 금융·문서·앱 연동 사례는 모델 성능뿐 아니라 실제 업무 처리와 평가 체계가 함께 확장되는 흐름을 나타냈다.

𝕏 실시간 트렌드 토픽

🔥 Grok 4.6의 비용 대비 지능과 에이전틱 성능포스트 18

Grok 4.6 출시와 함께 GDPVal-AA 1,753 ELO, Artificial Analysis Intelligence Index 61점, 동일 가격의 성능 개선을 내세운 포스트가 집중됐다.

  • Grok 4.6 출시는 같은 가격에서 Grok 4.5보다 크게 개선된 모델이라는 메시지로 확산됐고, 핵심 쟁점은 단순 답변 품질보다 지능·속도·비용을 함께 평가하는 효율성이었다. GDPVal-AA에서는 Grok 4.6이 1,753 ELO로 Fable 5 Max 1,741, GPT-5.6 Sol Max 1,728, Grok 4.5 High 1,526을 앞섰으며, Artificial Analysis Intelligence Index에서는 61점을 기록해 Grok 4.5보다 5점 높아졌다. 포스트들은 이 성능을 Grok Build, Cursor, Grok Bot, SpaceXAI API의 debugging·앱 제작·research·planning·agentic workflow로 연결했고, 실제 업무 과제에서 낮은 비용과 빠른 처리 속도를 함께 따지는 흐름을 만들었다.
찬성다수

Grok 4.6은 동일 가격에서 Grok 4.5보다 개선됐고, GDPVal-AA 1,753 ELO와 Intelligence Index 61점으로 실제 업무 및 에이전틱 과제에서 높은 비용 대비 성능을 확보했다.

중립소수

제시된 수치는 GDPVal-AA와 Artificial Analysis 지표에 기반하며, 포스트마다 Grok 4.6의 실제 사용 경험과 벤치마크 범위가 달라 단일 지표만으로 전체 성능을 판단하기는 어렵다.

원문 트윗 2개 보기

📈 SL2T의 Android 수어 입력포스트 4

Google DeepMind가 SL2T를 Pixel 11의 ASL-to-English 입력과 Android 기능에 연결하며 수어를 문자 입력으로 바꾸는 경로를 확장했다.

  • 기존 키보드 입력 대신 수어를 직접 문자로 바꾸려는 맥락에서 SL2T가 Android의 Gboard와 Live Transcribe에 적용됐다. 사용자가 카메라 앞에서 수어를 입력하면 기기에서 신체 자세를 추적하고 서버가 이를 텍스트로 변환하며, 한 손으로 휴대전화를 들고 수어하는 상황도 고려한 구조다. Google DeepMind는 SL2T가 학술 벤치마크에서 최고 수준이라고 밝혔고, Pixel 11에서는 American Sign Language-to-English부터 시작해 다른 수어와 애플리케이션으로 확장할 계획을 밝혔다.
찬성다수

SL2T는 수어 동작을 Gboard와 Live Transcribe의 문자 입력으로 연결하고, 기기 내 자세 추적과 서버 변환을 분리해 실제 휴대전화 사용 상황을 지원한다.

원문 트윗 2개 보기

🔥 오픈 웨이트 모델의 로컬 실행과 경량화포스트 5

Qwen3.8-2.4T-A95B와 NVIDIA Nemotron 3.5 Lightning을 포함한 오픈 웨이트 모델이 양자화·MoE·서빙 통합으로 로컬 및 상시 에이전트 실행 경로를 넓혔다.

  • 대형 오픈 웨이트 모델은 거대한 전체 파라미터를 그대로 메모리에 올리는 대신 일부 파라미터만 활성화하거나 가중치를 압축하는 방식으로 로컬 실행 문턱을 낮췄다. Qwen3.8-2.4T-A95B는 2.4T 파라미터와 95B 활성 파라미터 구조를 갖추고, Dynamic 1-bit로 크기를 4.9TB에서 397GB로 줄였으며, vLLM은 NVIDIA·AMD용 4-bit 체크포인트와 Day-0 지원을 제공했다. NVIDIA Nemotron 3.5 Lightning은 30B MoE에 3B 활성 파라미터를 사용하고 최대 4배 출력 속도를 내세웠으며, Unsloth 테스트에서는 22GB VRAM으로 10분간 도구 호출을 이어가며 80개 이상의 웹사이트를 인용하고 코드를 실행했다. 같은 흐름에서 North Micro Vision은 Apache 2.0 오픈소스 문서 이해 모델로, 여러 모델이 클라우드 전용이 아닌 로컬·전용 작업용 선택지로 이동하고 있음을 나타냈다.
찬성다수

오픈 웨이트 모델은 MoE의 활성 파라미터 제한, Dynamic 1-bit·4-bit 양자화, vLLM 통합을 통해 대형 모델도 로컬 또는 단일 장비에서 실행하는 경로를 확보했다.

중립소수

Qwen3.8의 로컬 실행에는 410GB 이상의 RAM 또는 VRAM이 필요하고, Nemotron 테스트도 22GB VRAM 조건에 의존하므로 모델별 하드웨어 요구량은 여전히 크다.

원문 트윗 2개 보기

Victor M

@victormustar

We are in an insane run of open-weight drops. Every modality, open source is winning. This is what an open source AI summer looks like: LLMs & Reasoning → DeepSeek-V4-Flash-0731 (my king ): 304B MoE refresh, Terminal-Bench 2.1 jumps 61.8→82.7 over the preview, DeepSWE 7.3→54.4. Closes in on Opus-4.8 on Agents' Last Exam (25.2 vs 25.7). MIT. → Muse-Glimmer-30B, from Meta (they are back!!): their first open agentic model. ~29.6B dense + perception encoder, 131k+ context, built to run fully local, no cloud. Apache 2.0. → Liquid AI LFM2.5-2.6B: 2.69B params, 131k context, 220 tok/s on an M5 Max in under 2.5GB RAM. Competitive with models 4x larger on agentic tasks. → inclusionAI Ling-3.0-flash: 124B total, only 5.1B active, ~12% the size of their old 1T flagship Ring-2.6, matches it on key benchmarks. MIT. → inclusionAI Ling-3.0-tiny: 7.9B total, 1.3B active, 86-90 tok/s on an M4 Pro MacBook at ~8GB peak memory. MIT. → NVIDIA Nemotron-3.5-Lightning-30B-A3B: hybrid Mamba-2+MoE+Attention, up to 1M context, runs on a single H100 or DGX Spark, SWE-bench Verified 52.8. → deepgrove maple-preview: 20B-A1B ternary-weight reasoner, 218 tok/s on a Mac mini M4, 5.3GB checkpoint. MIT. → BigBang-v1 (endless-frontier): fine-tuned from Qwen3.6-35B-A3B via a self-evolving generator/critic synthetic-data loop. Lands aggregate performance between DeepSeek V4 Flash (284B) and V4 Pro (1.6T), at 35B. Apache 2.0. Video → MiniMax-H3: 33B dense omni model, native stereo audio, up to 2K/15s. 3.6k+ likes already. → Minimax-H3-Turbo (lightx2v): Apache-2.0 turbo distillation of H3 for fast inference. → Lightricks LTX-2.5: image-to-video update, custom Gemma-4-12B text encoder, a markedly stronger distilled model. Voice → NVIDIA NemotronLabs VoiceChat-11B: full-duplex speech-to-speech, ~450ms turn-taking, #2 on open VoiceBench, and the first open full-duplex model with live tool-calling mid-conversation. Safety → Mistral Shieldstral-1.0-3B: 3B multimodal guardrail that takes your safety policy as plain text instead of fixed categories. Beats LlamaGuard-4-12B and ShieldGemma-9B on HarmBench (99.4) and ToxicChat (84.1) at a fraction of the size. Apache 2.0.

💬 14 15 72👁 7440

vLLM

@vllm_project

Congrats to @Alibaba_Qwen on Qwen3.8-2.4T-A95B, one of the largest open-weight models released to date. 2.4T params, 95B active, 512 experts. Day-0 support in vLLM, verified on @NVIDIA and @AMD hardware. A ready-made 4-bit checkpoint per vendor, both out of the box: Inferact/Qwen3.8-2.4T-A95B-NVFP4, 1.32 TiB, one NVIDIA 8xB300 node Inferact/Qwen3.8-2.4T-A95B-MXFP4, 1.45 TiB, one AMD 8xMI355X node No conversion, no calibration on your side. Just vllm serve. Thanks to @Alibaba_Qwen for the weights and the collaboration, @NVIDIAAI and @AIatAMD for the joint kernel engineering, @inferact for the quantized checkpoints and vLLM integration, @digitalocean and @togethercompute for early testing, and the vLLM community.

💬 3 5 10👁 701

Keras 3 기반 ranking 서빙 최적화포스트 2

Expedia가 ranking 모델을 Keras 3 환경으로 옮긴 뒤 학습 시간과 추론 지연을 각각 30%, 70% 낮췄다.

  • 대규모 ranking·recommendation 모델은 정확도뿐 아니라 학습 주기와 초저지연 추론 비용이 운영 병목이 된다. Expedia는 ranking 모델을 Keras 3 설정으로 전환해 학습 시간을 30% 줄이고 inference latency를 70% 낮췄으며, 관련 글은 대규모 모델 서빙의 performance optimization 사례를 다룬다. 모델 구조와 서빙 경로를 함께 바꾸면 추천 결과를 계산하는 반복 요청의 응답 시간을 줄이는 방향으로 이어진다.
찬성다수

Keras 3 전환은 Expedia ranking 모델의 학습 시간을 30%, inference latency를 70% 줄여 대규모 추천 시스템의 운영 효율을 높였다.

원문 트윗 1개 보기

📈 AI 위험 연구를 위한 Conceptual Reasoning Index포스트 1

Redwood AI와 AnthropicAI가 AI 위험 연구의 논증 능력을 측정하는 Conceptual Reasoning Index를 만들고 수동 검증 데이터와 공개 리더보드를 마련했다.

  • 수학·코딩처럼 신뢰할 만한 피드백을 쉽게 얻는 분야와 달리 AI 위험 연구는 실험이 미래의 초고도 모델에 무엇을 의미하는지 논증해야 해 자동 평가가 어렵다는 문제가 출발점이다. Conceptual Reasoning Index는 세 벤치마크의 각 데이터 포인트를 연구자가 직접 확인하고, 무작위 추측 수준인 0점부터 최고 가능 점수인 100점까지 측정하며 실제 성능 상한을 91점으로 추정한다. Redwood AI와 AnthropicAI는 여러 회사의 최고 점수 모델과 Fable 5, Muse Spark 1.2, Gemini Flash 3.6을 같은 리더보드에서 비교할 수 있는 공개 웹사이트를 운영한다.
찬성소수

Conceptual Reasoning Index는 수동 품질 검증과 0~100점 척도를 결합해 AI 위험 연구처럼 정답과 피드백이 불명확한 영역의 모델 성능을 측정하는 기준을 마련했다.

원문 트윗 1개 보기

📈 업무 도구와 기기 안으로 들어온 AI 에이전트포스트 4

금융 워크플로, Gemini 앱 연결, Runway Agent, Raspberry Pi 기반 Hermes Agent가 AI를 답변형 도구에서 업무 실행형 인터페이스로 확장했다.

  • AI 활용 사례가 단일 채팅창을 넘어 금융 결산·forecasting·treasury, 서비스 연결, 파일·문서 동기화, 저가 하드웨어의 상시 실행으로 이동했다. ChatGPT Work와 Codex는 금융팀의 16개 workflow에 쓰였고, Gemini는 설정에서 연결한 14개 앱을 통해 일정·생성·할 일 처리를 한곳에 모으며, Runway Agent는 Figma·Dropbox·Notion의 디자인·파일·문서를 직접 불러온다. Hermes Agent는 Raspberry Pi 4의 2GB RAM에서 에이전트 루프·메모리·도구만 실행하고 모델 추론은 API로 넘겨 약 50달러 하드웨어에서 상시 실행 구조를 구성한다.
찬성다수

AI 에이전트는 금융 업무의 반복 workflow, 외부 앱의 파일·문서 연결, 저사양 기기의 상시 실행으로 사용자의 검색·설치·정리 작업을 대신하는 방향으로 확장됐다.

중립소수

사례별로 ChatGPT Work·Codex, Gemini, Runway Agent, Hermes Agent가 처리하는 업무와 실행 환경이 달라 하나의 에이전트 구조로 일반화하기는 어렵다.

원문 트윗 2개 보기

용어 해설

GDPVal-AA
모델이 실제 업무에 가까운 과제를 얼마나 잘 수행하는지 측정하는 벤치마크입니다. 이번 포스트에서는 Grok 4.6의 순위를 ELO 점수로 비교하는 기준으로 쓰였습니다.
에이전틱 워크플로(Agentic Workflow)
AI가 질문에 답하는 데서 그치지 않고 도구 사용, 계획 수립, 자율 실행, 복합 문제 해결을 이어가는 작업 방식입니다.
Mixture of Experts
전체 파라미터를 매번 계산하지 않고 여러 전문가 네트워크 중 일부만 활성화하는 구조입니다. 포스트에서는 대형 모델의 실행 비용과 메모리 부담을 줄이는 방식으로 등장합니다.
수어-텍스트 변환 모델(SL2T)
수어 동작을 입력받아 문자로 바꾸는 모델입니다. Google DeepMind는 기기에서 신체 자세를 추적하고 서버에서 텍스트 변환을 수행하는 구조로 Android 기능에 적용했습니다.
KV 캐시(KV Cache)
Transformer 추론 중 이미 계산한 키와 값을 저장해 다음 토큰 처리에서 반복 계산을 줄이는 메모리 구조입니다. vLLM 포스트에서는 모델 가중치와 함께 클라우드 경로에서 불러오는 대상으로 등장합니다.
Dynamic 1-bit 양자화(Dynamic 1-bit)
모델의 층마다 양자화 방식을 선택해 가중치 저장 크기를 줄이는 기법입니다. Qwen3.8-2.4T-A95B의 크기를 4.9TB에서 397GB로 낮추는 데 사용됐습니다.
개념 추론 지수(Conceptual Reasoning Index)
AI 위험 연구처럼 정답을 빠르게 얻기 어려운 문제에서 논증의 질을 평가하기 위한 지수입니다. 각 데이터 포인트를 연구자가 직접 확인하고 세 벤치마크를 0~100점 범위로 측정합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 13.수집 2026. 08. 13.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.