TL;DR
이번 기간에는 Grok 4.6이 Databricks의 OfficeQA Pro V2 평가에서 Genie harness 기준 SOTA를 기록했다는 소식과 같은 가격의 성능 개선 소식이 함께 확산됐다. NVIDIA Nemotron 3.5 Lightning은 2-bit 양자화 상태에서 22GB VRAM으로 10분간 도구 호출을 수행했고, 파트너별 post-training과 Unsloth Desktop을 통한 실행·학습 경로가 함께 언급됐다. Hermes Agent는 웹사이트의 실제 API 호출을 관찰해 정적 API로 재사용하는 기능을 추가했고, Gradio 6.24는 앱 실행을 브라우저 로컬 저장소에 자동 보관해 대기열 없이 재생하도록 바뀌었다. MiniMax H3는 Magnific에서 영상 생성, 네이티브 오디오, 대화, 편집을 잇는 실시간 작업 흐름으로 시연될 예정이었다.
𝕏 실시간 트렌드 토픽
🔥 Grok 4.6의 OfficeQA Pro V2 평가 선두와 가격 동결포스트 2
Grok 4.6이 Databricks의 Genie harness로 수행한 OfficeQA Pro V2에서 SOTA 성능을 기록했고, Grok 4.5와 같은 가격으로 출시됐다는 소식이 묶였다.
세부 내용 보기
- Grok 4.6은 OfficeQA Pro V2의 문서 이해와 데이터 추론 과제에서 강점을 보였고, Databricks의 Genie harness를 통한 평가에서 SOTA 성능으로 기록됐다. 별도 게시물은 Grok 4.5와 같은 가격, 더 나은 agent·coding 성능, 더 빠른 처리, 입력 100만 토큰당 2달러와 출력 100만 토큰당 6달러를 언급해 평가 결과와 비용 조건을 함께 부각했다.
원문 트윗 2개 보기

Elon Musk
Grok 4.6 reaches #1 on @databricks
We worked with @SpaceXAI to evaluate Grok 4.6 on the latest OfficeQA Pro V2 from @DbrxMosaicAI. It achieves the SOTA performance with @databricks's Genie harness! The model is strongest on our document understanding and data reasoning tasks, and it is a very efficient driver!
Min Choi
Grok 4.6 just dropped. Same price as 4.5. Better agents. Better coding. Faster. And it now matches GPT-5.6 Sol on the AA Intelligence Index. $2/M input. $6/M output.
Introducing Grok 4.6. It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price.
📈 Grok Imagine Image 2.0의 Runway 탑재포스트 1
Grok Imagine Image 2.0이 Runway에서 이용 가능해지며 이미지·영상 생성 모델 묶음에 추가됐다.
세부 내용 보기
- Runway는 Grok Imagine Image 2.0을 자사 서비스에서 이용할 수 있게 됐다고 알렸다. 게시물은 이 모델을 최신 이미지 모델로 분류하고 Runway에서 제공 중인 이미지·영상 모델들과 함께 배치했지만, 생성 품질이나 가격 수치는 밝히지 않았다.
🔥 Nemotron 3.5 Lightning의 2-bit 도구 호출과 도메인별 post-training포스트 3
Nemotron 3.5 Lightning이 낮은 메모리 환경에서 장시간 도구 호출을 수행했고, 파트너별 post-training과 Unsloth Desktop 실행 경로가 함께 부각됐다.
세부 내용 보기
- NVIDIA는 2-bit Nemotron 3.5 Lightning이 22GB VRAM만으로 10분 동안 도구 호출을 이어가며 80개가 넘는 웹사이트를 인용하고 코드를 실행했으며 실제 위치 10곳을 검색했다고 밝혔다. 별도 게시물은 파트너가 각자의 도메인·도구·업무 흐름에 맞춰 모델을 post-training하는 사례를 언급했고, GGUF 파일과 Unsloth Desktop을 통해 실행·학습하는 경로도 함께 제공했다.
원문 트윗 2개 보기

NVIDIA AI
2-bit NVIDIA Nemotron 3.5 Lightning ran tool calls nonstop for 10 minutes on just 22GB of VRAM. It cited 80+ websites, executed code & searched for 10 real-world locations. Run and train via Unsloth Desktop. GGUF: https:// huggingface.co/unsloth/NVIDIA -Nemotron-3.5-Lightning-30B-A3B-GGUF … Guide: https:// unsloth.ai/docs/models/ne motron-3.5 …

NVIDIA AI
Love seeing our partners post-training Nemotron 3.5 Lightning for their own domains, tools, and workflows, as well as those offering post-training support Check out below to see what they’re building
📈 Hermes Agent의 웹사이트 API 호출 재사용포스트 1
Hermes Agent가 웹사이트 작업 중 발생한 API 호출을 관찰하고, 이를 정적 API로 만들어 이후 agent나 스크립트에서 재사용하는 선택적 skill을 추가했다.
세부 내용 보기
- 기존에는 웹사이트 작업을 수행할 때마다 agent가 같은 인터페이스를 다시 거쳐야 했지만, Hermes Agent의 새 skill은 작업 중 발생한 API 호출을 관찰한 뒤 정적 API 클라이언트로 생성한다. 사용자는 지정된 설치 명령을 실행해 이 기능을 추가할 수 있으며, 생성된 API는 agent나 스크립트가 이후 작업에서 재사용하는 입력 경로가 된다.
📈 Gradio 6.24의 실행 기록 자동 저장과 즉시 재생포스트 1
Gradio 6.24가 앱 실행 결과를 브라우저의 local storage에 자동 저장하고, 대기열을 거치지 않고 과거 실행을 재생하는 기능을 추가했다.
세부 내용 보기
- Gradio 앱의 실행 기록은 이제 브라우저 local storage에 자동 저장되며, 사용자는 저장된 실행을 클릭해 대기열에 다시 들어가지 않고 재생할 수 있다. 게시물은 코드 변경 없이 Gradio 6.24로 업그레이드하면 이 동작을 적용할 수 있다고 밝혀 앱 실험 결과의 보관과 재현 절차를 단순화했다.
➖ MiniMax H3의 영상 생성·오디오·편집 통합 작업 흐름포스트 1
MiniMax H3가 Magnific에서 영화적 영상 생성, 네이티브 오디오, 대화, 편집을 잇는 실시간 작업 흐름으로 다뤄질 예정이었다.
세부 내용 보기
- MiniMax와 Magnific은 H3를 Magnific 내부에서 직접 다루며 영상 생성 작업 흐름을 시연할 예정이라고 알렸다. 게시물에 따르면 작업 흐름은 영화적 생성, 네이티브 오디오, 대화, 편집을 한 세션에 묶고, H3로 이미 만들어진 결과물과 영상 제작 방향을 함께 다루는 구성이다.
용어 해설
- 최고 성능(SOTA)
- — SOTA는 특정 평가 과제에서 공개된 결과 중 가장 높은 성능을 뜻한다. OfficeQA Pro V2처럼 문서 이해와 데이터 추론을 측정하는 벤치마크에서는 모델의 상대적 순위를 나타내는 기준으로 쓰인다.
- OfficeQA Pro V2
- — OfficeQA Pro V2는 문서 이해와 데이터 추론 능력을 평가하는 최신 평가 세트다. Grok 4.6은 Databricks의 Genie harness를 통해 이 평가를 수행했고 SOTA 성능으로 기록됐다.
- Genie 평가 하네스(Genie harness)
- — Genie harness는 Databricks가 OfficeQA Pro V2 평가에 사용한 실행·평가 환경이다. 모델의 문서 이해와 데이터 추론 작업을 같은 절차로 측정해 결과를 비교하는 역할을 한다.
- 사후 학습(post-training)
- — post-training은 기본 모델이 학습된 뒤 특정 도메인, 도구, 업무 흐름에 맞춰 추가 조정하는 단계다. NVIDIA는 Nemotron 3.5 Lightning을 각 파트너의 요구에 맞게 조정하는 용도로 언급했다.
- 도구 호출(tool calls)
- — tool calls는 모델이 외부 검색, 코드 실행, 웹사이트 작업 같은 기능을 호출하는 과정이다. Nemotron 3.5 Lightning은 10분 동안 도구 호출을 이어가며 웹사이트 인용과 위치 검색을 수행했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
