TL;DR
최근 X 상에서는 Grok 4.5와 Grok Build 조합이 Snorkel AI 벤치의 약 2,000개 전문 업무 과제에서 우위를 보였고, Grok Build 사용을 권유하는 게시물이 다수 노출됐다. Motif-3-Beta는 총파라미터 약 314B, 토큰당 활성화 약 13B(스파스 MoE), 256K 컨텍스트 길이를 내세우며 대규모 MoE와 긴 컨텍스트 설계 흐름을 반영했다. Tencent는 Hyra-1.0(Hunyuan Research Agent)을 공개하며 연구용 파이프라인과 오픈소스 결과물을 통해 수십 개 벤치에서 SOTA를 보고했고, Tesla는 Cybercab에 Starlink V5를 직접 통합하고 베이 지역 라이드셰어를 SFO까지 확장했다. 전반적으로 대규모 모델 성능·장기 컨텍스트·제품 통합이 동시에 화제화되었으나, 벤치 결과의 실제 배포 일반화 가능성과 인프라 비용·검증 방법은 당면 과제로 남아 있다.
𝕏 실시간 트렌드 토픽
🔥 Grok 4.5와 Grok Build의 벤치 성과포스트 3
Elon Musk의 홍보와 함께 Grok Build를 조합한 Grok 4.5가 Snorkel AI 벤치의 거의 2,000개 전문 업무 과제에서 테스트되며 우위를 보였고, Long-Horizon Terminal-Bench에서도 1위를 차지했다. 테스트 대상에는 문서·스프레드시트·프레젠테이션 등 실제 업무 형식의 과제가 포함되었다. 관련 발언과 링크가 높은 노출을 기록해 해당 조합을 제품화·배포하려는 시도가 확산되고 있다.
- Snorkel AI 벤치에서 Grok 4.5+Grok Build가 GPT 5.5와 Claude Opus 4.8 등과 비교된 점이 보고되었다.
- 평가는 거의 2,000개의 전문가 제작 업무 과제를 포함해 실제 업무 형태를 대상으로 진행되었다.
- Long-Horizon Terminal-Bench의 이진 합격률 기준에서도 Grok 4.5가 상위권으로 보고되었다.
Grok 4.5와 Grok Build 조합이 다양한 실무형 벤치에서 선두를 차지해 생산성 측면의 우위를 보였다.
벤치 우위는 특정 평가 세트에 기반한 결과로, 실제 배포 환경·장기 안정성·비용 효율성은 추가 검증이 필요하다.
원문 트윗 2개 보기

Elon Musk
@elonmusk
Try Grok Build!
Grok 4.5 is leading on actual professional work In Snorkel AI’s benchmark, Grok 4.5 combined with Grok Build was tested against GPT 5.5 and Claude Opus 4.8 across nearly 2,000 expert-created workplace tasks involving real documents, spreadsheets, presentations and professional

Elon Musk
@elonmusk
Try Grok Build, it’s awesome! http:// X.ai/cli
Grok 4.5 now also ranked #1 on the Long-Horizon Terminal-Bench by binary pass rate, outperforming Claude Fable 5, Claude Opus 4.8 and GPT-5.6-sol Under the strictest scoring metric - where a task counts only if it is fully solved with a perfect reward and zero errors......Grok x.com/XFreeze/status…
📈 Tesla Cybercab과 Starlink V5 통합 및 서비스 확장포스트 3
Tesla가 Cybercab에 Starlink V5를 직접 통합한 사례가 공개되었고, Tesla AI 계정은 베이 지역 라이드셰어 서비스를 SFO까지 확장한다고 발표했다. 통합은 차량 내 고대역 스트리밍(예: 4K 비디오)과 연결성을 염두에 둔 조치로 보인다. 해당 발표는 지역 서비스 확장과 인프라 연계 측면에서 주목을 받았다.
- Cybercab에 Starlink V5가 직접 통합되었다고 Tesla 측 발표가 있었다.
- 베이 지역 라이드셰어 서비스의 목적지 확장(SFO)이 별도로 공지되었다.
- 통합은 차량-네트워크 연계 서비스(스트리밍, 연결성 강화)와 연관된 조치로 해석된다.
Starlink V5 직접 통합은 차량 내 고대역 연결성과 서비스 품질을 높여 미디어 스트리밍과 원격 서비스에 유리하다.
연결성 강화는 사용자 경험을 개선하지만 네트워크 비용·운영 복잡성 증가를 수반한다.
📈 Motif-3-Beta: 대규모 스파스 MoE와 긴 컨텍스트 제시포스트 1
Motif-3-Beta가 약 314B 총 파라미터, 토큰당 약 13B 활성 파라미터(스파스 MoE) 구조, 256K(262,144) 토큰 컨텍스트 길이를 내세우며 공개되었다. 라우팅은 384개의 전문가 중 토큰당 8개를 활성화하고 여기에 1개의 공유 전문가를 더하는 방식으로 보고되었다. 이 설계는 모델 규모와 장기 컨텍스트 처리 능력을 동시에 끌어올리려는 최근 흐름을 반영한다.
- 총 파라미터는 약 314B, 토큰당 활성화 파라미터 약 13B로 표기되었다.
- 컨텍스트 길이는 256K(262,144 토큰)로 장기 입력 처리에 중점을 뒀다.
- 스파스 라우팅은 384개 전문가 중 토큰당 8개를 활성화하고 추가로 1개 공유 전문가를 둔다.
스파스 MoE와 대용량 컨텍스트 결합은 장문 처리 능력과 파라미터 확장을 동시에 실현하는 설계로 보인다.
MoE 설계는 라우팅 복잡도·추론 인프라 요구가 증가하므로 운영 비용과 검증이 관건이다.
➖ Tencent의 Hyra-1.0(Hunyuan Research Agent)와 오픈 소스 결과포스트 3
Tencent는 Hyra-1.0 Hunyuan Research Agent를 소개하며 성능 중심의 연구·엔지니어링 과제를 반복적으로 개선하도록 설계된 에이전트를 제시했다. 발표 자료와 연동된 리포지토리에서 55개 공개 수학 문제 중 29개에서 SOTA를 갱신한 결과와 '10-digit addition transformer'가 15개 학습 파라미터만으로 공개 기록 대비 58.3% 적은 파라미터로 동작했다는 수치가 보고되었다. 모든 출력물은 오픈소스로 공개되었다는 점이 강조되었다.
- Hyra-1.0은 반복적 개선(recursive improvement)을 목표로 한 연구용 에이전트로 소개되었다.
- 오픈소스 결과물에서 29/55 문제에서 SOTA 갱신, 특정 태스크에서 파라미터 절감 수치(58.3%)가 보고되었다.
- 데모와 결과물이 공개 리포지토리로 연결되어 재현성과 검증이 가능하다.
Hyra의 오픈소스 결과는 연구 파이프라인과 자동화된 검증을 통해 학술적·공학적 산출물을 빠르게 도출하는 접근을 보여준다.
벤치마크와 초기 in-silico 후보 결과는 고무적이지만 실험실(웻랩) 검증 등 후속 검증이 필요하다.
원문 트윗 2개 보기
Tencent Hy
@TencentHunyuan
Introducing Hyra-1.0, the first version of Hunyuan Research Agent. Built to recursively improve solutions for performance-driven research and engineering tasks. Explore our demos in AI4AI, AI4Science, and AI4Fun: https:// hy.tencent.com/research/hyra
Tencent AI
@TencentAI_News
Refreshed SOTA on 29/55 open math problems 10-digit addition transformer with just 15 trainable params (58.3% fewer than public record) Sunspot prediction with r² = 0.77 on nearly a century of held-out data 44.4% more efficient qubit routing than SABRE on IBM Q20 Candidate parp1 inhibitors that outscored olaparib in silico(early-stage, wet-lab work still ahead) All outputs open-sourced → https:// github.com/Tencent-Hunyua n/hyra-results …
Introducing Hyra-1.0, the first version of Hunyuan Research Agent. Built to recursively improve solutions for performance-driven research and engineering tasks. Explore our demos in AI4AI, AI4Science, and AI4Fun: https:// hy.tencent.com/research/hyra
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
