본문으로 건너뛰기

Grok Bot의 업무 자동화, Qwen 모델 확장, 소형 추론 모델 효율화

컴퓨터를 직접 조작하는 Agent, 제작 도구로 확장되는 Qwen, 작은 활성 파라미터로 성능 경계를 넓히는 Ling

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 컴퓨터와 웹 도구를 직접 조작하는 Grok Bot의 업무 자동화 사례가 가장 큰 반응을 얻었습니다. Qwen3.8-Max는 Legal Research Bench에서 3개월이 지나기 전에 #22에서 #4로 올라갔고, Qwen-Image-3.0은 12개 언어의 텍스트와 웹페이지·게임·라이브스트림 인터페이스 렌더링을 내세워 배포 범위를 넓혔습니다. Ant Group의 Ling 3.0 Tiny는 7.9B 총 파라미터와 1.3B 활성 파라미터, 262K-token 컨텍스트 윈도로 Artificial Analysis Intelligence Index 25를 기록했지만, 낮은 정확도와 높은 토큰 사용량이 함께 나타났습니다. Agent 개발 쪽에서는 개인 지식 기반과 영속 메모리를 연결하는 Hermes Agent 활용법, W&B 로그를 이용한 로봇 제어 학습, Managed Deep Agents 교육 자료가 이어졌습니다.

𝕏 실시간 트렌드 토픽

🔥 Grok Bot의 컴퓨터 실행형 업무 자동화포스트 2

Grok Bot이 사용자의 컴퓨터와 업무 도구에 로그인해 일정 확인부터 웹 예약까지 수행하는 초기 사례가 공유됐습니다. 단순 질의응답보다 작업 입력·도구 조작·완료 결과 반환을 한 흐름으로 묶는 방식입니다.

  • 기존 챗봇이 답변을 반환하는 데 그쳤다면 Grok Bot은 각 Bot에 컴퓨터를 연결하고 사용자의 도구에 로그인해 실제 업무를 수행하는 구조입니다. 사용자가 필요한 예약을 찾도록 요청하면 캘린더에서 사전 작업을 확인하고, 적절한 시간을 판단한 뒤, 웹사이트 예약 절차를 직접 진행하는 입력→판단→조작 흐름으로 이어집니다. 한 사용자는 주차장으로 이동하는 동안 중국어와 영어를 섞어 말해도 이 작업이 진행됐다고 전했습니다. 일정과 예약처럼 여러 서비스 사이를 오가는 업무를 대화 한 번으로 연결한다는 점이 핵심입니다.
  • Grok Bot은 아직 early beta로 소개됐으며, 게시물에서는 각 Bot이 사용자의 도구에 로그인해 일을 끝낸 뒤 결과를 돌려준다고 설명했습니다. 별도 게시물은 달력 확인, 최적 예약 시간 결정, 웹사이트 탐색을 하나의 사례로 제시했습니다. 공개된 게시물만으로는 처리 정확도나 지원 서비스 범위의 수치를 확인할 수 없으므로, 이번 흐름은 제품 기능과 초기 사용 경험 중심으로 읽힙니다.
원문 트윗 2개 보기

📈 Qwen 모델의 연구·이미지 제작 배포 확대포스트 4

Qwen3.8-Max의 Legal Research Bench 순위 상승과 Qwen-Image-3.0의 OpenArt·Qwen Cloud 배포가 함께 이어졌습니다. 연구 성능 개선과 이미지 생성 기능의 실제 서비스 연결이 동시에 진행되는 흐름입니다.

  • Qwen3.8-Max는 Legal Research Bench에서 #22에서 #4로 올라갔고, 게시물은 3개월이 지나기 전에 점수가 거의 두 배가 됐다고 전했습니다. Qwen-Image-3.0은 OpenArt에 탑재됐으며 12개 언어의 네이티브 텍스트, 10px 단위의 정밀한 글자 표현, 웹페이지·게임·라이브스트림 같은 전체 인터페이스 렌더링을 기능으로 내세웠습니다. 연구 벤치마크의 순위 변화와 제작 서비스 안에서의 출력 기능이 서로 다른 경로로 확장되는 모습입니다.
  • Alibaba Cloud는 Qwen-Image-3.0을 Alibaba Cloud Model Studio와 Qwen Cloud에서도 사용할 수 있도록 연결했고, Qwen Live Episode 2에서는 Qwen-Image-3.0과 Qwen3.8-Max를 실제 Production과 Agent 요구에 맞추는 방향을 다룰 예정이라고 알렸습니다. 게시물에 적힌 수치는 Legal Research Bench의 순위와 점수 변화이며, 이미지 품질에 대한 독립적인 벤치마크 수치는 포함되지 않았습니다.
원문 트윗 2개 보기

📈 Ling 3.0 Tiny의 소형 추론 모델 효율화포스트 1

Ling 3.0 Tiny는 7.9B 총 파라미터와 1.3B 활성 파라미터로 Artificial Analysis Intelligence Index 25를 기록했습니다. 작은 활성 계산량과 긴 컨텍스트를 확보했지만, 토큰 사용량과 정확도에는 비용이 남았습니다.

  • Mixture of Experts 구조에서 Ling 3.0 Tiny는 총 7.9B 파라미터 중 1.3B만 활성화하고 262K-token 컨텍스트 윈도를 사용합니다. 이 구성으로 Artificial Analysis Intelligence Index 25를 기록해 gpt-oss-120b의 24와 비슷한 점수를 냈으며, 총 파라미터는 15분의 1, 활성 파라미터는 4분의 1이라고 게시물에 적혔습니다. 가중치는 Hugging Face에서 MIT 라이선스로 제공되고 InclusionAI API와 Novita Labs를 통해 접근할 수 있습니다.
  • 작은 모델 규모에도 계산 비용이 사라진 것은 아닙니다. Intelligence Index 실행에 213M 출력 토큰을 사용해 더 큰 Ling 3.0 Flash의 240M에 가까웠고, AA-Omniscience에서는 -19점, 정확도 9%, 환각률 30%를 기록했습니다. 이전 Ling-mini-2.0의 환각률 96%에서 개선됐지만 질문 시도의 비율은 37%에 그쳤으며, 도구 사용 점수는 𝜏³-Banking 21%, GDPval-AA v2 Elo 772로 작업 유형별 편차가 남았습니다.
원문 트윗 1개 보기

Artificial Analysis

@ArtificialAnlys

Ant Group has released Ling 3.0 Tiny, which scores 25 on the Artificial Analysis Intelligence Index. With just 7.9B total and 1.3B active parameters, it sits on the Pareto frontier for Intelligence vs. Active Parameters @AntLingAGI has released Ling 3.0 Tiny, an open weights reasoning model with a 262K-token context window. It scores 25 on the Artificial Analysis Intelligence Index, comparable to gpt-oss-120b (high, 24) with 15x fewer total parameters and 4x fewer active parameters. However, this parameter efficiency comes with high token usage: Ling 3.0 Tiny used 213M output tokens to run the Intelligence Index, nearly as many as the larger Ling 3.0 Flash (240M). It follows the recent release of Ling 3.0 Flash, which scores 38 with 124B total and 5.1B active parameters. The weights are available on Hugging Face under an MIT license. Key results: ➤ Ling 3.0 Tiny extends the open weights Pareto frontier for Intelligence vs. Active Parameters. It scores 25 on the Artificial Analysis Intelligence Index, and at 7.9B total and 1.3B active parameters, the model is small enough to run locally in many settings ➤ Ling 3.0 Tiny makes a 59-point improvement in AA-Omniscience over Ling-mini-2.0, primarily driven by improvements in hallucination rate. Ling 3.0 Tiny scores -19 with 9% accuracy and a 30% hallucination rate, similar to Qwen3.6 27B (-20), but its accuracy is relatively low among similarly sized open weights models. Compared to the previous generation, where Ling-mini-2.0 had a 96% hallucination rate, Ling 3.0 Tiny improves on hallucination while maintaining the same accuracy. Instead of guessing when it doesn’t know, it attempted just 37% of questions in the AA-Omniscience evaluation. ➤ Ling 3.0 Tiny is relatively capable in tool use but performs modestly in agentic work tasks. Ling 3.0 Tiny scores 21% on 𝜏³-Banking, ahead of Qwen3.6 27B (17%). On GDPval-AA v2, however, it reaches an Elo rating of 772, behind Nemotron 3.5 Lightning at 824 despite sitting slightly ahead on the overall Intelligence Index. Additional model details: ➤ Size: 7.9B total parameters, 1.3B active (mixture of experts) ➤ Context window: 262K tokens ➤ License: MIT ➤ Providers: InclusionAI first-party API and @novita_labs

💬 1 1 11👁 1769

Agent 개발을 위한 개인 메모리·로봇 학습 도구포스트 4

Hermes Agent를 개인 지식 기반과 영속 메모리에 연결하는 구성, 로봇 제어 학습에서 W&B 로그를 활용하는 사례, Managed Deep Agents 교육 자료가 한 흐름으로 묶였습니다. Agent를 실제 작업과 반복 학습에 연결하는 개발자 중심 내용입니다.

  • Hermes Agent 활용 사례는 하나의 Prompt로 Markdown 지식 기반, 영속 메모리 포인터, 연결된 네 개 레이어를 만드는 방식을 다룹니다. 지식 기반을 단일 진실 공급원으로 두고 이후 세션이 메모리 포인터를 참조하도록 구성해 개인 업무와 기록을 이어가는 형태입니다. 게시물은 이를 life OS와 second brain 구축 방식으로 소개했지만, 성능 수치나 재현성 평가는 제시하지 않았습니다.
  • 로봇 제어 학습 사례에서는 synthetic episodes에 대한 W&B 로그에서 일부 성공을 확인했지만, pelvis keyframe과 joystick control 사이의 90도 불일치가 발견돼 다음 학습 전에 입력 정렬이 필요했습니다. 별도로 Managed Deep Agents의 핵심 개념을 다루는 2시간 이상 단일 영상 또는 10분짜리 12편 Playlist가 준비 중입니다. 두 사례 모두 Agent를 업무 기억이나 제어 입력과 연결할 때 관찰 로그와 구성 정합성이 필요하다는 실무 조건을 담고 있습니다.
원문 트윗 2개 보기

용어 해설

에이전트(Agent)
사용자 대신 외부 도구와 서비스를 조작해 작업을 수행하는 소프트웨어 구조입니다. Grok Bot은 각 Bot에 컴퓨터를 연결하고 사용자의 도구에 로그인해 일정 확인, 예약 탐색, 웹사이트 조작까지 처리하는 방식으로 구현됩니다.
오픈 가중치(Open Weights)
모델의 학습 가중치를 외부에 공개하는 배포 방식입니다. Ling 3.0 Tiny는 Open Weights 모델로 제공되며, Hugging Face에서 MIT 라이선스로 사용할 수 있도록 배포됐습니다.
Mixture of Experts
모델 전체 파라미터를 매번 모두 활성화하지 않고 일부 전문가 경로만 선택해 계산하는 구조입니다. Ling 3.0 Tiny는 총 7.9B 파라미터 중 1.3B만 활성화해 처리량과 모델 규모 사이의 균형을 겨냥합니다.
컨텍스트 윈도(Context Window)
모델이 한 번에 입력으로 유지할 수 있는 토큰 범위입니다. Ling 3.0 Tiny는 262K-token 컨텍스트 윈도를 제공해 긴 문맥을 한 요청 안에서 처리하도록 구성됐습니다.
파레토 프런티어(Pareto Frontier)
한 지표를 높이면서 다른 지표를 일방적으로 희생하지 않는 효율 경계입니다. Ling 3.0 Tiny는 총·활성 파라미터 수가 작은 조건에서 Artificial Analysis Intelligence Index 25를 기록해 Intelligence와 Active Parameters 사이의 경계에 놓였습니다.
멀티모달(Multimodal)
텍스트와 이미지처럼 서로 다른 형식의 입력·출력을 함께 다루는 모델 특성입니다. Qwen 관련 게시물은 Qwen-Image-3.0과 Qwen3.8-Max를 실제 제작과 Agent 작업에 연결하는 방향을 다룹니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 12.수집 2026. 08. 12.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.