TL;DR
이번 포스트 묶음에서는 GLM-5.3의 출시와 Terminal-Bench 성능, Gemini 3.7 Flash의 비용 대비 코딩 성능, 로컬 실행형 모델과 Fine-tuning 도구가 함께 부상했다. GLM-5.3은 1M context와 Go 지원을 내세웠고, 다른 포스트에서는 743B 기반 사후 학습과 오픈 웨이트의 확산을 연결했다. Gemini 3.7 Flash는 Cognition의 FrontierCode 1.1에서 Claude Sonnet 5 수준 성능을 절반 이하 비용으로 냈다는 평가를 받았다. 에이전트 영역에서는 세션 간 상태 보존과 중간 압축이 토큰 사용량을 줄이는 핵심 과제로 떠올랐으며, Qwen 기반 기업용 사례는 비용·지연·데이터 규정 준수를 함께 다뤘다.
𝕏 실시간 트렌드 토픽
🔥 GLM-5.3 출시와 오픈 웨이트 코딩 경쟁포스트 5
GLM-5.3이 Go에서 1M context와 기존 5.2와 같은 가격으로 제공되기 시작했고, Terminal-Bench 성능과 743B 기반 사후 학습이 함께 주목받았다.
- GLM-5.3의 새 버전 출시 소식은 Go 지원, 1M context, GLM-5.2와 동일한 가격이라는 사용 조건과 함께 전해졌다. 같은 시기 다른 포스트에서는 GLM-5.2를 기반으로 다양한 장기 작업에 더 많은 연산을 투입한 사후 학습이 성능 향상의 배경으로 언급됐다.
- Terminal-Bench 비교 포스트들은 GLM-5.3이 Fable과 전날 공개된 DeepSeek V4-Pro 0813을 앞섰고, Claude Opus 4.8보다 높은 결과를 냈다고 전했다. 이 흐름은 모델 규모 자체보다 코딩·에이전틱 작업을 겨냥한 사후 학습과 오픈 웨이트 접근성을 함께 평가하는 방향으로 이어졌다.
원문 트윗 2개 보기
Cline
@cline
GLM-5.3 has released, beating Fable & the new DeepSeek V4-Pro 0813 from just yesterday on Terminal-Bench. It used GLM-5.2 as the base model with gains from more compute spent than ever before on post-training on diverse long-horizon tasks. Open weights have hit escape velocity.
Md Ismail Šojal
@0x0SojalSec
A 743B GLM-5.3 model now Beats Anthropic 6 Trillion model Claude Opus 4.8 on Terminal Bench
Introducing GLM-5.3: Built to Code. Ready for Cyber Defense. - Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model - A major leap in cybersecurity, setting a new standard among open models Tech Blog: https:// z.ai/blog/glm-5.3
📈 Gemini 3.7 Flash의 비용 대비 코딩 성능포스트 2
Gemini 3.7 Flash가 Devin 내부 FrontierCode 1.1 평가에서 Claude Sonnet 5 수준 성능을 절반 이하 비용으로 냈다는 포스트가 반복됐다.
- Cognition의 FrontierCode 1.1 측정에서 Gemini 3.7 Flash가 Claude Sonnet 5 수준에 도달했고 비용은 절반 이하였다는 수치가 공유됐다. 해당 평가는 Devin 안에서 저장소 관례에 맞춘 최소 변경의 범위가 좁은 Refactor 작업을 대상으로 이뤄졌으며, Flash 계열의 낮은 지연 시간도 함께 언급됐다.
- 이용자는 8월 27일까지 추가 50% 할인으로 실제 작업에서 시험할 수 있다는 조건을 접했다. 따라서 이 토픽의 핵심 비교축은 최고 성능 단독 경쟁보다 특정 코딩 작업에서의 성능, 비용, 지연 시간의 조합이다.
좁게 정의된 Refactor 작업에서 Gemini 3.7 Flash가 Claude Sonnet 5 수준 성능과 절반 이하 비용을 함께 달성했다는 평가가 공유됐다.
원문 트윗 2개 보기
Akshay
@akshay_pachaar
Gemini 3.7 Flash matches Sonnet 5 at half the price. On Cognition's FrontierCode 1.1 inside Devin, this performance was measured on tightly scoped refactors with minimal diffs that match repo conventions. Available at an extra 50% off through Aug 27.
Gemini 3.7 Flash is now available in Devin. On FrontierCode 1.1, it reaches Claude Sonnet 5-level performance at less than half the cost, with the low latency the Flash series is known for.
Avi Chawla
@_avichawla
Gemini 3.7 Flash reaches Sonnet 5-level performance at less than half the cost. That's measured on Cognition's own FrontierCode 1.1 number, and it comes with the low latency the Flash series is known for. Available at an extra 50% off through Aug 27 to test it on real work.
Gemini 3.7 Flash is now available in Devin. On FrontierCode 1.1, it reaches Claude Sonnet 5-level performance at less than half the cost, with the low latency the Flash series is known for.
📈 동일 프롬프트로 비교하는 차세대 영상 모델포스트 1
Seedance 2.5, MiniMax H3, FLUX 3에 동일한 프롬프트를 입력해 움직임·구도·디테일·속도·스타일의 차이를 나란히 비교하는 방식이 소개됐다.
- 세 영상 모델에 완전히 같은 창작 지시를 넣고 결과를 나란히 배치해 모델별 해석 차이를 비교했다. 비교 기준은 움직임, 구성, 세부 묘사, 페이싱, 스타일이며, 하나의 절대적 승자를 정하는 방식은 아니었다.
- 세 모델은 Factory에서 직접 시험할 수 있고, 사용자는 같은 프롬프트를 반복 입력한 뒤 자신의 장면에 맞는 모델을 고르는 흐름을 따를 수 있다. 모델 이름과 접근 경로가 한 포스트 안에 함께 제시돼 결과 비교와 즉시 실험이 연결됐다.
📈 에이전트 메모리를 줄이는 세션 상태 보존포스트 2
에이전트가 매 세션마다 사용자 정보를 다시 학습하는 낭비를 줄이기 위해 중간 세션 압축과 지속 상태 저장이 핵심 과제로 부각됐다.
- 에이전트가 세션마다 사용자를 다시 파악하면 이전 맥락이 이어지지 않아 토큰과 처리 시간이 반복해서 소모된다. TencentAI_News 포스트는 중간 세션 압축만으로 자체 사례에서 토큰 사용량을 61% 줄였다고 전했고, 관련 구현 전체를 공개했다고 밝혔다.
- 모듈을 교체할 수 있는 구조에서도 지난주 맥락과 상태가 함께 이동하지 않는 문제가 남는다는 지적이 나왔다. 이 구조에서는 대화와 작업 상태를 저장한 뒤 다음 세션에서 다시 주입하고, 중간 과정에서는 압축된 표현을 사용해 입력 규모를 줄이는 방식이 핵심이다.
세션 간 메모리와 중간 압축을 에이전트 확장의 병목으로 보고, 실제 사례에서 토큰 사용량 61% 절감이 있었다는 입장이다.
모듈을 자유롭게 교체해도 이전 맥락과 상태가 따라오지 않으면 에이전트의 연속 작업이 끊긴다는 문제 제기다.
원문 트윗 2개 보기

Tencent AI
@TencentAI_News
Agreed, been working on this. Agents re-learning who you are every session is the real waste. Mid-session compression alone cut 61% of token usage in our case. open-sourced the whole thing https:// github.com/TencentCloud/T encentDB-Agent-Memory …
Memory, not compute, is the rate limiter of the Agentic Era.
Tencent AI
@TencentAI_News
love the pluggable angle, the thing that never seems to plug in is state, you can swap modules all day but last week's context doesn't come along for the ride
📈 로컬 실행과 저자원 Fine-tuning의 확장포스트 4
12GB 휴대폰 CPU에서 구동하는 284B 모델, Mac에서 작동하는 30B 에이전트, 24GB VRAM에서 가능한 Muse Glimmer Fine-tuning이 한 흐름으로 묶였다.
- DeepSeek V4 Flash는 12GB 휴대폰 CPU에서 초당 1토큰 속도로 실행되며, 플래시 저장장치에서 전문가를 스트리밍하는 방식이 언급됐다. Muse Glimmer는 Mac에서 클라우드 없이 다단계 도구 사용과 자체 연구를 수행하는 로컬 에이전트 사례로 공유됐다.
- Unsloth 기반 Muse Glimmer 30B Fine-tuning은 기존 FA2 설정과 비교해 학습 속도 1.5배, VRAM 사용량 50% 감소, 24GB VRAM 로컬 실행, GRPO reinforcement learning 지원을 내세웠다. 모델 실행 위치와 학습 자원 요구량을 낮추는 여러 경로가 동시에 제시된 셈이다.
원문 트윗 2개 보기
Md Ismail Šojal
@0x0SojalSec
DeepSeek V4 Flash Running 12 GB phone CPU only. - Model: 284B parameters - Speed: 1 tok/s - Just clever expert streaming from flash storage. - https:// github.com/Helldez/BigMoe OnEdge …
Md Ismail Šojal
@0x0SojalSec
Fine-tune Meta’s new 30B Muse Glimmer model for free, - 1.5× faster training - 50% lower VRAM usage - Native GRPO reinforcement learning support Everything runs locally on 24GB VRAM.
You can now fine-tune Meta Muse Glimmer 30B for free! Our free notebook also supports GRPO RL training. Unsloth trains Muse Glimmer 1.5× faster with 50% less VRAM vs FA2 setups. Train locally with 24GB VRAM. Guide: https:// unsloth.ai/docs/models/mu se-glimmer/train … Notebooks: https:// unsloth.ai/docs/models/mu se-glimmer/train#free-fine-tuning-notebooks …
➖ Qwen 기반 규제 산업용 추론 최적화포스트 1
Alibaba Cloud가 Qwen을 활용한 동남아시아 규제형 AI 사례에서 비용, 출력 품질, 응답 속도, 현지 데이터 준수를 함께 묶었다.
- 규제 환경에서는 강한 모델만으로 충분하지 않고 비용 통제, 낮은 지연 시간, 현지 데이터 규정 준수가 함께 필요하다는 전제가 깔렸다. Alibaba Cloud 포스트는 Qwen을 사용한 ReN3 사례에서 추론 비용 40% 절감, 출력 품질 30% 향상, 응답 속도 30% 개선을 전했다.
- 사용자는 Alibaba Cloud Model Studio에서 Qwen을 시험할 수 있으며, 사례의 최적화 결과는 동남아시아 전반에 걸쳐 측정됐다고 언급됐다. 모델 선택보다 배포 환경과 규정 준수 조건까지 포함한 운영 결과가 평가 기준이 됐다.
➖ @bot을 활용한 개인용 봇 팀 관리포스트 1
@bot에 자신의 활동과 생성한 봇을 조사하게 한 뒤 봇 팀의 변경·추가와 관리 방식을 묻는 개인화된 운영 흐름이 공유됐다.
- 한 요청 안에서 사용자의 활동 정보와 직접 만든 봇을 함께 확인하고, 이 봇들을 팀으로 간주해 현재 구성을 점검하는 방식이다. 이후 필요한 봇의 변경 또는 추가 여부와 팀 관리 방안을 자연어로 묻는 순서가 이어진다.
- 이 흐름은 개별 봇을 따로 호출하는 대신 사용자 정보, 봇 목록, 운영 판단을 하나의 요청에 연결한다. 포스트의 질문은 @bot을 개인 작업 환경을 읽고 봇 구성을 조정하는 인터페이스로 활용하는 사례에 해당한다.
용어 해설
- 오픈 웨이트(Open Weights)
- — 모델 가중치를 공개해 사용자가 직접 내려받고 실행하거나 추가 학습할 수 있는 배포 방식이다. GLM-5.3 관련 포스트에서는 폐쇄형 모델과의 성능 비교 및 로컬 활용 가능성을 가늠하는 기준으로 쓰였다.
- 사후 학습(Post-Training)
- — 기본 모델을 만든 뒤 다양한 작업 데이터와 보상 신호를 활용해 지시 수행, 코딩, 장기 작업 능력을 보완하는 학습 단계다. GLM-5.3은 더 많은 연산을 투입한 사후 학습을 성능 향상의 원인으로 언급했다.
- 터미널 벤치마크(Terminal-Bench)
- — 터미널 환경에서 코드 작성과 실행 같은 장기 작업 수행 능력을 측정하는 평가 기준이다. 포스트에서는 GLM-5.3이 다른 모델보다 높은 결과를 냈다는 근거로 사용됐다.
- 컨텍스트 윈도(Context Window)
- — 모델이 한 요청에서 처리할 수 있는 입력과 출력 토큰의 범위다. GLM-5.3의 Go 지원 소식에서는 1M context가 주요 변경점으로 언급됐고, SuperGLM 계열 포스트에서는 202K context가 언급됐다.
- 전문가 혼합 구조(Mixture of Experts)
- — 모델 전체 파라미터를 매번 모두 계산하지 않고 입력에 맞는 일부 전문가만 활성화하는 구조다. SuperGLM 포스트는 30B-A3B MoE를 총 31B 파라미터와 3B 활성 파라미터로 설명했다.
- GRPO
- — 모델의 응답을 보상 기준으로 비교해 강화 학습에 활용하는 방법이다. Muse Glimmer Fine-tuning 포스트에서는 별도 데이터셋 변경 없이 GRPO reinforcement learning을 지원한다고 언급했다.
- 추론 비용(Inference Cost)
- — 모델이 응답을 생성할 때 발생하는 계산 자원과 사용 비용이다. Alibaba Cloud 포스트에서는 Qwen을 활용한 ReN3 사례에서 추론 비용 40% 절감과 응답 속도 30% 향상을 함께 언급했다.
코드 예제
xor dword [0xf80c2094], 1<<22AMD Family 16h 프로세서의 보안 경계를 무너뜨렸다고 언급된 단일 메모리 쓰기 명령이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
