TL;DR
이번 기간에는 Hy4 preview가 770B 전체·49B 활성 파라미터와 1M context를 앞세워 WorkBuddy, 코딩, 문서 변환, 게임 제작까지 실제 작업 범위를 넓혔고, Tencent 자체 engineering blind test에서 GLM 5.3과 Kimi K3를 소폭 앞섰다는 소식이 나왔습니다. Qwen3.8 Flash Next는 125B MoE·6B 활성 파라미터, 262K context, NVFP4 로컬 실행 경로가 공유됐지만 Qwen3.8-27B와 비교한 게임 수행 결과에서는 기본 조건 처리 격차가 관찰됐습니다. GLM-5.3-Flash는 agentic use case 성능을 겨냥한 configuration update 이후 재시험 요청이 나왔고, Keras는 Cosmic Ray의 원인 추정에 raw spatio-temporal waveform을 직접 입력하는 연구 흐름에 쓰였습니다. 에이전트 연구에서는 Co-Scientist의 실제 실험 확장과 실행 기록·지속형 위키·executable skill을 분리하는 방식이 각각 등장했으며, Airbnb의 Trust 조직은 LangChain과 LangGraph를 prototype에서 표준 production stack으로 확장한 사례를 공유했습니다.
𝕏 실시간 트렌드 토픽
🔥 Hy4 preview의 770B MoE와 1M context 기반 작업 실행포스트 5
Tencent의 Hy4 preview가 공개 weight와 1M context를 바탕으로 코딩·문서 변환·연구·게임 제작 작업에 투입됐습니다.
세부 내용 보기
- Tencent는 Hy4 preview를 770B total, 49B active, 1M context의 open-weight MoE로 공유했으며, 긴 시간 이어지는 코딩과 복잡한 문서의 deck·sheet 변환, multi-session research를 겨냥한 구성입니다. 전체 파라미터와 활성 파라미터를 나눠 표기해 모델 규모와 실제 토큰 처리 경로를 함께 드러냈습니다.
- Hy4 preview는 WorkBuddy에서 2주간 무료로 제공됐고, research tasks, Office tasks, frontend development, game development를 포함한 agent workflow에 투입됐습니다. 별도 사례에서는 prompt를 playable browser-based FPS game으로 바꾸고, webcam-controlled lightsaber game도 만들었으며, Tencent는 training pipeline과 kernels 최적화에도 Hy4 preview를 활용했다고 밝혔습니다.
- Tencent 자체 engineering blind test에서는 Hy4 preview가 GLM 5.3과 Kimi K3를 소폭 앞섰다고 전해졌지만, 이 비교는 Tencent 자체 평가라는 조건이 붙습니다. 긴 context와 코드·문서·게임을 한 모델에 묶은 배치가 실제 업무형 에이전트 실행에서 어떤 범위를 커버하는지 가늠하게 하는 사례입니다.
원문 트윗 2개 보기
Md Ismail Šojal
Another new open model from China today, There is no rest in AI. Hy4 preview is Tencent’s new open flagship & Slightly outperformed GLM 5.3 and Kimi K3 on Tencent’s own engineering blind test. - 770B total - 49B active - 1M context Tencent built this for real work: long-horizon coding, messy docs to decks and sheets, game prototypes, multi-session research.
Md Ismail Šojal
Tencent’s Hy4 AI model turns a prompt from into a playable browser-based FPS game.
Another new open model from China today, There is no rest in AI. Hy4 preview is Tencent’s new open flagship & Slightly outperformed GLM 5.3 and Kimi K3 on Tencent’s own engineering blind test. - 770B total - 49B active - 1M context Tencent built this for real work:
📈 Qwen3.8 Flash Next의 NVFP4 로컬 실행과 게임 수행 격차포스트 2
Qwen3.8 Flash Next의 연구용 open-weight 구성과 Qwen3.8-27B의 게임 수행 결과가 함께 공유되며, 차세대 구조의 기능과 한계가 드러났습니다.
세부 내용 보기
- Qwen3.8 Flash Next는 NVFP4와 Zero Refusal을 적용한 local-run용 research/red-team weight로 공유됐습니다. 125B MoE 중 6B active, 51B n-gram table의 RAM 배치, 262K context, vision·tools, GDN·sparse attention, 공식 serve command의 tensor parallel 4라는 실행 조건이 함께 제시됐습니다.
- 게시물은 refusal direction을 residual stream에서 제거한 구성을 언급하면서도 이 weight를 raw chatbot deployment용이 아닌 research/red-team 용도로 규정했습니다. 모델 구조, 메모리 배치, serving 병렬화가 한 번에 묶여 있어 기능 확장과 로컬 실행 조건을 함께 살필 수 있는 사례입니다.
- Cosmic Dodge 게임에서는 Qwen3.8-27B가 one-shot으로 승패 조건을 처리하고 polish했지만, Qwen3.8-Flash-Next는 여러 차례 시도 뒤에도 기본 win/lose condition에 어려움을 겪었다고 전해졌습니다. 같은 계열의 더 큰 차세대 구조가 모든 작업에서 이전 모델을 즉시 대체하지는 않는다는 비교 결과입니다.
원문 트윗 2개 보기
Md Ismail Šojal
Uncensored Qwen3.8 Flash Next just dropped in NVFP4 with Zero Refusal for local run. That’s the Qwen4 architecture preview 125B MoE, 6B active, - 51B n-gram table you can park in RAM, - 262K context, - vision + tools with the refusal direction ripped out of the residual stream. - GDN + sparse attention, - Tensor parallel in the official serve command is 4. This is a research/red-team weight, not a chatbot you deploy raw.
Md Ismail Šojal
Interesting gap in the new Qwen3.8 lineup. Qwen3.8-27B handled Cosmic Dodge game impressively one shot & polish. Qwen3.8-Flash-Next struggled with basic win/lose conditions even after multiple tries. Looks like Qwen4 still has work to do before it replaces 3.8. https:// x.com/TeksEdge/statu s/2093128931004002737/video/1 …
📈 GLM-5.3-Flash의 agentic use case 설정 업데이트포스트 2
GLM-5.3-Flash가 특정 agentic workflow의 성능 개선을 위한 configuration update를 거쳤고, iPhone에서 실시간 코드 수정 사례가 공유됐습니다.
세부 내용 보기
- GLM-5.3-Flash는 일부 agentic use case에서의 성능 개선을 목표로 configuration update가 배포됐습니다. 8월 26일부터 27일 사이 workflow에서 Ox Alpha보다 낮은 성능을 경험한 사용자에게 업데이트 후 재시도를 요청하는 방식으로 변화가 전달됐습니다.
- 별도 사례에서는 GLM-5.3-Flash가 작은 iPhone 4에서 iOS layout bug를 진단하고 파일을 patch한 뒤 작동하는 virtual cigarette UI를 배포했다고 전해졌습니다. 입력된 앱 상태에서 문제를 찾고 코드 파일을 수정한 다음 실행 가능한 결과로 이어지는 agent workflow입니다.
- 업데이트 게시물의 근거는 구체적인 benchmark 수치가 아니라 특정 기간의 workflow 재시험 요청이며, iPhone 사례도 단일 실행 사례입니다. 따라서 이번 변화의 의미는 일반 성능 순위보다 설정 변경이 agentic 작업과 기기 내 코드 수정 경험에 직접 연결됐다는 점에 있습니다.
원문 트윗 2개 보기

Zixuan Li
Yesterday, we rolled out a configuration update for GLM-5.3-Flash to improve performance in some agentic use cases. If it underperformed Ox Alpha in your workflow between August 26 and 27, please give it another try and let us know if the experience has improved.
Md Ismail Šojal
GLM-5.3-Flash on a tiny iPhone 4, debugging an iOS layout in real time. It diagnosed the bug, patched the files, then shipped a working virtual cigarette UI.
➖ Keras로 Cosmic Ray 원인을 추정하는 raw waveform 모델링포스트 1
Cosmic Ray의 기원을 찾는 역문제에 Keras를 적용해 사람이 만든 feature 대신 검출기의 raw spatio-temporal waveform을 직접 모델링하는 연구가 공유됐습니다.
세부 내용 보기
- 지상 기반 detector array에서 Cosmic Ray의 기원인 초신성이나 블랙홀 등을 추적하는 일은 어려운 inverse problem으로 제시됐습니다. 기존 방식은 사람이 hand-crafted feature를 설계하는 단계가 필요했지만, 해당 연구는 검출기에서 들어온 원시 시공간 파형 자체를 모델 입력으로 삼는 방향을 택했습니다.
- Keras를 사용해 raw spatio-temporal waveform에서 패턴을 직접 학습하면, 수작업 feature 추출을 거치지 않고 파형의 시간·공간 정보를 모델 처리 경로에 넣을 수 있습니다. 출력은 관측 신호를 만든 Cosmic Ray의 가능한 기원 추정으로 이어집니다.
- 게시물은 이 접근의 구체적인 정확도나 benchmark 수치를 제시하지 않았습니다. 대신 hand-crafted feature 중심 처리에서 raw waveform 직접 모델링으로 입력 경로를 바꾼 점이, 천체입자물리의 복잡한 원인 추정 문제에 Keras를 적용한 핵심으로 남습니다.
➖ Co-Scientist의 시뮬레이션 밖 실제 과학 실험 확장포스트 1
Google DeepMind의 Co-Scientist 연구가 에이전트를 simulation 환경에서 real-world experiment로 확장한 결과를 다뤘습니다.
세부 내용 보기
- Google DeepMind의 Co-Scientist 관련 연구는 과학 연구용 agent를 시뮬레이션에 한정하지 않고 실제 실험으로 옮긴 결과로 공유됐습니다. 에이전트가 계산 환경의 답변에 머무르지 않고 연구 과정의 실험 단계와 연결되는 흐름입니다.
- 게시물에 따르면 computer science 분야에서 Co-Scientist는 inference-time scaling architecture를 찾았고, 해당 구조가 HealthBench Hard에서 여섯 개 frontier model을 앞섰습니다. 탐색 과정에서 추론 시점의 확장을 활용해 구조를 찾고, benchmark 비교로 결과를 평가한 사례입니다.
- 구체적인 점수와 실제 실험의 세부 절차는 게시물에 포함되지 않았습니다. 다만 Co-Scientist를 real-world experiments로 확장했다는 점과 HealthBench Hard 비교 결과가 과학 연구 에이전트의 적용 범위를 가늠하는 근거입니다.
➖ 에이전트 경험을 지속형 위키로 축적하는 skill evolution포스트 1
한 연구는 실행 기록·축적 지식·executable skill을 분리하고, 이후 skill 업데이트가 지속형 위키를 기반으로 이어지게 하는 구조를 제안했습니다.
세부 내용 보기
- Skill-evolution system이 raw execution trace, persistent wiki of accumulated knowledge, executable skill을 하나로 뭉개는 문제가 출발점입니다. 이 연구는 세 요소를 분리해 실행 과정은 기록으로 남기고, 축적된 경험은 위키로 정리하며, 실제 동작 단위는 executable skill로 관리하는 흐름을 사용합니다.
- 에이전트의 경험을 wiki에 consolidate한 뒤 다음 skill update가 흩어진 optimization history가 아니라 해당 wiki를 입력으로 삼도록 연결합니다. 이렇게 하면 과거 실행에서 얻은 지식이 이후 skill 수정 과정에 지속적으로 전달됩니다.
- Ablation 결과는 wiki가 성능 향상의 큰 부분을 운반한다고 확인했으며, skill을 진화시킨 작은 모델이 skill 없이 사용한 훨씬 큰 모델을 앞섰습니다. 또한 한 모델이 진화시킨 skill이 다른 model family로 전이됐고, 때로는 자기 자신이 만든 skill보다 다른 모델이 만든 skill이 더 나은 결과를 냈습니다.
- 이 구조는 에이전트 성능을 매번 새로 최적화하는 대신 실행 경험을 지속 지식으로 바꿔 다음 업데이트에 재사용하는 경로를 제시합니다. 모델 크기와 skill 품질을 분리해 볼 수 있다는 점에서 skill library를 운영하는 시스템의 설계 기준이 됩니다.
➖ Airbnb Trust 조직의 LangChain·LangGraph production stack 전환포스트 1
Airbnb Trust 조직이 LangChain과 LangGraph를 사용해 prototype을 표준화된 production stack으로 확장한 사례가 공유됐습니다.
세부 내용 보기
- Airbnb의 Trust 조직은 오류 비용이 큰 도메인에서 만든 prototype을 LangChain과 LangGraph 기반의 standardized production stack으로 확장했습니다. 실험용 구현을 운영 표준으로 옮기는 과정이 핵심 맥락이며, Trust 업무의 높은 정확성 요구가 배경으로 제시됐습니다.
- 게시물은 조직이 LangChain과 LangGraph를 production stack에 사용했다고 밝혔지만, 입력 데이터 처리나 graph 구성, 배포 규모 같은 구현 세부사항은 공개하지 않았습니다. 따라서 확인 가능한 구현 경로는 prototype에서 standardized stack으로의 전환과 두 도구의 사용입니다.
- 이 사례는 agent workflow를 단일 prototype에 머무르게 하지 않고 조직 단위의 운영 스택으로 정착시키는 방향을 보여줍니다. 다만 성능 수치나 오류율 변화는 게시물에 없어 기술적 효과를 수치로 비교할 근거는 없습니다.
➖ Wan 3.0의 Video Edit Arena 데뷔와 1414 pts포스트 1
Wan 3.0이 Video Edit Arena 첫 참가에서 1414 pts로 1위를 차지하며 영상 편집 모델 순위에 진입했습니다.
세부 내용 보기
- Wan 3.0은 Video Edit Arena에 처음 참가했고, 해당 평가에서 1414 pts로 1위를 차지했습니다. Arena는 영상 편집 모델을 점수와 순위로 비교하는 장이므로, 이번 결과는 데뷔 모델의 상대적 위치를 수치로 드러냅니다.
- 인용된 Arena 게시물에 따르면 Wan 3.0은 dreamina-seedance-2.5보다 4 pts, MiniMax-H3보다 22 pts 높았습니다. 모델별 결과를 동일한 순위표에서 비교하는 방식으로 점수 차이가 산출됐습니다.
- 이번 포스트는 Arena 순위와 점수만 전달하며 영상 편집의 세부 기능이나 평가 샘플 처리 과정은 밝히지 않았습니다. 따라서 확인 가능한 의미는 Wan 3.0이 새 평가판에 합류하자마자 선두 점수를 기록했다는 점입니다.
용어 해설
- Mixture of Experts
- — 전체 파라미터 중 일부 전문가 모듈만 선택해 입력을 처리하는 모델 구조입니다. Hy4 preview는 770B 전체 파라미터와 49B 활성 파라미터를 함께 제시해, 큰 총규모와 실제 연산 규모를 분리해 나타냈습니다.
- NVFP4 양자화(NVFP4)
- — 모델 가중치와 연산을 낮은 비트 수로 표현해 메모리 사용량과 실행 비용을 줄이는 방식입니다. Qwen3.8 Flash Next는 NVFP4 형식의 로컬 실행용 weight로 공유됐습니다.
- 역문제(Inverse Problem)
- — 관측된 결과에서 이를 만든 원인이나 조건을 거꾸로 추정하는 문제입니다. Cosmic Ray 연구에서는 지상 검출기 배열이 얻은 시공간 파형으로 초신성이나 블랙홀 관련 기원을 추정합니다.
- 지속형 위키(Persistent Wiki)
- — 에이전트의 실행 기록에서 축적된 지식을 별도 문서 구조에 계속 저장하는 방식입니다. 이후 skill 업데이트가 흩어진 최적화 이력이 아니라 이 위키를 바탕으로 진행되도록 연결합니다.
- Video Edit Arena
- — Video Editing 모델의 결과를 점수와 순위로 비교하는 평가 장입니다. Wan 3.0은 데뷔와 함께 1414 pts로 1위를 차지했고, Dreamina-Seedance-2.5보다 4점 높았습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.