TL;DR
이번 기간에는 Qwen3.8 계열을 중심으로 12GB·24GB급 로컬 하드웨어에서 추론, 보안 연구, 코드 생성과 에이전트 실행을 시도하는 사례가 이어졌습니다. 에이전트 쪽에서는 Sol과 Luna의 모델 위임, Hermes Bot Mode, sandbox·channel·middleware·evals 같은 실행 구성요소, DeepSeek Harness의 급격한 GitHub 성장과 같은 흐름이 함께 나타났습니다. 추론 단계에서는 Chain of Thought부터 MCTS까지 후보 생성과 선택을 조합하는 8가지 방법이 정리됐고, 선택기의 검증 신호가 탐색 규모보다 먼저 갖춰져야 한다는 결론이 나왔습니다. Watermarking은 EU AI Act 준수와 편집을 통한 제거 가능성, 코드 출력 영향이 쟁점이 됐으며, ExtractBench는 복잡한 기업 문서 추출에서 상용 VLM의 누락·환각 문제를 측정하는 benchmark로 제시됐습니다.
𝕏 실시간 트렌드 토픽
📈 Qwen3.8 계열의 저사양 로컬 실행 확장포스트 6
Qwen3.8 계열을 12GB VRAM 환경의 보안 연구부터 24GB 카드의 게임 코드 생성까지 로컬에서 실행했다는 포스트가 이어졌습니다. MoE 구성, 거부 방향 제거, 262K context와 도구·비전 기능 보존이 핵심 근거로 제시됐습니다.
- Qwen3.8 관련 포스트는 8~16GB VRAM에 맞춘 35B 총 파라미터·3B 활성 구조와 12GB에서 실행되는 27B 보안 연구 모델을 함께 다뤘습니다. 입력 하드웨어 제약에 맞춰 활성 파라미터와 양자화 모델을 선택하고, 로컬 환경에서 코드 리뷰·취약점 분석·agentic DFIR을 수행하는 흐름이며, 27B 모델에는 262K context와 비전·도구·추론 기능이 보존됐다고 적혔습니다. 이는 고사양 서버 없이도 특정 연구 작업을 로컬에서 처리하려는 사용 패턴을 뒷받침합니다.
원문 트윗 2개 보기
Md Ismail Šojal
@0x0SojalSec
Uncensored Qwen3.8 27B specifically for red teaming & security research run on your computer locally, - 262K context - Refusal rate Near-zero : collapsed across AdvBench, HarmBench, StrongREJECT, etc. - Capability: almost fully retained - Ready for real red teaming - MMLU/ GSM8K/ CMMLU barely moved - Vision, tools, reasoning, and 262K context all preserved They didn’t just jailbreak it. They surgically removed the refusal direction from Qwen3.8 27B and re-quantized it to official FP8.
Md Ismail Šojal
@0x0SojalSec
Wtf, Qwen3.8 27B wrote the entire a fully playable 3D FPS game locally in the browser. Setting: elegant Chinese lotus courtyard Targets: floating porcelain drones Ornate weapon. Smooth controls: mouse lock, sprint, reload, hold Z for scope. Everything you see was generated by Qwen3.8 27B (code) https:// x.com/MaziyarPanahi/ status/2088616278470570400/video/1 …
🔥 모델 위임과 로컬 실행을 잇는 에이전트 하네스포스트 6
Sol이 Luna 에이전트 집합을 관리하고 모델 간 위임을 수행하는 기능, Hermes Bot Mode와 세션 기능, managed deep agents의 실행 구성요소가 한 흐름으로 묶였습니다. DeepSeek Harness의 GitHub 성장과 Grok이 직접 밝힌 미지원 기능은 에이전트 실행층의 범위를 가르는 기준이 됐습니다.
- 에이전트 시스템의 병목은 단일 모델의 응답보다 여러 모델과 도구를 연결하는 실행층에 놓였습니다. Sol은 지원 모델을 포함한 Luna 에이전트에 작업을 위임하고, managed deep agents는 외부 메신저 연결인 channel, 안전한 파일시스템을 갖춘 sandbox, 에이전트 루프를 제어하는 middleware, 반복 평가를 위한 evals를 조합합니다. Hermes Bot Mode와 세션 탭은 데스크톱 사용 흐름에 이 기능을 붙이는 사례이며, Grok은 지속 메모리·병렬 봇·자연어 일정 기능은 지원하지만 자율 학습 루프, 20개 이상 플랫폼 gateway, 완전한 MIT 오픈소스 로컬 실행은 아직 빠졌다고 밝혔습니다. DeepSeek Harness는 이 실행층에 대한 관심을 2일 만에 GitHub stars 114,000개라는 수치로 드러냈습니다.
원문 트윗 2개 보기
Tibo
@thsottiaux
Let Sol manage an efficient fleet of Luna agents for you. These models know each other well and collaborate to achieve the result in an incredibly fast and efficient way.
This went under the radar this week, but we just shipped the ability for models with multi agents v2 to delegate to any supported model, including Luna! Took a bit of time to make sure this worked reliably
Md Ismail Šojal
@0x0SojalSec
114,000 GitHub stars in just 2 days. DeepSeek Harness just became the fastest-rising open-source project in GitHub history. faster then OpenClaw/Linux
➖ Watermarking의 규제 준수와 출력 편집 문제포스트 3
Watermarking 구현이 EU AI Act 준수와 연결되면서 주요 모델 개발사들의 참여가 언급됐습니다. 동시에 편집으로 신호를 숨길 수 있는지와 코드 출력에 어떤 영향을 주는지가 남은 쟁점으로 떠올랐습니다.
- Watermarking은 AI 출력에 식별 신호를 넣어 생성물의 출처를 판별하려는 장치이며, Tim Dettmers의 포스트는 EU AI Act 준수를 위해 이를 구현한다고 밝혔습니다. 다른 주요 모델 개발사들도 같은 Code of Practice에 서명해 구현에 참여한다고 전해졌지만, 실제 방식은 제시되지 않았습니다. TechCrunch 포스트는 편집으로 신호를 숨길 수 있는지, 코드에도 같은 방식이 적용되는지를 물어 규제 목적과 기술적 견고성 사이의 검증 과제를 남겼습니다.
EU AI Act 준수를 위해 Watermarking을 도입해야 한다는 입장입니다. 주요 모델 개발사들이 같은 Code of Practice에 서명했다는 점이 근거로 언급됐습니다.
편집으로 Watermarking을 숨길 수 있다면 식별 장치의 실효성이 약해질 수 있고, 코드 출력에 적용할 때 별도 문제가 생길 수 있다는 우려입니다.
원문 트윗 2개 보기
Tim Dettmers
@Tim_Dettmers
We’ve written an FAQ to answer some of the questions we've received about watermarking. In summary: • We’re implementing watermarking to comply with the EU AI Act. Other major model developers have signed the same Code of Practice and will also be implementing watermarking;
TechCrunch
@TechCrunch
How will the watermarking actually work? Can it be hidden with editing? And how does this affect code?
➖ 추론 시간 확장의 성능 상한과 검증 신호포스트 1
Inference 단계에서 Chain of Thought, Majority Voting, Best-of-N, Extended Thinking, Tree of Thought, Beam Search, MCTS 등을 조합하는 방법이 정리됐습니다. 더 많은 샘플과 긴 추론이 항상 정확도를 높이지 않으며, selector가 실제 정답보다 proxy 점수를 최적화할 수 있다는 한계가 핵심입니다.
- 학습을 다시 하지 않고 정확도를 높이려면 같은 프롬프트를 여러 번 샘플링하거나 하나의 추론 경로를 길게 확장할 수 있습니다. 병렬 샘플은 토큰·GPU 사용량을 늘리지만 지연 증가가 작고, 순차 추론은 앞선 토큰에 의존해 지연 시간이 직접 늘어납니다. Majority Voting은 분산을 줄여도 같은 오독을 반복하는 편향은 고치지 못하며, Best-of-N과 Beam Search는 탐색 규모가 커질수록 reward model이 정답보다 점수 패턴을 만족하는 답을 고르는 문제가 생깁니다. GSM8K에서 GPT-3.5의 Self-refinement는 오답 7.6%를 고쳤지만 정답 8.8%를 망가뜨렸고, 이에 따라 탐색 확장보다 compiler·test suite 같은 검증 신호를 먼저 설계해야 한다는 결론으로 이어졌습니다.
➖ ExtractBench가 겨냥한 복잡한 기업 문서 추출포스트 1
ExtractBench는 페이지 길이, 필드 수, 분야와 작업 유형이 크게 다른 실제 기업 문서 추출을 평가 대상으로 삼았습니다. 긴 문서와 고밀도 표에서 상용 VLM이 누락값과 환각값을 내놓는 문제가 benchmark의 배경이 됐습니다.
- 기업 문서 추출은 한 페이지에서 1~10개 필드를 찾는 needle-in-a-haystack 작업부터 페이지당 100~1,000개 필드와 수백 페이지를 다루는 long-lists까지 입력 분포가 넓습니다. 상용 VLM은 파산 채권자 목록처럼 긴 문서에서 attention을 잃어 대규모 누락·환각 구간을 만들 수 있으며, ExtractBench는 이런 문서를 필드 수와 페이지 길이, 작업 유형별로 나눠 평가합니다. 포스트는 해당 taxonomy와 Figure 6, ArXiv 논문을 함께 제시해 production 문서 추출의 실패 양상을 별도 benchmark로 측정할 필요를 뒷받침했습니다.
➖ MiniMax H3의 로컬 영상 생성포스트 2
MiniMax H3를 RTX 3090 같은 단일 로컬 GPU에서 실행해 text-to-video, image-to-video, reference-to-video와 native stereo audio를 생성했다는 사례가 나왔습니다. 24GB 카드와 31GB 시스템 RAM에서 15초 영상을 완성했다는 하드웨어 조건도 함께 제시됐습니다.
- 로컬 영상 생성 사례는 MiniMax H3를 자체 하드웨어에서 실행해 텍스트·이미지·참조 영상을 입력으로 받고 stereo audio가 포함된 영상을 출력하는 흐름입니다. 포스트는 RTX 3090에서 해당 수준의 생성이 가능하다고 적었고, 별도 포스트에서는 단일 24GB 카드와 31GB 시스템 RAM으로 15초 생성을 완료했다고 밝혔습니다. 모델명과 실행 조건이 함께 제시돼 영상 생성 모델의 로컬 배포 가능성을 하드웨어 기준으로 비교할 수 있게 했습니다.
원문 트윗 2개 보기
Md Ismail Šojal
@0x0SojalSec
basically, you can generate this level quality of Ai-video locally on RTX 3090 MiniMax H3 runs on your own hardware for text-to-video, image-to-video, and reference-to-video with native stereo audio.
Md Ismail Šojal
@0x0SojalSec
Complete 15s generations on a single 24 GB card with only 31 GB system RAM, -
➖ AI Engineering 역량의 네 가지 축포스트 1
Andrew Ng이 10,000개 이상의 채용 공고 분석과 전문가 인터뷰를 바탕으로 AI Engineering 역량 지도를 제시했다는 포스트가 공유됐습니다. AI 애플리케이션 구축·배포, Software Engineering 기초, coding agents 활용, 제품 감각이 네 축으로 묶였습니다.
- AI Engineering 역량은 모델 자체보다 애플리케이션을 실제로 만드는 실행 능력에 맞춰 분류됐습니다. 제시된 네 영역은 AI 애플리케이션 구축·배포, Software Engineering fundamentals, coding agents를 효과적으로 사용하는 능력, build의 방향을 정하는 product sense이며, 10,000개 이상의 채용 공고와 전문가 인터뷰가 분류 근거로 언급됐습니다. 포스트는 이를 2026년의 역량 지도라는 형태로 공유해 개발·배포와 제품 판단을 함께 요구하는 역할 범위를 나타냈습니다.
➖ 소형 모델의 Hyperparameter 민감도포스트 1
Meta 논문을 바탕으로 4M 파라미터 규모에서도 Scaling laws가 나타나지만 Hyperparameter 조정이 충분해야 한다는 해석이 공유됐습니다. 모델 규모가 커질수록 손실 지형이 저차원화돼 하나의 유효 조정 방향에 가까워진다는 내용이 핵심입니다.
- 소형 모델이 대형 모델의 Scaling law를 따르지 못하는 이유를 모델 크기 자체가 아니라 조정 부족으로 해석하는 연구가 소개됐습니다. 4M parameter 모델에서도 Hyperparameter를 충분히 조정하면 Scaling laws가 나타났고, 규모가 커질수록 hyperparameter loss surface가 저차원화돼 하나의 유효한 tuning direction에 가까워졌다는 결과가 언급됐습니다. 따라서 작은 모델의 성능 비교에서는 구조와 데이터뿐 아니라 조정 수준을 같은 조건으로 맞춰야 한다는 의미가 남습니다.
용어 해설
- Mixture of Experts
- — 전체 파라미터를 모두 실행하지 않고 여러 전문가 모듈 중 일부만 선택해 입력을 처리하는 구조입니다. Qwen3.8-35B-A3B에서는 총 35B 파라미터 중 3B만 활성화하는 방식으로 언급됐습니다.
- 거부 방향 제거(Refusal Direction Removal)
- — 안전 거부 반응과 연결된 가중치 방향을 제거해 특정 요청에 대한 거부율을 낮추는 조정 방식입니다. Qwen3.8 27B 사례에서는 Fine-tuning이나 LoRA 없이 적용됐다고 전해졌습니다.
- 에이전트 실행 하네스(Agentic Harness)
- — 모델이 도구를 호출하고 작업을 반복 수행하도록 실행 상태, 메모리, 병렬 작업과 같은 주변 제어층을 묶은 구조입니다. 이번 포스트에서는 로컬 모델의 실행 속도와 기능 범위를 비교하는 맥락에 쓰였습니다.
- 워터마킹(Watermarking)
- — AI가 생성한 출력에 식별 가능한 신호를 삽입해 생성물의 출처를 판별하려는 기술입니다. EU AI Act 준수를 위한 구현과 편집을 통한 제거 가능성, 코드 출력에 미칠 영향이 함께 제기됐습니다.
- 추론 시간 확장(Inference-Time Scaling)
- — 모델을 다시 학습하지 않고 여러 후보를 샘플링하거나 한 추론 경로를 길게 확장해 답변 품질을 높이는 방법입니다. 후보 선택기의 품질과 토큰·GPU 비용, 지연 시간이 성능 상한을 좌우합니다.
- 비전 언어 모델(VLM)
- — 이미지와 텍스트를 함께 입력받아 문서의 시각 정보와 내용을 처리하는 모델입니다. 긴 문서나 페이지당 추출 필드가 많은 업무 문서에서는 누락값과 환각값이 늘어나는 문제가 언급됐습니다.
- Monte Carlo Tree Search(MCTS)
- — 유망한 경로를 확장하고 완성 답변까지 시뮬레이션한 뒤 점수를 경로에 되돌려 보내는 탐색 방식입니다. 노드 확장 상한이 있으면 탐색이 국소 최적해에 머물 수 있다는 한계가 제시됐습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
