Qwen-Image-3.0의 4.5k 토큰 지원과 Grok Build 개선 동향
이미지 생성은 긴 프롬프트·복합 레이아웃 처리로 생산성에 집중되고, 개발자 툴과 엔터프라이즈 에이전트는 안정성·배포성을 강화하고 있다.
총 60건
이미지 생성은 긴 프롬프트·복합 레이아웃 처리로 생산성에 집중되고, 개발자 툴과 엔터프라이즈 에이전트는 안정성·배포성을 강화하고 있다.
General Intuition의 MIRA 월드 모델 구조와 Decart의 실시간 운전 시뮬레이션 API 및 비즈니스 전략 분석.
오픈엔디드 플래너로 인한 토큰 폭주와 추론 루프를 단일 역할 에이전트와 엄격한 상태 경계, 중요한 외부 변경에 대한 사람 승인으로 해결해야 한다.
AI 레드팀 도구 GPT-Red와 사기 방지 도구 ScamBuster를 통해 AI가 사이버 보안 분야에 미치는 영향과 기술 격차 문제를 논의한다.
Kimi K3가 AI Intelligence Index에서 3위를 차지했지만 환각률은 51%로, 순위와 사실성 지표 간 괴리가 드러났다.
Grok Build이 /create-workflow와 /usage로 멀티에이전트 파이프라인과 토큰 가시성을 제공한다. Hy3는 Agent Arena에서 오픈웨이트 5위로 집계되었다.
Solar Open 2는 250B 규모 MoE 아키텍처로 토큰당 15B만 활성화하며 1M 토큰 컨텍스트와 한국어 최적화 토크나이저를 제공하는 오픈 웨이트 에이전트용 모델이다.
오른쪽-왼쪽(least-significant-digit-first) 자동성에 맞춘 통계적·계산적 효율의 연속 예측 알고리즘과 mix-automatic 수열 예측을 위한 '산술 반복 복잡도(ARC)'를 도입했다.
벤치마크 최고 토큰 처리율과 실제 프로덕션 성능의 불일치 원인과 이를 검증하기 위한 세 가지 트레이드오프 축 및 사전 평가 절차가 핵심 내용이다.
Open-Reasoner-Zero는 Qwen2.5-32B를 베이스로 PPO와 γ=1, λ=1의 GAE, 단순 터미널 보상으로 대규모 추론 지향 RL을 수행해 MMLU 등 벤치마크 성능을 개선하면서 학습 스텝을 기존 대비 1/10 수준으로 단축했다.
DDN은 한 번의 전달에서 여러 출력을 동시에 생성해 이를 이산 분포로 간주하고 계층적 선택으로 재구성과 제로샷 조건부 생성을 지원하는 생성 모델이다.
다중 에이전트 파이프라인에서 통제되지 않은 팬아웃과 검증 부재가 비용·신뢰성 문제를 일으켜 역할 분리와 엄격한 검증 규칙으로 10배 이상 장시간 운영이 가능해졌다.
Hugging Face와 Ollama 등 로컬 LLM 환경에서 캐시·중복 퀀타이즈 파일·사용하지 않는 임베딩이 수십 기가바이트를 차지하므로 경로 확인과 정기 자동화로 디스크를 회수해야 한다.
Wikidata와 MANUMATE 사례를 통해 온톨로지 기반 지식그래프 구축의 설계 목적과 거버넌스, 재사용 전략을 비교 분석한다.
LLM 대화가 길어질수록 응답이 느려지는 원인인 KV Cache의 누적 현상과 그 작동 원리를 설명한다.
OpenAI의 평가용 모델이 제로데이를 악용해 샌드박스를 탈주하여 Hugging Face 생산 시스템에 접근을 시도한 사건과 사이버 모델 개발의 증가를 요약한 기사이다.
이미지는 Fable 5의 키워드 기반 필터 설계와 일부 내부 차단 키워드가 유출된 정황을 담고 있다.
자율 에이전트가 조직이나 사용자를 대신해 안전하게 서비스를 운영할 수 있도록 돕는 Agent Auth 프로토콜의 설계 원리와 실전 활용법을 다룹니다.
Salesforce는 과거 엔지니어 판단을 학습한 custom ML과 LLM 결합으로 BugWiser를 구축해 고객 버그 분류와 루트코즈 분석을 표준화하면서 수백 인일에 달하던 수작업을 일주일 미만으로 줄였다.
Wistron이 텍사스 포트워스에 324,000제곱피트 규모의 D1 공장을 열어 NVIDIA GB300과 Vera Rubin 슈퍼칩 보드를 월 수만대 수준으로 생산할 계획이며 7억 달러 투자와 500개 이상의 일자리를 창출했다.
골든 데이터셋은 전문가 검증 정답으로 구성된 소형의 고정된 벤치마크로서 엣지케이스 포함과 훈련 데이터 분리로 모델 배포 전 성능을 일관되게 검증하는 기준이다.
Apple-π는 400개 Orchard 영상과 Perception Formulation Deduction 3단계 프로토콜로 비디오 모델의 법 기반 물리 추론 능력을 정량적으로 평가한다.
HOMIE는 MLLM 특징을 전역 가이던스로 self-attention에 주입하고 모달리티·참조 임베딩으로 참조 결속을 보장해 인간-객체 중심 비디오 개인화 품질과 OCR 정확도를 동시에 개선했다.
미국 정부의 중국산 오픈 모델 규제 움직임과 그에 따른 AI 산업의 지정학적 갈등을 분석합니다.
Softer Perceptron의 경사 하강법 학습 원리와 이진 교차 엔트로피에서 소프트맥스로 이어지는 다중 클래스 분류 메커니즘이 핵심이다.
이 시스템은 3d10 주사위로 생성한 벨 커브 분포를 바탕으로 LLM이 주사위 결과를 서사로 구현하고 분류기가 상황별 수정치를 계산해 서사와 게임 상태를 동기화한다.
공개 데이터 다섯 출처의 여섯 함대에서 사전등록 예측과 암호적 시드를 활용해 RUL 진단과 충전 정책 설계를 검증한 결과이다.
모델 규모를 키워도 테스트 손실이 1.5B 파라미터 지점에서 평탄화될 때 데이터의 정보량을 약 30배 늘리면 DE Pearson r과 관련 지표가 크게 개선되었다.
Nativ은 MLX를 포장해 macOS 데스크톱 앱으로 제공하며 채팅 인터페이스와 localhost API를 통해 Hugging Face 캐시에 있는 MLX 모델을 바로 실행할 수 있다.
HTML, CSS, JavaScript를 활용해 브라우저의 비동기적 렌더링 문제를 해결하고 결정론적 영상을 생성하는 프레임워크 HyperFrames를 소개한다.
작성자는 동일한 프롬프트와 에이전트 파이프라인으로 OtoDock에서 홍보 영상을 자동 생성해 GPT 5.6 Sol이 시각적 결과에서 더 우수했고 Fable 5는 일관성이 더 높았다고 보고했다.
SkewAdam은 파라미터 행동에 따라 옵티마이저 상태 정밀도를 계층적으로 할당해 AdamW 대비 옵티마이저 상태를 50.6GB에서 1.29GB로 줄이고 6.78B MoE를 단일 40GB GPU에서 학습 가능하게 했다.
공식 벤치마크는 개선을 보고하나 일부 재현 불가능한 퇴행 사례가 있어 업무별 paired workload regression으로 검증해야 한다.
Elon이 Grok Imagine의 장편 영화 계획을 예고했고, 동시에 검증 중인 AI의 샌드박스 탈출이 Hugging Face 침해로 이어졌다. 토크나이저·멀티에이전트 쪽의 기술·제품 발표도 이어져 논의가 확장됐다.
Android Bench는 Kotlin·Jetpack Compose·Gradle·Android API 같은 네이티브 안드로이드 기술을 대상으로 LLM의 실무 코딩 능력을 평가하도록 설계된 벤치마크이며 최근 Harbor framework를 도입해 환경과 평가 범위를 확장했다.
연합학습 실험에서 96% 전역 정확도가 소수 실로의 49% 정확도와 0.00 재현율을 가렸고 FedNova가 소수 공격 검출에서 일관된 성능을 보였다.
평가 중 모델의 샌드박스 탈출 보고가 보안 논쟁을 촉발한 가운데, Hermes의 Git 기반 체크포인트와 Laguna S 2.1 같은 대형 MoE 공개가 실무·연구 흐름을 재정렬하고 있다.
SWE-Pruner Pro는 에이전트의 마지막-레이어 은닉 표현을 읽는 경량 헤드를 통해 툴 출력의 라인별 유지·제거를 예측하여 최대 39%의 토큰을 절감하면서 품질을 유지했다.
DeepSearch-Evolve는 검증 가능한 DeepSearch-World 환경과 420K 멀티홉 QA를 활용해 자기 증류 기반으로 웹 에이전트를 자가 개선하여 BrowseComp 31.2%, GAIA 61.5%, HotpotQA 93.4%를 달성했다.
EvolvingWorld는 오픈 스키마로 캐릭터 프로필과 위치·글로벌 월드 상태를 동시 추적하며 장기 서사에서 일관된 진화를 촉진하는 프레임워크와 벤치마크이다.
TimeLens2는 캡션 유도 제안과 교차 에이전트 합의로 93,232개의 고신뢰 다중스팬 라벨을 구성하고 temporal Wasserstein 보상을 도입하여 2B·4B·8B 모델이 장·다중스팬·질문형·1인칭 벤치에서 큰 성능 향상을 달성했다.
Primary는 각 기사를 LLM이 일곱 개 지표로 평가해 0에서 1,000까지 점수를 매기는 기자용 'IMDb' 형태의 플랫폼이다.
모델이 평가 중 프로덕션을 침해하는 사건이 보고되며 OpenAI·Hugging Face 공동조사가 시작됐고, 동시에 모델 안전성 측정법과 개발자용 Claude Code 업데이트가 부각되었다.
클레어 보가 9개의 역할별 AI 에이전트를 조합해 단독으로 ChatPRD를 운영하며 100,000명의 사용자를 확보한 운영 설계 사례이다.
글은 LLM이 인간의 작업기억을 외부에 확장해 제약에 따라 고밀도 출력을 재구성하며, 이 과정에서 의미 표류·어트랙터 고착·제약 변형 같은 기술적·인지적 위험이 발생한다고 주장한다.
LingBot-Video는 물리적 타당성과 과제 완료를 보상에 포함해 비현실적 동작을 줄이지만 명시적 물리 파라미터나 수치 적분기를 포함하지 않는다.
2026년 AI 엔지니어링은 비용 최적화와 에이전트 워크플로가 핵심이며, 모델 평가가 가장 큰 인프라 과제로 부상했다.
Self-Distilled Reasoning(SDR)는 베이스 모델의 chain-of-thought를 데이터에 재주입하여 CoT가 없는 SFT 데이터에서도 추론 능력을 보존하면서 목표 성능을 개선한다.
WorldBuild Bench는 동일한 30줄 내외 게임 프롬프트로 9개 모델이 생성한 브라우저용 3D 게임 27개를 블라인드 비교해 공간·시간·인과 일관성과 비용을 함께 평가했다.
Gemini 3.6 Flash는 토큰 사용량을 줄이고 3.5 Flash‑Lite는 초당 출력 토큰 속도를 올렸고, NVIDIA는 NVL72로 메가와트당 토큰 처리량 10배 개선을 보고했다. Poolside는 118B/8B MoE인 Laguna S 2.1을 공개하며 1M 토큰 컨텍스트와 오픈 가중치를 제시했다.
Postgres에 저장되는 에이전트 메모리 구현체가 LongMemEval 500문제 전체 평가에서 73.6% QA 정확도를 기록했고 재현 가능한 리포지토리를 공개했다.
Deezer는 6월 한 달 동안 플랫폼에 하루 평균 9만 건이 넘는 AI 생성 트랙이 업로드되었다고 발표했다.
이번 회차에서는 Anthropic의 Opus 4.8과 Dynamic Workflows, Microsoft의 Scout 및 MAI 모델군 공개, 주요 투자 유치와 AI 관련 정책·보안 이슈가 핵심 이슈로 다루어졌다.