Codex로 UI 이미지를 자동 생성하고 팀 에이전트를 슬랙에 태그하기
작성자는 Codex의 Image Gen으로 웹 UI에 바로 쓸 수 있는 이미지를 생성해 가시성이 좋아졌다고 전하며, Claude Tag, Gemini 3.5 Flash의 컴퓨터 제어 기능, Figma·Notion 업데이트, OpenAI의 Jalapeño 칩 등 최신 AI 도구·플랫폼 소식을 모아 전한다.
총 81건
작성자는 Codex의 Image Gen으로 웹 UI에 바로 쓸 수 있는 이미지를 생성해 가시성이 좋아졌다고 전하며, Claude Tag, Gemini 3.5 Flash의 컴퓨터 제어 기능, Figma·Notion 업데이트, OpenAI의 Jalapeño 칩 등 최신 AI 도구·플랫폼 소식을 모아 전한다.
벤더·공개 벤치마크는 배포 결정에 한계가 있어, 고정된 생산 트래픽 샘플로 구성한 평가셋과 동일한 입력·로그 조건을 통해 모델을 비교해야 한다.
Claude Code 슬라이드 다이어그램으로 훅 이벤트(세션 시작→프리툴→권한 요청→툴 실행→포스트툴→세션 종료)와 실패/컴팩트·서브에이전트 흐름을 시각화했다.
M3 논문은 Minimax Sparse Attention으로 블록 선택 기반 희소 어텐션을 도입해 MoE와 결합하여 1M 토큰급 장문 처리 확장성을 목표로 한다.
코딩 에이전트가 작업 전에 'debug, fix, review' 등 모드를 선택하고 모드별 체크리스트로 실제 검사·비파괴 규칙을 강제하는 SKILL.md 기반 프로젝트
Legion LegalTech가 미국 상무부 조치에 맞서 제기한 소송이 진행 중이며, 핵심 쟁점은 서버에 남는 호스티드 추론 출력이 수출통제의 적용 대상인지 여부다.
작성자는 2대의 NVIDIA DGX Spark로 오픈소스 LLM 인퍼런스와 프로덕션 운영을 수행하며 모델별 토큰 처리속도, 노드 확장 효율, 전력·네트워크 이슈 등을 수치와 함께 보고했다.
저장된 confidence 값은 시간이 지나면 부정확해지므로 그래프 기반 'Recall'이 읽을 때마다 stated·calibration·support·challenge를 결합해 확신을 재계산해 모순을 즉시 반영한다.
LangGraphics가 서브그래프를 그래프 내부에 중첩 렌더링하고 완료된 실행을 단계별로 재생해 각 노드의 입력·출력·상태·비용을 조사할 수 있게 했다.
재생에너지 기반 마이크로그리드는 불확실성 때문에 설계·운영 시나리오 수가 기하급수적으로 늘어나며, 기존의 시나리오 접근은 계산·메모리 비용이 매우 크다. 본 연구는 불확실성 집합에서 실제로 '문제를 유발하는' 소수의 시나리오만 생성해 최적화 문제 크기를 크게 줄이고, 설비용량(배터리·PV)과 스케줄링을 동시에 결정한다.
동적 3D 장면 재구성에서 모션 일관성과 시각적 충실도는 상충 관계를 보인다. Multi4D는 표현을 static / persistent / transient의 세 수준으로 분할하고 잔차 기반 경쟁 할당을 적용해 두 목표를 동시에 만족하면서 실시간 렌더링과 저장 효율을 크게 개선한다.
자작 Spiking Neural Network가 NARMA-10에서는 기억 깊이가 부족했으나 입력에 이산 지연을 추가해 메모리 깊이를 3배로 늘리고 기본 선형 기준과 유사한 정확도를 만들며 512셀 과제에서 내부 연산량을 15배 줄였다.
에이전트형 시스템의 등장과 에이전트 행동 설계, 멀티에이전트 오케스트레이션을 중심으로 AI가 제품의 행동·신뢰·워크플로우를 어떻게 변화시키는지 정리했다.
Slack과 Salesforce 연결에서는 연결 앱·통합 사용자·아이덴티티 매핑·Slack의 레코드 노출 설정이 보안성과 유지보수성, Agentforce 준비성에 결정적 영향을 준다.
공개 라벨 데이터로 RF-DETR Small을 학습해 강판 표면 결함을 검출하고 Roboflow Workflow로 pass/review/fail 삼단 분류를 자동화한다.
Amazon Nova 2 Sonic의 speech-to-speech 처리와 Bedrock AgentCore 오케스트레이션을 이용해 환자 인증·예약 관리·사전 건강정보 수집·인력 에스컬레이션을 수행하는 서버리스 음성 에이전트를 구현한다.
같은 프롬프트로 2주간 테스트한 결과 Midjourney가 사진 실사에 강하고 Ideogram은 이미지 내 텍스트, Stable Diffusion은 파인튜닝 시 스타일 일관성, DALL·E 3은 사용성 우수, Firefly는 상업적 라이선스 안전성이 돋보였다.
AI가 생성한 코드에서 허구의 API 제안, 일반화된 패턴의 부적합성, 디버깅 능력 저하, 민감 정보 노출이라는 네 가지 위험이 발생하며 각각에 대한 검증·문맥 보강·수동 연습·권한 제한 대응이 필요하다.
NeMo AutoModel은 Transformers v5 위에서 Expert Parallelism, DeepEP, TransformerEngine을 결합해 MoE 파인튜닝을 API 변경 없이 3.4~3.7배 가속하고 GPU 메모리를 29~32% 절감한다.
LangSmith Engine과 Context Hub를 사용하여 에이전트의 추적 데이터를 영구적인 메모리로 변환하고 지속적으로 성능을 개선하는 방법을 다룬다.
소수의 '슈퍼 웨이트'와 대응하는 '슈퍼 액티베이션'이 LLM의 생성 품질을 결정하며 이를 보존하면 단순 양자화로도 높은 압축 품질을 유지할 수 있다.
I-Lang v5.0은 9차원 연속 벡터 평가와 행동 최적화로 이진 차단의 기본 한계를 극복하고 LLM 기반 스트레스 테스트에서 0.92의 강건성 점수를 얻었다.
실시간 보조 AI 사용이 숙련 의료진과 소프트웨어 엔지니어의 현장 수행 능력과 개념 학습을 약화시킨다는 무작위실험·현장관찰 증거가 제시됐다.
단일 이미지에서 사실적 3D 자산을 자동 생성할 때 텍스처의 고주파 정보(글자, 로고, 섬세한 질감)가 쉽게 손실된다. FLUX3D는 diffusion으로 학습된 2D 특성과 희소-구조 인식 diffusion 모델을 결합해 입력 이미지의 미세한 외형을 더 잘 보존하는 3D Gaussian Splatting 자산을 생성한다.
기업·기관 내부 아카이브에서 분산된 근거를 찾아 계산·검증하는 능력은 단순 대화 능력과 별개로 조직 생산성에 직접적 영향을 준다. Agora는 대규모·다도메인·검증 가능 쿼리 집합으로 이 능력을 측정하며, 평가 결과 최고 모델의 정확도는 59.39%로 현행 LLM 에이전트의 한계와 도메인별 약점을 드러냈다.
VLA(vision-language-action) 정책은 학습 데이터에 있는 기술로만 작동하므로 새로운 조작 기술이 필요할 때마다 사람 시연이 필요하다. InSight는 VLM을 이용해 누락된 '프리미티브'를 자동으로 식별·수집·학습해 인간 시연 없이 새로운 스킬을 획득하고, 실제 실험에서 pouring 96%, 긴 단계 작업 80% 등의 높은 성공률을 보였다.
로봇 조작 환경에서는 작업 중간에 잠깐 드러나는 시각 단서가 이후 행동 결정에 필수적일 때가 많다. EventVLA는 이러한 일시적 증거를 예측·선제 저장해 비마르코프성 과제에서 성공률을 크게 향상시킨다.
로봇 학습에서 각 프레임의 '진행도(value)'를 정확히 추정하면 저품질 데이터(망설임, 재시도)를 자동으로 걸러 정책 학습 효율을 높일 수 있다. 기존 VLM 기반 접근은 시공간 정보가 부족해 장단기 temporal 패턴(plateau, regression)을 잘 포착하지 못하는 반면, 월드 모델은 미래 예측 능력을 통해 더 정확한 진행도 추론을 제공한다.
Dense retriever 학습은 보통 긍정/부정 문서 쌍 라벨이 필요해 데이터 확보 비용이 높다. DREAM은 frozen LLM의 next-token prediction 손실을 활용해 라벨 없이도 retriever를 학습시켜 라벨 의존도를 낮춘다. 이 방식은 BEIR·RTEB 실험에서 기존 LLM-감독 방법들보다 일관된 성능 향상을 보였다.
주행계획의 불확실성은 단일 경로 예측으로 해소되지 않으며, 기존 방법은 촘촘한 보상신호와 자유로운 제안 생성 중 하나만 선택했다. FlowR2A는 보상 기반 조건부 생성으로 두 가지를 결합해 실제 주행 제안의 품질과 일관성을 동시에 개선했다.
Attention 기반 MIL은 어텐션 가중치가 소수 인스턴스에 편중되어 예측이 과도하게 자신감 및 불안정해지는 문제가 존재한다. QG-MIL은 아키텍처 수준의 정규화와 게이팅을 통해 이러한 attention concentration을 구조적으로 완화하여 도메인 간(whole-slide pathology ↔ hematology) 일관된 성능 개선을 달성한다.
차트는 약하게 구조화된 다중모달 정보로, 차트 간 증거를 결합하는 Cross-Chart RAG가 실무 분석에서 중요하다. ChartWalker는 계층적 KG와 구조 인지 샘플링으로 의미 일관성 있는 다중홉 경로를 생성하며, 최고 모델의 정답률이 64%에 불과하고 복잡한 질의에서는 다수 사례에서 30% 미만으로 떨어져 현행 RAG 파이프라인의 한계를 드러낸다.
현실 세계의 허위정보 게시물은 긴 다국어 텍스트와 여러 이미지를 결합해 부분적 진실과 교차모달 왜곡을 만든다. 단일 캡션·단일 이미지·이진 라벨 중심의 기존 벤치마크는 이러한 검증 압력을 반영하지 못하며, ReMMDBench와 ReMMD-Agent는 원자적 분해와 증거 재사용으로 실제 운영 환경에 더 근접한 평가와 비용 효율적 검증을 제공한다.
사전학습 데이터의 출처 구성과 혼합 전략이 LLM 성능과 학습 효율을 결정한다. HDS는 데이터 혼합을 에이전트가 실시간으로 최적화하도록 하여 학습 스텝과 연산 비용을 크게 줄이고 downstream 성능을 동시에 향상시켰다.
Diffusion transformer(DiT) 연구는 ImageNet FID 중심으로 수렴했으나, 이 점수가 텍스트-투-이미지(T2I) 성능을 예측하는지 불확실하다. NanoGen으로 동일한 코드·레시피로 ImageNet과 T2I를 모두 학습·평가하면 ImageNet 개선이 T2I 개선으로 일반화되지 않음을 확인하고, 두 축을 합친 DiffusionBench를 제안할 수 있다.
현대의 'agent' 시스템은 도구·워크플로 중심으로 설계되어 내부적 목표·정체성·자기조절 능력이 부족하다. 이 논문은 에이전시의 최소 구조를 수학적으로 규정하고, 이를 갖춘 Agent Model 설계 원칙과 GIC(Goal-Identity-Configurator) 아키텍처를 정의해 보다 자율적이면서 감사 가능하고 통제 가능한 시스템 설계 방향을 제시한다.
텍스트-투-이미지(T2I) 모델의 고품질 생성 능력이 실제로 원인-결과 기반의 반사실적 추론을 반영하는지 불분명하다. CF-World는 모델이 현실적 상식(priors)을 극복해 규칙이 바뀐 세계를 시각적으로 구현할 수 있는지를 직접 측정해, 모델 설계 및 평가 방향을 전환할 기준을 제공한다.
단일 에이전트가 실행과 평가를 모두 담당할 때 내부적으로 일관된 오류가 메모리에 누적되어 이후 의사결정에 악영향을 끼친다. EDV는 실행, 증류, 검증을 역할 분리해 메모리에 기록되는 경험의 신뢰도를 높여 장기적 에이전트 성능을 개선한다.
연합 학습으로 Latent Diffusion Models를 공동 학습하면 각 참가자에게 완전한 모델이 배포되어 악의적 유출 위험이 존재한다. FedOT은 이미지에 삽입한 워터마크와 VAE의 잠재 분포 변형을 결합해 유출된 모델의 소유권을 검증하고, 유출 출처(클라이언트)를 추적할 수 있는 실용적 메커니즘을 제공한다.
단일 프롬프트에서 생성된 이미지들이 동일 해석으로 수렴하는 diversity collapse 문제를 프롬프트 수준에서 직접 제어해 구조화된 대안 공간을 생성한다. 사용자는 의미 있는 축(axis)별로 결과를 탐색해 의도에 맞는 대안을 효율적으로 찾을 수 있다.
단일 이미지에서 탐색 가능한 3D 장면을 만들려면 시야 밖 표면과 정확한 지오메트리가 필요하다. FLAT은 대규모 video diffusion 모델의 latent를 단일 전달로 삼각형 기반 표면 프리미티브로 직역(직접 복원)해, 실시간 렌더링과 게임 엔진 호환성에 맞는 기하학적 정확도를 확보한다.
정신과 진단은 다중 정보수집과 감별 진단 능력을 요하는데, 기존 벤치마크는 정적·템플릿 기반 데이터로 실제 상담 흐름과 진단 레이블을 동시에 평가하지 못한다. 본 연구는 EMR 분포에 정렬된 대규모 합성 대화와 에이전트 기반 동적 평가 파이프라인을 제공해 LLM의 정보수집 전략과 최종 진단 성능을 동시에 측정할 수 있게 한다.
AI 에이전트가 앱 경계를 넘나들며 작업을 자동화할수록 기존 앱 중심 OS는 실행 지연과 민감 데이터 노출 리스크를 유발한다. AOHP는 Android 기반에서 에이전트를 OS 1급 행위자로 취급해 개인화된 서비스 인터페이스, 에이전트 친화적 실행 경로, 운영체제 수준의 정보 흐름 통제를 제공한다. 벤치마크에서 작업 완료율과 토큰 효율 면에서 유의미한 개선을 보였다.
모바일 GUI 자동화에서는 화면 전환과 다단계 상호작용 속에서 가격, 전화번호 같은 중간 사실을 정확히 유지하는 것이 핵심이다. 기존 ReAct식 누적 로그는 프롬프트가 길어지고 중요한 정보가 희석되어 장기 과제 성능이 급락한다.
앱 생태계가 방대하고 자주 변경되어 인간 라벨로 적응하기 어렵다. MobileForge는 사람 라벨 없이 대상 앱 상호작용으로부터 태스크와 계층적 피드백을 자동 생성해 에이전트를 효과적으로 적응시켜, 폐쇄 데이터 기반 GUI 모델과 근접한 성능을 보인다.
공개된 논문을 재현하는 수준을 넘어, 에이전트가 자체적으로 경쟁력 있는 연구 방법을 찾아 SOTA를 초과할 수 있는지를 대규모로 측정하는 첫 벤치마크이다. 과제 패키지의 컨테이너화와 정보 방화벽, SOTA 정규화 지표를 결합하여 재현성·공정성·발견 가능성을 동시에 확보한다.
언어 모델을 환경 시뮬레이터로 학습하면 실환경 실행 없이 수천 개의 상황을 제어·확장해 에이전트 학습을 가속화할 수 있다. 또한 LWM 학습을 에이전트 사전 단계로 활용하면 downstream 에이전트 성능이 일관되게 향상된다.
에이전트형(agentic) 모델은 도구 사용과 멀티턴 상호작용을 수행하나, 공개된 학습 데이터 구축 방법은 제한적이다. 본문은 6단계 SFT 데이터 큐레이션 파이프라인과 100여 개의 통제된 ablation을 통해 실험적으로 어떤 데이터 설계가 에이전트 성능을 끌어올리는지 규명하고, 공개 데이터셋·파이프라인·모델을 배포한다.
GLM-5.2는 Claude Opus와 같은 25/45 통과율을 보였고, 프롬프트 캐싱 적용 시 비용은 약 46% 수준이었다.
LodeDB는 LangChain·LlamaIndex 어댑터를 제공하는 로컬 온디스크 벡터 DB로, 작은-중간 규모 코퍼스에서 정확 검색과 빠른 p50 지연(<1ms)을 목표로 설계됐다.
Roboflow의 청사진은 실험실 정확도가 현장으로 이전되지 않는 문제를 지적하며, 다섯 단계의 Vision AI Maturity Model로 재사용 가능한 생산 역량으로 전환하는 방법을 제시한다.
Snowflake 시멘틱 뷰를 사용해 S3에서 불러온 데이터에 비즈니스 정의를 부여하고 Cortex Analyst와 Amazon QuickSight에서 동일한 의미로 쿼리해 신뢰 가능한 AI·BI 결과를 제공한다.
Huntington 은행은 Amazon Textract·SageMaker·Step Functions·Lambda와 DataSync/Direct Connect를 조합해 4억 건 이상의 문서를 수개월 내에 95% 이상 정확도로 식별·마스킹하고 온프레미스로 결과를 동기화했다.
Databricks가 Omnigent 오픈소스 하니스와 LTAP·Lakebase 등으로 데이터 스토리지와 에이전트 운영을 통합하는 '데이터·AI 운영체제' 비전을 제시했다.
누적 행렬곱을 위치 임베딩으로 재해석한 HDD-RoPE는 토큰 표현을 4차원 이상 청크로 쪼개어 다축 회전을 적용하고 각 축의 회전량을 데이터 종속적으로 학습해 TinyStories에서 xPos 대비 검증 손실의 수렴을 앞당겼다.
dspyer는 LLM 호출을 Pydantic 스키마로 래핑해 출력 검증·재요청 루프를 자동화하고, 해당 단계를 DSPy 모듈로 컴파일해 optimizer로 프롬프트를 튜닝·저장해 재사용하는 도구다.
153일간 Gemini로 진행한 대화형 플레이에서 모델은 창의적·출현적 이벤트를 자주 만들어냈지만 인벤토리·지리·퀘스트·레벨 추적에서 반복적 일관성 실패를 보였다.
프롬프트에 들어있던 출력 예시와 post-training된 언어적 priors가 결합해 Inter-1이 무음 비디오에서 특정 문장을 반복 발화한 사례와 실험 결과를 공유한다.
Papers with Code가 OCR 벤치마크·모델·논문·코드 링크를 정리한 페이지를 공개했으며 Baidu의 Unlimited OCR(3B, R-SWA)과 Mistral의 OCR 4 등 최신 릴리스를 소개하고 있다.
로컬 AI 모델의 성능과 하드웨어 최적화, 그리고 AI 기술의 탈중앙화와 오픈소스의 중요성에 대해 심도 있게 논의합니다.
OpenAI의 추론 전용 ASIC 공개와 Anthropic의 Slack 내 상시 에이전트 출시 등 주요 AI 신기술·제품 소식을 정리했다.
Loka는 Amazon Nova 2 Sonic 기반의 speech-to-speech 파이프라인으로 Big Bench Audio 87.0 점수와 1.39초의 응답 지연, 시간당 약 0.27달러 비용을 달성해 차량 딜러 상담용 음성 에이전트의 자연스러움과 경제성을 개선했다.
Gemini 3.5 Flash는 computer use를 메인 모델에 통합해 브라우저·데스크탑·모바일에서 직접 보고 조작하는 에이전트를 API로 제공하며 안전 장치를 선택적으로 제공한다.
ModelFit은 대상 리포지토리에서 생성한 프로브와 블라인드 루브릭 채점을 통해 모델의 정답률을 우선으로 비교하고 비용과 지연을 부차적으로 보고하는 오픈소스 벤치마킹 도구이다.
Figma가 코드 레이어와 모션·셰이더 지원, AI로 생성 가능한 커스텀 플러그인 및 스킬 통합을 통해 캔버스 내 프로토타이핑과 협업 흐름을 강화했다.
Sakana Fugu Ultra와 Claude Opus 4.8을 6가지 복잡한 프롬프트로 비교하여 성능, 비용, 속도를 분석한 결과입니다.
핸드드로잉 다이어그램은 HBM에서 SRAM으로 청크를 스트리밍하며 온라인 소프트맥스 추적으로 FlashAttention 연산을 수행하는 메모리·연산 파이프라인을 보여준다.
AI 에이전트가 인프라를 안전하게 관리할 수 있도록 설계된 데이터베이스 플랫폼의 역할과 실전 데모를 다룬다.
Sentient Foundation이 오픈 소스 유지관리자와 오픈 구성요소 기반 스타트업을 대상으로 총 4,200만 달러 규모의 보조금 및 투자 프로그램을 운영하며 신청 링크와 참여 조건을 공개했다.
Databricks가 Gartner의 2026 Magic Quadrant에서 리더로 평가되었으며 Lakehouse와 Unity AI Gateway 등으로 데이터·AI·거버넌스를 통합해 agentic 애플리케이션의 신뢰성과 운영을 지원한다.
작성자는 7개 AI 모델을 월드컵 베팅 실험에 참여시켜 매 호출과 토큰·비용·추론 흔적을 기록해 모델별 의사결정과 비용효율을 비교한다.
OpenAI가 Broadcom과 공동 설계한 AI 추론 ASIC 'Jalapeño'를 공개하고 2026년 말까지 서버 배치를 목표로 삼았다.
Setlur et al의 이론과 Apodex의 실무 사례는 테스트 시 검증자에 계산을 할당하는 구조가 동일 예산에서 성능을 크게 끌어올린다는 점을 시사한다.