Nemotron 3 Embed의 RTEB 전체 1위와 에이전트형 검색 진전
NVIDIA의 Nemotron 3 Embed가 RTEB에서 전체 1위를 기록하며 에이전트형 검색에서 더 나은 검색 기반 컨텍스트 품질을 제공했다.
open-source 모델, 데이터셋 및 transformers 라이브러리 업데이트를 다루며, 모델 출시 소식과 fine-tuning 가이드, 커뮤니티 소식을 공유합니다.
NVIDIA의 Nemotron 3 Embed가 RTEB에서 전체 1위를 기록하며 에이전트형 검색에서 더 나은 검색 기반 컨텍스트 품질을 제공했다.
NeMo AutoModel은 Transformers v5 위에서 Expert Parallelism, DeepEP, TransformerEngine을 결합해 MoE 파인튜닝을 API 변경 없이 3.4~3.7배 가속하고 GPU 메모리를 29~32% 절감한다.
CUGA는 프롬프트와 도구 목록만으로 에이전트형 앱을 빠르게 구성하고, 생산 환경에서 거버넌스와 확장을 가능한 한 줄의 코드로 제공합니다.
PP-OCRv6는 파라미터 규모를 1.5M에서 34.5M으로 확장할 수 있는 다언어 OCR로, 엣지부터 서버까지 다양한 배포 조건에서 실전 성능을 제공한다.
딥 리서치 에이전트가 웹 검색 과정에서 파편화된 정보를 조합해 기업 비밀을 유출하는 모자이크 효과를 분석하고, 이를 방지하는 강화학습 기반 PA-DR 기법을 제안함.
AllenAI가 공개한 MolmoMotion은 언어 지시와 비디오를 기반으로 객체의 미래 3D 궤적을 예측하여 로봇 계획 및 영상 생성 성능을 향상시킨다.
Strands Robots SDK는 LeRobot 스택을 에이전트 도구로 추상화하여 시뮬레이션과 실제 로봇 간의 워크플로를 통합하고 자연어 기반 제어를 지원한다.
1M 토큰 컨텍스트와 IndexShare 아키텍처를 도입하여 장기 코딩 작업 성능을 극대화한 오픈소스 모델 GLM-5.2가 공개됐다.
Allen Institute for AI(Ai2)가 LLM 개발 과정에서 모델 체크포인트 간의 성능 변화를 정밀하게 추적하고 비교할 수 있는 평가 워크벤치 olmo-eval을 공개했다.
4개 언어 쌍의 코드 스위칭 음성 데이터를 활용해 7개 ASR 모델의 성능을 WER, SWER, AER 지표로 검증한 결과, ElevenLabs Scribe V2와 Gemini 3 Flash가 최상위 성능을 기록했다.
AI 에이전트가 Hugging Face Spaces의 agents.md를 활용해 이미지 생성 모델과 3D 재구성 모델을 연결하여 3D 갤러리를 자동 구축하는 사례.
ADHD 환자의 실행 기능 장애를 돕기 위해 Gemma 3 12B 모델을 LoRA로 파인튜닝하여, 할 일 목록 대신 도파민을 자극하는 따뜻한 대화형 응답을 생성하는 프로젝트.
단일 모델 기반의 에이전트 경제 시뮬레이션에서 창발적 행동이 이기종 모델들로 구성된 시스템에서는 재현되지 않으며, 신뢰할 수 있는 결과는 입력 조작이 아닌 결정론적 설계로 확보해야 함을 보여줌.
Qwen3.5 4B 모델을 활용해 파키스탄 내 스팸 메시지를 식별하고 안전한 대응 가이드를 제공하는 소형 AI 도구 개발 과정과 기술적 교훈을 공유한다.
Claude Code의 세션 로그를 분석하여 비용, 리스크, 도구 사용 내역을 시각화하고 요약하는 로컬 분석 도구.
Qwen2.5-3B 모델을 활용하여 경제 활동을 수행하는 멀티 에이전트 시뮬레이션 'Thousand Token Wood'의 구축 과정과 기술적 해결책을 다룬다.
DeepSeek V4 Pro로 지식 증류한 Qwen3-8B 모델을 활용하여 이력서 기반의 맞춤형 채용 공고 검색 및 평가를 자동화하는 AI 어시스턴트 개발 사례.
Persona Atlas는 소형 모델 에이전트를 활용해 인물의 사고방식을 연구하고, 답변을 임베딩하여 인물 간의 성향 차이를 시각적으로 비교하는 도구이다.
NVIDIA가 다중 모달 입력, 12개 언어 지원, 맞춤형 정책 적용 및 추론 기능을 통합한 4B 파라미터 규모의 안전 모델 Nemotron 3.5 Content Safety를 공개했다.
NVIDIA가 공개한 600M 파라미터 규모의 Nemotron 3.5 ASR은 40개 언어를 실시간으로 처리하며, 캐시 인식 아키텍처를 통해 낮은 지연 시간과 높은 정확도를 동시에 제공한다.
EVA-Bench 2.0은 항공, IT, 의료 등 3개 도메인에 걸쳐 213개의 시나리오와 121개의 도구를 포함하여 음성 에이전트의 실무 평가를 지원한다.
공개 태스크의 학습 데이터를 시드로 활용하여 추론과 지식이 강화된 합성 Q&A 데이터를 생성하고, 이를 통해 LLM의 MMLU-Pro 및 GPQA 성능을 개선하는 파이프라인을 구축했다.
SFT 후 발생하는 텍스트 퇴화 문제를 DPO를 통해 59.4% 감소시킨 DharmaOCR의 학습 파이프라인 사례.
HCompany가 다양한 환경과 에이전트 프레임워크를 지원하는 컴퓨터 사용 모델 Holo3.1을 공개하며, 로컬 추론을 위한 양자화 체크포인트를 도입했다.