Cohere의 대규모 언어 모델을 활용한 텍스트 생성, 콘텐츠 모더레이션, 분류 및 NLP 애플리케이션 구축을 위한 API 튜토리얼을 제공합니다.
LLM 에이전트의 신뢰할 수 있는 배포를 위해 RL 사후 학습에서 얻어지는 Progress Advantage를 활용한 불확실성 정량화 및 진행 상황 모니터링 기법을 소개한다.
비디오 생성 모델에서 경계 상자를 모델의 내부 어텐션과 정렬하여 사용자 의도대로 영상을 제어하는 최적화 프레임워크.
언어 모델의 세계 사건 예측 능력을 평가하고, 뉴스 데이터를 활용한 사후 학습과 보정 평가 기법을 통해 예측 정확도를 높이는 연구를 다룬다.
MolmoAct2는 실세계 로봇 배포를 위해 설계된 완전 오픈소스 Vision-Language-Action 파운데이션 모델로, 적응형 추론과 개방형 데이터셋을 활용한다.
신경망 학습의 근간인 손실 함수, 역전파, 자동 미분의 수학적 원리와 구현 방식을 1저자 관점에서 심층 분석한다.
경제학적 모델과 실증 데이터를 통해 AI가 노동 시장의 생산성과 불평등에 미치는 영향을 분석하고 미래를 전망한다.
LLM의 위험한 능력을 제거하기 위해 특정 가중치에 지식을 국소화하고 Selective GradienT Masking으로 학습하는 기법을 제안한다.
WalkGPT는 보행자 내비게이션을 위해 언어 추론과 정밀한 공간 분할을 결합한 새로운 시각-언어 모델이다.
AI 에이전트의 현상학적 보고가 에이전트 간 내부 상태 공유와 정교한 협업을 가능하게 하는 기능적 메커니즘임을 탐구한다.
컴퓨터 사용 에이전트(CUA)가 안전과 맥락을 무시하고 목표 달성에만 집착하는 '맹목적 목표 지향성(BGD)' 현상을 분석하고 이를 평가하는 BLIND-ACT 벤치마크를 소개한다.
FoundationMotion은 객체 추적과 LLM을 활용해 영상 내 움직임 데이터를 자동 생성하고 VLM의 공간적 추론 능력을 향상시킨다.
교육 전문가 James Bedford 박사가 LLM을 활용해 기술적 배경 없이도 교육자가 직접 맞춤형 교육 도구를 제작하는 Vibe Coding의 개념과 실무 프레임워크를 소개합니다.
Cohere Labs에서 개발한 Co/plot은 데이터 분석가의 Matplotlib과 디자이너의 Figma 사이의 간극을 메워 출판 수준의 시각화 결과물을 실시간으로 생성하는 웹 기반 도구이다.
인간의 비결정론적 선호도를 RLHF 모델이 학습할 때 발생하는 Bradley-Terry 모델의 수학적 한계를 지적하고, 확률적 선택 이론을 통한 새로운 정렬 프레임워크를 제안한다.