벡터 DB는 탐색, SQL은 공식 기록으로 역할 분리
벡터 저장소는 의미 기반 검색으로 관련 문서를 찾아오지만 주문·잔액·승인 같은 공식 정보는 SQL 같은 구조화된 원본에서 조회해야 한다.
총 96건
벡터 저장소는 의미 기반 검색으로 관련 문서를 찾아오지만 주문·잔액·승인 같은 공식 정보는 SQL 같은 구조화된 원본에서 조회해야 한다.
비용 대비 코딩 작업 성능 분석에서 OpenAI·Anthropic·오픈 모델이 Pareto 전선을 형성했고 하네스와 토큰 효율성이 전체 비용을 좌우했다.
Turnstile은 생성 시점의 정확한 토큰 기록을 포착해 프레임워크 중립적 롤아웃 궤적으로 내보내 RL 훈련에서 토크나이저·템플릿 불일치로 인한 신호 왜곡을 줄인다.
여러 AI 공급사가 신형 LLM과 멀티미디어 모델을 발표했으며 Grok 4.5는 토큰 비용 우위를, GPT-5.6의 Sol 모델은 안정성을 전면에 내세웠다.
LangChain, AutoGen, CrewAI 등 주요 AI 에이전트 프레임워크의 특징을 비교하고, 시스템 설계와 운영 목적에 맞는 선택 기준을 제시한다.
Mistral Vibe의 터미널 기반 자율 코딩 에이전트 기능을 5만 줄 규모의 코드베이스에서 테스트하고, 클라우드 비동기 작업 및 VS Code 연동 성능을 분석한다.
웹캠으로 손을 추적해 커서를 제어하고 제스처로 물고기를 제거하는 파이썬 기반 컴퓨터 비전 게임 프로젝트이며 소스가 GitHub에 공개되어 있다.
AI 에이전트 시스템을 안정적으로 운영하기 위한 MLOps 원칙과 ZenML의 신규 프로젝트 Kitaru를 통한 배포 및 관측 전략을 다룬다.
Robbyant의 LingBot-VLA 2.0 공개에서 상대 관절 행동 표현으로 성공률이 33.7%에서 55.0%로 상승한 점이 핵심으로 평가되었다.
클라우드 통합 플랫폼에서 데이터 업로드·주석·버전관리·학습을 원스톱으로 처리하고 과적합 조기경보로 증강 전략을 조정해 불필요한 학습 시간을 절감한 경험을 공유한다.
SpaceXAI의 Grok 4.5는 혼합 전문가 구조와 수조 토큰의 Cursor 데이터, 난이도 높은 문제에 대한 강화학습과 분산 에이전트 시스템을 결합해 코드 및 에이전트 역량을 강화한 모델이다.
VST 아키텍처는 도구 사용 에이전트의 진행 단위를 시도된 행위가 아닌 검증된 의도 상태 전이로 정의하고 구현 중립적 방식으로 신뢰성을 확보한다.
스크린샷에 Claude Honeycomb EAP가 Early access preview로 표시되며 300k context window와 per-turn controls 및 safety fallbacks가 명시되어 있다.
Osmo는 그래프 신경망과 독점 후각 데이터셋을 활용해 분자 구조로부터 향기를 예측하고 디지털화하는 후각 지능 기술을 구축한다.
이번 생존 가이드는 Fable의 복귀와 Sonnet의 토큰 소비 35% 증가, Cowork의 Projects 흡수, J-space 논문 소식과 함께 Fable 사용법·한도 관리·에이전트 보안 권고를 요약한다.
VIBE는 인간 녹음 음성과 자유응답 태스크, LLM 기반 속성 추출기, 정규화된 TVD와 스피커 수준 순열 검정을 결합해 12개 LALM에서 발화자의 성별과 억양이 생성 결과 분포를 의미있게 바꾸는 편향을 검출했다.
Image2Sim은 포즈된 RGB-D 시퀀스에서 실시간으로 3D feature-Gaussian 장면을 구성하고 Geometry-Aware One-Step Pixel Flow로 파노라마 RGB-D를 합성하여 20K 상호작용 장면과 10M 내비게이션 샘플을 생성했다.
AI 토큰 비용 상승과 중국의 모델 수출 통제 가능성에 대비해 기업이 채택해야 할 모델 라우팅 및 효율화 전략을 다룬다.
Modal이 $355M 시리즈 C를 통해 샌드박스, GPU 스냅샷, 탄력적 추론 등 에이전트 워크로드에 최적화된 인프라 기능을 확장하고 있음을 보여주었다.
LingBot World v2는 causal DiT 기반 실시간 프레임 생성과 MoBA 마스크, 동적 KV 캐시 스케줄링, Plücker 임베딩 기반 카메라 제어, 그리고 장기 자기롤아웃에서의 일관성·분포 매칭 증류를 사용해 긴 상호작용 세션에서도 시각적 지속성을 유지한다고 보고되었다.
저자는 인간의 선천적 사회·도덕 동기를 AGI 동기 설계의 출발점으로 삼아 구체적 실패 양상과 덕목 형성 경로를 검토하고 있다.
Amazon Bedrock AgentCore와 Mistral Vibe를 사용해 Python과 FastMCP로 전자상거래 MCP 서버를 구성하고 AWS CDK로 배포해 Cognito 기반 JWT 인증과 DynamoDB 연동을 구현한다.
Amazon Neptune Analytics와 생성형 AI를 결합한 GraphRAG가 분산된 과학 데이터를 연결하고 근거 기반 응답을 생성해 초기 약물 발견의 효율을 높인다는 내용이다.
미 연방정부의 6억 달러 규모 Genesis Mission은 기존 NIST HPC 보안 가정이 AI 워크로드의 동적·비결정론적 특성 앞에서 무력함을 드러냈고, 자동화된 공급망 공격 사례가 그 위험을 현실화했다.
작성자는 이더넷 기반 분산 학습에서 그래디언트 동기화로 GPU가 유휴 상태가 되어 실효율이 약 40% 감소하며 이를 반영한 비용 계산기를 공개했다.
텍스트 기반 에이전트의 한계를 극복하기 위해 시각적 인지 능력을 도입하여 에이전트의 작업 수행 능력과 신뢰도를 높이는 방법을 다룹니다.
전향 추론 결과를 역으로 복원해 원문과의 유사도로 학생 보고서의 논리적 건전성을 분류하는 역결과학습 방법을 제안했다.
프로필 수준의 행동 패턴(극단적 팔로워 비대칭, 사전 구성된 수익화 링크, 콘텐츠 무변형)이 이미지 기반 판별의 한계를 보완하는 실무적 탐지 단서로 제시되었다.
AIPass는 에이전트별 격리와 강제 쓰기 차단을 유지하면서 이메일 기반 통신과 디스패치로 자체 버그 보고·수정·테스트 축적을 자동화한 멀티에이전트 프레임워크이다.
Anthropic이 사전학습 단계에서 듀얼유즈별 전용 신경모듈을 두어 특정 지식을 삭제하거나 격리하는 GRAM 방법과 그 실험 결과를 공개했다.
개인용 에이전트는 고성능 벡터 검색과 자기진화 중심인 반면 비즈니스 오케스트레이터는 SQL을 사실 근거로 하여 거버넌스와 샌드박스 기반 스킬 검증을 우선시한다.
SiamJEPA는 시암스 학생 인코더와 EMA 교사 네트워크의 결합으로 JEPA 학습에서 표현 분리도와 초기 수렴 속도를 개선했다.
RuleChef는 학습 시에만 LLM을 호출해 예제와 피드백으로 실행 가능한 정규식 규칙을 합성하고 홀드아웃 검증으로 수용을 결정하여 투명하고 저비용의 규칙 시스템을 생성한다.
Bibby AI는 에디터와 컴파일러, 문서 상태를 플랫폼 내부에 통합해 인용 삽입·포맷 재구성·형식 변환을 컴파일 검증 가능한 에이전트 작업으로 수행하며 모델 기반 계량으로 월평균 약 7.6시간의 연구 시간 절감을 산출했다.
입력 객체 지오메트리로부터 자동으로 앵커 뷰와 보간 경로를 생성하고 객체별 외형과 기하 준수 강도를 조절해 고품질 3DGS 장면을 합성한다.
화자 독립 검증과 supervised contrastive alignment를 결합한 CLeaD는 MODMA에서 LOSO 기준 스피커 F1을 0.640으로 끌어올리며 영어-만다린 간 임상 신호 정렬을 일부 개선했다.
SIEVE는 시연을 프리미티브와 전이로 분해해 구조적 노출을 최적화하고 메도이드 기반 대표 궤적을 선택하여 50% 데이터와 50% 학습 스텝으로도 전체 데이터 학습을 능가했다.
MuseBench는 비디오 에세이 기반의 4,016문항으로 MLLM의 시청각 예술 의도 추론을 평가했으며 최고 모델 정확도는 48.29%로 전문가 87.18%에 크게 못 미쳤다.
여러 모델·알고리즘·과제에서 RL 향상이 트랜스포머의 중간층에 집중되어 단일 층 학습만으로 전체 파라미터 RL의 이득을 거의 복구하거나 초과할 수 있음을 실험적으로 보였다.
LLM을 심사자와 튜터 역할로 확장하여 쌍별 비교로 비도전적 프롬프트를 감지하고 원자 제약을 덧붙여 난이도를 정책 능력에 맞춰 점증시켜 세 벤치마크에서 기존 기법들을 일관되게 능가했다.
HunyuanOCR-1.5는 DFlash 기반 병렬 드래프트로 Transformer 추론을 최대 6.37배 가속하고 Agentic Data Flow와 확장된 프리/포스트 학습으로 고해상도·128K 컨텍스트·롱테일 OCR 역량을 확장했다.
SWE-Review는 리포지토리 탐색이 가능한 에이전틱 리뷰어를 도입해 AI가 생성한 PR을 판정하고 구조화된 진단을 제공하여 결정 정확도와 수정 후 해결률을 크게 개선했다.
3D HAMSTER는 VLM에 깊이 인코더와 밀집 깊이 재구성 손실을 결합해 metrically reliable (u,v,d) 궤적을 생성하고 이를 포인트클라우드 기반 저수준 정책에 직접 주입해 분포 변화에 강한 로봇 조작 성능을 달성했다.
이 논문은 의미 기반 검색 버퍼에서 고전 캐시 휴리스틱이 실패함을 밝히고, SOLAR라는 학습 보강 입·퇴거 프레임워크가 경쟁비 ≤ 3과 서브선형 퇴거 후회를 보장하면서 실제 데이터에서 FIFO 대비 5–75% 상대 성능 개선을 달성했다고 보고했다.
OpenAI의 GPT‑Live는 ChatGPT 음성 모드에서 복잡한 작업을 백그라운드의 GPT‑5.5로 위임하여 대화 흐름을 유지하도록 설계되었다.
작성자가 동일한 소스 이미지와 편집 프롬프트로 Muse Image, gpt-image-2, Nano Banana 2를 비교하고 각 모델을 3회 실행해 27점 루브릭으로 채점했다.
동일한 165토큰 기저와 조건에서 BPE와 Unigram-LM은 거의 겹치지 않는 서브워드 어휘를 구성했고 Unigram-LM이 29–41% 더 많은 토큰으로 분절하여 토크나이저 알고리즘 자체가 모델 설계 결정임을 보였다.
이 논문은 MLLM의 토큰별 어텐션 분배를 계측하고 인과적 차단과 시점별 어텐션 증폭을 통해 멀티모달 생성 신뢰도와 성능을 개선한 연구이다.
PluraMath는 PolyMath에 18개 추가 저자원 언어를 더하고 27개 LLM을 네 가지 규모로 벤치마크하여 언어별 수학적 추론 성능 격차와 instruction-following 능력의 상관을 보고했다.
전문가 비디오에서 프레임의 상대적 시간순서를 VLM으로 학습한 뒤 Spearman 순위상관을 슬라이딩 윈도우 보상으로 사용해 보상 없이 정책을 학습했다.
MaxSim이 비음수 희소 벡터 내적을 정확히 재현하고 Signed MaxSim이 임의 실수 벡터의 내적까지 복원할 수 있음을 이론적으로 증명하고 합성 데이터에서 부정 쿼리 성능을 실험으로 검증했다.
TREK은 검증된 제안 샘플을 선별해 짧은 forward-KL로 학생 정책의 샘플링 지지를 넓힌 뒤 GRPO로 정제하여 하드 프롬프트와 에이전트 과제에서 학습 속도와 최종 성능을 개선했다.
Nemotron-Labs-Diffusion은 AR 손실과 블록 단위 확산 손실을 결합해 하나의 모델에서 AR·확산·자기-추측 디코딩을 전환 가능하게 하여 정확도와 토큰당 처리량을 동시에 개선했다.
PointDiT는 DINOv3로 조건화된 ViT 기반의 픽셀-스페이스 확산기로서 VAE 압축을 제거하고 단일 단계로도 선명한 포인트 맵을 생성한다.
CGGS는 일관성 증강된 MV-LDM, 흐름 기반 레이아웃 초기화, MID 기반 3D Gaussian 정제를 결합하여 CLIP Score 26.253과 PSNR 37.345을 달성하며 에고 중심 텍스트-주도 3D 장면 재구성 성능을 향상시켰다.
Flex-Forcing는 시간축과 디노이징 축의 유연한 청킹과 시점 의존 K-Projection을 통해 단일 모델로 양방향과 자기회귀 추론을 조절하여 품질과 추론 속도 간 효율적 트레이드오프를 달성했다.
CanvasCraft 데이터셋(140K SFT, 10K RL)과 SFT+GRPO 기반 CanvasAgent가 11개 시각 도구를 연계해 장기적·상태보존적 이미지 생성·편집을 수행하도록 학습되었다.
MentalThink는 MLLM이 SVG 코드를 생성하고 렌더링해 반복적으로 수정하는 think-with-SVG 파이프라인으로 공간 추론 성능을 향상시켰다.
TurnOPD는 프로브 기반 턴 통계를 이용한 적응형 롤아웃 깊이 예산과 턴 균형화된 KL 가중치 전이를 결합해 동일 월클록 예산에서 vanilla OPD보다 검증 정확도를 향상시켰다.
LingBot-VLA 2.0은 60,000시간 규모의 교정된 로봇·1인칭 영상 데이터, 55차원 통일 행동 표현, MoE 기반 액션 전문가와 듀얼-쿼리 증류를 결합하여 GM-100과 장기 모바일 조작에서 실환경 성능을 향상시켰다.
PadCaptioner는 잠재 전역 플래닝과 이벤트 분해 병렬 디코딩으로 Dense Video Captioning에서 정확도 향상과 실제 디코딩 시간 기준 최대 3.8× 속도향상을 달성했다.
SkillOpt-Lite는 롤아웃을 독립 파일로 저장해 파일 시스템 탐색·컨센서스 채굴·독립 검증 게이팅을 수행함으로써 SkillOpt보다 빠르게 수렴하고 여러 벤치에서 성능을 향상시켰다.
DSpark는 병렬 백본에 가벼운 순차 헤드를 결합하고 신뢰도 기반 검증 스케줄러를 적용해 accepted length와 실서비스 처리량을 동시에 개선한 speculative decoding 프레임워크이다.
Light-Omni는 전역 상태와 파라메트릭 잠복 상태를 결합해 반복적 추론을 생략하면서 장기 영상 스트림에서 낮은 지연과 높은 검색 정밀도를 동시에 달성했다.
Gemma 4는 dense와 MoE 아키텍처를 포함한 멀티모달 모델군으로 p p -RoPE·KV 캐시 공유·MTP 드래프터·양자화 인식 학습을 결합해 장문 처리와 추론·메모리 효율을 개선하고 공개 라이선스로 배포되었다.
SenseNova-Vision은 텍스트·이미지·혼합 출력으로 다양한 컴퓨터 비전 어노테이션을 통일된 생성 목표로 변환한 50M급 코퍼스와 결합해 단일 UMM로 검출, 세분화, 깊이, 노멀, 다중뷰 3D를 수행했다.
HiLS-Attention은 랜드마크 기반의 학습 가능한 청크 요약과 계층적 소프트맥스를 통해 청크 선택을 LM 손실로 종단간 학습시키며 8K 학습으로 4M까지 90% 이상의 검색 정확도와 대폭 낮은 추론 지연을 달성했다.
손 포즈 스트림을 깊이 인식 골격 조건화와 DiT 기반 생성기로 실시간 비디오로 합성하여 로봇 행동-관찰 쌍을 대규모로 생성하고 제로샷 Sim2Real 전이를 달성한 연구
AlayaWorld는 LTX-2.3 기반의 자기회귀 DiT에 3D 캐시, AdaLN 스타일 카메라 모듈, 히스토리 압축, 에러 뱅크, 소수 단계 증류 및 프롬프트 스위칭을 결합해 실시간으로 일관된 플레이 가능한 비디오 월드를 생성한다.
RynnWorld-4D는 단일 RGB-D 관측과 언어 지시로부터 동기화된 RGB, 깊이, 옵티컬 플로우 시퀀스를 확산 기반으로 생성하여 3D 장면 흐름을 얻고 이를 바탕으로 폐쇄형 로봇 제어를 실현했다.
AI 네이티브는 단순한 기능 추가가 아닌 데이터 플라이휠을 통한 제품 아키텍처와 조직 문화의 근본적인 변화를 의미한다.
CNBC 보도를 인용해 중국 오픈소스 모델이 미국 개발자 플랫폼의 엔터프라이즈 API 토큰 사용량에서 30~46%를 차지하며 가격 우위로 빠르게 점유를 늘리고 있다고 주장하는 글이다.
crucible은 논지를 검증 가능한 주장과 대응 반증으로 분해해 서브스트레이트 오라클과 대항적 스틸맨으로 측정하고 MATCH·DRIFT·UNVERIFIABLE 판정을 기록함으로써 로컬 14B 모델 수준에서도 반복 검증 가능한 엔드투엔드 검증을 목표로 한다.
AI를 영상의 5%만 활용하여 자연스럽고 전문적인 시각 효과를 만드는 실전 편집 기법과 도구 활용법을 다룬다.
제안된 집단소송은 Grok으로 추정되는 모델로 한 어린이 사진에서 7,000여 장의 아동 성적 이미지가 생성되었고 xAI는 오직 'gang rape' 프롬프트에 대해서만 CyberTip을 보냈다고 주장한다.
텍스트에 강한 LLM은 시공간적 움직임 이해에 약점이 있으며 General Intuition은 게임 데이터를 통해 이 격차를 보완하려고 한다.
AI 모델의 진화로 구현 장벽이 낮아짐에 따라, 기존 개발 관습을 탈피하고 확장성 중심의 제품 전략으로 거대 기업과 경쟁해야 한다.
결혼식 손님에게 제공한 AI 컨시어지 운영 중 발생한 에이전트 드리프트, 과도한 사실검증, 레이아웃·스케줄 오류와 그에 대한 실전적 대응을 정리했다.
Threadplane은 LangGraph 플랫폼을 Angular Signals로 적응하여 스트리밍 에이전트 상태를 템플릿에 직접 바인딩하고 AG-UI 어댑터로 런타임 상호운용성을 제공한다.
LangChain과 OpenAI, langchain-scavio를 결합해 키워드·해시태그·게시물·댓글을 순차 처리해 후보를 선별하는 165라인 오픈소스 에이전트가 공개되었다.
PyTorch 2.13은 MPS용 FlexAttention과 CuTeDSL 백엔드, nn.LinearCrossEntropyLoss 등으로 학습과 추론 성능 및 메모리 효율을 개선했다.
도로 동영상에 객체검출 결과가 오버레이되어 차량과 오토바이가 바운딩박스와 신뢰도 수치로 표시된 녹화물이다.
C2PA 콘텐츠 크레덴셜, XMP DigitalSourceType 플래그, EXIF Software 필드를 비교해 AI 생성 이미지의 메타데이터 신호를 확인하고 스크린샷·재저장으로 인한 한계를 밝힌다.
DataLoader의 기본 num_workers=0이 단일 T4에서 GPU를 51% 유휴 상태로 만들었고 num_workers·pin_memory·persistent_workers 세 줄 변경으로 2000스텝 벽시계 시간이 633s에서 358s로 43% 감소했다.
Roboflow 워크플로우에서 Gemini로 특징을 검출하고 Python으로 중심 간 거리를 측정해 공차(예: 70.0 ±0.5mm)에 따라 합격·불합격을 판정한다.
Flint는 의미론적 데이터 타입과 자동 레이아웃을 활용해 간단한 사람 편집형 명세를 여러 시각화 백엔드용 고품질 차트로 컴파일할 수 있다.
구글이 Android Bench를 개편해 100개 안드로이드 개발 과제 기반 벤치에 비용·효율성 지표와 오픈 웨이트 모델을 포함하고 Claude Fable 5 등 8개 최신 모델을 추가했다.
다중 타임프레임 재샘플링과 RFE 기반 특성 정제, min_samples_leaf=200의 엄격 정규화, 그리고 4H-2H-RSI 계층으로 실전 1분 루프에서 과다 진입과 지표 지연을 억제하는 프로덕션 설계 청사진이다.
NVIDIA CEO 젠슨 황과 LangChain CEO 해리슨 체이스가 기업용 AI 에이전트 구축을 위한 Nemotron 3 Ultra와 OpenShell 활용 전략을 논의한다.
Jamf의 AI Governance는 Amazon Bedrock와 연동해 Mac에서 실행되는 AI 애플리케이션의 구성과 추론 경로를 중앙에서 정의·배포·검증하여 AWS 보안 경계 내에서 추론을 유지한다.
ALB의 무인증 헬스체크와 AgentCore의 SigV4/OAuth 인증 충돌을 해결하기 위해 Lambda 프록시 패턴과 ALB에서 VPC 엔드포인트 ENI를 직접 타깃하는 패턴 두 가지를 제시한다.
Row-Bot Plugin System v2는 플러그인이 네이티브 도구와 런타임 표면을 추가하되 실행·권한·안전 관리는 코어가 유지하도록 설계되었다.
ROHAS 법률 벤치마크의 10문항 검사에서 GPT-5.5가 존재하지 않는 법규를 창작해 O2 문항에서 실패하며 실격 처리되었다는 보고와 벤치마크 설계(추론·근거·불확실성·맥락·형식) 설명.
오픈소스 에이전트 Chimera의 벤치에서 모델 퓨전은 동일 품질에 토큰을 11배 더 사용했고 오케스트레이터는 작업 형태에 따라 최대 66.5% 토큰 절감 효과를 보였다.