RL 중심 스타트업 25곳이 만든 차세대 인프라 물결
스타트업들이 RL을 제품 중심으로 채택해 시뮬레이션 환경과 성과 채점 도구에 투자하며 AI 인프라의 '학습을 통한 신뢰성' 계층을 성장시키고 있다.
총 65건
스타트업들이 RL을 제품 중심으로 채택해 시뮬레이션 환경과 성과 채점 도구에 투자하며 AI 인프라의 '학습을 통한 신뢰성' 계층을 성장시키고 있다.
LangGraph 기반의 오픈소스 멀티에이전트 템플릿으로 도메인 팩, 실행별 예산 제한, 모의 응답 모드, 운영용 스텁과 800+ 테스트를 제공한다.
문법 제약 디코딩은 토큰별 유효성만 보장하고 종료를 보장하지 않아 Qwen3-VL이 동일 항목을 무한 반복하며, 반복 패널티로 루프를 깰 경우 유효한 항목 수가 0이 되는 문제가 발생했다.
Google DeepMind가 Gemini Omni와 Veo 모델을 활용해 1959년 펠레의 기록되지 않은 전설적인 골을 영상으로 복원했다.
Claude Code와 AI 도구들을 연동하여 숏폼 콘텐츠 제작부터 9개 플랫폼 자동 배포까지 전 과정을 자동화하는 시스템 구축 가이드.
AI의 컨텍스트 윈도우, 추론 능력, 신뢰성에 대해 흔히 갖는 5가지 오해를 분석하고 실제 작동 원리와 한계를 명확히 설명한다.
이 게시물은 Kubernetes에서 GPU를 공유할 때 팀 신뢰 경계를 기준으로 time-slicing, MPS, MIG 중 어떤 방식을 선택해야 하는지 실무적 기준과 장단점을 제시한다.
교사 모델의 롤아웃으로 학생 모델을 미세조정하면 감정·검열 등 교사의 특성이 학생에게 이전될 수 있으며 단순 필터링만으로 이를 막기 어렵다는 사실을 재현하고 가중치와 코드를 공개했다.
카메라 또는 영상 입력에서 먼저 YOLOv5로 화재·연기를 감지하고 위험이 포착된 프레임에 한해 COCO 기반 사람 검출을 수행하는 경량 Edge AI 데모이다.
SRM-LoRA는 LoRA 파라미터 공간에 민감도 기반 리만 계량을 적용하여 역전파 업데이트의 고비용 방향을 억제함으로써 환각을 줄이고 사실성을 개선한 방법이다.
Microsoft Build 녹화에서 NIST 접근법을 근거로 책임 있는 AI 원칙과 인간·AI 워크플로 설계 연구가 논의되었으나 구체적 수치나 코드 등 재현 가능한 기술 세부사항은 제공되지 않았다.
간단한 브리프로 샷 리스트를 생성하고 비디오 모델을 호출하는 에이전트에서 엄격한 JSON 스키마, 필드 길이 검증, 최대 샷 제한, 재시도 루프를 도입해 형식 오류를 대부분 해결했다.
Miora는 브랜드명과 타겟, 분위기만 입력하면 로고, 컬러, 영상 등 전체 브랜드 에셋을 자동으로 생성하는 에이전트 기반 디자인 플랫폼이다.
비전·레이다 수신 영상에서 곱셈적 노이즈를 로그 변환으로 덧셈화하고 필터링 기반 복원 절차가 핵심이다.
Humanbound는 MCP를 통해 에이전트 엔드포인트에서 자동화된 적대적 프로빙과 런타임 방어를 연계하는 오픈소스 보안 테스트 엔진이다.
로컬 MacBook M3 Pro에서 llama.cpp 기반 CPU 추론 서버 reame로 네 개 LLM을 같은 웹페이지로 평가해 Qwen3.5-9B가 정확성을 보였고 특정 모델은 발명·자기모순·계산 오류를 보였으며 재현 가능한 성능수치와 추론 중단 버그가 보고되었다.
작성자는 dense optical flow와 시간적 집계를 활용한 결정적 복구 파이프라인으로 Ghost Font를 복구하고 OCR과 LLM 조합으로 문자를 해독했다며 논문과 Colab 코드를 공개했다.
Latent Space는 GPT 5.6 출시 직후 7월10–12일에 600만 사용자가 관측되고 24.5시간 후 700만으로 갱신된 데이터와 과거 Codex의 200만 사용자 공개를 근거로 채택 추이 차트를 업데이트했다.
Chain of Thought가 읽기 좋은 추론 흔적을 남기더라도 계산의 충실성을 보장하지 못하고 토큰 직렬화 비용이 커지므로 잠재 재귀와 외부 감사 DAG를 조합하는 방향이 제안된다.
VaseMuseum은 시각 기반 추론과 반복적 외부 검색을 결합하고 출처·응답 제어와 훈련-프리 GRPO 선택을 통해 도자기 관련 질의에 대해 근거 기반이고 불확실성 보정된 답변을 제공한다.
Soofi S는 Nemotron 3 Nano 기반의 하이브리드 MoE 모델로 약 27조 토큰으로 학습되어 독일어 성능을 강화하고 긴 컨텍스트에서 높은 추론 처리량을 달성했다.
AI 에이전트의 보안과 원격 연결을 위해 Tailscale을 활용하여 안전한 프라이빗 네트워크를 구축하는 방법을 다룹니다.
차세대 AI의 전력 수요가 기존 데이터센터 공급능력을 초과하면서 랙당 수십 kW에서 메가와트까지의 격차와 이를 완화하는 저전력 하드웨어 배치 방안이 부각되었다.
저자는 책의 GPT-2 구현을 따라하며 355M 파라미터 모델을 Kaggle 무료 GPU에서 함수 호출 출력으로 파인튜닝해 88%의 올바른 파싱 결과를 얻었다.
AI 에이전트의 실행 계획에 형식 검증과 증명 포함 코드를 도입하여 안전성을 강제하는 프레임워크 Automind와 언어 Universalis를 소개한다.
PagedAttention이 KV Cache에 가상메모리와 copy-on-write를 적용해 추론의 GPU 메모리 병목을 줄이고 vLLM 계열 엔진의 처리량을 크게 향상시킨다
비디오를 프레임·클립 수준에서 임베딩 또는 해시로 표현해 코사인·해밍 거리로 비교하는 6기법 벤치마크 실전 가이드이다.
Tyler the Creator 어조를 모사한 'Igor' 페르소나가 force-for-plugin 기반 무의존 배포로 공개되어 세션 훅 없이 일관된 캐릭터를 제공한다.
픽셀 플로우 분해와 optical flow 처리로 영상에서 호흡 신호를 분리하고 얼굴 마스크를 열 증폭기로 활용해 저해상도 열영상으로도 호흡 깊이와 코/입 호흡을 판별할 수 있다.
Apple과 OpenAI의 법적 분쟁을 통해 본 AI 산업의 경쟁 심화와 미국 정부의 지정학적 규제 움직임을 분석한다.
기업 내 AI 에이전트와 섀도우 AI 확산에 따른 기존 보안 모델의 한계를 분석하고, 브라우저 기반의 정책 내재화 방안을 논의한다.
Anthropic은 309,815회 대화를 자동 라벨링해 339개 가치 범주를 도출하고 이를 4개 축으로 압축해 Claude 계열 모델과 언어에 따른 가치 성향 차이를 식별했다.
MedPMC는 6.1M PMC 논문에서 11M 의료 이미지-텍스트 쌍을 자동으로 정제해 고충실 학습 데이터로 변환하고, 이를 학습한 MedPMC-CLIP이 BMC-CLIP 대비 평균 AUC를 7.1 포인트 향상시킨 연구이다.
S3M 표현을 PanPhon 음운 벡터로 투사한 SPAM은 1분 미만의 라벨만으로도 견고한 음소 분할과 인식을 달성하며 다양한 언어·도메인에서 일반화되었다.
Flow-ERD는 AFM(Agent-type Aware Flow Matching)으로 연속적 다중모드 행동을 생성하고 ERD(Entropy-Regularized Distillation)로 폐루프 분포를 온도 조정해 WOSAC에서 높은 RMM(0.7878)과 보존된 다양성(CPD 0.1828)을 달성했다.
이 논문은 파인튜닝으로 새로운 사실을 빠르게 암기하는 LLM이 해당 지식을 다중홉 추론으로 활용하지 못하는 'Knowing–Using Gap'을 규명하고, self-patching으로 58–75%의 회복이 가능함을 입증했다.
모델이 질문 관련 스팬을 스스로 표지한 뒤 그 스팬만으로 테스트-타임 next-token 학습을 수행하는 Self-Guided TTT는 긴 문맥에서 적응 신호의 잡음을 줄여 성능과 효율성을 동시에 개선했다.
PanoWorld는 ERP의 회전-등변성을 이용해 회전을 재투영으로 처리하고 DPRC와 GMA로 병진 기반의 고충실 파노라마 영상 생성과 장기 메모리 일관성을 달성한 프레임워크이다.
ReChannel은 T2I 백본의 토큰 필드를 활용하여 타깃-사이드 VAE 디코더를 제거하고 토큰-로컬 선형 리드아웃으로 픽셀-정렬 dense prediction에서 SOTA 성능과 최대 2.48× 처리 속도 향상을 달성했다.
KronQ는 Kronecker-팩터화 헤시안 근사로 그래디언트 공분산을 양자화 손실에 통합해 2비트 가중치 양자화에서 LLaMA-3-70B의 WikiText-2 perplexity를 7.93으로 유지했다.
TOP-D는 교사와 학생 확률을 α로 보간해 로그 보상을 하한으로 묶고 내부 trust region 반복으로 오프라인 데이터를 안전하게 재사용하여 그래디언트 분산을 제어하고 AIME 벤치마크에서 OPD 대비 최대 25.84%p 절대 향상을 기록했다.
GenCeption은 텍스트-투-비디오 생성 사전학습을 피드포워드 인식기로 전환해 단일 모델로 깊이·법선·세그멘테이션·3D 관절 등 다양한 시각 과제를 적은 파인튜닝 데이터로 달성한다.
문서 원형 이미지에서 추출 과정을 거치지 않고 비지도 시각적 사전학습을 수행하면 동일 코퍼스에서의 텍스트 전용 사전학습보다 언어 지능 성능이 일관되게 향상되었다고 보고되었다.
Long-Horizon-Terminal-Bench는 46개 장기 터미널 과제를 서브태스크 기반 밀집 보상으로 채점하여 평균 통과율 4.3%와 GPT-5.5의 15.2% 통과율을 보고함으로써 장기 실행과 검증의 취약점을 드러냈다.
장기 실행 함수 호출 에이전트의 히스토리를 바이트 일치 방식으로 폴딩해 프롬프트 캐시 재사용을 목표로 한 오픈소스 도구이다.
LLM의 $/Mtok, STT의 $/min, TTS의 $/1M chars를 포함한 134개 모델·25개 공급자 비용 데이터와 원시 JSON·레포를 CC-BY-4.0으로 공개한다.
SceneSmith는 VLM 기반의 디자이너·크리틱·오케스트레이터 3개 에이전트 협업으로 사실적 3D 실내 장면을 자동 생성하여 로봇 시뮬레이션용 환경을 대폭 풍부하게 만들었다.
RAG Benchmark 2026은 Exa가 종합점수 88.5로 품질 1위를 기록했으나 KeiroLabs가 1,000쿼리당 $3.76로 최저 TCO를 보여 비용 대비 가치에서 우위를 보였다.
Pheno4D는 옥수수와 토마토 개체를 20일간 매일 레이저 스캔해 서브밀리미터 포인트클라우드와 각 포인트별 인스턴스 ID를 제공하여 잎 면적·길이·줄기 지름 등 장기 성장 추적을 가능하게 하는 데이터셋이다.
UAVid 원본을 YOLO 호환 디렉토리 구조로 재구성하고 YOLO26 기반 의미 분할 사전학습 모델과 상세한 모델 카드를 Hugging Face에 공개했다.
SageMaker AI Studio의 UI가 데이터 기반 권장 설정과 사전설정 프로필 및 원클릭 배포를 통해 생성형 모델의 프로덕션 배포 시간을 분 단위로 단축한다.
Amazon Bedrock AgentCore Identity가 OAuth 2.0 Token Exchange(RFC 8693)를 사용해 다중 테넌트 에이전트 환경에서 사용자 신원을 audience‑bound 토큰으로 안전하게 전달한다.
GPT-5.6과 Grok 4.5가 같은 날 출시되고 Apple이 OpenAI를 소송했으며 완전 자율 랜섬웨어 'JADEPUFFER'가 보고되고 OpenAI는 ChatGPT Work를 출시했다.
CodeAlchemy는 합성 데이터 파이프라인으로 오픈소스 코드에서 생성한 토큰이 거의 1조에 이른다.
AI 에이전트가 안전하게 코드를 실행하고 작업을 수행할 수 있는 샌드박스 클라우드의 아키텍처, 격리 기술, 지속성 및 확장 전략을 다룹니다.
LLM 게이트웨이와 프롬프트 분류기, 라우팅 테이블과 컴팩션을 결합해 에이전트 개편 없이 AI 비용을 줄이는 실용적 방안을 제시했다.
인텔이 아일랜드 레익슬립 캠퍼스에 AI와 고성능 컴퓨팅 수요에 대응하기 위해 50억 유로를 투자해 제조 능력을 확장한다.
Prime Intellect가 제공하는 오픈소스 post-training 도구와 prime-rl 라이브러리, 그리고 Lab 플랫폼을 활용한 에이전트 모델 학습 및 배포 인프라를 분석한다.
오픈소스 AI 에이전트 Boop의 iMessage 연동, patchright 기반 브라우저 자동화, Convex 데이터베이스 도입 및 데스크톱 앱 전환 과정을 다룬다.
팀은 반복적 코드 생성 호출의 약 75%를 저비용 모델로 처리하고 판단이 필요한 호출만 고비용 모델로 보내면서 전체 비용을 크게 낮췄다.
AI가 대다수 코드를 작성해 수주 내 배포된 브라우저 오픈월드 레이서 사례에서 AI는 보일러플레이트와 일회성 시스템을 빠르게 구현했으나 공간 추론·전역 상태 모델링·퍼포먼스 예측에서는 인간의 지속적 검증과 판단이 필수였다.
작성자는 에이전트별 과거 기준선 대비 실패율이 2배를 넘으면 자동 실행을 제한하고 제안 전용 모드로 전환하는 guardplane 구현과 데모를 공유했다.