CNN이 작은 물체와 큰 물체를 모두 놓치지 않는 이유
CNN의 계층적 구조와 FPN, Skip connection 등 아키텍처 기술을 통해 다양한 스케일의 객체를 효과적으로 인식하는 원리를 다룬다.
총 100건
CNN의 계층적 구조와 FPN, Skip connection 등 아키텍처 기술을 통해 다양한 스케일의 객체를 효과적으로 인식하는 원리를 다룬다.
오케스트레이션, MCP, 로컬 SLM, 구조화 출력, CI/CD 평가, Git Worktrees를 중심으로 한 최소 툴셋을 정리했다.
다중 LLM 평의회·심판·30개 검사로 금융 뉴스레터 신뢰성을 설계했다
Gemma 4는 소폭의 파라미터 증가와 지시문 데이터 조정으로 벤치마크에서 크게 향상했으나 사전학습 데이터 세부는 공개하지 않았다.
Max Planck이 여러 최첨단 LLM을 무료로 시험해볼 수 있는 comparity ai와 개인 리더보드를 공개했다.
Wan3.0의 문서 입력 기반 영상 생성과 허브 스토리지 증설, LMCache·Agent Memory 같은 인프라 확장이 동시에 주목받음
AI 도구와 워크플로를 모아 책 쓰기·편집·출판을 지원하는 GitHub 리포지토리
주기적 프로브 샘플링으로 배포된 LLM의 품질 변화를 기준선과 비교해 조기 경고를 생성하는 경량 모니터링 도구.
신뢰구간의 정의를 둘러싼 피셔와 네이만의 통계학적 논쟁을 통해 그 정확한 의미를 파헤친다.
TurboQuant로 KV 캐시를 극한 압축하고 Groq LPU·Ironwood TPU 같은 추론 전용 칩을 조합해 추론 병목을 해소하는 기술 전망 요약
Grok 이미지 게시물과 Muse Code의 하니스 최적화 실험이 관심을 끌었습니다
RNGD와 Backend.AI 통합으로 동일 워크로드에서 와트당 처리량이 1.3x–1.5x 개선되었다.
Anthropic은 6월 15일 시행 예정이던 Agent SDK 및 관련 표면의 구독 분리 과금을 보류했으며, 재개는 지연되나 완전 폐기는 아닌 것으로 판단된다.
Claude Fable 5가 단일 프롬프트와 이미지로 브라우저용 3D 게임을 생성해 GitHub에 배포한 사례 보고
Transformer autoencoder + SVQ로 서브밴드 프리코딩을 초압축해 업링크 효율을 개선한 연구
Video-DeepResearch-35B-A3B는 64.0% 정확도로 Claude-4.5-Sonnet 대비 +5.0%p를 기록했다.
16B 자율회귀 확산 모델이 SA‑DMD와 장기 증류를 결합해 소스 충실도와 장기 안정성을 유지하면서 단일 B200 GPU에서 720p 약 30 FPS 실시간 편집을 달성했다.
로컬 OCR 파이프라인 실험에서 정확도를 60%에서 99%로 끌어올린 과정과 실패·돌파구를 블로그로 공유함
n8n 노드로 AgentCore 하니스를 프로비저닝해 지속 메모리·툴 연동·VPC 실행을 간편하게 구현
브라우저 확장과 네이티브 메시징으로 AgentCore 에이전트가 로컬 MCP 서버의 도구를 표준 MCP JSON‑RPC로 호출하도록 구현했다.
Codex 플랫폼을 활용해 브라우저 제어, 업무 자동화, 원격 연결 등 AI 에이전트의 효율적인 운영 방법을 다룬다.
Claude Code용 글쓰기 스킬 중 humanizer·stop-slop·AI-Research-SKILLs 등이 실무에 유용하다
Mirendil이 Google Cloud와 1억 달러 이상 규모의 컴퓨트 계약을 체결해 TPUs·GPUs 접근을 확보했다.
Spotify 추천팀 출신이 세션·문맥 신호를 실시간 벡터로 읽어 이커머스 개인화를 구현하는 Malachyte를 론칭하고 1천만 달러를 유치했다.
AI 모델이 AI가 생성한 데이터로 반복 학습할 때 발생하는 모델 붕괴 현상의 원인과 이를 방지하기 위한 기술적 대응 방안을 설명한다.
단어 임베딩과 Transformer의 QKV 기반 어텐션을 예제와 수식으로 정리한 입문형 글이다.
Decodo의 스크래핑 API와 MCP를 결합하여 IP 차단 없이 웹 데이터를 수집하고 이를 AI 에이전트와 연동하는 파이프라인 구축 과정을 다룬다.
프롬프트에 토큰 예산을 명시하고 문제 복잡도에 따라 추론 토큰을 동적으로 조절해 CoT의 토큰 사용량을 줄였다.
스키마를 LLM에 제공하고 run_query 도구로 읽기 전용 SQL을 실행해 결과를 반환하는 실무 가이드
픽셀 좌표와 시간 입력으로 밝기를 예측하는 SIREN 기반 신경망으로 Bad Apple을 재구성해 손실 0.0090과 가중치 3.2MB를 기록한 실험.
연구 보고서에 따르면 DeepSeek V4-Flash가 테스트당 평균 3센트로 주요 모델 중 실행 비용이 가장 낮았습니다.
다섯 단계 출처 조회로 미확인 필드는 unknown 처리하고 실행을 보류해 사용자를 묻도록 설계된 사전검증 스켈레톤
Muse Code는 Muse Spark 기반 에이전트로 대형 레포에서 병렬 하위 에이전트를 띄워 코드 계획·작성·검증을 수행한다.
긴 행동 시퀀스를 오프라인에서 깊게 학습하고 온라인에서 경량으로 결합해 광고 랭킹을 확장하는 접근법
대규모 버그 수정과 권한·파싱 개선으로 에이전트 실무 흐름이 더 안정적으로 바뀌었습니다
TensorSharp가 MoE CPU 오프로드를 메인에 병합하고 llama.cpp 대비 다수 설정에서 처리량을 크게 개선한 벤치마크를 공개했습니다.
LLM 파이프라인의 유료 API 비용을 추정하고 재생으로 CI 비용을 없애는 TypeScript 오픈소스 툴
LLM 과금 모델에서 출력 엔트로피를 제약해 토큰당 정보밀도를 올리면 비용을 절감할 수 있다
프리트레인 지식과 태스크 기하를 분리해 일별 리프레시가 가능한 스트리밍 추천 전이 체계를 제시합니다
87M 규모 데이터와 Nano3D-v2로 학습한 통합 3D 이해·생성·편집 모델
Query 기반 인코더-디코더와 블록-인과 확산 Transformer로 고용량 프리픽스 정렬 잠재를 직접 모델링하는 연속-잠재 확산 언어모델
98,843개 상품 기반 365일 주문·주문결과 지연 시뮬레이터로 LLM 에이전트의 장기 일관성을 평가함.
Anthropic 연구진이 LLM의 내부 추론 과정을 해석하는 자코비안 렌즈 기법과 모델의 글로벌 워크스페이스 구조를 제시한다.
AI 에이전트가 사용자 맞춤 기능을 직접 구현하고 실행하는 보안 중심의 새로운 클라우드 앱 아키텍처 'Gadgets'를 소개한다.
생산 실패를 자동으로 수리·재생해 소형 모델로 압축하는 지속 학습 파이프라인
AgentCore로 온프레미스 티켓 조회를 자동화해 응답 시간을 90% 단축하고 성공률 98%를 달성
초심자를 겨냥해 ReLU, Sigmoid, Softmax의 동작을 시각화한 첫 강의 녹화물
Gemini Workspace 확장으로 Docs·Sheets·Gmail을 연결해 맞춤형 뉴스 요약과 NotebookLM 오디오를 자동 생성하는 시스템 가이드
Jeff Dean이 Google을 떠나 Discovery Loop을 창업했고 DeepMind도 리더십 재편이 진행 중입니다.
OpenAI와 Anthropic 모델을 활용해 Polymarket의 예측 시장에서 실제 베팅을 진행하는 AI 에이전트 대결 2주차 과정이다.
구글이 모바일에서 Google Assistant를 9월 4일부터 중단하고 Gemini로 전환을 시작한다.
AISI는 강력한 AI 도구 두 개가 가짜 인물 프로필을 생성해 사람을 속이려 한 사이버 공격 시도가 있었다고 밝혔습니다.
Hark가 웹 구조와 시각적 데이터를 결합해 API가 없는 사이트에서도 작업을 자동 수행하는 Handoff를 공개했다.
Celeris-1은 131k 토큰 컨텍스트와 초당 2,033.7 토큰 출력을 지원하는 비추론형 멀티모달 모델이다
PFor는 MoE+PLE와 혼합 양자화를 결합해 WT9932P4-Tiny에서 9 tokens/s로 동작하는 180.9M 파라미터 LLM이다
Agentic Workflows는 Actions 안에서 실행되는 에이전트를 통해 이슈·PR 등의 판단과 반복 작업을 자동화하되 엄격한 권한·네트워크·출력 제한으로 안전성을 확보한다.
28개 MCP 서버와 250개 도구로 LLM 에이전트의 복합 실무 역량을 평가하는 벤치다.