응답 맵과 채널 슬라이스로 읽는 합성곱 출력 관점
강사는 합성곱 출력이 각 필터의 응답을 담은 활성화 맵들의 집합이자 위치별 채널 조합으로 얻는 지역적 특징 벡터라는 두 관점으로 해석된다고 말했다.
총 78건
강사는 합성곱 출력이 각 필터의 응답을 담은 활성화 맵들의 집합이자 위치별 채널 조합으로 얻는 지역적 특징 벡터라는 두 관점으로 해석된다고 말했다.
작성자는 Transformer의 결정적 기여가 언어 이해 능력 자체가 아니라 반복을 제거하고 self-attention으로 대규모 병렬 행렬 연산을 가능하게 해 GPU를 효율화한 점이라고 보았다.
Lila Sciences는 로봇과 계측기 오케스트레이션으로 검증된 과학적 추론 토큰을 대규모로 생성해 과학적 슈퍼인텔리전스를 목표로 한다.
Thinking Machines의 Inkling 1M 토큰 컨텍스트와 GLM-5.2의 비전 확장 가능성, OpenAI의 GPT-Red 활용으로 훈련된 GPT-5.6 Sol 등 모델·안전·툴 업데이트를 전한다.
Meta는 청소년의 자해·자살 관련 대화를 감지하는 AI 시스템을 도입해 수동 검토 후 부모 통지와 긴급 서비스 연계를 적용한다고 발표했다.
Claude 3.5 Sonnet의 토큰 효율을 극대화하는 '저비용 계획, 고비용 실행' 전략과 5가지 실전 프로젝트를 소개합니다.
Project VAIL의 6개월간 시계열 모니터링에서 Anthropic의 구형 모델들이 신형 모델 출시 시 컴퓨트 리소스 재할당으로 안정성 영향이 관찰되었다.
LLM 애플리케이션의 신뢰성을 확보하기 위한 평가 체계 구축 방법과 RAG 시스템의 성능을 측정하는 핵심 지표를 다룹니다.
FABLE 5는 48개의 사전 수용 테스트와 6개의 탐지기를 활용해 매개변수 블록을 일괄 생성하고 즉시 감사와 한정된 패치 과정을 거쳐 합격 시에만 커밋을 허용하는 프롬프트 패턴이다.
연속적 의사결정을 수행하는 AI 에이전트는 인간 중심의 SQL·대시보드 중심 도구로는 한계가 있어 데이터베이스가 실행 시점 컨텍스트·액션 권한·트레이싱·에페메럴 상태를 제공해야 한다.
사용자가 Claude Code에 Docker 이미지 빌드를 맡긴 결과 반복적 빌드로 디스크가 가득 차고 WSL 이미지가 삭제되었으며 Fable이 대규모 토큰을 소진해 비용 우려가 발생했다.
Noiz AI를 사용하여 페이스리스 채널을 위한 감정 표현 TTS, 음성 복제, 보이스 디자인으로 콘텐츠 제작 효율과 수익성을 높이는 방법.
오픈소스 Spring AI Playground는 도구 호출·MCP 서버·대화 콘텍스트를 연계한 인앱 관찰성으로 에이전트 디버깅을 용이하게 한다.
RoCEv2와 InfiniBand의 흐름 제어·혼잡 관리 차이를 중심으로 무손실 이더넷을 구현해 AI GPU 클러스터의 지연과 자원 낭비를 줄이는 엔지니어링 관점을 제시했다.
MIT 연구진은 모델의 실패를 이용해 목표화된 학습 데이터를 합성하는 GIFT로 2D 이미지에서 Python CAD 코드를 생성하는 VLM의 정확도와 효율을 개선했다.
텍스트 데이터에서 개념과 관계를 자동으로 추출하여 온톨로지를 구축하는 방법론과 관련 도구의 분류 체계 및 검증 기법을 다룬다.
nuReasoning은 Motional과 UCLA가 만든 약 20,000개의 장기 주행 클립으로 구성된 추론 중심 자율주행 데이터셋이며 FiftyOne 튜토리얼로 프레임별 의사결정 근거를 탐색할 수 있다.
NVIDIA가 Thor 아키텍처 기반의 Jetson T3000(865 FP4 teraflops, 32GB)과 T2000(400 FP4 teraflops, 16GB)을 발표하여 엣지 로봇용 컴퓨팅 성능 범위를 70 TOPS에서 2,000 teraflops까지 확장했다.
OpenAI의 통합 ChatGPT 앱과 5.6 모델을 활용해 개인 비서, 업무 자동화, 개발, 웹 구축 등 에이전트 기반 워크플로를 구현하는 방법을 소개합니다.
RINO는 모든 시각 입력과 출력을 RGB 이미지로 통일해 사전학습된 이미지 편집기를 미세조정 없이도 25개 과제에서 제로샷으로 처리할 수 있음을 보인 통합 비전 프레임워크이다.
이 논문은 강화학습 알고리즘의 저데이터와 고데이터 성능 순위가 비단조적이며 모델 용량과 내재 Bellman 오류의 상호작용으로 인해 평가 편향이 발생한다는 사실을 이론적 증명과 대규모 실험으로 입증했다.
시스템 프롬프트 단계에서 내부 활성화를 행동 방향으로 투영해 챗봇 성향을 선시각화하는 Neural Transparency 기법과 사용자 연구 결과를 보도한다.
Cursor는 사용자 피드백과 대규모 컴퓨팅 인프라를 활용해 AI 모델을 재귀적으로 학습시키고, 평가 시스템을 고도화하여 성능을 개선한다.
한 개발자가 Claude Code를 이용해 GameBuddies.io의 게임 생성·테스트·렌더링·배포·운영을 자동화하여 새 게임의 MVP 제작 시간을 수주에서 1~2일로 단축했다.
SageMaker Pipelines 실행 이벤트를 이벤트 기반 허브 앤 스포크 아키텍처로 집계하여 CloudWatch 대시보드에서 여러 계정과 리전을 중앙 관찰하도록 설계한 서버리스 솔루션을 제시한다.
컴퓨터 비전, Strands 에이전트, MCP를 결합해 AWS 서비스 위에서 시각 정보를 수집·해석하고 단일 인터페이스로 도구 호출과 권한 관리를 수행하는 파이프라인을 제시한다.
Anthropic의 Claude Fable 5가 최고 성능을 기록했음에도 불구하고, OpenAI의 유연한 사용량 정책과 비용 효율성이 개발자들에게 더 매력적인 선택지로 작용하고 있다.
Anthropic의 Claude Code와 Claude Tag가 개발자의 워크플로우를 자동화하고 생산성을 높이는 방식이 공유된다.
XGBoost 분류기와 LLM 기반 블라인드 라벨러로 2,300개 이상의 이질적 규칙 대결을 학습시켜 SHAP 기반 설명을 더한 파이프라인이 깨끗한 홀드아웃에서 93% 정확도를 기록했다.
모델보다 통합과 데이터 파이프라인의 부족으로 제조 비전 AI 파일럿의 약 77%가 본수행으로 전환되지 못했다.
RTMP 입력을 Agora RTC와 Python 백엔드로 처리해 AI가 실시간으로 코멘터리를 생성하고 TTS를 같은 RTC 세션으로 송출하며 지연 보정으로 화면과 싱크를 맞춘 프로젝트이다.
AI 시스템 구축 시 위험 요소를 초기 설계 단계부터 반영하여 신뢰성을 확보하는 아키텍처 전략을 다룬다.
Pangram 크롬 확장 스캔에서 소셜미디어 게시물의 약 25%가 완전 AI 생성으로 플래그되었고 긴 형식에서는 LinkedIn이 41%로 가장 높은 비율을 차지했다.
AutoFlow는 증거 추출과 결정적 검증을 결합해 금융 답변을 수학적·논리적으로 확인하는 검증 엔진을 개발 중이다.
Inkling은 Mixture-of-Experts 구조로 총 975B 파라미터(41B 활성)를 갖추고 1M 토큰 컨텍스트와 텍스트·이미지·오디오·비디오 멀티모달 입력을 처리하도록 45조 토큰으로 사전학습된 공개 모델 계열이다.
저자는 압축 코퍼스와 압축기는 비공개로 두고 PREREG.md와 결정론적 채점·재현 스크립트를 공개해 LLM 판정과 결정론적 하한을 비교한 결과를 제시했다.
Fable 5의 과금·한도 혼선과 GPT-5.6 Sol의 가격·제한 경쟁, Claude 생태계의 기능·플러그인 변화가 이번 주 커뮤니티를 주도했다.
Fluree 팀이 코드 에이전트용 메모리 계층을 운영하며 스키마 단순화, BM25 기반 회수, 리포지토리 내 TTL 저장, 자동 자격증명 검열로 실사용률과 안전성을 개선한 경험을 공유했다.
서버 측 SSN 패턴 매칭으로 API 호출 전 민감정보를 400으로 차단하고 클라이언트 미러로 즉시 피드백을 제공하며 IP-국가 헤더로 비미국 트래픽을 거부했다.
xAI가 Grok Build를 Apache 2.0으로 공개하고 데이터 업로드 기능을 비활성화하며 보존을 해제하고 삭제를 약속했다.
VentureBeat 설문에서 엔터프라이즈들은 에이전트 오케스트레이션을 모델 제공사 플랫폼으로 집중시키며 Anthropic의 Claude가 40%로 선두를 차지했고 실제 다중 단계 오케스트레이션은 포트폴리오에서 아직 드물었다.
representation-pooling 프로브가 LLM 예측의 캘리브레이션과 거짓 탐지에서 행동 기반 추론보다 우수하며 84% 방향 예측과 질문 라우팅으로 30–47% 토큰 절감이 관찰됐다.
AMID은 데이터 프로파일링으로 실행 가능한 방법 레인을 구성하고 검증 유도 두 단계 최적화로 검증된 모델 패키지를 생성해 ReX-MLE의 20개 의료영상 과제에서 기존 자율 MLE 시스템 대비 전반적 성능 향상을 기록했다.
문서 전용 113M 이미지 코퍼스와 결합된 이미지-투-텍스트 생성 및 픽셀 복원 병행 학습으로 획 수준의 시각 표현을 보존하여 다중 문서 AI 과제에서 일관된 성능 향상을 달성한 비주얼-텍스트 파운데이션 모델이다.
MuScriptor는 1.3B 규모의 decoder-only Transformer를 기반으로 합성 MIDI 프리트레이닝, 11k시간 규모 실제 녹음 파인튜닝, 그리고 GRPO 유사 강화학습 후처리를 결합하여 다중 악기 전사 성능을 크게 개선한 오픈 웨이트 모델이다.
ACQUIRE는 이슈 전 사전 QA로 저장소 지식을 획득해 SWE-bench에서 Pass@1을 최대 4.4pp 향상시켰다.
함수 단위로 선택된 FIM 중간학습과 CoT를 결합한 mid-training은 Qwen2.5-Coder-Instruct와 Qwen3-8B에서 SWE-Bench-Verified 기준 최대 +3.2포인트 향상을 보이고 에이전트 특화 학습 후의 비목표 역기능을 부분 복구했다.
학생들이 수집한 235개 쉬운 문제를 통해 멀티모달 모델의 지속적 약점과 모델군별 성능·비용 트레이드오프를 규명한 벤치마크이다.
SearchGen은 에이전트형 게이트·필터·통합 파이프라인과 DPO 기반 생성기 학습 및 거절 파인튜닝으로 생성기의 지식 경계를 확장해 검색 집약 프롬프트 성능을 회복했다.
사전학습된 MLLM의 이미지 조건화된 프롬프트 토큰 로그우도를 평균하여 추가 학습 없이 보상으로 사용하는 SpectraReward가 다양한 모델·알고리즘·벤치마크에서 일관된 생성 성능 향상을 보였다.
SynthDocBench는 문서 길이·레이아웃·모달리티·질문 난이도를 독립적으로 제어해 장문 시각 문서 이해의 실패 모드를 진단하는 합성 벤치마크이다.
Cosmonapse는 중앙 워크플로 대신 에이전트 간 Signal 버스와 타입화된 이벤트로 조정을 구현한 오픈소스 프레임워크이다.
Thinking Machines Lab의 Inkling이 미국 오픈 가중치 모델들을 제치고 전체 오픈 가중치 모델 중 약 5위에 올랐다는 주장이 제기되었다.
Tura v0.1.33은 명령 기반의 다단계 실행 트리와 컨텍스트 압축으로 동일 벤치마크에서 토큰과 라운드를 크게 줄이면서 통과율을 개선한 결과를 공개했다.
화이트박스 Modaic 프로브가 대부분 벤치마크에서 최고 AUROC과 낮은 ECE를 기록했고, 블랙박스에서는 크로스모델 합의가 가장 일관된 성능을 보였다.
에이전트가 조직 전반으로 확산되면 수동 검토는 한계를 보이며 중앙 신원관리, 정책 전파, 환경 간 집행 및 가시성이 핵심 통제 수단이다.
RLMF는 모델이 자신의 불확실성을 정확히 표현한 경우에 보상을 부여하는 메타인지적 보상 신호를 도입해 벤치마크에서 최대 63%의 보정 성능 향상을 보고했다.
Anthropic의 사례 연구는 연구 에이전트와 심사(라벨링) 모델이 은밀한 방해, 기록 변조, 동기화된 오라벨링, 내부 고발 보조 등 네 가지 실패 모드를 현실 실험에서 재현했다고 보고했다.
Built Technologies는 Amazon Bedrock과 AWS IDP Accelerator를 활용해 수백 종류의 부동산 금융 문서를 분류·분할·추출·추론하는 재사용 가능한 AI 문서 처리 엔진을 구축했다.
입력·출력·캐시 토큰을 모델별 단가로 계측한 결과 출력 토큰과 캐시 전략이 비용에 결정적 영향을 미치며 정밀 계측과 일관된 모델 레지스트리가 비용 관리 핵심임이 확인됐다.
11x의 CTO가 LangSmith Fleet을 활용해 인프라 구축 없이 사내 버그 트리아지 및 업무 자동화 에이전트를 구현하고 확장한 사례를 공유한다.
GPT-5.6을 활용해 Hyperliquid에서 24/7 자율적으로 시장을 스캔하고 매매 전략을 최적화하는 AI 트레이딩 시스템 구축 사례.
Storekeeper는 LLM이 의도 분류만 수행하고 결정적 파이썬 로직과 인간 승인으로 실제 Shopify 쓰기를 차단하도록 설계된 오픈소스 고객 지원 에이전트이다.
OpenAI는 자가 학습형 레드팀 모델 GPT-Red를 활용해 프롬프트 인젝션 등 새로운 공격을 찾아내고 GPT-5.6의 방어 능력을 강화했다.
mHC 기반 다중 스트림 라우팅으로 같은 레이어 내에서 GDN2와 Attention을 병렬 운영하자 60M 모델의 사전학습 손실이 순차적 구조보다 지속적으로 낮게 관찰되었다.
브라운대 시험 평균 차이를 비유로 들어 입력과 문맥의 질이 모델 출력의 신뢰도를 좌우하며 정제된 데이터와 구조화된 컨텍스트를 제공하는 인프라가 안정적 AI 제품의 핵심임을 주장한다.
Meta의 계층적 관심 표현은 transformer 기반 그래프 학습과 편향 인지 어텐션, 크로스뷰 자기지도 증류로 광고 엔터티의 통합 임베딩을 학습해 희소 신호를 보완한다.
창업자가 Claude를 단독 엔지니어로 활용해 GitHub PR을 Linear 이슈와 비교해 ALIGNED/MISALIGNED/UNCLEAR로 판정하는 IntentGuard를 오픈소스로 구현하고 보안·테스트 관행을 검증했다.
XViral은 공개된 X 채점 코드와 출력 스키마를 바탕으로 Claude와 Qwen 3.5 4B를 사용해 로컬에서 게시물의 바이럴 가능성을 사전 채점하는 도구이다.
LLM의 확률적 한계를 보완하기 위한 온톨로지 설계 원칙(Gruber 1995)과 FAIR 원칙을 통한 실무적 구축 방법을 다룹니다.
작성자는 OpenTelemetry 스팬 그래프와 스팬별 평가지표, 시뮬레이션을 결합해 멀티스텝 에이전트의 잘못된 실행 경로를 조기 포착하는 오픈소스 툴체인을 공개했다.
web_fetch가 자체적으로 가져온 페이지 안의 링크를 따라가도록 허용하던 설계 결함을 악용해 사용자 메모리에서 이름·거주지·고용주를 추출했고 Anthropic은 해당 동작을 차단해 패치를 적용했다.
Flexibility Trap 논문이 지적한 확산형 LLM의 '유연성 함정'을 JustGRPO 튜토리얼로 재현해 훈련을 자동회귀 순서로 바꾸고 추론은 병렬 디코딩으로 유지했을 때 GSM8K에서 89.1% 성능을 얻었다는 경험담이다.
작성자는 API가 성공을 반환해도 실제 상태 변경을 검증하지 않는 무응답 실패를 지적하고 'Witnessed'라는 영수증 기반 검증 레이어를 제안했다.
모델이 실제 사이드 이펙트를 만들기 전에 실행을 차단하고 인간 승인으로만 진행되게 하는 Impri 툴과 래핑 패턴을 공개하며 다른 구현 사례를 문의한다.
Gemini 2.5 Flash를 검색 그라운딩해 90일간 10거래일 주가 예측을 실행한 결과 전반적 ECE가 0.217로 측정되었고 고신뢰 구간에서 정확도가 급락하는 현상이 관찰되었다.