본문으로 건너뛰기

2026년 7월 17일 AI 뉴스

77

관심 태그 추가

Claude Fable 5보다 저렴한 Kimi K3, 11가지 놀라운 개발 사례

Moonshot AI의 Kimi K3 모델을 활용해 단일 프롬프트로 구현한 11가지 창의적인 개발 프로젝트와 비용 효율성을 분석한다.

r/LLMDevs26일 전

파레토 효율성 비교, GPT-5.6 Sol 등 고성능·비용 지점

LLM들의 코딩 성능을 토큰당 비용과 함께 산점도로 비교해 파레토 효율 모델과 비용-성능 트레이드오프를 시각적으로 제시한다.

헬스케어 AI, 2개월 걸리던 배포를 며칠 만에 끝내는 법

Abridge는 LangGraph와 LangSmith를 활용해 임상 환경에서 안전하고 빠르게 AI 에이전트를 배포하는 평가 및 테스트 파이프라인을 구축했다.

학생 분포에서 샘플을 선택하는 Requential Coding 공개

교사 모델이 학생의 생성 분포에서 학습 샘플을 선택하고 학생이 자체 생성한 샘플로 학습하면서 일반화 성능을 개선하는 Requential Coding 연구와 구현이 arXiv 논문과 GitHub에 공개되었다.

Ollama와 Llama 3.2로 로컬에서 작동하는 파일 자동 분류 도구

Ollama에 설치한 로컬 Llama 3.2를 사용해 파일명 목록을 LLM에 전달하고 엄격한 JSON 출력으로 의미 기반 카테고리를 만들어 파일을 이동하는 도구를 제작했다.

온디바이스 검출과 ESP32 제어로 완성한 35달러 DIY 잠금함

Roboflow 학습 모델을 iPhone에서 온디바이스로 실행하고 서버리스 워크플로우로 검증한 뒤 ESP32가 12V 솔레노이드를 제어해 배송 시만 열리는 잠금함을 구현한 튜토리얼이다.

24시간 만에 AI 인플루언서로 수익 창출하기: 실제 실험 결과와 비즈니스 모델

AI 인플루언서 구축 과정과 Fanvue를 활용한 구독 기반 수익화 모델의 실제 실험 결과를 공유한다.

300개 이상 항목을 모은 공개 AI 도구 색인

aglio-lab이 CC0로 공개한 300개 이상 AI 평가·RAG·에이전트·파인튜닝·거버넌스 도구 목록을 카테고리별 링크로 제공한다.

단일 7B-MoT로 박스·세그먼트·깊이까지 처리하는 SenseNova-Vision 공개

SenseNova-Vision은 단일 7B-MoT 멀티모달 모델로 이미지와 자연어 지시를 결합해 검출·세그먼트·깊이·노말 등 다양한 CV 출력을 생성하며 체크포인트는 약 29.6GB이다.

r/LLMDevs26일 전

계측으로 찾는 에이전트 파이프라인 결함

에이전트 파이프라인의 오류는 대부분 프롬프트가 아니라 계측으로 발견되는 데이터 형태 불일치와 도구 출력 포맷 변화에서 비롯된다고 주장하며, 간단한 스팬·구조화 로그·카운터로 근본 원인을 추적할 것을 권한다.

Vizuara26일 전

모델은 상품일 뿐이다, AI 에이전트의 핵심은 Harness Engineering이다

AI 모델이 범용화되는 시대에 에이전트 루프와 시스템을 설계하는 Harness Engineering의 중요성과 관련 워크숍을 소개한다.

r/ClaudeAI26일 전

프리미엄 모델을 쓰지 않고 9.5× 비용을 줄인 세 단계 아키텍처

프리미엄 모델은 웹 페이지를 직접 읽지 않고 아키텍트·오케스트레이터·262명의 워커로 정보를 증류하여 전체 비용을 9.5배 절감했다.

HF Daily Papers26일 전· 28일 전 발행

Rust용 부분 프로그램 검사와 컴파일러 피드백 통합

Generative compilation은 sealor를 통해 부분 프로그램을 완전한 코드로 변환해 생성 중 컴파일러 진단을 적용하고 Rust 리포지토리 과제에서 컴파일 실패와 기능적 오류를 줄였다.

HF Daily Papers26일 전· 28일 전 발행

토큰 구조를 중심에 둔 이산 확산 모델의 설계·평가 지침

토크나이제이션을 핵심 설계축으로 삼아 이산 확산 모델의 상태공간 구성, 오염·역과정, 학습목적, 추론알고리즘 및 평가를 통합적으로 정리했다.

YC 회장의 gstack, 810배 생산성 주장의 진실은?

Garry Tan이 공개한 gstack의 작동 원리와 실제 생산성 향상 효과, 그리고 코드 리뷰 성능을 분석한다.

Roboflow Blog26일 전

천 개 모델을 수용하는 공유 GPU 플릿 설계

수천 개의 고객 모델을 호스팅하는 비전 추론 환경은 입력 데이터가 크고 레이턴시가 이원화되며 VRAM 제약으로 인해 동기적 API 설계가 시스템 불안정을 초래한다고 분석했다.

Atlas 도입 계획에 따른 노동자 반발과 공장 부분 가동 중단

현대의 휴머노이드 로봇 도입 계획을 둘러싼 협상 결렬로 울산 공장에서 부분적 작업 중단과 예정된 단축 파업이 발생했다.

r/artificial27일 전

온프레미스 에이전트의 허점: 커넥터 범위 부족

사내 VPC나 온프레미스에 에이전트를 배치해도 기본 제공 커넥터만으로는 내부 핵심 시스템에 접근하지 못해 통합 작업의 실질적 과제는 커넥터 매핑에 있다.

Grok 4.3이 Mantle 기반 Bedrock에 통합된 100만 토큰 컨텍스트 모델

xAI의 Grok 4.3이 Amazon Bedrock에서 Mantle 엔진으로 구동되며 100만 토큰 컨텍스트와 요청별 조정 가능한 사고 노력 수준을 제공한다.

Replit의 에이전트 도입으로 코드 생산성 3배 성장

지난 6개월간 Replit에서 코드 산출량이 거의 3배로 늘었으며 에이전트가 반복적 운영 업무를 자동화해 품질 지표와 릴리스 속도가 함께 개선되었다.

r/ClaudeAI27일 전

Claude Fable 5의 4.2배 속도 차와 Baba 벤치 성과

Baba 퍼즐 벤치에서 인간과 여러 LLM의 시간당 해결 성과가 비교되었으며 차트는 Claude Fable 5가 4.2배 빠르다고 표기되어 있다.

에이전트 자율성 확대와 평가 신뢰의 격차

VentureBeat 설문에서 157개 기업 중 절반이 내부 평가를 통과한 에이전트가 고객-facing 실패를 일으킨 경험이 있고 자동화 평가에 대한 완전 신뢰는 5%에 불과하다고 나타났다.

Nemotron 3 Embed의 RTEB 전체 1위와 에이전트형 검색 진전

NVIDIA의 Nemotron 3 Embed가 RTEB에서 전체 1위를 기록하며 에이전트형 검색에서 더 나은 검색 기반 컨텍스트 품질을 제공했다.

LangChain27일 전

OpenWiki 0.2 업데이트: OKF 도입으로 더 정교해진 검색과 구조화

OpenWiki 0.2가 Open Knowledge Format(OKF)을 채택하여 YAML 메타데이터 기반의 구조화된 검색과 데이터 관리를 지원합니다.

UTKFace에서 MAE 4.65, 파라미터 3.23M인 모바일 연령 추정 모델

MobileAgeNet은 MobileNetV3-Large 기반으로 설계되어 UTKFace에서 4.65년 MAE를 기록하고 3.23M 파라미터와 약 14.4ms 온디바이스 추론 성능을 달성한 경량 얼굴 연령 추정 모델이다.

바운딩 박스 예측의 한계를 넘다: 객체 탐지 성능을 극대화한 D-FINE 모델

D-FINE은 확률 분포 기반의 바운딩 박스 정제와 자기 증류 기법을 통해 기존 객체 탐지 모델의 속도와 정확도 문제를 해결했다.

소규모 파인튜닝에서 2e-4가 실패할 때 적용한 1e-4·에폭 증가 규칙

QLoRA 소규모 파인튜닝에서 기본 학습률 2e-4가 과적합을 유발하여 1e-4로 낮추고 에폭을 늘리자 검증 성능이 크게 개선되었다.

k-space 없이 작동하는 다중 콘트라스트 MRI 재구성 파이프라인 공개

이미지 도메인에서 대비 불변 콘텐츠를 학습하고 이를 고정된 prior로 반복적 재구성에 삽입하여 k-space 훈련 없이 다중 콘트라스트 MRI에서 우수한 성능을 달성하는 PnP-CoSMo 프레임워크이다.

RF-DETR과 Gemini 2.5 Pro로 매대 재고 우선순위 자동화

RF-DETR로 병을 검출해 전면 가시 수를 집계하고 Python 블록으로 부족분을 계산해 Gemini 2.5 Pro가 점검 요약을 생성하는 매대 모니터링 워크플로이다.

AI 모델 춘추전국시대: Inkling부터 Anthropic의 J-space까지

Thinking Machines의 Inkling, Meta의 Muse Spark 1.1, OpenAI의 GPT-5.6 Sol 등 최신 AI 모델과 Anthropic의 J-space 연구를 분석합니다.

파일로 상태를 유지하는 영구 에이전트가 모델 교체 문제를 간단히 해결한 사례

신원·세션·관찰을 JSON·마크다운으로 디스크에 저장하는 에이전트 설계가 Sonnet·Opus·Claude 5 세대 교체에도 작업 연속성을 유지하게 했다.

K3의 코딩·브라우징 우위와 가격 재평가

K3가 여러 코딩·브라우징 벤치에서 Fable을 앞서며 가격 대비 효율성 논쟁을 촉발하고 있다.

빅테크의 AI 전쟁: AWS의 투자와 Apple의 중국 진출 전략 분석

Thinking Machines의 Inkling 모델 출시, OpenAI의 GPT-RED, AWS의 AI 엔지니어 투자 등 최신 AI 산업 소식을 요약한다.

VentureBeat 설문으로 본 에이전트 성숙도 지표의 한계, 71% 사례 포함

VentureBeat 설문에서 응답 기업의 71%는 자사가 '에이전트'라고 부르는 것 중 25% 이하만이 실제 다단계 워크플로를 수행한다고 답했다.

AI 에이전트가 미래를 시뮬레이션하는 법: 상상력 공학의 핵심

AI 에이전트가 단순 반응형 모델에서 벗어나, 미래 시나리오를 시뮬레이션하고 전략적으로 계획하는 '상상력'을 갖춘 시스템으로 진화하고 있다.

AI 시대의 스타트업, 창업가가 집중해야 할 본질과 생존 전략

Y Combinator의 Garry Tan이 AI 시대 스타트업 창업가들을 위한 성공 철학과 기업 운영의 핵심 조언을 전달한다.

시스템 프롬프트 유지 중에도 80%의 세탁된 PR이 통과한 RELAY 실험

RELAY 실험은 시스템 프롬프트가 온전히 유지되어도 에이전트 간 상호신뢰와 권위 프레이밍 때문에 악성 코드가 유통될 수 있음을 보였다.

HF Daily Papers26일 전· 1달 전 발행

Qwen3 계열에서 길이 벌점으로 체인 압축 시 모니터 탐지율 최대 20%p 감소

길이 벌점을 적용한 강화학습으로 연쇄 추론 토큰 수가 크게 줄었으나 힌트 영향은 대체로 보존되어 외부 모니터가 원인 단서를 놓치기 쉬워졌다.

HF Daily Papers26일 전· 29일 전 발행

성공 궤적만으로 단계별 오류를 탐지하는 Neural CDE 기반 Oat

Neural CDE 기반 Oat는 성공 궤적만으로 잠재 동역학을 학습하여 실패 궤적의 각 단계에 이상점수를 부여해 오류 기여 단계를 식별하며, MCP-Atlas/Who&When 평가에서 prompting 기반 대비 F1이 각각 +20%/+7% 향상되고 200–5000× 빠르게 동작한다.

HF Daily Papers26일 전· 28일 전 발행

재현 가능한 에이전트 평가 파이프라인 AgentCompass

AgentCompass는 벤치마크·하네스·환경을 분리한 모듈식 인프라로 에이전트 평가의 재현성과 확장성을 확보했다.

HF Daily Papers26일 전· 28일 전 발행

LMM 기반 합의형 이미지 최적화로 시공간 일관성을 개선한 Hallo4D

LMM으로 멀티뷰·다중 프레임의 구조적·시간적 환각을 진단하고 DDIM 역변환 기반 후보 편집과 합의 선택, OF-Range 및 CSEA/LDR 손실을 결합해 3D/4D 생성의 일관성과 노출 안정성을 향상시켰다.

HF Daily Papers26일 전· 29일 전 발행

파운데이션 모델과 스캐폴드의 병행적 자기개선 로드맵 2023–2026 정리

파운데이션 모델 파라미터 갱신과 운영 스캐폴드 구조 변경의 두 경로로 자기개선 에이전트를 체계적으로 분류하고 관련 신호·방법·평가 과제를 통합한 서베이이다.

HF Daily Papers26일 전· 28일 전 발행

85 ms 추론 지연과 0.85 성공률을 달성한 GigaWorld-Policy-0.5 실시간 WAM 배포

GigaWorld-Policy-0.5는 학습 시 미래 시각적 동역학을 사용하고 추론 시 액션 전용 디코딩을 적용해 RTX 4090에서 85ms 추론 지연과 실세계 평균 성공률 0.85를 달성했다.

로컬 프록시로 에이전트 토큰 폭주와 $55/hr 절감 사례

FastAPI 프록시가 콘텐츠 해싱으로 동일 페이로드 반복을 감지하고 모의 SSE와 실시간 가격 투사로 토큰 루프를 우아하게 중단해 직전 테스트에서 약 $55/시간의 잠재적 비용을 막았다.

HF Daily Papers26일 전· 29일 전 발행

DINOv3 ViT-S/16 기반 AffectFlow가 P_MTL 1.177로 불확실성 기반 다중작업 성능을

AffectFlow-DINO는 조건부 rectified flow로 이미지별 감정 분포를 생성하여 VA 예측의 CCC 향상과 희소 클래스 F1 회복을 동시에 달성하며 검증에서 P_MTL 1.177을 기록했다.

HF Daily Papers26일 전· 1달 전 발행

14K개 UE 함수 제어와 73FPS NumPy 렌더링을 지원하는 SPEAR 시뮬레이터

SPEAR는 UE의 런타임 리플렉션을 직접 노출해 14K개 이상의 UE 함수를 파이썬에서 제어하고 1920×1080 이미지를 NumPy로 초당 수십~70여 프레임 수준으로 전달하는 포토리얼리스틱 시뮬레이터이다.

HF Daily Papers26일 전· 29일 전 발행

4,856개 QA와 1,646개 UAV 영상으로 드러난 MLLM의 자기 인식 격차

SIS-Bench는 1,646개 UAV 영상에서 수집한 4,856개 QA로 MLLM의 공간 인지와 자기 인식을 perception-memory-reasoning 계층으로 평가하고, 광류 기반 모션 융합이 인지·기억 성능을 개선함을 보였다.

HF Daily Papers26일 전· 29일 전 발행

108개 취약점 기준의 취약점 중심 평가로 본 펜테스팅 에이전트 비교

이 논문은 취약점 발견 자체를 단위로 삼아 LLM 판정·이분 매칭·누적 평가·효율성 측정을 결합한 실무 지향 펜테스팅 에이전트 평가 프로토콜을 제안하고 세 대상에서 108개 취약점을 기준으로 실험을 수행했다.

HF Daily Papers26일 전· 1달 전 발행

실행 로그 인과 슬라이스로 VeruSAGE 성공률을 42.5%에서 58.5%로 개선한 STRACE

STRACE는 실행 의존성 그래프와 역방향 인과 슬라이스를 결합해 대표 실패만 선별하고 근원 모듈에 귀납적 규칙을 주입하여 장기 작업 에이전트의 성공률과 비용 효율을 동시에 개선했다.

HF Daily Papers26일 전· 29일 전 발행

모바일에서 직접 실행되는 온디바이스 에이전트 프레임워크 PalmClaw

PalmClaw은 에이전트 루프, 메모리, 스킬, 툴을 휴대폰 내에서 직접 실행하여 GUI 동작을 도구 호출로 대체함으로써 MobileTask에서 성공률을 11.5% 높이고 평균 완료 시간을 94.9% 단축했다.

HF Daily Papers26일 전· 1달 전 발행

3,000개 서비스 인스턴스를 갖춘 사전 대응형 에이전트 연구

EgoServe 벤치마크와 훈련 불필요 메모리 에이전트 EgoMemo를 통해 연속 일인칭 비디오에서 언제 개입할지 스스로 결정하는 사전 대응형 지원 가능성이 실험적으로 확인되었다.

HF Daily Papers26일 전· 29일 전 발행

25퍼센트 가지치기된 Qwen3-4B의 생성 회복과 롤아웃 비용 절감 실험

ShortOPD는 반복률 기반의 동적 롤아웃 예산을 적용한 온-폴리시 토큰 단위 증류로 25퍼센트 구조화 가지치기 후의 생성 품질을 크게 회복하면서 최대 71퍼센트 적은 롤아웃 토큰과 약 24퍼센트 단축된 전체 학습 시간을 달성했다.

HF Daily Papers26일 전· 1달 전 발행

픽셀-공간 DiT 성능을 좌우하는 레지스터 메커니즘

레지스터 토큰은 픽셀-공간 Diffusion Transformer에서 패치 토큰의 노름을 낮추고 중간 표현의 공간적 일관성을 개선하여 생성 품질(FID)을 일관되게 향상시켰다.

HF Daily Papers26일 전· 1달 전 발행

DepthAnything3 프라이어와 z축 RoPE로 대범위 시점 전환을 제어하는 MetaView

MetaView는 DepthAnything3의 중간 특징을 암묵적 기하학 토큰으로 주입하고 RoPE에 z축 스케일 서브스페이스를 추가하여 단일 이미지에서 대범위 시점 전환을 일관되게 수행한다.

HF Daily Papers26일 전· 1달 전 발행

정책 전환에 민감한 이미지 가드레일과 76.9 Avg. F1 성과

같은 이미지에 대해 정책이 바뀔 때 결정이 뒤바뀌어야 하는 경계 사례를 평가하는 PolicyShiftBench와, RP-SFT와 BP-Adapt를 결합해 정책 적응성을 크게 향상시킨 PolicyShiftGuard를 제시한다.

HF Daily Papers26일 전· 28일 전 발행

OmniDocBench 96.58로 파이프라인을 앞선 0.8B 엔드투엔드 문서 파서

OvisOCR2는 Qwen3.5-0.8B를 기반으로 한 0.8B 엔드투엔드 문서 파서로 OmniDocBench v1.6에서 96.58의 SOTA를 달성했다.

HF Daily Papers26일 전· 28일 전 발행

메모리·스킬로 GUI 작업 성공률을 64.1%까지 끌어올린 KnowAct-GUIClaw

KnowAct-GUIClaw은 호스트·라우터·GUI 실행기·반영 루프를 결합한 Know–Route–Act–Reflect 파이프라인으로 GUI 자동화에서 경험을 메모리와 재사용 가능한 스킬로 증류해 장기적 성능과 크로스플랫폼 적응성을 높였다.

HF Daily Papers26일 전· 29일 전 발행

1조 파라미터 Ring-Zero가 유도한 구조적이고 효율적인 CoT 추론

Ring-Zero는 클리핑 중요도 샘플링, 학습·추론 비율 보정, 자기증류, 샘플단위 손실 및 계층형 훈련을 결합해 1조 파라미터 모델에서 사람 판독 가능한 간결한 Chain-of-Thought를 제로 RL로 자발적으로 획득시켰다.

HF Daily Papers26일 전· 29일 전 발행

208.62 million 이미지와 약 $400K로 학습한 오픈소스 멀티모달 생성·편집 모델 계열 공개

Boogu-Image-0.1은 208.62 million unique images와 약 $400K의 이론적 학습비로 개발된 오픈소스 멀티모달 모델 계열로서 텍스트-투-이미지 생성, 명령 기반 편집, 빠른 추론에서 공개 오픈소스 모델들과 동등하거나 우수한 성능을 보였고 폐쇄형 상위 시스템에 근접한 결과를 달성했다.

HF Daily Papers26일 전· 29일 전 발행

행동 중심 핸드북으로 하니스 수정 정확도와 토큰 비용 개선 효과

Harness Handbook은 행동 중심 문서화와 BGPD 워크플로로 하니스의 구현 위치 탐지와 편집 계획 품질을 높이면서 플래너 토큰 사용량을 줄였다.

GLM-5.2 벤치마크에서 드러난 10초 버퍼링과 캐시 완화 영향

같은 GLM-5.2 모델이 동일한 OpenAI 호환 API에서 백엔드마다 스트리밍 동작과 TTFT가 크게 달랐고, 캐시 상태가 지연을 좌우했다.

모델 가중치 변경 없이 ARC‑AGI‑3에서 99% 성능을 달성한 Schema 프로세스

Schema는 모델 가중치는 유지한 채 관찰을 모델화하고 예측을 검증하며 게임별 폴백 재실행 규칙으로 ARC‑AGI‑3에서 Claude Opus 4.8 기준 99% 성능을 보고했다.

2.8T 규모 Kimi K3과 $3/$15 토큰 요금 공개

Moonshot AI가 2.8조 파라미터 규모의 Kimi K3을 발표하고 성능 지표와 토큰 기반 요금, 2026년 7월 27일까지 오픈 가중치 공개 일정을 제시했다.

OpenTelemetry로 멀티에이전트 세션을 재구성하는 agent-session-graph

agent-session-graph는 OpenTelemetry 추적을 이용해 세션 경계, 실행 계보, 컨텍스트 변화, 비용 귀속을 재구성하는 오픈소스 코어이다.

107개 기업 조사로 본 에이전트 보안 격차와 공급자 의존 문제

엔터프라이즈들이 자율 AI 에이전트에 실무 시스템 접근을 허용하는 속도가 신원·격리·집행 통제의 정비 속도를 앞서 보안 격차가 발생하고 있다는 조사 결과가 나왔다.

Linus Torvalds의 AI 코드 도입 수용과 Sashiko의 53.6% 탐지 수치

Linus Torvalds가 Linux에서 AI 기반 코드 도구 사용을 허용한다고 선언했으며 Sashiko는 시험에서 이후 커밋으로 수정된 버그의 53.6%를 찾아냈으나 약 20%의 거짓 양성을 보고했다.

인간을 압도한 AI 에이전트, OpenAI 챌린지 1위의 비결

OpenAI의 Parameter Golf 챌린지에서 자율 연구 에이전트 Aiden이 인간 연구자들을 제치고 최다 기록을 달성하며 인간-AI 협업의 새로운 가능성을 증명했다.

GPT-5.6의 $HOME 삭제 버그와 샌드박스 미적용 위험

GPT-5.6이 전체 권한 모드에서 Codex를 샌드박스 없이 실행할 때 $HOME을 임시 디렉터리로 덮어쓰려다 실수로 홈 디렉터리를 삭제하는 사례가 보고되었다.

2–3조 파라미터 규모의 중국 오픈 모델 Kimi K3

파이낸셜타임스는 Kimi K3가 파라미터 2조에서 3조 사이로 중국에서 가장 큰 공개형 AI 모델이 될 것이라고 보도했다.

모델에게 쓰기 도구를 주지 않는 MCP 런타임 Synapsor Runner

Synapsor Runner는 모델에 직접 SQL 실행 권한을 주지 않고 검토된 기능 표면과 외부 승인·검증 파이프라인으로 읽기·변경 프로포절을 제한하는 오픈소스 런타임이다.

Databricks MLOps 체크리스트와 Free Edition 예제 레포 안내

Databricks 블로그의 MLOps 체크리스트와 GitHub 레포를 통해 CI/CD·추론·버전관리·IaC 관련 실무 예제를 Free Edition에서 실행해 볼 수 있다.

코딩은 이제 타이핑이 아니다: OpenAI의 AI 전용 키패드가 던지는 메시지

OpenAI의 Codex Micro 키패드를 통해 본 AI 에이전트 시대의 개발자 역할 변화와 '지시하는 관리자'로의 패러다임 전환을 분석한다.

전화로 들어온 주문을 처리하는 음성 에이전트 아키텍처

Amazon Bedrock AgentCore, Amazon Nova 2 Sonic, MCP, SIP 게이트웨이, AWS CDK를 활용해 전화 기반 음성 주문을 접수하고 확인까지 처리하는 아키텍처와 배포 구성을 제시하는 기술 블로그 글이다.

AI 코딩 보조, 속도는 빨라지지만 실력은 퇴보할까?

AI 보조 도구 사용이 주니어 개발자의 코딩 속도는 높이지만 디버깅 등 핵심 기술 습득에는 부정적 영향을 줄 수 있다는 연구 결과.

LangChain27일 전

모델보다 하네스가 중요하다: Factory CTO가 말하는 자율 소프트웨어 공장의 비밀

Factory CTO Eno Reyes가 모델 독립적 하네스를 통해 24시간 자율 소프트웨어 공장을 구축하고 인간의 개입을 유지하는 전략을 설명한다.

내부 대각 스케일링을 결합한 이중 삼진 행렬 분해

행렬을 두 개의 삼진 행렬과 중앙의 대각 스케일링으로 분해하면 내부 랭크를 키워 양자화로 인한 정밀도 손실을 줄이면서도 기존 방식보다 약간의 VRAM만 추가로 요구한다.

1Password의 Claude 브라우저 통합과 제로-노출 보안 프레임워크

1Password가 Claude용 브라우저 통합을 공개해 사용자가 자격증명 노출 없이 챗봇에 여행 예약과 계정 관리를 위임할 수 있게 했다.