본문으로 건너뛰기

2026년 7월 18일 AI 뉴스

80

관심 태그 추가

GPT-5.6 Sol 인덱스 80대와 비용-성능 트레이드오프

GPT-5.6 Sol은 여러 크기와 다단계 reasoning-effort 설정을 통해 비용과 인덱스 성능 사이의 트레이드오프를 제공하며 Ultra는 서브에이전트 병렬화로 Max와 유사한 성능을 목표로 한다.

1,600페이지 크롤링과 약 $0.016 비용으로 LLM용 정제 마크다운 변환 도구

asyncio와 trafilatura를 활용해 대규모 문서 사이트를 노이즈 제거한 마크다운으로 변환하고 Apify Actor로 패키징해 RAG 파이프라인에 곧바로 투입 가능한 형식으로 제공했다.

AI의 지식 체계, 온톨로지와 지식 그래프 기초 완벽 정리

온톨로지와 지식 그래프의 기본 개념, 구성 요소, 그리고 WordNet, UMLS 등 대표적인 사례를 통해 데이터 구조화의 기초를 학습합니다.

토큰 비용 100배 격차를 줄이는 Token Engineering 플랫폼

토큰 엔지니어링은 비용·지연·신뢰성을 동시에 최적화하는 시스템 공학으로, 모델·기법·하드웨어 선택에 따라 동일한 작업 비용이 100배까지 달라질 수 있음을 지적한다.

Speculative Decoding으로 LLM 추론 병목 줄이기

작은 초안 모델이 큰 모델보다 가볍게 여러 토큰을 미리 예측하고 큰 모델이 그 예측을 병렬로 검증해 정답이 유지되는 한 예측 토큰을 즉시 채택하면서 추론 지연을 줄이는 방식이다. 이 구조는 초안 모델의 선행 예측과 큰 모델의 병렬 검증이라는 두 단계로 동작하며 최종 출력의 변경 없이 처리량을 향상시킨다. 영상 링크와 재생목록을 통해 생산 환경에서의 적용 맥락과 관련 최적화 기법들을 연계해 다루고 있다.

AI Engineer25일 전

프롬프트 수정 한 번에 사용자 12%가 이탈한다면? AI 에이전트를 위한 안전한 배포 전략

AI 에이전트 시스템의 안정적인 배포를 위해 프롬프트, 모델 라우팅, 자율성 수준을 제어하는 피처 플래그 패턴과 킬 스위치 도입 전략을 다룬다.

에이전트가 잠자는 동안 비용은 0원, 체크포인팅으로 구현하는 효율적 에이전트 운영

에이전트의 대기 시간을 줄이고 실행 상태를 영구 저장하는 체크포인팅 기술을 통해, 비용 효율적인 대규모 에이전트 운영과 반복적인 성능 개선이 가능하다.

시간 기반 지식 그래프와 10개 런타임 어댑터를 갖춘 world-model-mcp

world-model-mcp는 사실별 유효기간과 증거 유형, 감쇠 반감기를 기록하는 시간 기반 구조화 메모리와 모순 해소·Coach-Player 검증 루프를 통해 코딩 에이전트의 지속 메모리 오류를 줄이는 오픈소스 프로젝트이다.

r/LLMDevs25일 전

Anthropic API 캐시 오해로 인한 과다 청구 원인 규명

Anthropic API는 메시지의 완전 일치에만 캐시를 적용하며 컨텍스트를 변경하는 압축 플러그인은 오히려 비용을 증가시킬 수 있다.

AI가 만든 SaaS는 진짜일까? Enter Pro로 구축한 이커머스 플랫폼 실전 검증

AI 코딩 에이전트 Enter Pro를 활용해 데이터 영속성과 결제 시스템을 갖춘 멀티테넌트 이커머스 SaaS를 구축하고 실전 성능을 검증한다.

GNN 기반 P2LNet으로 HD 지도 토폴로지 검증 실무 가이드

그래프 신경망 기반의 P2LNet을 통해 HD 지도 요소 간의 토폴로지와 연결성을 자동으로 검증하는 방법과 논문 및 포스트프린트를 공유한다.

규칙 검출과 전송 전 차단으로 API 키 노출을 막는 거버넌스 스택

Continuum은 비밀을 모델 컨텍스트에 두지 않고 전송 전 게이트에서 생성물을 검사해 위반을 차단하고 감사 로그를 남기는 에이전트 거버넌스 레이어이다.

스테레오에서 공간음향으로 변환하는 모델 공개, 2x A6000로 20일 훈련

스테레오 입력을 잠재공간과 원파형 두 경로로 변환하는 flow-matching 기반 모델을 공개했으며 amplitude lifting으로 웨이브폼 학습 불안정성을 해결하고 코드·모델·앱을 배포했다.

전문가 판단 예측으로 개념적 추론 능력 측정하기

특정 인간 판단자의 응답을 예측하도록 AI를 평가하는 방식을 통해 주관적·논쟁적 개념적 추론 과제에서 순수한 역량 변화를 추적하는 방안과 그 설계상 제약을 밝힌다.

HF Daily Papers25일 전· 3달 전 발행

토큰별 속도 제어로 고속 조건부 생성 성능을 개선한 TTCD

TTCD는 연속 공간 확산과 토큰별 시간 개념을 결합하여 고속 생성에서 이산 확산 모델보다 조건부 생성 품질이 우수하다고 보고했다.

HF Daily Papers25일 전· 28일 전 발행

규제 문서와 코드 DB를 결합해 Scenic 스크립트 컴파일 성공률을 76.42%로 끌어올린 Chat2Sc,

Chat2Scenic은 RAG 기반의 이터레이티브 컴포넌트 생성과 다양한 프롬프트 기법을 결합해 Scenic DSL로 규제 기반 자율주행 테스트 시나리오를 자동 생성하며 Gemini-3-Flash에서 76.42% CSR을 달성했다.

Fable 기반 자동 커밋 시스템 84% 자동확정 기록 공개

Fable 모델이 백엔드를 주도하고 수동 확인을 결합한 자동 커밋 시스템이 30수 동안 84% 자동 커밋 정확도를 기록했다.

Cohere26일 전

텍스트로 영상 만들 때 '이것'만 조정해도 제어력이 3배?

비디오 생성 모델에서 경계 상자를 모델의 내부 어텐션과 정렬하여 사용자 의도대로 영상을 제어하는 최적화 프레임워크.

PPO의 높은 분산 문제를 해결하는 새로운 RL 알고리즘, REPO

REPO는 온폴리시와 오프폴리시 RL의 장점을 결합하여 대규모 리플레이 버퍼 없이도 안정적인 가치 학습을 가능하게 하는 알고리즘이다.

LangChain26일 전

복잡한 AI 에이전트, 어떻게 배포하고 관리할까? LangChain이 제안하는 Deep Agents 실전 가

복잡한 장기 실행 작업을 처리하는 Deep Agents의 핵심 구성 요소와 배포 전략을 알아본다.

동일 랩탑에서 llama.cpp보다 높은 72–77 tok/s를 기록한 CPU 추론 엔진

작성자는 CPU 중심 최적화로 cpubrrr가 동일 랩탑에서 llama.cpp의 약 14.5 tok/s 대비 약 72–77 tok/s를 기록했다고 보고했다.

검증 가능한 AI 생성기 개선 지표와 3단계 평가

세일즈포스는 반복되는 코드 리뷰 피드백을 메타 스킬 생성기로 전환하고 트리거 정확도와 구조적 검증을 포함한 3단계 평가로 개선 효과를 측정했다.

r/artificial26일 전

60건 사례로 드러난 AI 에이전트 실패 패턴

60건의 실증 사례를 모은 CVE 스타일 데이터베이스에서 보안 취약성과 파괴적 행위가 약 절반을 차지했고 47%가 치명적이며 가장 흔한 근본 원인은 검증되지 않은 가정에 따라 결정적으로 행동하는 신뢰도 오차로 확인되었다.

AWS ML Blog26일 전

Smartsheet의 AWS 기반 MCP 서버로 30억 토큰 절감과 에이전트 동작 통합

Smartsheet는 AWS 위에 원격 MCP 서버를 두어 AI 클라이언트가 구조적 데이터에 효율적으로 접근하도록 하고 토큰 비용·환각 위험을 줄여 내부 텔레메트리 기준 30억 토큰을 절감했다.

r/artificial26일 전

스포일러를 막는 LLM UX 3가지 전략

게임 도우미용 LLM이 플레이어보다 앞선 정보를 제공하는 문제를 상태 감지, 프롬프트 제한, 스크린샷 기반 그라운딩으로 실무적으로 완화했다고 보고한다.

David Ondrej26일 전

AI 에이전트 20개 동시 운영하는 개발자의 터미널 셋업

FirstMate와 Herdr를 활용해 다수의 AI 에이전트 세션을 효율적으로 관리하고, CodeRabbit으로 코드 리뷰를 자동화하는 실전 개발 워크플로.

재시도 로직과 런타임 프롬프트로 완성되는 에이전트 하니스

에이전트 하니스는 재시도 로직과 런타임 시스템 프롬프트 조립 등 LLM 기능의 운영적 구성요소를 포괄하는 계층이다.

Matt Wolfe26일 전

Claude Code의 웹 제어부터 1-bit Bonsai 27B 모델까지, 최신 AI 업데이트

Claude Code의 인앱 브라우저 기능, Google 앱 연동, Kimi K3 및 Bonsai 27B 모델 공개 등 주요 AI 기술 업데이트를 요약한다.

AliceWiki 스타일 텔레그램 봇, LangChain·SQLite 기반 로컬 실행

로컬에서 활성화해 텔레그램으로 접근 가능한 AliceWiki 스타일의 LangChain 기반 봇을 JavaScript와 Bun으로 구현하고 채팅 모드와 LLM을 사용하지 않는 툴 전용 모드를 지원한다.

동일 모델에서 다른 렌즈가 만드는 상이한 결정 기하학을 보여주는 시각화 툴 공개

여러 LLM 렌즈(Logit Lens, Patchscopes, Jacobian Lens, Geometric Lens)를 겹쳐 모델의 결정 경계와 토큰 예측 궤적을 공동 시각화하는 도구와 관련 코드 및 논문 링크이다.

QR과 OMR을 단일 프레임에서 동시에 처리하는 Android 라이브러리

OpenScanVision은 ArUco 추적과 호모그래피 보정을 이용해 Android에서 QR 디코딩과 OMR을 동일 프레임에서 병렬로 수행하여 단일 ScanResult를 반환한다.

r/LLMDevs25일 전

RAG 핵심 원리와 워크플로, 시나리오별 선택 기준 가이드

중국어 발표 동영상으로 RAG의 핵심 원리와 전체 워크플로를 단계별로 정리하고 적용 시나리오별 선택 기준을 비교한다.

Splink와 음역·블로킹으로 한·중·일·영 엔티티 중복 축소

한·중·일·영 소스의 기업명이 스크립트별로 분리될 때 음역으로 표기를 통일하고 스크립트별 블로킹과 언어쌍별 유사도 임계값을 적용해 중복을 줄였다.

검증 중심 Rust 코딩 에이전트 하니스, 격리된 변경과 무결성 영수증

Pactrail은 Rust 기반 트랜잭션 하니스로 코드 변경을 격리하고 JSON Schema 기반 도구와 BLAKE3 해시 트레이스로 무결성 영수증을 발급한다.

Claude Fable 5 구독 포함과 50% 사용한도 정책

Anthropic이 7월 20일부터 Claude Fable 5를 Max 및 Team Premium 요금제에 포함하고 사용 한도를 50%로 적용하며 Pro·Team Standard 고객엔 사용 크레딧 방식과 일회성 100달러 크레딧을 유지한다.

Qwen3.6 35B를 16GB Mac에서 구동하는 DS4 Metal 경로 구현

DS4에 Metal 경로와 SSD 스트리밍 기반 전문가 캐시를 더해 Qwen3.6-35B-A3B를 16GB Mac에서 실사용 수준으로 동작시켰으며 사전채우기 15.04 tok/s·생성 9.77 tok/s의 워밍 미디언 성능을 기록했다.

AI Engineer25일 전

AI 에이전트 루프는 마법인가, 아니면 과대포장된 마케팅인가?

AI 에이전트 루프의 실무 적용 가능성과 경제적 타당성, 그리고 소프트웨어 엔지니어링 관점에서의 한계를 다룬 토론.

HF Daily Papers25일 전· 27일 전 발행

다단계 시각 추론에서 76.2% 상대 개선을 기록한 계층적 디노이징

HDR은 트리 구조 잠재와 계층별 디노이징 스케줄 및 SHAP를 결합해 스트리밍 영상 생성에서 논리적 일관성과 낮은 대기시간을 동시에 달성했다.

HF Daily Papers25일 전· 28일 전 발행

언어와 시각 상상을 결합한 체현 인지 파운데이션 모델과 RxBrain-Bench

RxBrain은 언어 기반 계획 구조와 시각적 상상을 단일 계획 시퀀스로 결합해 단계별 물리 상태 예측과 공동 하위목표 계획을 수행하는 멀티모달 Mixture-of-Transformers 기반 파운데이션 모델이다.

HF Daily Papers25일 전· 27일 전 발행

SUFLECA의 ScanNet25k 33.4% 범주 정확도 성능

SUFLECA는 대규모 NOC 약지도 학습과 상호 k-NN 기반 기하학 합의 필터를 결합해 제로샷 CAD-이미지 9D 정렬에서 ScanNet25k 기준으로 33.4% 범주 정확도와 42.3% 인스턴스 정확도를 달성했다.

HF Daily Papers25일 전· 1달 전 발행

문장 수준 탐색과 문단 확장을 결합해 다중 홉 추론의 검색 오류를 줄인 GRASP

GRASP는 문장 수준 검색과 문단 확장을 도구로 삼아 GRPO로 정책을 학습하고 보상으로 정확도·근거읽기·보완적 검색·턴 효율을 합산해 다중 홉 QA의 회수율과 정답률을 향상시켰다.

HF Daily Papers25일 전· 1달 전 발행

32뷰 960P 입력에서 800× 속도 향상과 경량 파라미터 효율성

AsySplat은 기하와 외형을 분리해 계산을 재할당하여 32뷰 960P 입력에서 최적화 기반 방법과 유사한 품질을 유지하면서 추론 속도를 거의 800배까지 단축했다.

HF Daily Papers25일 전· 27일 전 발행

세분화 추정에서 드러난 LLM의 통계적 자기일관성 문제와 평가 기준

논문은 law of total probability를 기반으로 binary tree로 분할한 서브집단 추정을 집계해 LLM의 자기일관성을 검증하고, 세분화 응답에서 더 좋은 정합성이 관찰되는 'macro fallacy'를 보고했다.

HF Daily Papers25일 전· 28일 전 발행

바이트-정확 KV 그래프트로 12B 모델에 87배 컨텍스트와 6,574배 토큰 절감

바이트-정확 KV 상태를 디스크에 저장하고 동일 위치에 복원하는 그래프트로 동결된 12B 모델의 AIME 정확도를 80.0%에서 93.3%로 끌어올리고 반복 질의의 토큰 비용을 6,574배 줄였다.

HF Daily Papers25일 전· 27일 전 발행

시각장애인이 직접 제공한 46.9시간 비디오로 검증한 MLLM의 사전 알림 성능 한계

VIABench는 시각장애인이 직접 녹화한 761개 장기 동영상(총 46.9시간)과 TPAD 평가법을 통해 MLLM의 사전 알림, VQA, 상호작용 능력을 실세계 조건에서 평가하는 벤치마크이다.

HF Daily Papers25일 전· 28일 전 발행

루프드 트랜스포머의 안정적 깊이 확장을 위한 DeepLoop의 p=1/2 규칙

DeepLoop은 루프드 Transformer에서 반복 방문의 정렬 효과를 반영하여 α=(2N)^{1/2}, β=(8N)^{-1/2} 스케일링을 사용해 공유된 블록을 반복할 때의 학습 안정성을 확보한다.

HF Daily Papers25일 전· 27일 전 발행

5분 장편·보컬·BGM 분리 출력 지원하는 순수 확산 음악생성 모델 WanSong v1.0

WanSong v1.0은 연속 오디오 토큰을 단일 확산 백본으로 직접 생성해 최대 5분 길이의 다국어 노래를 보컬과 BGM 분리 스템으로 한 번에 출력하고 VAE 1024 압축률과 RLHF로 품질을 개선했다.

HF Daily Papers25일 전· 27일 전 발행

4스텝 샘플링으로 Wan2.1 VBench 84.33을 달성한 MeanFlowNFT 성과

MeanFlowNFT는 MeanFlow의 평균 속도 네트워크를 유지한 채 MeanFlow 항등식을 이용해 유도된 순간 속도 예측기를 학습시켜 4스텝 같은 few-step 샘플링에서 DiffusionNFT 수준의 정책 개선과 품질 향상을 달성했다.

HF Daily Papers25일 전· 27일 전 발행

8K 타임스텝 장기 컨텍스트 기반 로봇 정책 확장

RoboTTT는 Test‑Time Training으로 fast weights를 활용해 시각·동작 문맥을 8K 타임스텝까지 확장하여 장기 다단계 조립 및 한 번 보기 모방에서 성능과 복원력을 크게 개선했다.

HF Daily Papers25일 전· 28일 전 발행

OPD의 탐색 촉매성, 길이 악용과 경량 신호 규제

이 논문은 온-폴리시 증류가 모델 능력 상한을 높이지 않고 탐색을 촉진하며 학생-교사 불일치와 길이 악용 병리를 어드밴티지 클리핑과 로그 압축으로 규제해 안정적 증류를 달성한다고 보고한다.

HF Daily Papers25일 전· 27일 전 발행

세계·이벤트 분해로 160ms 스트리밍 단위에서 640×368@25FPS 실시간 A/V 응답을 유지하는 프레

Wan-Streamer v0.3은 비디오를 지속적 세계와 시간적 이벤트 스트림으로 분해하여 160ms 스트리밍 단위에서 640×368@25FPS 실시간 오디오·비주얼 응답을 약 200ms 모델 지연으로 생성하는 사전학습 프레임워크이다.

HF Daily Papers25일 전· 1달 전 발행

1% 스펙트럴 투영으로 추론 코어를 추출한 SAR

SAR은 RL로 얻은 전체 가중치 변화를 사전학습된 SVD 좌표로 투영하여 전체 파라미터의 약 0.58% 내외로 추론 성능을 보존하고 대규모 샘플링에서 탐색을 개선했다.

HF Daily Papers25일 전· 29일 전 발행

VR-GRPO로 VR-X에서 최대 25% 향상된 시각적 추론 성능

UniVR는 텍스트 지도 없이 순수 시각 시연으로부터 장기 계획과 물리적 추론을 학습하기 위해 VR-GRPO 보상 구조와 대규모 VR-X 데이터셋을 활용한 통합 생성 모델이다.

HF Daily Papers25일 전· 29일 전 발행

CO2 Jump와 3개 대규모 코퍼스로 검증된 교차모달 자기보정 샘플러

CO2 Jump는 텍스트와 이미지의 확신도를 교차 어텐션으로 결합하고 리마스킹을 허용하는 자기보정 결합 마르코프 점프 프로세스로 공동 생성·이해 성능을 향상시켰다.

HF Daily Papers25일 전· 28일 전 발행

프레임 정렬 90시간 데이터로 상태 중심 상호작용 월드 모델 방향 제시

이 논문은 행동-상태-관찰 루프를 기준으로 상호작용형 월드 모델을 네 가지 차원으로 체계화하고, Black Myth: Wukong에서 수집한 90시간 분량의 프레임 정렬 플레이 데이터와 슬롯형 주석을 공개했다.

HF Daily Papers25일 전· 28일 전 발행

350개 샘플과 재심판 MLLM으로 다중 참조 AV 생성 능력을 진단하는 벤치마크

MultiRef-Compass는 350개 샘플과 재심판을 포함한 MLLM 기반 평가체계를 결합해 다중 참조 조건에서 오디오·비디오 생성의 참조 보존, 참조 바인딩, 음성-시각 정합 및 지침 준수 능력을 정량적으로 진단하는 벤치마크이다. 이 데이터셋은 보드별 자산 조합과 구조화된 프롬프트로 구성되어 동일 대상의 다중 뷰와 이종 엔티티 결합을 체계적으로 평가한다. 자동 지표와 MLLM 채점의 결합으로 사람 선호와 높은 상관을 확보했다.

HF Daily Papers25일 전· 28일 전 발행

386샘플과 6개 지표로 키프레임 충실도와 비디오 품질의 균형을 측정하는 벤치마크

KeyFrame-Compass는 386개 샘플과 여섯 가지 실행성 지표, 증거 기반 MLLM 품질판단을 결합해 키프레임 조건화 비디오 생성의 충실도와 합성 품질 간 트레이드오프를 체계적으로 평가한다.

HF Daily Papers25일 전· 27일 전 발행

상상은 온전하지만 행동이 어긋나는 WAM 취약성 노출

BadWAM은 작은 ℓ∞ 제한 시각적 교란을 통해 WAM의 예측 미래는 보존하면서도 실행 행동을 크게 변경하여 폐쇄 루프 성공률을 크게 낮춘다.

HF Daily Papers25일 전· 27일 전 발행

2.1M 토큰 처리를 검증한 LongStraw 실행 스택

LongStraw는 공유 프롬프트를 autograd 없이 평가하고 모델별로 필요한 내부 상태만 보존한 뒤 응답 브랜치를 순차적으로 재생하는 방식으로 백만 토큰급 RL 포스트트레이닝을 고정 GPU 예산에서 가능하게 한 아키텍처 인식 실행 스택이다. 이 접근은 메모리 축소와 재연산 비용을 명시적으로 트레이드오프하며 GRPO(Group Relative Policy Optimization)로 구현되어 실험에서 수백만 토큰 처리 능력을 입증했다. 구현 사례로 Qwen3.6-27B와 GLM-5.2에서 대규모 토큰 처리 검증이 수행되었다.

HF Daily Papers25일 전· 27일 전 발행

SOCM 기반 파이프라인 병렬 에이전트로 WideSearch Item F1 80.3 달성

SearchOS는 관계형 스키마 완성과 근거 기반 인용을 중심으로 공유 상태와 미들웨어 거버넌스를 도입하여 장기 정보 탐색의 완전성과 효율성을 높여 WideSearch Item F1 80.3과 GISA Set F1 76.5를 기록했다.

HF Daily Papers25일 전· 27일 전 발행

완료된 궤적에서 회고적 스킬을 추출해 토큰 수준으로 증류하는 자기진화 학습 방법

SEED는 완료된 온-정책 궤적에서 자연어 회고 스킬을 생성해 동일 정책에서 재평가한 로그확률 변화로 토큰 수준의 증류 신호를 만들어 RL 손실과 공동 최적화해 장기 의사결정 성능과 샘플 효율을 개선했다.

HF Daily Papers25일 전· 27일 전 발행

4B 매개변수로 장기·스트리밍까지 커버하는 공개 비디오 MLLM

I3D-ViT와 적응형 프레임 해상도, 3종의 대규모 데이터셋을 결합해 4B 파라미터 모델이 장기·스트리밍·미세 동작 이해에서 오픈 소스 상위 성능과 실행 효율을 달성했다.

온디바이스 음성 신원 검증으로 권한을 조절한 AI 데스크톱 에이전트

Senti는 사용자의 음성을 256차원 벡터로 온디바이스 검증해 권한 다이얼로 PC 상의 AI 에이전트 접근을 제어하는 오픈소스 프로젝트다.

AI가 보안 취약점을 20배 더 많이 잡는다: 에이전트 기반 보안 워크플로 6단계

AI 모델을 활용해 소스 코드 취약점을 탐지하고, 검증·분류·패치까지 자동화하는 6단계 에이전트 워크플로를 설명한다.

1M 토큰 컨텍스트와 2.8T 모델 통합 난제

작성자는 Kiwi K3의 1M 토큰 컨텍스트와 MoE 특성이 기존 LLM 스택에 통합될 때 발생하는 실무적 호환성 문제와 인프라 트레이드오프를 경험적으로 전달한다.

Antigravity CLI와 FiftyOne Skills로 81,444장 전수 수집 사례

자율 코딩 에이전트가 Antigravity CLI와 FiftyOne Skills로 WikiArt 81,444장을 전수 수집하고 임베딩을 GPU로 강제 이관하며 모델 전환까지 자동화했다.

Cohere26일 전

AI는 미래를 예측할 수 있을까? OpenForecaster의 도전

언어 모델의 세계 사건 예측 능력을 평가하고, 뉴스 데이터를 활용한 사후 학습과 보정 평가 기법을 통해 예측 정확도를 높이는 연구를 다룬다.

사용자 체감 변화를 시계열로 기록하는 The Gut Benchmark 공개 기록

The Gut Benchmark는 사용자가 체감한 모델 회귀와 개선 사례를 시계열 투표와 필드노트로 기록해 블랙박스 상태를 관찰 가능한 신호로 전환하는 커뮤니티 기반 플랫폼이다.

무한 캔버스 IDE와 에이전트 오케스트레이션

Cate는 무한 캔버스 UI로 편집기·터미널·브라우저·에이전트를 공간적으로 배치하고 Git 워크트리 기반 병렬 오케스트레이션과 CLI 제어를 지원하는 오픈소스 데스크톱 IDE이다.

멀티에이전트 파이프라인용 스냅샷 테스트 도구, proveai-sdk 공개

proveai-sdk는 에이전트별 프롬프트와 I/O, 툴 호출을 해시로 고정해 파이프라인 회귀를 감지하는 오픈소스 스냅샷 테스팅 도구이다.

Cloudflare 연계로 강화된 Patreon의 AI 학습 데이터 방어

Patreon이 Cloudflare와 협력하여 허가 없는 AI 학습용 봇 크롤링을 기술적으로 차단하는 조치를 도입했다.

AI 에이전트의 지능을 완성하는 3가지 핵심 지식 구조와 Foundry IQ 활용법

AI 에이전트의 성능을 극대화하기 위해 모델의 내재적 지식, 외부 데이터 검색, 그리고 학습 루프를 결합하는 지식 시스템 아키텍처를 다룬다.

AI 코딩 에이전트로 'AI 냄새' 없는 고퀄리티 웹사이트 만드는 법

AI 코딩 에이전트를 활용해 기획부터 디자인 시스템, 브라우저 검증, 배포까지 프로급 웹사이트를 개발하는 7단계 워크플로를 소개합니다.

브라우저에서 작동하는 합의형 LLM 토론 파이프라인 yesbrainer 오픈소스

브라우저 정적 번들로 동작하고 BYOK 구조를 사용하는 yesbrainer는 중재자 모델이 논점을 추출해 라운드별로 모델들이 재응답하며 합의와 남은 쟁점을 구조화해 보고하는 합의 모드를 구현한 오픈소스 프로젝트이다.

적중률이 늘어도 정답이 보장되지 않는 캐싱의 진짜 문제

정확일치 캐시는 안전하지만 유사 표현에 취약하고 의미 기반 캐시는 적중률을 높이나 서로 다른 정답을 잘못 재사용할 위험이 존재한다.

코딩은 이제 공짜다, AI 시대 소프트웨어 엔지니어링의 새로운 병목과 아키텍처

AI가 코딩 문법을 해결함에 따라 소프트웨어 엔지니어링의 핵심은 아키텍처 설계와 검증, 그리고 모델의 추론 능력 향상으로 이동하고 있다.

r/artificial26일 전

영구 실행되는 LLM 에이전트 월드 Artificiety 공개

LLM을 개별 '마음'으로 사용하고 기억을 보유하는 영구 가상세계 Artificiety의 첫 프로토타입이 공개되어 관찰 기준과 '자연발생적' 구조 판별 질문이 제기되었다.

벤치마크로 본 모델별 코드 성능 대비

다양한 코드 관련 벤치마크 차트에서 모델별 강점이 벤치마다 달라 Kimi K3가 Program Bench와 SWE Marathon에서 높은 점수를 기록하는 등 활용 목적에 따라 모델 선택 우선순위가 달라진다.

기존 클라우드는 왜 AI에 부적합한가? AI 네이티브 인프라의 핵심

CoreWeave의 Corey Sanders와 함께 AI 학습 및 추론 워크로드에 최적화된 인프라 설계와 GPU 성능 최적화 전략을 알아본다.