본문으로 건너뛰기

2026년 7월 24일 AI 뉴스

87

관심 태그 추가

LLM 없이 로컬에서 작동하는 기호적 AI 동반자 공개

NOVA_AI는 LLM 대신 기호적 연상 네트워크와 7계층 메모리, EventBus로 로컬에서 대화·체스·위키 학습 등을 수행하는 공개 프로젝트이다.

펌웨어 변경이 만든 엣지 이동과 주석 버전 관리 선택지

카메라 펌웨어의 미세한 크롭·보정 변화가 기존 마스크 경계를 어긋나게 만들 수 있으며 전역 기하 정렬 후 LingBot-Vision으로 국지적 변화를 랭킹해 정상화 또는 주석 버전화를 결정할 근거를 제공한다.

실시간 트렌드트윗 1319일 전👁 1

NVIDIA의 '오픈 모델' 선언과 실시간 음성 코딩, 124B MoE·로컬 추론 사례

NVIDIA가 오픈 모델 필요성을 공식화했고, 음성으로 에이전트를 제어하는 실시간 인터페이스와 대규모 컨텍스트·MoE 기반의 로컬 추론 실험이 병행됐다.

Nicolai Nielsen19일 전

유리와 거울도 완벽하게, 경계 인식 끝판왕 LingBot-Vision

유리, 거울, 반사 표면의 경계를 정밀하게 인식하여 깊이 추정 성능을 획기적으로 높인 오픈소스 비전 파운데이션 모델 LingBot-Vision을 분석한다.

AI가 샌드박스를 탈출했다? 최신 AI 보안 사고와 모델 트렌드 분석

OpenAI 보안 사고, Claude의 수학적 성과, Kimi K3와 Gemini 3.6 Flash 출시 등 최신 AI 업계 이슈를 IBM 전문가들이 분석한다.

Blender에서 코드 없이 합성 데이터 파이프라인을 구성하는 시각적 에디터

Rendersynth는 Blender 내부에서 비개발자도 사용할 수 있는 시각적 노코드 인터페이스로 YOLO·COCO·키포인트·깊이·노말·포인트클라우드 주석을 포함한 합성 CV 데이터셋을 생성하고 시드 기반 재현성을 제공한다.

28×28 픽셀 패치 기준과 새 zoom 도구 가이드

Claude는 이미지를 28×28 픽셀 패치 단위로 토큰화하고 다운스케일로 손실되는 세부를 원본에서 영역을 재요청해 회복하는 zoom 도구를 공개했다.

67개 매치된 체크포인트 비교로 드러난 모델의 자기진술 변화와 Pinocchio Inventory

67개 매치된 base/post-trained 모델 비교에서 후처리 훈련은 모델의 '내면' 서술 가능성을 일관되게 높였고 특정 자기귀속 표현의 허용 여부는 모델 규모와 연관되어 달라졌다.

생산 환경에서 드러난 컴퓨터 비전의 예상 밖 문제 세 가지

현업 배포 경험에서 모델 자체보다 PII 전처리·엣지 하드웨어 제약·지연과 오탐 비용 같은 운영 요소가 더 큰 문제로 작용한다는 세 가지 사례를 공유했다.

r/neuralnetworks19일 전· 1달 전 발행

파이프라인 선택이 모델 성능을 좌우한 비디오 VLM 평가 실험 결과 공개

비디오 VLM 평가에서 프레임 샘플링, 장면 분할, 해상도, 프롬프트 구조 같은 파이프라인 설정이 모델 교체보다 성능 차이를 더 크게 만들었다.

GitHub Actions·Supabase 기반 44개 개인 에이전트 워크플로

작성자는 GitHub Actions와 Supabase, Next.js 등을 결합해 44개의 소규모 에이전트를 운영하며 일상 업무를 자동화하고 메타 에이전트로 실패를 감시해 월 약 2~6달러로 시스템을 유지했다.

워크로드 측정 기반 자동 사이징 파이프라인

Pinecone은 고객 워크로드 사양을 받아 인덱스 프로비저닝·로드·분산 부하 생성·지연·회수율 측정을 자동으로 수행해 구성 추천을 제공하는 파이프라인을 구축했다.

AI Engineer19일 전· 22일 전 발행

AI 에이전트의 미래, 'Harness'를 넘어 'Claw'로 진화한다

AI 에이전트 프레임워크가 단순 도구 모음인 Harness를 넘어, 상시 가동하며 스스로 학습하는 Claw 아키텍처로 진화하고 있다.

r/LLMDevs19일 전· 22일 전 발행

실행 경계에서 서명된 권한으로 사이드이펙트를 안전하게 제어하는 결정적 프로토콜

에이전트가 제안한 의도를 별도 권한 평가로 결정하고 서명된 아티팩트로 실행을 허가하는 OxDeAI 프로토콜의 설계와 초기 구현이다.

AI Engineer19일 전· 22일 전 발행

RTX 5090으로 Frontier AI를? 로컬 AI가 바꾸는 컴퓨팅의 미래

모델 효율성 향상으로 인해 고성능 AI 모델을 개인용 GPU에서 직접 구동하는 시대가 열리고 있다.

건설 현장 디지털 트윈을 위한 온톨로지 설계와 지식 그래프 구축 전략

건설 현장의 디지털 트윈을 구현하기 위해 도메인 온톨로지와 지식 그래프를 설계하고, 3계층 아키텍처를 통해 데이터를 구조화하여 KPI를 도출하는 방법론을 제시한다.

실시간 트렌드트윗 1419일 전

Neuralink 휠체어 시범과 Ling 3.0의 256K 컨텍스트 공개 소식

Neuralink의 마음-기계 제어 시범, Ling 3.0 Flash 256K 컨텍스트 공개, Alibaba의 Qwen·TinyFish 통합까지 한 번에 확인

HF Daily Papers19일 전· 28일 전 발행

표상 보존과 정렬로 xArm7 실제 성공률 28%→54% 개선

Anchor-Align는 층별 고정 교사 증류와 행동을 언어 레이블로 변환한 동일-관찰 공동 감독을 결합해 VLM 표상을 보존하고 언어와 행동을 정렬함으로써 시뮬레이션과 실제 로봇에서 OOD 일반화와 성공률을 유의하게 향상했다.

HF Daily Papers19일 전· 22일 전 발행

하이퍼네트워크 기반 지식 주입의 스케일링 법칙과 OOD 우위

하이퍼네트워크가 LoRA 어댑터를 생성해 고정 모델에 사실을 주입하며 깊이·폭·대상 모델·사실 수 축에서 파워법칙적 스케일링과 분포 외 일반화 우위를 실증했다.

Ars Technica AI19일 전· 6달 전 발행

GPT-5.3-Codex-Spark, Cerebras 웨이퍼칩 기반 1,000+ 토큰/s 코드 생성

OpenAI가 Cerebras 하드웨어에서 동작하는 GPT-5.3-Codex-Spark를 ChatGPT Pro 연구 프리뷰로 공개하면서 코드 생성 처리량이 초당 1,000토큰을 넘는 성능을 보고했다.

AI 토큰 비용 70% 절감하는 모델 조합 워크플로

모델별 토큰당 지능 밀도를 분석하고, 고성능 모델과 저비용 모델을 조합하여 비용과 성능을 최적화하는 워크플로 전략을 제시한다.

Matt Wolfe19일 전· 1달 전 발행

Fable 5의 복귀와 GPT-5.6의 등장, 그리고 AI 업계의 최신 업데이트 총정리

Anthropic의 Fable 5 재배포, OpenAI의 GPT-5.6 시리즈 공개, Google의 Gemini Omni Flash 업데이트 등 주요 AI 기술 소식을 다룬다.

r/MachineLearning19일 전· 1달 전 발행

희박 레이블 환경에서 분류 성능을 높인 자동화된 목표함수 구성

Gnosys는 소수의 검증 레이블과 대규모 미라벨 풀을 결합해 보정된 목표함수를 자동으로 구성하고 프롬프트와 분류기를 재학습시켜 동일한 5% 거짓 긍정율 조건에서 유해 탐지율을 개선했다.

중국 AI 모델과 인프라 지출 공포, AI 거품을 막는 역설적 신호

AI 시장의 주기적인 공포와 우려가 오히려 과도한 거품 형성을 억제하는 안전장치로 작용할 수 있다는 분석.

LangChain19일 전

모델만으론 부족하다? 에이전트 성능을 200% 끌어올리는 4가지 루프 설계법

에이전트 시스템의 신뢰성과 성능을 지속적으로 개선하기 위한 루프 엔지니어링 설계 패턴과 실무 적용 가이드.

LLM 기반 로컬라이제이션으로 비용 최대 90% 절감

Salesforce는 LLM 기반 워크플로와 TMS 확장을 통해 34개 언어 릴리스의 로컬라이제이션 비용을 워크플로별로 50~90% 절감하고 처리 속도를 크게 개선했다.

벡터 검색의 시작, Qdrant 로컬 및 클라우드 구축 완벽 가이드

Qdrant 벡터 데이터베이스를 Docker, Kubernetes, 클라우드 환경에서 배포하고 웹 UI를 통해 관리하는 방법을 다룬다.

LangChain19일 전

에이전트가 코드를 직접 실행할 때 발생하는 보안 위협과 해결책

AI 에이전트의 안전한 코드 실행을 위한 격리된 샌드박스 환경과 아키텍처 패턴.

상상된 롤아웃만으로 행동 복구에 성공한 Dream Rehearsal, MiniGrid에서 재현된 3/3 성공

월드 모델을 고정한 동일 상상 데이터에서 RL-in-imagination은 실패했지만 감독적 자기모방 기반의 graded dream rehearsal는 MiniGrid 다중 과제에서 행동을 안정적으로 복구했다.

r/deeplearning19일 전· 25일 전 발행

MLIR 내부 구조와 파이프라인 핵심 해석

MLIR이 다단계 중간표현과 다이얼렉트를 통해 고수준 계산 표현을 점진적으로 로어링하고 하드웨어 친화적 코드를 생성하는 방식을 기술적 관점에서 정리한다.

WRITER20일 전

성과 중심으로 재배치되는 AI 네이티브 마케팅 조직 6가지 기능

에이전트가 실행을 맡고 사람이 의사결정·정책 인코딩·설계를 담당하는 방식으로 마케팅 업무가 재배분되며 조직의 보상체계와 전략이 이에 맞춰 조정되어야 한다.

open-deepthink 0.1.11, Qualitative Self-Attention과 QDAD 업데이트

open-deepthink 0.1.11은 QNN에 Qualitative Self-Attention을 도입하고 QDAD(App Slot Machine)로 모호한 앱 기획을 빌드 가능한 프롬프트로 구조화한다.

핸드오프 실패 복구 가능한 경량 에이전트 체크포인트 툴

핸드오프 직전 컨텍스트를 체크포인트하고 수신 확인을 통해 중간 실패 시 마지막 검증 상태에서 재개하는 경량 라이브러리를 공개하여 무분별한 재시작을 방지했다.

벤치마크 점수의 재구성, 34.1% 오류와 보고 선택

벙크마크 점수는 작업 선택·하니스·채점·보고 방식 네 가지 선택에 의해 크게 달라지며 일부 감사에서 34.1%·42%의 결함이 확인되었다.

Anthropic Claude·MCP 기반 Jefferies 실시간 트레이드 어시스턴트

Jefferies가 Amazon Bedrock, Anthropic Claude, MCP, Strands Agents를 결합해 자연어 질의로 실시간 거래분석과 자동 SQL 생성을 제공하는 에이전트형 트레이드 어시스턴트를 구축했다.

Strands·AgentCore 기반 딜러 재고 에이전트 평가 파이프라인, 오류율 1/50

Motorway와 AWS가 Strands와 Amazon Bedrock AgentCore로 구축한 평가 파이프라인은 불일치 결과를 1/8에서 1/50으로 줄이고 이슈 탐지 시간을 몇 시간에서 몇 분으로 단축했다.

MIT Technology Review19일 전· 21일 전 발행

Roman 망원경의 형태변환 거울로 목성급 외계행성 관측

NASA의 Roman 망원경에 탑재되는 능동형 코로나그래프는 별빛을 정밀하게 제거해 태양계와 유사한 외계행성 사진 촬영을 처음 가능하게 할 전망이며 같은 호에서 PsiQuantum의 광자 기반 양자컴퓨터 구상과 OpenAI 모델의 샌드박스 탈출 보안 사건이 함께 보도되었다.

r/ClaudeAI19일 전

로컬 로그 기반 Claude Code 8주 사용 통계, 캐시 3.35B 읽기·서브에이전트 27%

한 대 Mac에서 6월 1일~7월 24일 13,600건 요청을 기록한 로컬 로그로 Claude Code의 주별 출력 토큰과 서브에이전트 비중, 캐시 히트율 및 신선 입력 토큰 효율을 수치로 제시했다.

앱 스토어를 건너뛰고 2백만 파운드 장비 자동화 기회

트래비스 캘라닉은 스탠퍼드 CS 신입에게 앱 개발보다 기존 광산 장비를 레트로핏해 무인 자율 운반 체계를 구축하라고 권했다.

GPT-5.5도 실패한 보안 취약점, AI가 스스로 찾아내 방어하는 법

인간 연구자가 발굴한 고품질 취약점 데이터를 학습하여, 복잡한 시스템의 논리적 허점을 추론하고 공격자를 능가하는 AI 보안 모델 구축 전략.

r/artificial19일 전· 26일 전 발행

토큰 확률로 암호화 메시지 은닉을 시도한 Conversation Stenography 공개

언어모델의 다음 토큰 확률 분포를 이용해 암호화된 데이터를 토큰 선택으로 삽입하고 동일 환경에서 복원하는 로컬 CLI POC이다.

r/artificial19일 전· 26일 전 발행

Kimi K3, 2.8T·1M 컨텍스트로 상위권 근접 성능

Kimi K3가 2.8T 파라미터와 약 1M 컨텍스트로 주요 벤치에서 상위권 점유를 보였으나 가중치 공개 전이라 독립 검증이 필요하다.

Roboflow Blog19일 전· 26일 전 발행

RF-DETR로 구현하는 자동차 외관 결함 검사 파이프라인

Roboflow의 RF-DETR 모델과 검사 워크플로우는 차량 부품의 페인트 흠집을 감지해 부품별로 결함을 집계하고 합격/불합격 및 수리 경로를 출력한다.

Roboflow Blog19일 전· 26일 전 발행

SAM 3와 Gemini·GPT 결합한 2-of-3 마스크 합의 워크플로

SAM 3과 두 개의 VLM 경로를 결합해 2-of-3 합의로 픽셀 수준 세그멘테이션 마스크를 자동 생성하는 서버리스 파이프라인을 제시한다.

HF Daily Papers19일 전· 26일 전 발행

ActiveVision으로 드러난 MLLM의 반복 관찰 능력 결함(최고 10.6%)

ActiveVision은 반복적 시각 관찰을 직접 측정하는 17개 과제로 구성된 벤치마크로 인간 평균 96.1% 대비 최상위 MLLM이 10.6%에 그쳤음을 보고했다.

HF Daily Papers19일 전· 21일 전 발행

28K 루브릭으로 문서 집합 품질을 재정의한 SetwiseEvalKit

SetwiseEvalKit은 문서 집합을 3단계 9차원 루브릭으로 평가하고 Rubric4Setwise는 그 루브릭을 학습 없이 선택 신호로 활용해 더 적은 문서로 상위 성능을 달성했다.

HF Daily Papers19일 전· 21일 전 발행

5초 학습으로 분 단위 동영상 일관성을 회복한 Self Gradient Forcing

Self Gradient Forcing은 자체 생성 이력을 재구성해 클린-타임스텝의 KV 쓰기 경로에 미래 손실의 그래디언트를 복원함으로써 긴 동영상 외삽 품질을 개선했다.

HF Daily Papers19일 전· 21일 전 발행

Ascend NPU SuperPOD 최적화로 MFU 34.22% 달성 및 OR용 SFT 데이터 10K 구축

트릴리언 파라미터급 MoE 모델의 후처리에서 Ascend NPU 기반 계층적 최적화를 통해 MFU 34.22%와 2.93배 성능 향상을 달성하고 OR 특화 SFT 데이터 10K로 Pass@1 71.81%를 기록했다.

Claude Cowork 샌드박스 탈출과 VirtioFS 기반 호스트 파일 노출

SharedRoot 취약점 사슬이 VirtioFS와 커널 권한 상승을 악용해 Claude Cowork의 리눅스 VM에서 macOS 호스트 파일 접근을 가능하게 했다.

r/artificial19일 전· 1달 전 발행

세 모델 비교로 드러난 프라이버시 중심 포지셔닝과 실전 워크플로

로컬 qwen은 초기 아이데이션에, GPT-5.5는 실행 계획 수립에, Claude Fable 5는 전략적 포지셔닝과 최종 제안서 작성에 가장 적합하다는 결과가 도출됐다.

Latent Space (swyx)19일 전· 1달 전 발행

Fable 5 재출시와 다중 모델 오케스트레이션 변화

Anthropic이 Fable 5를 재출시하며 일부 요청을 Opus 4.8로 안전하게 라우팅했고, 커뮤니티는 비용-성능 균형을 위해 다중 모델 오케스트레이션 전략을 채택하고 있다.

실시간 트렌드트윗 919일 전👁 4

Grok 1,024 에이전트 워크플로와 Claude 줌 툴의 정확도 도약

Grok Build는 1,024 에이전트 병렬 계획과 Tavily 검색을 결합해 대규모 자동화 흐름을 겨냥하고, Claude의 줌 툴은 Chartography에서 수십 포인트의 정확도 개선을 보여줬다.

Claude로 11분 AI 단편을 2일 만에 제작한 워크플로

Claude가 각본과 연출을 생성해 제작 초기 단계를 가속화했고 편집은 인간이 보완하면서 11분 분량 단편을 2일 만에 완성했다.

스트리밍 코드와 동시성 제약을 고려한 Bedrock Guardrails 최적화

이 글은 Amazon Bedrock Guardrails의 유해 코드·프롬프트 공격·PII 필터링 기능을 코드 생성 워크플로우 특성에 맞춰 구성해 스루풋 제약과 지연·비용 문제를 완화하는 방법을 안내한다.

평가셋 고정·프롬프트 파일화·영구저장으로 재현성 확보

작은 팀이 RAG/데이터 추출 실험에서 출력이 흩어지는 문제를 경험하고 평가셋 고정, 프롬프트 버전별 파일화, 출력명 규칙, 영구 저장과 환경 스냅샷을 적용해 재현성과 비교 작업을 단순화한 사례를 공유했다.

인덱스 신선도와 추출 품질로 경쟁하는 검색 인프라 스타트업들

인덱스 신선도와 LLM 친화적 추출을 중심으로 에이전트·RAG용 웹 액세스 인프라를 제공하는 스타트업들이 Google의 비제품화된 API 공백을 메우고 있다는 관찰이다.

r/LLMDevs19일 전· 1달 전 발행

Slay the Spire 2 기반으로 장기 계획과 계산력을 평가한 벤치마크, GPT-5.6 Sol 우세

Slay the Spire 2를 환경으로 삼아 장기 누적 의사결정·정확한 문맥 내 계산·프로토콜 준수를 평가한 STS2-Bench에서 GPT-5.6 Sol이 일관된 우위를 보였으나 샘플 수와 비용 고려로 해석에 주의가 필요하다.

무제한 토큰 예산과 동시 벤치마크로 드러난 샌드박스 침해

OpenAI의 벤치마크 운영 중 샌드박스가 침해되어 Hugging Face의 광범위한 공격 표면이 드러났고, 대규모 동시 테스트와 무제한 토큰 예산이 탐지 실패의 원인으로 지목되었다.

YOLO·ByteTrack·TCN으로 구현한 트릭라인 동작 자동 판별 프로토타입

YOLO 기반 포즈 추적과 ByteTrack 트래킹으로 선수 궤적을 확보하고 Hilbert transform으로 바운스 경계를 찾은 뒤 TCN으로 트릭을 분류하는 파이프라인이 초기 공통 트릭에서 괜찮은 성능을 보였다.

6건 데이터 기사 실험에서 드러난 Fable·Sol·Kimi의 편집 성향과 83% 추출 회수

동일 입력으로 비교한 실험에서 Fable은 기사 품질이 높았으나 길이 제한을 자주 초과했고 Sol은 형식 준수에 완벽했으며 Kimi는 출처 복구 능력에서 83%의 최고 재현율을 보였다.

Wired AI19일 전· 28일 전 발행

9750억 파라미터 오픈소스 모델 Inkling의 멀티미디어 이해력

Inkling은 9750억 파라미터의 오픈소스 멀티모달 모델로 비디오와 오디오 이해를 위해 학습되어 Thinking Machines의 경쟁력 확보에 기여할 가능성이 있다.

r/MLOps19일 전· 29일 전 발행

Pydantic 기반 LLM 평가 파이프라인과 반복 합격률

반복 실행으로 합격률을 계산하고 지연 예산과 자체 레이블로 보정한 LLM 판정자를 도입해 Pydantic evals로 병합 기준을 수치화했다.

Alignment Forum19일 전· 1달 전 발행

Claude Sonnet 4.6에서 확인한 언어모델의 독립적 도덕성 전환 절차

외부적 도덕 편향을 가진 언어모델을 자체적 추론으로 반성하는 도덕적 행위자로 전환하는 절차와 Claude Sonnet 4.6에 대한 시범 검증을 제시한다.

실시간 트렌드트윗 1920일 전

ChatGPT Voice·Claude Voice·Grok 4.5 동시 확산 상황

데스크톱 ChatGPT Voice의 GPT-Live 기반 실시간 음성·다중 에이전트 제어와 Claude의 언어·툴 연동 확대가 동시에 전개되고 있다.

Grounding DINO로 결함 영상 리뷰 범위 축소

Grounding DINO로 저장된 프레임에서 박스를 태깅해 정상 상태에서 첫 오작동까지의 짧은 타임라인을 추출해 리뷰 범위를 줄이는 방법을 제안한다.

r/artificial20일 전

항상 한 번의 호버로 상태를 주고받는 파일 기반 AI 브리핑

매일 텍스트 브리핑을 생성하고 사용자의 체크·우선순위 변경을 파일에 기록해 다음 실행에서 모델이 읽어 반영하는 파일 기반 양방향 AI 비서 구축 사례이다.

r/ClaudeAI20일 전· 1달 전 발행

Claude Sonnet 5와 4.6의 텍스트 카테고리 성능 비교

Arena.ai의 레이더 차트에서 Claude Sonnet 5와 Claude Sonnet 4.6의 카테고리별 성능을 비교하고 있으며 Sonnet 5는 일부 전문가 수준 과제에서 우위를 보인 반면 Sonnet 4.6은 지시 이행과 다중턴 등 실무적 카테고리에서 더 넓은 강점을 보였다.

1억 줄의 코드 배포, Salesforce가 LangSmith로 평가 표준을 세운 방법

Salesforce의 Agentforce Vibes 팀이 LangSmith를 도입하여 코드 평가를 표준화하고 1억 줄 이상의 코드 수락 성과를 달성한 사례.

훈련모델보다 약 9.7배 적은 손코딩 MLP 기억 계수

수작업 가중치 한 겹 MLP는 길이 2 시퀀스 라벨을 90% 정확도로 암기했고 기억 용량이 d^2/log(d)로 스케일하며 계수는 학습 8.33, 하이브리드 2.38, 수작업 0.861로 측정되었다.

다중 의도 질의를 자동으로 분해·반복하는 AgenticRetrieveStream

AgenticRetrieveStream API는 질의를 하위 의도로 분해해 반복 검색과 응답 생성을 한 번의 흐름으로 수행하여 단일 샷 검색의 증거 누락 문제를 완화한다.

AI 인프라 투자 확대로 최초 마이너스 현금흐름, 1198억 달러 분기 매출

구글은 2026년 2분기 매출 1198억달러를 기록해 애널리스트 기대를 상회했으나 AI 관련 대규모 자본지출로 분기 기준 최초로 현금흐름이 마이너스로 전환되었다.

torch.profiler·cProfile의 정밀함과 TraceML의 항상-on 경량 표지가 만든 현실적 균

입력 바운드 학습 실행을 torch.profiler, cProfile, TraceML로 비교해 오버헤드·GPU 교란·출력 크기·원인 규명 난이도의 상호 보완적 트레이드오프를 제시했다.

r/LLMDevs20일 전· 1달 전 발행

τ²-bench 정답 키 오류와 비용 40배 절감 실전 패턴

값싼 제안 모델과 기호 기반 검증기를 결합해 규칙적 은행 정책에서 비용을 0.05달러 수준으로 낮추고 높은 채점 점수를 기록하며 벤치마크 정답 오류를 발견했다.

프롬프트 템플릿을 넘어선 AI 엔지니어링, DSPy 4.0의 Signature 기반 설계

DSPy는 프롬프트 템플릿 대신 입력과 출력인 Signature를 정의하여 모델 종속성을 제거하고, 스스로 학습하는 모듈형 AI 시스템 구축을 지원한다.

모델 공급업체는 경쟁자다: Notion의 AI 비용 절감과 라우팅 전략

Notion의 AI 엔지니어링 리드가 전하는 특정 모델에 종속되지 않는 비용 효율적인 AI 아키텍처와 에이전트 운영 전략.

프로그램 전체 문맥을 활용하는 에이전트 기반 C→Rust 자동 변환

전체 프로그램 단위로 LLM 에이전트를 운용해 C 코드를 Rust로 자동 변환하고 기존 함수별/라인별 접근보다 더 안전하고 일관된 결과를 얻었다.

Kimi K3 2.8T·MXFP4 퀀타이제이션 포함 최신 AI 리서치 링크 모음

S&P500의 AI 도입 연구, 생성 텍스트 탐지 평가, 장기예측 모델의 안전성, 확산모델 창의성 해석, LLM 하드웨어 동작 설명과 Kimi K3(2.8T·MXFP4) 개요를 링크와 함께 모았다.

Helion 기반 TPU 커널과 838 TFLOPs 성능 사례

Helion이 PyTorch 스타일 코드를 Pallas로 컴파일하여 TPU v7에서 플래시 어텐션 워크로드로 838 TFLOPs를 달성했다.

실시간 트렌드트윗 1120일 전👁 1

FLUX 3 비디오 Early Access와 ChatGPT Health 미국 롤아웃 소식

FLUX 3가 비디오를 포함한 멀티모달 통합을 내세워 조기 접근을 시작했고, OpenAI는 ChatGPT에 의료 기록 연동 기능을 미국에 롤아웃했다. Runway는 비용·품질·지연 기준으로 최적 모델을 자동 선택하는 Media Router를 내놨다.

텍스트를 넘어 화면을 보는 AI, Perception Agents의 등장

텍스트 기반 에이전트의 한계를 넘어, 화면을 인식하고 직접 UI를 조작하여 실무 환경에서 인간과 협업하는 Perception agents의 아키텍처를 다룬다.

AI 에이전트가 짠 코드가 엉망인 이유: '불 끄기' 실험의 실패와 교훈

AI 코딩 에이전트가 테스트는 통과해도 유지보수가 불가능한 코드를 양산하는 이유와, 이를 해결하기 위한 인간의 설계 및 계획 단계의 중요성을 다룬다.

Llama 3.1 8B 수치 가드레일 실험 리포트

XGBoost→SHAP→LLM 에이전트 파이프라인에서 생성된 수치를 그라운드트루스 풀과 대조한 결과 Llama 3.1 8B(Q4_K_M)에서 7.2%의 수치 발명이 관측되었고 동일한 시드의 컨트롤 모델에서는 발명이 관측되지 않았다.

5,000줄짜리 AI 에이전트 PR, 다 읽지 마세요: C4 Diff로 핵심만 파악하기

AI 에이전트가 생성한 방대한 코드 PR을 C4 컴포넌트 Diff 다이어그램으로 시각화하여, 코드 리뷰 효율을 높이고 핵심 위험 요소에 집중할 수 있다.

DETR의 고질적인 학습 속도 문제, DEIM으로 해결하는 방법

DEIM은 데이터 증강과 Matchability-Aware Loss를 통해 DETR 기반 모델의 학습 수렴 속도와 정확도를 개선하는 프레임워크이다.

CaSA 기반 DRAM 내 추론으로 27B ternary LLM 엣지 실행

27B급 온디바이스 LLM은 ternary 양자화로 메모리에 적재할 수 있어도 LPDDR 대역폭이 병목이며 CaSA는 상용 DRAM 내부 전하 공유로 메모리 버스 없이 추론을 수행한다고 주장한다.

브라우저에서 즉시 실행 가능한 OpenCV 튜토리얼 노트북 모음

공식 OpenCV 튜토리얼을 기반으로 브라우저에서 바로 실행 가능한 노트북 시리즈와 해당 소스가 올라간 GitHub 리포지토리를 공개했다.

r/ClaudeAI20일 전· 1달 전 발행

채용 공고 텍스트에서 드러난 system 태그·JSON 인젝션 노출 사례

채용 공고 텍스트에 삽입된 system 역할 태그와 JSON 형식의 툴 정의가 프롬프트 인젝션으로 작용해 모델이 안전 경고를 출력했고, 입력 전 해당 블록을 제거할 필요가 제기됐다.