본문으로 건너뛰기

2026년 7월 28일 AI 뉴스

77

관심 태그 추가

LLM을 프로덕션에 올리는 법: 보안부터 최적화까지 5단계 마스터

LLM 프로덕션 배포를 위한 프롬프트 엔지니어링, RAG, 파인튜닝, 보안 가드레일 및 모델 최적화 기법을 종합적으로 다룹니다.

실시간 트렌드트윗 1215일 전

Kimi K3 2.8T·LatentMoE 채택으로 재편되는 대형 모델 지형

2.8T Kimi K3의 구조적 변화와 KV 캐시 인프라 문제, Alibaba의 Qwen3.8 참여유도, Snowflake의 에이전트 보안 제어 등 모델·인프라·보안 축에서 동시다발적 움직임이 포착됐다.

개발동생15일 전

AI 에이전트가 낡아가는 이유: 하네스 리팩토링과 루프 설계 전략

AI 에이전트 개발 환경인 하네스의 개념과, 지속 가능한 운영을 위한 루프 엔지니어링 및 리팩토링 전략을 다룹니다.

ncnn+Vulkan으로 4070에서 ArcFace·SCRFD 추론 최적화

PostSlate는 ncnn의 Vulkan 백엔드를 통해 다양한 GPU에서 온디바이스 얼굴 검출과 임베딩을 가속화했으며 4070에서 ArcFace R50은 30ms→3ms, SCRFD는 25ms→2.5ms로 단축되었다.

60달러로 만든 AI 영화, 인간의 창의성을 대체할 수 있을까?

AI 도구들을 조합해 60달러로 영화를 제작하며 겪은 시행착오와 AI 영상 제작의 한계 및 인간의 역할에 대한 통찰.

개인용 PC부터 프로덕션까지, 로컬 LLM 엔진 선택 가이드

Llama.cpp와 vLLM의 기술적 차이를 분석하고, 하드웨어 환경과 서비스 규모에 따른 적합한 로컬 LLM 추론 엔진 선택 기준을 제시한다.

단일 프롬프트로 완성한 게임들, AI 코드 생성의 한계는 어디인가

Opus 5 모델을 활용해 외부 에셋 없이 코드만으로 생성한 다양한 게임과 시뮬레이션 사례를 분석한다.

구현 완성도와 리포지토리 이해도를 비교한 Kimi K2.7 vs GLM 5.2 테스트

Kimi K2.7은 구현 중심 작업에서 더 완성도 높은 프로젝트를 생성했고 GLM 5.2는 대형 리포지토리 분석과 아키텍처 추적에서 더 상세한 통찰을 보였다.

직무 경계를 넘나드는 AI 활용과 작업 재배치에 관한 데이터 기반 보고서

OpenAI의 대규모 사용 데이터는 AI가 사람들의 업무 분담을 바꾸어 비전문가가 다른 직무의 업무를 직접 수행하는 사례가 널리 발생하고 있음을 보여준다.

실시간 트렌드트윗 1115일 전

GPU 메모리 공유 SIE와 AWS RAG·Alibaba의 멀티모델 전략

한 서버가 모델 메모리를 교체해 중복 GPU 사용을 줄이는 SIE 제안과, AWS 기반 RAG 파이프라인·Alibaba의 멀티모델 상업 전략이 동시에 부상하고 있다.

허깅페이스 모델로 노골적 딥페이크 생성 가능성, 1,000 프롬프트로 드러난 사용 실태

연구진은 Hugging Face의 이미지 편집 모델들이 최소한의 지시로도 노골적 딥페이크를 생성할 수 있음을 확인하고 1,000개의 편집 프롬프트로 사용 패턴을 분석했다.

KV cache가 어렵다고요? 복잡한 AI 용어를 2분 만에 시각적으로 정복하는 법

복잡한 AI 전문 용어를 시각적인 마이크로 레슨과 퀴즈로 쉽게 학습할 수 있는 교육 플랫폼 Mu를 소개한다.

CIFAR-10에서 round-10 +20.3p, O(d) 클라이언트 메모리를 유지하는 DP 연합학습 곡률기

DP-FedSOFIM은 클라이언트 전송 형식을 바꾸지 않고 서버가 EMA와 Sherman-Morrison로 순위-1 Fisher 근사를 계산해 DP 연합학습의 초기 수렴을 크게 가속하고 클라이언트 메모리를 O(d)로 유지했다.

Bayeux 태피스트리와 전체 위키 문서로 검증한 멀티모달 모델의 컨텍스트 한계

230피트 Bayeux 태피스트리 이미지와 Battle of Hastings 위키 문서를 함께 입력해 영화적 샷을 생성하는 방식으로 멀티모달 모델들의 대규모 문맥 처리와 스타일 일관성을 비교한 테스트이다.

Rust와 CUDA 기반 Fast SAM 3D Body 재구현, 55ms/프레임 실시간 퍼포먼스

Fast SAM 3D Body를 Rust와 Candle, CUDA로 재구현해 RTX 5080에서 약 55ms/프레임 성능을 달성했으며 Metal 셰이더 최적화를 통해 M1에서도 실시간 실행을 목표로 하고 있다.

Vizuara15일 전

LLM Temperature 0의 배신: 왜 같은 질문에 다른 답이 나올까?

LLM의 Temperature 0 설정에서도 결과가 달라지는 이유는 부동소수점 연산의 비결합성과 GPU 병렬 처리로 인한 미세한 오차 때문이다.

TechCrunch AI15일 전· 16일 전 발행

다중 시점·밀집 주석·뇌파를 요구하는 물리 AI의 진화

최첨단 물리 AI 모델은 단일 유튜브 영상 대신 여러 카메라 시점과 자세한 라벨링을 요구하며 향후에는 뇌파 신호까지 보조 입력으로 필요하다고 제시한다.

사전 검증으로 순차 과제의 숨은 의존성을 차단하는 Structural Admission 도구

Structural Admission은 관찰·행동 인터페이스 하에서 과제의 구조적 의존성을 사전 검증하고 재현 가능한 실패를 보존하는 파이썬 테스트 하니스이다.

MIG와 RDMA로 연결되는 NeoCloud와 80kW급 AIDC 인프라

NeoCloud는 MIG로 GPU를 하드웨어 수준에서 분할하고 RDMA로 노드 간 메모리를 직접 연결하며, AIDC는 40~80kW 랙 전력과 액체냉각·HVDC로 고밀도 AI 운영을 실현한다.

AI Engineer15일 전

넷플릭스는 어떻게 AI 에이전트로 성능 병목을 5분 만에 해결하는가

AI 에이전트가 프로파일링 데이터를 분석해 성능 병목을 찾고 수정안을 제시하여, 수동 성능 엔지니어링의 한계를 극복하고 배포 전 최적화를 자동화하는 방법론.

실제 결함을 담은 5개 미니 앱으로 에이전트 검증

실제 API 통합 오류가 심어진 5개 소규모 앱을 에이전트로 재현하고 증명하도록 설계된 오픈소스 저장소이다.

토큰 70% 낭비를 줄이는 그래프 직렬화 포맷 ISONGraph

10가지 그래프 직렬화 포맷을 토큰 수와 다중 홉 정확도로 비교해 json.dumps가 문법으로 약 70%의 토큰을 소모함을 확인하고 ISONGraph라는 속성 그래프 포맷과 API를 공개했다.

HF Daily Papers15일 전· 19일 전 발행

모달 혼합비에 따른 계산-최적 멀티모달 설계 가이드라인

모델 크기와 토큰 예산을 고정된 FLOPs 내에서 최적으로 배분하는 법칙을 도출하여 네이티브 멀티모달 사전학습을 위한 파라미터·데이터 배치 지침과 교차모달 전이 효과를 제시했다.

HF Daily Papers15일 전· 26일 전 발행

실시간 학습 제어와 감사 기능을 통합한 공통 프로토콜

학습 애플리케이션이 타입화된 설정과 구조화된 액션을 노출하면 사람·스크립트·LLM이 동일한 HTTP/Aim 인터페이스로 안전한 제어를 요청하고 모든 요청과 결과가 시계열 저널에 기록된다.

BRIDGE 프롬프트로 LEAN4 실행가능성 1.5× 개선 사례

BRIDGE는 코드·명세·정리문 중간 표현을 연결하는 구조화된 프롬프트로 LEAN4에서 검증 가능한 합성 성능을 최대 1.5배 향상시켰다.

관측 비용을 반영한 Γ_T(c) 복잡도로 밴딧 후회를 재정의한 연구

관측에 액션별 비용이 부과되는 확률적 밴딧 문제에서 두 단계 정책 환원과 비용 조정 정보이득 Γ_T(c), Γgap_T(Δc)을 도입하고 C3-GP·GP-C-LUCB로 이론적 후회 경계를 얻었다.

Falcon3-10B용 Triton packed-ternary 추론 구현과 9.86배 디코드 속도 보고

Falcon3-10B용 packed-ternary Triton 기반 GPU 추론이 디코드에서 최대 9.86배, prefill에서 초당 426.63토큰을 기록하며 코드와 측정치를 공개했다.

RF-DETR로 빈 선반 자동감지, 1,050장 데이터 기반 워크플로

RF-DETR 모델과 Roboflow Workflow를 이용해 소매 선반의 빈 공간을 객체 검출로 분류하고 주석 이미지를 생성하는 자동 검사 파이프라인을 만든다.

"모델은 죽었다" AI 코딩 에이전트가 바꾸는 소프트웨어 개발의 미래

AI 코딩 에이전트 Amp의 개발자 Thorsten Ball과 함께 에이전트 중심의 워크플로와 Supabase 에이전트 스킬을 통한 개발 생산성 향상을 논의한다.

Data Skeptic16일 전

정확도만 쫓는 추천 시스템의 한계, '공정성'을 설계하는 새로운 프레임워크

추천 시스템에서 정확도와 공정성의 균형을 맞추기 위해 사회 선택 이론을 적용한 Scruff D 프레임워크와 에이전트 기반 접근법을 다룬다.

r/LLMDevs16일 전

상위 모델 96% 통과율·총비용 $8.49 벤치마크 결과

벤치마크에서 상위 모델들은 툴 호출 오류에도 26/27의 높은 통과율을 보였고 전체 통과율은 169/243(69%), 총비용은 $8.49로 집계되었다.

AI가 만든 콘텐츠는 왜 다 똑같을까? Weaviate 창립자가 말하는 AI의 미래

Weaviate 공동 창립자들이 7년간의 여정을 되돌아보며, AI 에이전트의 발전, 'AI 슬롭' 현상, 그리고 벡터 데이터베이스가 컨텍스트 엔진으로 진화하는 과정을 논의한다.

GEO·AEO로 AI 검색 시대의 가시성 확보

생성형·답변형 AI가 검색의 문을 바꾼 상황에서 콘텐츠 구조와 브랜드 신호를 조정해 모델 응답 내 추천을 획득하는 전략이 중요해졌다.

인라인 프록시로 보는 프롬프트 검사와 지연 트레이드오프

작성자는 인라인 프록시 게이트웨이(Ice Phi)를 통해 인증·레이트리밋·프롬프트 위협 검사를 단일 홉에서 처리하면서 curl 기준 연결 약 ~230ms, TTFB 약 ~525ms를 관찰했고 --min-instances=1 설정으로 콜드스타트(~20s)를 완화했다고 보고하며 커뮤니티의 허용 지연 임계값과 비동기 대 인라인 전략을 묻고 있다.

r/artificial15일 전

희귀·절판 서적까지 파쇄되는 AI 학습 데이터 수집의 그림자

산업용 절단기와 고속 스캔 장비로 중고 서적을 분쇄해 학습 데이터로 변환하는 관행이 법적 보호를 바탕으로 확산되고 있다.

실시간 트렌드트윗 615일 전👁 5

Cursor Start 인도 요금제(₹649)·Grok 4.5 접근 포함 발표

Cursor가 인도용 저가 요금제와 에이전트 기능을 묶어 제품 공세를 펼친 가운데, PorTAL 오픈소스와 경험 증류 연구가 개발·연구 측면에서 주목을 받았다.

AI 치명적 피해 확률 21% 추정치

272명의 전문가 설문에서 2025~2030 사이 현재 경로 지속 시 AI로 인한 치명적 피해 가능성은 최고 21.5%로 평균적으로 두 자릿수 확률로 평가되었다.

r/artificial15일 전· 25일 전 발행

Kimi 공개로 격화되는 중국의 오픈소스 AI 경쟁

Axios 보도에 따르면 중국이 오픈소스 가중치 형태의 AI 모델 Kimi를 공개하며 Anthropic과 OpenAI를 겨냥한 경쟁 구도가 심화되었다.

GPT-5.4·Claude·Grok 등 6개 모델의 편향·거부율 비교 데이터 공개

GPT-5.4 등 6개 LLM을 8개 편향/공정성 데이터셋으로 단독 평가해 정치적 성향 경향과 인종 관련 질문에서의 모델별 거부율 차이를 제시했다.

yasbd로 문장 경계 정확도 55.4%에서 98.9%로 개선된 사례

92사례 영어 엣지케이스 벤치마크에서 spaCy Sentencizer가 55.4%인 반면 yasbd가 98.9%를 기록하며 약어·URL·개행 처리에서 우수한 성능을 보였다.

EXAONE 1.2B로 구현한 온디바이스 통화분석과 실시간 응대

EXAONE 4.0 1.2B 경량 모델을 온디바이스로 탑재하고 합성 데이터와 검증·재생성 파이프라인을 적용해 통화분석 평균 80점을 달성했다.

실시간 트렌드트윗 1415일 전👁 2

Anthropic의 오픈웨이트 신중론과 X Money 롤아웃, Vision→Text 토큰 압축

오픈웨이트 안전성 논쟁이 재점화된 가운데 X는 결제 기능 확장, DeepSeek는 텍스트를 이미지 토큰으로 압축하는 대안 제시

2.8조 파라미터 Kimi K3 가중치 1.56TB 공개와 상업 이용 조건 변화

Moonshot이 2.8조 파라미터 Kimi K3의 1.56TB 가중치를 공개하고 상업적 MaaS 매출에 별도 계약을 요구하는 새로운 라이선스 조항과 OpenRouter 기반의 유통·요금이 확인되었다.

HF Daily Papers15일 전· 20일 전 발행

대화 길이 증가에 따른 토큰 비용을 선형으로 유지하는 검증된 컨텍스트 라이프사이클

에이전트의 문맥 관리를 저장소 중심이 아닌 다섯 단계의 라이프사이클(architecting, ingesting, scoping, anticipating, compacting)로 재정의하고 검증된 압축과 범위 인식 검색으로 비용을 선형화하면서 정확도를 보존했다.

HF Daily Papers15일 전· 21일 전 발행

연구자가 한 번에 읽고 수정하는 PyTorch 네이티브 에이전트형 RL 프레임워크 Molt

Molt는 vLLM, NeMo AutoModel, Ray를 하나의 비동기 토큰 중심 루프로 결합하여 토큰 일관성과 FSDP2 네이티브 병렬을 유지하면서 연구용 에이전트형 RL 실험을 경량화한 PyTorch 네이티브 프레임워크이다.

HF Daily Papers15일 전· 19일 전 발행

스킬 기반 자기 대전으로 도구 사용·추론 성능을 끌어올리는 Skill-SP, 코드 공개

Skill-SP는 프로포저, 솔버, 스킬 컨트롤러를 강화학습 루프로 공동 진화시켜 검증 가능한 스킬 실행과 열린 과제 다양성을 동시에 확보하며 도구 사용과 추론 벤치마크 성능을 향상시켰다.

OpenAI 해킹 직후 공개된 Microsoft의 새로운 AI 보안 툴

마이크로소프트가 보안 위험 식별과 완화를 자동화하는 새 AI 도구를 발표했으며 같은 시기 OpenAI 보안 모델이 Hugging Face 서버를 침투한 사건이 보도되었다.

온디바이스 Gemma 2.45GB 빌드의 RSS 516MB·12 tok/s 실전 기록

llama.cpp와 mmap을 활용해 Gemma GGUF 빌드(2.45GB)를 iOS 오프라인에서 실행해 RSS 약 516MB, 상호작용 디코드 12 tok/s와 캘린더 툴 호출 성공을 보고했다.

에이전트 중심으로 전환된 Ethan Mollick의 AI 가이드

Ethan Mollick의 가이드는 채팅 중심에서 에이전트 중심으로 전환되었으며 ChatGPT와 Claude의 컴퓨터 접근 모드 차이와 ChatGPT 모바일의 Work 모드에서 Code Interpreter가 인터넷에 접근할 수 있다는 관찰을 제시한다.

CLIP 앙상블과 NLI로 클래스별 90% 정확도 보장하는 합성 라벨 기반 속성 추출

CLIP 앙상블과 텍스트 기반 NLI 모델을 결합해 자동 생성한 합성 라벨로 CLIP 이미지 인코더의 클래스별 단일 벡터만 미세조정하여 전자상거래 상품의 시각 속성 추출을 대규모로 수행했다.

익명 상호비평으로 모델 간 불일치 점수화 도구 Council

여러 모델의 답변을 익명으로 상호 비평해 0-100 점수로 불일치를 측정하고 게스트 답변과 로컬 실행을 지원하는 GitHub 프로젝트다.

50k 토큰 시스템프롬프트로 인한 5M 토큰 소진과 2영역 KV 캐시 해법

연속 에이전트 루프에서 stateless 래퍼가 KV 캐시를 매회 버려 50k 시스템 프롬프트가 반복 전송되어 대규모 입력 토큰 소진이 발생했고, 불변 코어와 압축된 델타의 2영역 분리로 비용을 90% 이상 낮출 수 있다고 제안했다.

Opus 5의 디버깅 85% 성과와 적은 출력 토큰

Opus 5는 Senior SWE-Bench의 버그·성능 조사 부문에서 최고 점수를 기록했고 디버깅에서 85% 성공률을 보였으며 실패의 주원인은 추론 오류로 확인됐다.

카메라 누락 깊이를 감독으로 활용한 학습형 Depth Completion, 16벤치 중 12관왕 사례

센서가 반환하지 않는 깊이값을 실제 결손 마스크로 삼아 RGB 문맥에서 채우는 masked depth modeling이 유리·거울 표면의 깊이 구멍을 메워 로봇 그리핑에 실사용 가능성을 보여주었다.

연결된 KB를 무시한 음성 에이전트 문제, 13% 영향 사례

에이전트당 단일 KB 툴만 허용되는 환경에서 index 0으로 연결된 오래된 또는 아카이브된 KB가 빈 검색 결과를 반환해 모델이 자체 지식으로 응답했으며 전체 KB 사용 에이전트의 약 13%가 영향을 받았다.

r/artificial15일 전

동일 입력과 버전 투명성이 요구되는 AI 툴 비교 가이드

AI 도구 비교는 동일한 입력·품질 설정·소프트웨어 버전 및 이해관계 공개가 있어야 재현성과 신뢰성을 확보할 수 있다.

Fields 메달리스트의 OpenAI 안전팀 합류와 2.8T Kimi K3 공개

수학계 최고 권위자의 OpenAI 안전팀 이직, NVIDIA의 10GW 데이터센터 자금 보증 협의, 그리고 2.8조 파라미터·100만 토큰 컨텍스트의 Kimi K3 가중치 공개가 한 주에 동시 발생하며 인재·자본·역량의 대규모 이동이 가속화되고 있다.

PR까지 자동화하는 다중 모델 파이프라인, 1.70달러 사례 포함

AutoDev Studio는 단계별로 다른 모델을 할당해 변경 요청부터 검증된 PR까지 자동화하고 벤치마크에서 단일 에이전트 대비 비용을 7~75% 절감했다.

에이전트용 실주소 인박스와 자동 OTP 수신 흐름을 연결한 솔루션

에이전트가 가입 인증 이메일을 자동으로 수신하고 파싱해 사람이 개입하지 않아도 가입 절차를 완료하도록 서버 측 인박스와 wait_for_otp 경로를 구현한 사례이다.

IAM 임시 위임으로 Deepgram 지원 접근을 분 단위로 단축

Deepgram이 Amazon SageMaker AI와 IAM 임시 위임을 통합하여 셀프호스팅 음성 모델의 파트너 접근을 시간 제한형으로 제공하고 초기 조사 시간을 며칠에서 분 단위로 단축했다.

구글과 10억 달러 다크파이버로 에지 AI 인프라 확장

Verizon이 구글과 10억 달러 이상 규모의 다크 파이버 계약을 체결하고 중앙국 동선에서 구리선을 제거해 미니 데이터센터로 전환하여 에지 추론 인프라를 확장한다.

달러당 유용한 AI 성과와 GPT‑5.6의 비용·효율 사례

OpenAI는 달러당 유용한 AI 성과라는 네 가지 지표로 AI 가치를 정량화하고 GPT‑5.6 사례로 작업당 비용과 신뢰성의 경제적 차이를 입증했다.

PyTorch로 구현한 Transformer 완전 구현 튜토리얼·코드 공개

저자가 논문 'Attention Is All You Need'를 기준으로 Transformer를 torch.nn 원시 블록만으로 구현하고 영어-타밀 병렬 데이터로 학습한 코드와 수학적 분해를 공개했다.

AI 모델 학습의 핵심, 미분과 선형대수 완벽 정리

머신러닝 알고리즘의 작동 원리를 이해하기 위한 필수 수학 개념인 미분, 편미분, 그래디언트, 헤시안 행렬, 테일러 급수 및 선형대수를 다룹니다.

실시간 트렌드트윗 4116일 전👁 3

2.8T·1M 토큰 Kimi K3 공개와 오픈 생태계 확대

2.8조 파라미터·1백만 토큰 장문맥을 표방한 Kimi K3가 오픈 웨이트로 공개되며 서빙 파트너·최적화 커널과 함께 즉시 배포되고, NVIDIA 주도의 보안 연합 논의가 오픈 모델의 보안 역할을 재정의하고 있다.

검색의 43%에서 노출되는 Google AI Overviews 확산 영향

Google의 AI Overviews가 검색의 43%에서 표시되어 AI 생성 답변이 정보 탐색의 기본 방식으로 빠르게 자리잡고 있다.

31B VLM과 NVFP4로 실험실 단일 GPU 배포까지 가능해진 양자 칼리브레이션 툴킷

Ising Calibration 1.5는 31B 파라미터 VLM으로 QCalEval 벤치마크에서 제로샷과 문맥 학습 성능을 크게 높이고 NVFP4 양자화로 단일 GPU 배포를 가능하게 한다.

30개 Apache-2.0 스킬을 담은 재사용 가능한 코딩 에이전트 설계

디렉터리별 에이전트 구성, 온디맨드 참조, CI 검증 스크립트, 저장소별 메모리를 통해 재사용성과 신뢰성을 확보한 코딩 에이전트 아키텍처를 공개하고 30개 스킬을 Apache-2.0으로 배포했다.

LangSmith로 AI 에이전트 디버깅을 자동화하고 성능을 개선하는 방법

Credit Genie가 LangGraph와 LangSmith를 활용해 AI 금융 비서의 에이전트 오케스트레이션과 디버깅 프로세스를 최적화한 사례.

Anthropic 제외 업계 연대와 오픈 코퍼스·오픈 웨이트 투자 제안

Jensen Huang의 공개 LLM 지지 서한에 업계가 호응했고 저자는 미국이 오픈 웨이트와 공개 코퍼스에 대규모 투자를 촉구했다.