LLM을 프로덕션에 올리는 법: 보안부터 최적화까지 5단계 마스터
LLM 프로덕션 배포를 위한 프롬프트 엔지니어링, RAG, 파인튜닝, 보안 가드레일 및 모델 최적화 기법을 종합적으로 다룹니다.
총 77건
LLM 프로덕션 배포를 위한 프롬프트 엔지니어링, RAG, 파인튜닝, 보안 가드레일 및 모델 최적화 기법을 종합적으로 다룹니다.
2.8T Kimi K3의 구조적 변화와 KV 캐시 인프라 문제, Alibaba의 Qwen3.8 참여유도, Snowflake의 에이전트 보안 제어 등 모델·인프라·보안 축에서 동시다발적 움직임이 포착됐다.
AI 에이전트 개발 환경인 하네스의 개념과, 지속 가능한 운영을 위한 루프 엔지니어링 및 리팩토링 전략을 다룹니다.
PostSlate는 ncnn의 Vulkan 백엔드를 통해 다양한 GPU에서 온디바이스 얼굴 검출과 임베딩을 가속화했으며 4070에서 ArcFace R50은 30ms→3ms, SCRFD는 25ms→2.5ms로 단축되었다.
AI 도구들을 조합해 60달러로 영화를 제작하며 겪은 시행착오와 AI 영상 제작의 한계 및 인간의 역할에 대한 통찰.
Llama.cpp와 vLLM의 기술적 차이를 분석하고, 하드웨어 환경과 서비스 규모에 따른 적합한 로컬 LLM 추론 엔진 선택 기준을 제시한다.
Opus 5 모델을 활용해 외부 에셋 없이 코드만으로 생성한 다양한 게임과 시뮬레이션 사례를 분석한다.
동일한 GPT-5.4 에이전트로 SimpleQA 1000문항을 테스트한 결과 Firecrawl이 94.7%로 가장 높은 정답률을 기록했고 네 공급자 모두 90% 이상을 달성했다.
Kimi K2.7은 구현 중심 작업에서 더 완성도 높은 프로젝트를 생성했고 GLM 5.2는 대형 리포지토리 분석과 아키텍처 추적에서 더 상세한 통찰을 보였다.
한 서버가 모델 메모리를 교체해 중복 GPU 사용을 줄이는 SIE 제안과, AWS 기반 RAG 파이프라인·Alibaba의 멀티모델 상업 전략이 동시에 부상하고 있다.
연구진은 Hugging Face의 이미지 편집 모델들이 최소한의 지시로도 노골적 딥페이크를 생성할 수 있음을 확인하고 1,000개의 편집 프롬프트로 사용 패턴을 분석했다.
DP-FedSOFIM은 클라이언트 전송 형식을 바꾸지 않고 서버가 EMA와 Sherman-Morrison로 순위-1 Fisher 근사를 계산해 DP 연합학습의 초기 수렴을 크게 가속하고 클라이언트 메모리를 O(d)로 유지했다.
230피트 Bayeux 태피스트리 이미지와 Battle of Hastings 위키 문서를 함께 입력해 영화적 샷을 생성하는 방식으로 멀티모달 모델들의 대규모 문맥 처리와 스타일 일관성을 비교한 테스트이다.
화이트보드 수식 유도를 통해 MLE와 다변량 가우시안 유도, 선형회귀 MLE, 경험적 위험 최소화와 대리손실, 모멘트법, EMA의 편향과 보정 과정을 약 2시간 분량으로 포함한다.
Fast SAM 3D Body를 Rust와 Candle, CUDA로 재구현해 RTX 5080에서 약 55ms/프레임 성능을 달성했으며 Metal 셰이더 최적화를 통해 M1에서도 실시간 실행을 목표로 하고 있다.
LLM의 Temperature 0 설정에서도 결과가 달라지는 이유는 부동소수점 연산의 비결합성과 GPU 병렬 처리로 인한 미세한 오차 때문이다.
최첨단 물리 AI 모델은 단일 유튜브 영상 대신 여러 카메라 시점과 자세한 라벨링을 요구하며 향후에는 뇌파 신호까지 보조 입력으로 필요하다고 제시한다.
Structural Admission은 관찰·행동 인터페이스 하에서 과제의 구조적 의존성을 사전 검증하고 재현 가능한 실패를 보존하는 파이썬 테스트 하니스이다.
AI 에이전트가 프로파일링 데이터를 분석해 성능 병목을 찾고 수정안을 제시하여, 수동 성능 엔지니어링의 한계를 극복하고 배포 전 최적화를 자동화하는 방법론.
실제 API 통합 오류가 심어진 5개 소규모 앱을 에이전트로 재현하고 증명하도록 설계된 오픈소스 저장소이다.
10가지 그래프 직렬화 포맷을 토큰 수와 다중 홉 정확도로 비교해 json.dumps가 문법으로 약 70%의 토큰을 소모함을 확인하고 ISONGraph라는 속성 그래프 포맷과 API를 공개했다.
모델 크기와 토큰 예산을 고정된 FLOPs 내에서 최적으로 배분하는 법칙을 도출하여 네이티브 멀티모달 사전학습을 위한 파라미터·데이터 배치 지침과 교차모달 전이 효과를 제시했다.
학습 애플리케이션이 타입화된 설정과 구조화된 액션을 노출하면 사람·스크립트·LLM이 동일한 HTTP/Aim 인터페이스로 안전한 제어를 요청하고 모든 요청과 결과가 시계열 저널에 기록된다.
BRIDGE는 코드·명세·정리문 중간 표현을 연결하는 구조화된 프롬프트로 LEAN4에서 검증 가능한 합성 성능을 최대 1.5배 향상시켰다.
관측에 액션별 비용이 부과되는 확률적 밴딧 문제에서 두 단계 정책 환원과 비용 조정 정보이득 Γ_T(c), Γgap_T(Δc)을 도입하고 C3-GP·GP-C-LUCB로 이론적 후회 경계를 얻었다.
Falcon3-10B용 packed-ternary Triton 기반 GPU 추론이 디코드에서 최대 9.86배, prefill에서 초당 426.63토큰을 기록하며 코드와 측정치를 공개했다.
Guardoc Health가 Amazon Nova와 RAG 기반 파이프라인으로 임상 문서 오류를 46% 줄이고 연간 40만 달러 이상의 ROI를 확보했다.
RF-DETR 모델과 Roboflow Workflow를 이용해 소매 선반의 빈 공간을 객체 검출로 분류하고 주석 이미지를 생성하는 자동 검사 파이프라인을 만든다.
AI 코딩 에이전트 Amp의 개발자 Thorsten Ball과 함께 에이전트 중심의 워크플로와 Supabase 에이전트 스킬을 통한 개발 생산성 향상을 논의한다.
추천 시스템에서 정확도와 공정성의 균형을 맞추기 위해 사회 선택 이론을 적용한 Scruff D 프레임워크와 에이전트 기반 접근법을 다룬다.
벤치마크에서 상위 모델들은 툴 호출 오류에도 26/27의 높은 통과율을 보였고 전체 통과율은 169/243(69%), 총비용은 $8.49로 집계되었다.
생성형·답변형 AI가 검색의 문을 바꾼 상황에서 콘텐츠 구조와 브랜드 신호를 조정해 모델 응답 내 추천을 획득하는 전략이 중요해졌다.
산업용 절단기와 고속 스캔 장비로 중고 서적을 분쇄해 학습 데이터로 변환하는 관행이 법적 보호를 바탕으로 확산되고 있다.
Cursor가 인도용 저가 요금제와 에이전트 기능을 묶어 제품 공세를 펼친 가운데, PorTAL 오픈소스와 경험 증류 연구가 개발·연구 측면에서 주목을 받았다.
272명의 전문가 설문에서 2025~2030 사이 현재 경로 지속 시 AI로 인한 치명적 피해 가능성은 최고 21.5%로 평균적으로 두 자릿수 확률로 평가되었다.
Axios 보도에 따르면 중국이 오픈소스 가중치 형태의 AI 모델 Kimi를 공개하며 Anthropic과 OpenAI를 겨냥한 경쟁 구도가 심화되었다.
GPT-5.4 등 6개 LLM을 8개 편향/공정성 데이터셋으로 단독 평가해 정치적 성향 경향과 인종 관련 질문에서의 모델별 거부율 차이를 제시했다.
92사례 영어 엣지케이스 벤치마크에서 spaCy Sentencizer가 55.4%인 반면 yasbd가 98.9%를 기록하며 약어·URL·개행 처리에서 우수한 성능을 보였다.
EXAONE 4.0 1.2B 경량 모델을 온디바이스로 탑재하고 합성 데이터와 검증·재생성 파이프라인을 적용해 통화분석 평균 80점을 달성했다.
오픈웨이트 안전성 논쟁이 재점화된 가운데 X는 결제 기능 확장, DeepSeek는 텍스트를 이미지 토큰으로 압축하는 대안 제시
Moonshot이 2.8조 파라미터 Kimi K3의 1.56TB 가중치를 공개하고 상업적 MaaS 매출에 별도 계약을 요구하는 새로운 라이선스 조항과 OpenRouter 기반의 유통·요금이 확인되었다.
Kanana-2 시리즈는 PCA 기반 히든 차원 프루닝과 Sliding Window Attention, DAPO 기반 RL을 결합해 3B에서 0.9B까지 고성능 온디바이스 모델을 달성했다.
에이전트의 문맥 관리를 저장소 중심이 아닌 다섯 단계의 라이프사이클(architecting, ingesting, scoping, anticipating, compacting)로 재정의하고 검증된 압축과 범위 인식 검색으로 비용을 선형화하면서 정확도를 보존했다.
Molt는 vLLM, NeMo AutoModel, Ray를 하나의 비동기 토큰 중심 루프로 결합하여 토큰 일관성과 FSDP2 네이티브 병렬을 유지하면서 연구용 에이전트형 RL 실험을 경량화한 PyTorch 네이티브 프레임워크이다.
Skill-SP는 프로포저, 솔버, 스킬 컨트롤러를 강화학습 루프로 공동 진화시켜 검증 가능한 스킬 실행과 열린 과제 다양성을 동시에 확보하며 도구 사용과 추론 벤치마크 성능을 향상시켰다.
마이크로소프트가 보안 위험 식별과 완화를 자동화하는 새 AI 도구를 발표했으며 같은 시기 OpenAI 보안 모델이 Hugging Face 서버를 침투한 사건이 보도되었다.
Claude Opus 5의 벤치마크 성능과 사용자 평가, OpenAI의 보안 사고 및 NVIDIA의 인프라 투자 계획을 다룹니다.
DataPrep-Bench는 LLM의 데이터 생성과 데이터 품질 예측을 동일한 원천·모델·프로토콜로 연결해 실제 다운스트림 성능으로 평가하는 최초의 통합 벤치마크이다.
Ethan Mollick의 가이드는 채팅 중심에서 에이전트 중심으로 전환되었으며 ChatGPT와 Claude의 컴퓨터 접근 모드 차이와 ChatGPT 모바일의 Work 모드에서 Code Interpreter가 인터넷에 접근할 수 있다는 관찰을 제시한다.
CLIP 앙상블과 텍스트 기반 NLI 모델을 결합해 자동 생성한 합성 라벨로 CLIP 이미지 인코더의 클래스별 단일 벡터만 미세조정하여 전자상거래 상품의 시각 속성 추출을 대규모로 수행했다.
여러 모델의 답변을 익명으로 상호 비평해 0-100 점수로 불일치를 측정하고 게스트 답변과 로컬 실행을 지원하는 GitHub 프로젝트다.
연속 에이전트 루프에서 stateless 래퍼가 KV 캐시를 매회 버려 50k 시스템 프롬프트가 반복 전송되어 대규모 입력 토큰 소진이 발생했고, 불변 코어와 압축된 델타의 2영역 분리로 비용을 90% 이상 낮출 수 있다고 제안했다.
Opus 5는 Senior SWE-Bench의 버그·성능 조사 부문에서 최고 점수를 기록했고 디버깅에서 85% 성공률을 보였으며 실패의 주원인은 추론 오류로 확인됐다.
센서가 반환하지 않는 깊이값을 실제 결손 마스크로 삼아 RGB 문맥에서 채우는 masked depth modeling이 유리·거울 표면의 깊이 구멍을 메워 로봇 그리핑에 실사용 가능성을 보여주었다.
에이전트당 단일 KB 툴만 허용되는 환경에서 index 0으로 연결된 오래된 또는 아카이브된 KB가 빈 검색 결과를 반환해 모델이 자체 지식으로 응답했으며 전체 KB 사용 에이전트의 약 13%가 영향을 받았다.
AI 도구 비교는 동일한 입력·품질 설정·소프트웨어 버전 및 이해관계 공개가 있어야 재현성과 신뢰성을 확보할 수 있다.
수학계 최고 권위자의 OpenAI 안전팀 이직, NVIDIA의 10GW 데이터센터 자금 보증 협의, 그리고 2.8조 파라미터·100만 토큰 컨텍스트의 Kimi K3 가중치 공개가 한 주에 동시 발생하며 인재·자본·역량의 대규모 이동이 가속화되고 있다.
AutoDev Studio는 단계별로 다른 모델을 할당해 변경 요청부터 검증된 PR까지 자동화하고 벤치마크에서 단일 에이전트 대비 비용을 7~75% 절감했다.
Deepgram이 Amazon SageMaker AI와 IAM 임시 위임을 통합하여 셀프호스팅 음성 모델의 파트너 접근을 시간 제한형으로 제공하고 초기 조사 시간을 며칠에서 분 단위로 단축했다.
TAKC는 문서를 과제별로 사전 압축해 RAG가 놓치는 교차문서 연관성을 보존하면서 8x–64x 토큰 감소로 분석 비용과 지연을 줄인다.
Verizon이 구글과 10억 달러 이상 규모의 다크 파이버 계약을 체결하고 중앙국 동선에서 구리선을 제거해 미니 데이터센터로 전환하여 에지 추론 인프라를 확장한다.
OpenAI는 달러당 유용한 AI 성과라는 네 가지 지표로 AI 가치를 정량화하고 GPT‑5.6 사례로 작업당 비용과 신뢰성의 경제적 차이를 입증했다.
저자가 논문 'Attention Is All You Need'를 기준으로 Transformer를 torch.nn 원시 블록만으로 구현하고 영어-타밀 병렬 데이터로 학습한 코드와 수학적 분해를 공개했다.
머신러닝 알고리즘의 작동 원리를 이해하기 위한 필수 수학 개념인 미분, 편미분, 그래디언트, 헤시안 행렬, 테일러 급수 및 선형대수를 다룹니다.
2.8조 파라미터·1백만 토큰 장문맥을 표방한 Kimi K3가 오픈 웨이트로 공개되며 서빙 파트너·최적화 커널과 함께 즉시 배포되고, NVIDIA 주도의 보안 연합 논의가 오픈 모델의 보안 역할을 재정의하고 있다.
Google의 AI Overviews가 검색의 43%에서 표시되어 AI 생성 답변이 정보 탐색의 기본 방식으로 빠르게 자리잡고 있다.
Ising Calibration 1.5는 31B 파라미터 VLM으로 QCalEval 벤치마크에서 제로샷과 문맥 학습 성능을 크게 높이고 NVFP4 양자화로 단일 GPU 배포를 가능하게 한다.
디렉터리별 에이전트 구성, 온디맨드 참조, CI 검증 스크립트, 저장소별 메모리를 통해 재사용성과 신뢰성을 확보한 코딩 에이전트 아키텍처를 공개하고 30개 스킬을 Apache-2.0으로 배포했다.
Credit Genie가 LangGraph와 LangSmith를 활용해 AI 금융 비서의 에이전트 오케스트레이션과 디버깅 프로세스를 최적화한 사례.
Jensen Huang의 공개 LLM 지지 서한에 업계가 호응했고 저자는 미국이 오픈 웨이트와 공개 코퍼스에 대규모 투자를 촉구했다.