JSON 때문에 낭비되는 LLM 토큰, TOON 포맷으로 비용과 성능 동시에 잡는다
LLM 입력 시 JSON의 반복적인 구조로 인한 토큰 낭비를 줄이기 위해 설계된 새로운 데이터 포맷 TOON의 특징과 활용법을 소개한다.
총 88건
LLM 입력 시 JSON의 반복적인 구조로 인한 토큰 낭비를 줄이기 위해 설계된 새로운 데이터 포맷 TOON의 특징과 활용법을 소개한다.
Vercel이 출시한 DeepSec은 Claude Code와 연동하여 대규모 코드베이스의 보안 취약점을 체계적으로 스캔하고 분석하는 자동화 하네스 도구이다.
OpenAI와 Elon Musk 간의 법정 공방에서 드러난 내부 갈등과 OpenAI의 자체 스마트폰 개발 계획에 대한 분석을 다룹니다.
OpenClaw와 Pazi.ai를 활용해 Slack 채널 내에서 관리자, 개발자, 운영 에이전트가 협업하여 Flask 앱을 Google Cloud에 자동 배포하는 멀티 에이전트 워크플로우를 구축한다.
자연어 프롬프트로 앱을 생성하는 바이브 코딩의 확산에 대응하여, 비결정론적 AI 생성을 가시화하고 결정론적 실행으로 연결하는 새로운 거버넌스 아키텍처가 필요하다.
Halliburton은 Amazon Bedrock과 Claude 3.5를 활용하여 복잡한 지진 데이터 처리 워크플로 구성을 자연어 대화로 자동화하고 작업 시간을 95% 이상 단축했습니다.
프롬프트 스킬을 다른 에이전트에 이식할 때 발생하는 컨텍스트 충돌을 방지하기 위해 명시적인 계약(Contract) 정의가 필요하다.
오타, 추임새, 공백 등 인간의 일상적인 작성 습관이 의도 변화 없이도 LLM의 토큰 수를 변화시켜 효율성에 영향을 준다.
Anthropic이 공개한 MCP(Model Context Protocol)는 LLM과 외부 데이터 소스를 표준화된 방식으로 연결하여 에이전트의 생산성을 극대화하는 개방형 프로토콜이다.
MIT 테크놀로지 리뷰는 AI가 일상에 확산되며 발생하는 불확실성과 권태를 분석하고, 로봇 공학 및 의료 분야의 최신 AI 트렌드를 조명했다.
카메라, LiDAR, 레이더 데이터를 단일 워크플로에서 통합 라벨링하여 데이터 일관성을 높이고 비용을 절감하는 센서 퓨전 어노테이션 기법을 소개합니다.
에이전트가 파일, DB, 웹 등 다양한 소스에서 최적의 정보를 스스로 선택하고 추출하는 에이전틱 검색의 실전 메커니즘을 다룹니다.
NumPy를 사용하여 임베딩 정규화, 코사인 유사도 계산, PCA 시각화를 포함한 벡터 검색 엔진을 직접 구현하며 작동 원리를 설명한다.
Rust로 개발된 Claudy는 MCP 브리지를 통해 Claude Code에서 다양한 모델과 로컬 에이전트를 사용할 수 있게 지원한다.
급성장하는 AI 장난감 시장에서 부적절한 콘텐츠 노출과 아동 발달 저해 위험이 제기됨에 따라 규제 강화의 필요성이 커지고 있다.
VS Code 확장 프로그램인 NEO는 단일 프롬프트로 합성 데이터 생성, 모델 학습, 추론 API 구축 및 UI 생성까지 수행하는 자율 머신러닝 엔지니어 에이전트이다.
AMD Instinct MI300X 하드웨어와 ROCm 소프트웨어 스택을 활용하여 Qwen3-1.7B 모델을 의료 질의응답용으로 LoRA 파인튜닝하는 전체 과정을 다룹니다.
Relevance AI 플랫폼과 Claude를 활용하여 유튜브, 팟캐스트, 블로그 등의 소스를 분석하고 플랫폼별 맞춤형 SNS 포스팅을 자동 생성하는 에이전트 구축 과정을 다룹니다.
AI 에이전트가 프로덕션 환경에서 오작동하지 않도록 MCP 환경에서의 새로운 가드레일 설계 패턴과 실제 실패 사례를 통한 보안 전략을 제시한다.
AI 코딩 에이전트의 핵심인 시스템 프롬프트를 5가지 영역으로 구조화하고 환경 변수를 동적으로 주입하여 지능적인 에이전트를 구축하는 방법을 다룬다.
NVIDIA Grace Blackwell 기반 Dell GB10 워크스테이션의 128GB 통합 메모리와 FP4 가속을 통한 Llama 3.3 70B 모델의 로컬 추론 성능 검증기입니다.
인지 과학 이론인 GWT와 IIT 프록시를 활용해 자율적 인지 상태와 성격 모델을 갖춘 Python 기반 AI 에이전트 프로젝트가 공개됐다.
텍스트, 이미지, 비디오를 동시에 처리하는 네이티브 멀티모달 모델 Qwen3.5의 특징과 vLLM 및 llama.cpp를 이용한 추론 방법을 소개한다.
Distributional의 CEO Scott Clark가 전통적인 평가 지표(Evals)를 넘어 운영 환경에서의 비지도 학습 기반 분석을 통해 복잡한 AI 에이전트의 비정상 패턴을 탐지하는 방법을 설명합니다.
대형 언어 모델의 추론 능력을 강화하기 위한 강화 학습 과정에서 정답(Positive)과 오답(Negative) 간의 의미적 중첩으로 인해 발생하는 그래디언트 충돌 문제를 해결합니다. 오답의 그래디언트 업데이트가 정답의 유효한 논리 구조까지 억제하는 현상을 방지하여 모델의 성능과 생성 다양성을 동시에 개선합니다.
기존 비디오 생성 모델의 증류 방식은 모든 프레임과 픽셀을 동일하게 취급하여 품질 개선에 한계가 있었다. Stream-R1은 보상 모델을 활용해 개선이 더 필요한 영역에 학습 집중도를 차등 배분함으로써, 추론 속도를 30배 높이면서도 원본 모델보다 더 뛰어난 영상미와 일관성을 확보했다.
트럼프 행정부가 새로운 AI 모델 출시 전 연방 정부의 검토를 거치게 하는 행정명령을 검토 중이라는 소식과 함께 연방 정부 내 AI 관련 갈등을 다룹니다.
Anthropic이 출시한 Claude for PowerPoint 추가 기능을 통해 슬라이드 자동 생성, 데이터 시각화, PDF 기반 덱 구축 및 다국어 번역을 수행하는 실전 방법을 다룹니다.
Databricks는 Unity Catalog와 Lakebase를 기반으로 데이터 사일로를 통합하고 AI 에이전트 및 애플리케이션 구축을 지원하는 통합 데이터 지능 플랫폼이다.
유럽 스쿠터 기업 Voi의 공동 창업자들이 설립한 스웨덴 AI 스타트업 Pit이 a16z로부터 1,600만 달러 투자를 유치하며 기업용 맞춤형 AI 소프트웨어 자동화 시장에 진출했다.
Perplexity가 로컬 파일 및 앱 접근 권한을 가진 AI 에이전트 'Personal Computer'를 Mac 데스크톱 앱을 통해 모든 사용자에게 공개했다.
Simon Willison이 개발한 llm-gemini 플러그인이 0.31 버전으로 업데이트되어 Gemini 1.5 Flash-Lite 모델의 정식 출시 버전을 지원한다.
애플이 시각 정보를 수집하여 Siri와 연동하는 카메라 탑재 에어팟의 시제품 테스트를 진행하며 양산을 준비 중이다.
구글 딥마인드의 게임 내 AI 테스트와 멀티모달 임베딩, SSM 구조 분석 등 최신 AI 연구 및 서비스 트렌드를 요약한 뉴스레터이다.
NVIDIA와 미국 에너지부는 Genesis Mission을 통해 10만 개의 GPU가 탑재된 슈퍼컴퓨터를 구축하고 AI를 활용해 핵융합 및 전력망 효율화를 추진합니다.
Ollama의 로컬 비전 모델을 사용하여 사용자가 정의한 기준에 따라 macOS 사진 라이브러리를 분석하고 불필요한 사진을 선별해주는 오픈소스 앱입니다.
OpenAI가 개발자를 위해 실시간 추론, 70개 언어 번역, 스트리밍 전사를 지원하는 새로운 오디오 모델 3종을 API로 출시했다.
Informatica는 IDMC 전반에 멀티 에이전트 시스템인 CLAIRE를 구축하여 복잡한 데이터 관리 워크플로의 작업 성공률을 90%까지 끌어올렸습니다.
Anthropic은 AI 모델의 내부 숫자 데이터인 활성화를 사람이 읽을 수 있는 텍스트로 번역하는 Natural Language Autoencoders 기술을 공개했다.
Pydantic AI와 Logfire를 사용하여 서비스 중단 없이 프롬프트와 모델을 업데이트하고 프로덕션 데이터를 기반으로 에이전트 성능을 지속적으로 최적화하는 실전 기법을 다룬다.
무작위로 초기화된 다층 퍼셉트론(MLP)의 기대 출력을 실제 모델 실행 없이 가중치 분석만으로 몬테카를로 샘플링보다 정확하고 빠르게 추정하는 기법을 제안한다.
규제 대상 업무에서 LLM의 확률적 특성으로 인한 신뢰성 문제를 해결하기 위해, 해석은 LLM이 하되 결정은 결정론적 규칙 엔진이 담당하는 이층 구조 아키텍처가 필수적이다.
WRITER 플랫폼을 활용해 실시간 외부 데이터베이스와 연결하고 출처 인용이 가능한 고신뢰도 리서치 에이전트를 구축하는 방법과 사례를 제시한다.
AWS에서 단기 ML 워크로드를 위해 EC2 Capacity Blocks와 SageMaker 학습 계획을 활용하여 GPU 가용성을 보장받고 비용을 최적화하는 전략을 제시한다.
중국 AI 연구소들은 실용주의적 태도, 학생 중심의 인력 구조, 기술 내재화 의지를 바탕으로 미국과는 차별화된 방식으로 LLM 생태계를 구축하고 있다.
Salesforce가 AI 에이전트, LLM, API 트래픽을 통합 관리하고 보안 및 비용 정책을 자동 적용하는 MuleSoft Omni Gateway를 출시했다.
Gemini 기반 진화 알고리즘 에이전트 AlphaEvolve가 출시 1년 만에 과학 연구 및 구글 클라우드 인프라 최적화에서 실질적인 성과를 거두었다.
머신러닝 모델의 학습 안정성과 예측 신뢰성을 확보하기 위해 학습과 추론 파이프라인 간의 데이터 정규화 기법을 표준화하고 일관되게 적용해야 한다.
오픈 소스와 폐쇄형 AI 모델 간의 성능 격차 변화와 물리적 환경에 내장되는 임베디드 AI의 부상을 통해 향후 2년 내 AI 생태계의 변화를 전망합니다.
사용자가 Claude Code와 MCP를 활용해 구축한 하이브리드 홈랩 경험을 바탕으로, Anthropic이 공식적인 로컬 추론 솔루션을 제공할 필요성을 제안했다.
RAG 시스템의 할루시네이션 문제는 대부분 모델 성능보다 청킹, 메타데이터 필터링, 유사도 임계값, 쿼리 최적화 등 검색 전략의 부재에서 발생한다.
AI 에이전트가 주장의 근거와 신뢰도를 수학적 벡터와 시간적 감쇠 모델을 통해 체계적으로 관리할 수 있게 돕는 Veritas 프레임워크가 공개됐다.
IBM Think 2026에서 전문가들이 모여 AI가 단순한 도구를 넘어 기업의 핵심 전략 결정과 엔드투엔드 운영을 주도하는 '에이전트 시대'의 신뢰 및 거버넌스 과제를 논의한다.
Heym 워크플로를 통해 4개의 AI 에이전트가 협력하여 코드 변경 사항을 검토하고, 이를 MCP 서버로 노출해 Claude Code 등과 연동하는 자가 호스팅 시스템이다.
사용자가 3개월간 Discord와 GitHub 등에서 수집하고 검증한 Claude Code 전용 실전 프롬프트 패턴 8가지를 공유했다.
Claude Code의 단순 grep 검색 한계를 극복하기 위해 하이브리드 검색과 재순위화 기능을 갖춘 Denser Retriever를 도입하여 문서 검색 정확도를 개선한 사례이다.
프로덕션 데이터를 추적하여 구축한 5만 개의 데이터셋으로 7B 모델을 파인튜닝함으로써 GPT 비용의 2% 수준으로 80%의 트래픽을 처리했다.
Anthropic의 폐쇄적인 Claude Design 워크플로를 로컬 환경에서 무료로 구현할 수 있는 오픈소스 프로젝트 Open Design이 공개되었다.
Kubernetes v1.35는 실행 중인 Pod의 리소스를 재시작 없이 변경하는 기능의 GA 전환과 AI 워크로드를 위한 Gang Scheduling 도입을 통해 운영 효율성을 극대화했다.
이미지 생성에 특화된 확산 모델이 가진 시각적 이해 능력을 극대화하여 별도의 복잡한 구조 없이도 정교한 이미지 분할이 가능함을 입증했다. 이는 생성 모델이 단순한 화가 역할을 넘어 의료, 위성, 농업 등 다양한 분야에서 범용적인 시각 이해 도구로 활용될 수 있는 새로운 방향을 제시한다.
로봇이 실세계에서 복잡한 작업을 수행하려면 도구 사용이나 동적 제약 조건과 같은 물리적 원리를 이해해야 하지만, 기존 벤치마크는 언어나 인지 능력에 치중되어 있었습니다. KinDER는 인지적 요소를 배제하고 순수하게 물리적 추론 능력만을 측정할 수 있는 표준화된 환경을 제공하여 로봇 지능 연구의 새로운 방향을 제시합니다.
기존 멀티모달 모델들이 시각적 이해와 생성 능력을 개별적으로 다루던 한계를 극복하고, 공간 지능을 중심으로 두 능력을 통합했습니다. 이를 통해 단순한 이미지 생성을 넘어 물체의 위치, 거리, 시점 변화를 정밀하게 제어하는 차세대 시각 모델의 방향성을 제시합니다.
일반 중계 영상만으로 탁구공의 3D 위치, 스핀, 선수의 움직임을 정밀하게 복원하는 기술을 제시한다. 기존의 한계를 극복한 Lift-First 접근법을 통해 가림 현상이 심한 상황에서도 물리적으로 타당한 데이터를 대규모로 생성할 수 있어 스포츠 분석과 로봇 학습에 기여한다.
최신 LLM들이 논리적 추론과 도구 사용 능력에서 큰 진전을 보였으나, 주변 사물을 원래 용도가 아닌 새로운 방식으로 활용하는 창의적 문제 해결 능력은 여전히 부족함을 밝혀냈습니다. 이 논문은 사물의 물리적 속성을 기반으로 기능을 유추하는 '어포던스' 개념을 도입하여, 미래의 자율 에이전트가 예기치 못한 상황에서 얼마나 유연하게 대처할 수 있는지를 평가하는 새로운 기준을 제시합니다.
기존 3D 생성 모델은 겉모습만 그럴듯한 '빈 껍데기'를 만드는 데 그쳐 로봇 시뮬레이션이나 게임 내 상호작용에 활용하기 어려웠다. PhysForge는 물체의 재질, 질량, 관절 가동 범위 등 물리적 속성을 함께 생성하여 별도의 수작업 없이도 즉시 조작 가능한 지능형 에셋을 제공한다.
기존 LLM은 복잡한 문제를 풀 때 추론이 끝날 때까지 사용자를 기다리게 하거나, 너무 빨리 답하려다 틀린 답을 내놓는 딜레마가 있었다. 이 논문은 추론 과정 중간에 확신이 서는 부분만 골라 먼저 보여주는 Side-by-Side(SxS) 기법을 통해 대기 시간을 줄이면서도 높은 정확도를 유지하는 방법을 제시한다.
의료 분야 AI 에이전트는 과학적 무결성과 안전성이 필수적이지만, 기존의 일반적인 벤치마크로는 이를 충분히 검증하기 어렵다. MedSkillAudit은 의료 연구 기술의 배포 전 준비 상태를 체계적으로 감사하여 전문가 검토 수준의 신뢰성을 확보할 수 있는 프레임워크를 제공한다.
기존 자율주행 모델은 미래 장면을 생성하거나 현재 상황을 이해하는 기능이 분리되어 있어 복잡한 상황 판단에 한계가 있었다. HERMES++는 LLM을 기반으로 3D 기하학적 예측과 시각적 질의응답을 하나의 프레임워크로 통합하여, 차량이 주변 환경을 말로 설명하면서 동시에 미래의 3D 구조 변화를 정확히 예측할 수 있게 한다.
LLM의 환각을 탐지하기 위해 기존에는 여러 번 답변을 생성하여 비교하는 고비용 방식이 주로 사용되었다. 이 논문은 답변의 첫 번째 핵심 토큰이 생성될 때의 확률 분포(Entropy)만 확인해도 기존의 복잡한 방식과 대등하거나 더 나은 성능을 낼 수 있음을 입증하여 추론 비용을 획기적으로 줄일 수 있는 길을 열었다.
기존 로봇 AI 모델들이 단순한 사물 인식과 이동에 그쳤다면, RLDX-1은 움직이는 물체를 잡거나 계란을 깨뜨리지 않고 옮기는 등 인간 수준의 정교한 손동작을 구현했다. 시각 정보뿐만 아니라 촉각과 힘의 변화를 실시간으로 감지하여 복잡한 환경에서도 안정적인 작업이 가능하다는 점이 가장 큰 특징이다.
자연어만으로 앱을 만드는 '바이브 코딩' 플랫폼들이 등장했지만, 이들이 실제 비즈니스 환경에서 사용 가능한 수준인지는 미지수였다. 이 논문은 단순 코드 생성을 넘어 기획, 설계, 보안, 인프라를 아우르는 68개 지표로 AI 플랫폼을 평가하여 현재 기술의 명확한 한계와 개선 방향을 제시한다.
비디오 편집 모델이 길어지는 영상 길이에 따라 연산량이 기하급수적으로 늘어나는 문제를 해결했다. 문맥 토큰의 중요도를 선별적으로 계산하는 새로운 Sparse Attention 기법을 통해 시각적 품질 저하 없이 처리 속도를 획기적으로 높였다.
최고 수준의 멀티모달 검색 에이전트는 학습 데이터와 방법론이 비공개인 경우가 많아 재현이 어려웠다. 이 논문은 고품질 데이터 생성 파이프라인과 강화학습 알고리즘을 모두 공개하여 누구나 강력한 시각 검색 에이전트를 구축할 수 있는 기반을 제공한다.
최근 FLUX.2와 같은 고성능 이미지 생성 모델들은 빠른 속도를 위해 적은 단계로 이미지를 생성하는 Step-distillation 기법을 사용하지만, 새로운 개념을 학습시키기 위해 추가 학습(Fine-tuning)을 하면 이 효율적인 생성 능력이 손상되는 문제가 있다. 이 논문은 모델이 스스로 생성한 데이터를 바탕으로 학습하는 On-policy 방식을 도입하여, 기존의 빠른 생성 속도를 유지하면서도 새로운 스타일이나 개념을 완벽하게 학습할 수 있는 해결책을 제시한다.
기존 멀티모달 모델의 한계였던 '듣고 말하기'의 순차적 구조를 깨고, 실시간으로 보고 들으며 동시에 말할 수 있는 전이중(Full-Duplex) 상호작용을 구현했습니다. 9B라는 효율적인 파라미터 규모로도 온디바이스 환경에서 인간과 유사한 능동적 반응을 보여주며 차세대 AI 인터페이스의 방향성을 제시합니다.
기존 검색 시스템은 단순히 유사한 문서를 찾는 데 집중했으나, 복잡한 추론이 필요한 에이전트 환경에서는 여러 관점의 증거를 조합하는 능력이 필수적이다. 이 논문은 에이전트의 사고 과정을 지원하는 다각도 검색 평가 체계와 이를 학습하기 위한 합성 데이터 생성 기법을 제시하여 에이전트 검색의 새로운 기준을 마련했다.
스포츠 코칭이나 재활 치료에서 사람의 동작이 얼마나 정확한지 평가하는 것은 매우 중요하지만, 여러 각도의 카메라 영상을 동시에 분석해야 하므로 연산 비용이 매우 높았다. 이 논문은 적은 연산 자원만으로도 다중 시점 영상을 통합 분석하여 단순 점수 산출을 넘어 전문가 수준의 구체적인 조언까지 생성하는 효율적인 모델 구조를 제시한다.
AI 생성 음악 플랫폼의 급성장으로 전통적인 아티스트 평판 없이 오직 오디오 특성만으로 음악의 성공 가능성을 예측해야 하는 필요성이 커졌다. 이 논문은 음악의 미적 품질과 대중적 인기도가 서로 보완적인 관계임을 입증하며, AI 음악의 품질 평가와 추천 시스템 성능을 동시에 개선할 수 있는 기술적 토대를 마련했다.
구글과 메타의 제품 리더였던 니킬 싱할이 AI 기술이 제품 관리, 디자인, 엔지니어링의 경계를 허무는 방식과 변화하는 커리어 전략을 공유한다.
OpenAI가 ChatGPT 사용자의 자해나 자살 징후를 감지했을 때 지정된 보호자에게 알림을 보내는 '신뢰할 수 있는 연락처' 기능을 도입했다.
ChatGPT가 중국어 응답 시 '내가 너를 든든하게 받아줄게'라는 어색하고 과하게 친절한 표현을 반복적으로 사용하는 현상이 중국 인터넷에서 밈으로 확산되고 있다.
AeSlides는 검증 가능한 미적 지표와 GRPO 강화학습을 결합하여 LLM의 슬라이드 레이아웃 생성 능력을 획기적으로 개선하는 프레임워크이다.
리눅스 네트워킹 유지관리자 야쿠브 키친스키가 AI 생성 버그 리포트 폭주에 대응하기 위해 사용되지 않는 138,000줄의 레거시 코드를 삭제했다.
Amazon SageMaker에서 GRPO 알고리즘과 검증 가능한 보상(RLVR) 기법을 사용하여 Qwen2.5 모델의 수학적 추론 능력을 획기적으로 개선하는 방법을 설명한다.
Mozilla는 Anthropic의 Mythos 모델을 활용해 Firefox에서 15년 된 취약점을 포함한 수백 개의 고위험 보안 버그를 발견하고 수정했습니다.
오로라 혁신(Aurora Innovation)의 CEO 크리스 엄슨이 자율주행 트럭의 상업적 운영 성과와 검증 가능한 AI 시스템의 중요성을 강조했다.
Effect 라이브러리 소스 코드를 프로젝트에 직접 포함시켜 코딩 에이전트가 정확한 패턴을 학습하고 신뢰할 수 있는 TypeScript 코드를 생성하게 만드는 실전 워크플로를 다룬다.