코딩 에이전트만 성공하는 이유, 지능과 전문성의 차이
LLM의 지능은 범용적이지만 전문성은 부족하다. 지속적 학습을 통해 경험을 압축하고 전문성을 쌓아야만 에이전트가 실질적인 업무를 수행할 수 있다.
총 49건
LLM의 지능은 범용적이지만 전문성은 부족하다. 지속적 학습을 통해 경험을 압축하고 전문성을 쌓아야만 에이전트가 실질적인 업무를 수행할 수 있다.
AutoScientist는 데이터와 모델을 자동 최적화하여 연구 장벽을 낮추고, 모델 크기 경쟁을 넘어선 새로운 AI 연구 패러다임을 제시한다.
Qwen3.8-2.4T-A95B가 선택적 Expert 활성화와 Hybrid Attention으로 GB300 NVL72에서 초대형 모델 서빙을 구현합니다.
NavWareSet은 충돌 회피와 사회적 네비게이션을 같은 조건에서 비교하는 로봇 데이터셋입니다.
YUTO MMS가 기울어진 LiDAR와 panoramic camera를 결합한 Toronto 주행 데이터셋을 공개했습니다.
Twitch가 Amazon 생성형 AI 학습에 채널 콘텐츠를 쓰지 못하게 하는 선택 설정을 추가했습니다.
CUR 2.0의 IAM principal 데이터를 Athena와 CUDOS에 연결해 Amazon Bedrock 비용을 사용자·프로젝트·모델별로 추적합니다.
Grok 4.6 출시가 GDPVal-AA 1,753 ELO와 에이전틱 성능으로 확산되는 사이 SL2T·Qwen3.8·Keras 3가 실제 입력·실행·서빙 경로를 넓혔다.
LLM 텍스트는 다시 쓰고 검증하며 생성 조건까지 밝혀야 독자의 신뢰를 지킬 수 있습니다.
Adam의 좌표별 second moment가 회전 대칭을 깨뜨려 저랭크 복원을 방해하며, shared-scalar 방식에서는 성능이 회복됐다.
OlmoEarth Studio가 지구관측 임베딩을 COG로 내보내 검색·분류·변화 탐지를 지원한다.
MindTopo는 멀티모달 모델이 정적 장면을 넘어 행동 과정의 연결·포괄·매듭 관계를 유지하는지 평가합니다.
Gemini가 월간 사용자 10억 명을 넘기고 Grok Bot과 AI 에이전트 경쟁이 본격화됐습니다.
에이전트가 API를 안정적으로 선택하고 복구하도록 오류·context·인증·도구 surface를 설계하는 원칙을 정리했습니다.
Claude Design으로 디자인 시스템을 구축하고, 와이어프레임과 프로토타입을 거쳐 Claude Code로 실제 앱을 개발하는 5단계 워크플로우.
책을 빠르게 AI 학습 데이터로 바꾸는 과정에서 실물 도서가 파괴될 수 있다는 우려와 그 대안을 다룬 글입니다.
VRAM과 컨텍스트, 작업 유형을 맞춰 로컬 LLM의 실행 가능 모델과 속도를 계산하는 방법을 정리합니다.
대화형 에이전트의 도구 사용, 정책 준수, 협업 능력을 다각도로 평가하는 벤치마크 τ-bench와 τ²-bench의 설계 원리와 분석 결과를 다룬다.
OneAdvanced가 Llama 모델과 50개 이상 에이전트를 영국 AWS 리전에 자체 구축했습니다.
Natural Language Processing과 Machine Learning의 작동 원리와 산업별 활용, 도입 한계를 정리한 글입니다.
음성 받아쓰기로 수집한 원시 데이터를 LLM 에이전트로 정제하고, 위키와 그래프 뷰로 시각화하여 개인 지식 베이스를 자동 구축하는 방법.
오프라인 및 온라인 힌팅 전략을 결합하여 정답 데이터 없이도 엔터프라이즈 모델의 성능을 지속적으로 개선하는 방법론.
에이전트의 치명적 오류를 방지하는 하한선(Floor) 중심의 코드 기반 평가 전략과 실전 이슈 탐지법을 다룬다.
Thrive Holdings가 AI 업무 전환과 인프라 규제 서비스 확장을 위해 20억 달러를 조달했습니다.
유사 장애 검색과 LLM 해결책 생성을 사람의 승인 및 메모리 갱신과 연결한 Flask 애플리케이션입니다.
vibe-coding 스타트업 Lovable이 13.3 billion 달러 기업가치로 400 million 달러를 조달했다.
Mesh가 Android에서 인맥 검색과 관계 관리 기능을 제공하며 Nexus AI를 확장합니다.
D’Addario가 홍보 트랙 재생성에 Suno Studio를 사용했다고 인정하고 AI 사용 공개 절차를 강화하기로 했다.
기존 벤치마크의 독립적 태스크 평가 방식을 비판하고, 모델의 실제 학습 개선도를 측정하는 Gain 메트릭과 지속 학습 벤치마크를 제안한다.
온폴리시 자기 증류(OPSD)를 사용하여 AI 모델이 스스로 힌트를 생성하고 학습함으로써, 기존 RLHF나 GRPO의 한계를 극복하고 지속적으로 성능을 개선하는 방법.
장기 실행 에이전트에서 메모리를 쓰기-관리-읽기 제어 루프로 설계하여 성능과 비용 효율성을 최적화하는 방법을 다룬다.
공개 데이터로 학습된 LLM이 개인화된 도메인 지식을 습득할 때 발생하는 성능 붕괴 문제를 해결하기 위해, 데이터가 아닌 연산(Compute)을 확장하여 모델의 깊이를 확보하는 연구 방향을 제시한다.
AI 클립 스타트업 VideoVerse의 250 million 달러 인수가 위조 문서와 미지급금 의혹으로 법정 공방에 휘말렸습니다.
OWASP의 2026년 LLM 보안 순위에서 에이전트의 과도한 자율성이 3위로 뛰어오르며 권한 관리의 중요성이 커졌다.
OpenAI의 두 연구는 기업 AI 활용이 질문 응답에서 도구 연결형 업무 실행으로 이동하며 조직별 격차가 커지고 있음을 수치로 보여줍니다.
SRAM 기반 air-cooled accelerator가 GPU 추론의 메모리 병목과 냉각 부담을 낮추는 구조를 제시합니다.
같은 Gemma 3 4B는 전용 GPU에서 더 빠르게 응답했지만 통합 그래픽 노트북에서도 일상 작업을 수행했다.
Google Pixel Watch 5가 하드웨어보다 Gemini와 건강 추세 분석을 강화했습니다.
Google이 Gemini 기능과 Pixel Tag를 앞세운 Pixel 11 시리즈와 Pixel Watch 5를 공개했습니다.
Amazon SageMaker HyperPod에서 Curvine 공유 NVMe를 L2 KV cache로 활용해 vLLM replica 간 Prefix Caching과 TTFT 개선을 구현한 실전 구성입니다.
Solv Labs가 AgentCore payments와 정책 proof·하드웨어 attestation을 결합해 거래별 감사 기록을 정산 전에 생성했습니다.