이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
Andrew Ng와 DeepLearning.ai는 10,000건이 넘는 채용 공고와 전문가 인터뷰 등을 바탕으로 AI Engineering의 핵심 역량을 AI 애플리케이션 구축·배포, Software Engineering 기초, coding agent 활용, 빌드 방향 설정의 네 축으로 정리했습니다. 기사 후반부는 실제 agent 성능이 기본 모델보다 하니스의 실행·평가·복구 구조에 크게 좌우되고, MCP가 기업용 인증과 장기 실행 인프라로 확장되는 흐름을 전합니다. 모델 비교도 단일 벤치마크 점수에서 벗어나 비용당 완료 작업, 토큰 캐시, 양자화, 지연과 메모리를 함께 보는 방식으로 이동하며, 온디바이스 환경에서는 클라우드와 다른 효율 기준이 필요하다는 점을 수치로 뒷받침합니다.
섹션별 상세
Andrew Ng와 DeepLearning.ai는 AI Engineering을 특정 직함이 아닌 폭넓은 실무 역량으로 재정의하며, 10,000건이 넘는 채용 공고와 수십 건의 구조화 인터뷰, 설문 및 온라인 자료를 종합해 역량 지도를 만들었습니다. 지도는 AI 애플리케이션 구축·배포, Software Engineering 기초, coding agent 활용, 제품과 사업 맥락에 맞춰 빌드를 이끄는 능력의 네 축으로 구성됩니다. 이는 기존 Machine Learning Engineer나 MLOps 업무뿐 아니라 AI를 활용해 소프트웨어를 만드는 개발자 전반의 기준이 바뀌고 있음을 뜻합니다.


근거
- Andrew Ng의 AI Engineering Skills Map은 10,000건이 넘는 채용 공고와 수십 건의 구조화 인터뷰, 설문 및 온라인 자료를 종합해 네 가지 핵심 역량을 도출했습니다. — 기사 앞부분의 Andrew Ng 및 DeepLearning.ai 재출범 소개 문단
AI 애플리케이션 구축과 배포 역량은 LLM, Context Engineering, RAG, agentic workflow, Machine Learning과 Deep Learning을 조합한 뒤 통계적 측정으로 시스템의 행동을 조정하고 관리하는 흐름입니다. 실무에서는 Prompt Engineering부터 harness engineering, Fine-tuning, 자체 agent lab 구축까지 이어지며, 반복적인 평가와 오류 분석으로 예측 가능성을 높입니다. 따라서 모델을 호출하는 것만으로는 충분하지 않고 입력·실행·평가·개선 루프 전체를 운영하는 능력이 핵심이 됩니다.
Software Engineering 기초는 사용할 기술 스택과 시스템 아키텍처, 데이터 저장소, 테스트 사이의 trade-off를 파악하게 해 coding agent가 만든 코드를 검증하는 기반이 됩니다. 경험이 부족한 개발자가 선택의 이유를 모른 채 agent에게 컨텍스트를 적게 주면 실행 가능한 결과가 나와도 구조와 유지보수성에서 나쁜 결정을 반복할 수 있습니다. 기사에서는 LLM이 낮은 숙련도의 개발자보다 높은 숙련도의 개발자에게 더 큰 상한선 상승을 제공한다고 평가하며, AI 도구가 기본기를 대체하지 않는다는 점을 짚습니다.
Coding agent 활용은 agent의 작동 방식과 한계를 이해하고, 언제 직접 개입하며 언제 자율 실행을 허용할지 조절하는 능력입니다. 명확한 사양을 작성할 필요가 있는 작업과 그렇지 않은 작업을 구분하고, 여러 agent를 조율하며, 운영 데이터베이스를 망가뜨리는 위험을 막는 실행 환경을 설계해야 합니다. Copilot 중심이던 2023년 이후 Claude Code, Codex, Cognition, Cline 등이 등장한 흐름은 도구 선택과 작업 절차를 계속 갱신하는 민첩성과 검증 습관을 동시에 요구합니다.
빌드를 형성하는 역량은 제품 감각과 사업 맥락, 고객 목표를 기술 구현에 연결해 프로젝트의 속도와 완성도를 결정하는 능력입니다. 빠르게 MVP를 만들어 사용자에게 시험할 때와 더 긴 시간을 들여 신중하게 구축할 때를 구분해야 하며, AI PM과 Design Engineering처럼 기존 역할의 경계가 흐려진 환경에서 특히 중요합니다. AI Engineering이 코드 작성만이 아니라 무엇을 만들지 정하고 사용자 피드백을 통해 방향을 바꾸는 업무까지 포함한다는 점이 네 번째 축에 담겼습니다.
에이전트 인프라 연구에서는 기본 모델보다 하니스가 실제 성능을 좌우하는 사례가 늘고 있으며, NVIDIA의 평가에서 단순한 skill 검사 점수와 사람이 판단한 유용성의 Spearman ρ가 0.14에 그쳤습니다. 같은 작업을 skill이 있을 때와 없을 때 동일 조건으로 실행해 완료 작업의 차이를 측정하는 Skill Lift가 대안으로 제시됐고, Headlong와 exo는 지속 실행, DAG 형태의 trajectory 저장, append-only event log, sandbox snapshot과 rollback을 구현하는 방향을 택했습니다. 이런 구조는 agent가 prompt·도구·메모리를 수정하더라도 영구 상태를 직접 훼손하지 못하게 하며, 앞으로의 최적화가 Prompt Engineering보다 내구성·분기·복구·지속 실행으로 이동하고 있음을 보여줍니다.
근거
- NVIDIA 평가에서 단순한 agent skill 검사 점수와 사람이 판단한 유용성의 상관관계는 Spearman ρ = 0.14였으며, Skill Lift 측정이 대안으로 제시됐습니다. — Agent Harnesses, Persistent Agents, and Enterprise MCP 절의 첫 문단
MCP는 장난감 수준의 연결을 넘어 기업용 인증과 장기 실행을 지원하는 인프라로 확장되고 있습니다. Anthropic의 enterprise-managed auth는 조직의 identity provider를 통해 Asana, Atlassian, Canva, Datadog, Figma, Notion, Slack, Supabase 같은 connector의 권한을 중앙 관리하고, 로드맵은 streaming·server push, 로컬 서버용 HTTP, 대규모 카탈로그의 progressive discovery, 표준 identity와 delegated permission을 예고합니다. 사용자별 도구 OAuth를 반복하는 방식을 줄이고 감사 가능한 권한 체계를 마련한다는 점에서 실제 운영 환경과 초기 데모 사이의 간극을 좁힙니다.
모델 선택은 단일 점수보다 비용과 하드웨어 제약을 포함한 실제 완료 작업으로 평가되는 방향으로 바뀌고 있습니다. DeepSWE에서 GLM-5.3은 100달러 예산으로 Fable 5보다 약 5배 많은 작업을 완료했고, GPT-5.6 Sol Max는 72.7% 점수와 작업당 6.47달러, Fable 5 Max는 69.7%와 21.63달러로 비교됐으며, 모바일 평가에서는 Nanbeige4.2-3B와 LFM2.5-2.6B가 평균 점수 63을 기록했습니다. Pipette는 모델·양자화·runtime·기기 조합을 품질, 속도, 지연, 메모리 기준으로 측정하고 35개 모델 계열과 7개 quant, 4개 기기에서 10,000건이 넘는 검증 결과를 모아 클라우드와 다른 모바일 Pareto 기준을 제시합니다.
근거
- GLM-5.3은 100달러 예산에서 DeepSWE 작업을 Fable 5보다 5배 더 많이 완료했으며, 비교 수치는 대략 17개 대 3개였습니다. — Cost-normalized agent benchmarks 문단의 Together AI 비교
- Pipette는 35개 모델 계열, 7개 quant, 4개 기기 조합에서 10,000건이 넘는 검증 결과를 제공하는 온디바이스 추론 평가 스택입니다. — On-Device AI and Inference Systems 절의 Pipette 소개 문단
- 모바일 평가에서 Nanbeige4.2-3B와 LFM2.5-2.6B는 평균 점수 63을 기록했고, LFM2.5-2.6B는 iPhone에서 8.0초와 2.3GB를 사용했습니다. — Phone-scale results 문단의 8GB 메모리·16K 컨텍스트 비교
용어 해설
- 에이전트 하니스(Agent Harness)
- — 에이전트가 작업을 수행하도록 도구 호출, 실행 환경, 메모리, 테스트와 복구 절차를 묶어 제공하는 실행 구조입니다. 같은 모델이라도 하니스가 어떤 컨텍스트와 피드백 루프를 주느냐에 따라 실제 완성 작업의 품질과 비용이 달라집니다.
- 컨텍스트 엔지니어링(Context Engineering)
- — 모델이 작업에 필요한 지침, 문서, 상태, 도구 결과를 적절한 순서와 형식으로 받도록 입력 환경을 설계하는 방법입니다. 단순한 Prompt Engineering보다 실행 중 정보 관리와 반복적인 컨텍스트 갱신까지 포함합니다.
- 추측적 도구 호출(Speculative Tool Calling)
- — 모델이 코드 생성을 마칠 때까지 기다리지 않고 안전하다고 예측한 도구 호출을 복제된 환경에서 먼저 실행하는 방식입니다. 도구 실행과 토큰 생성을 겹쳐 전체 에이전트 지연을 줄이지만, 잘못된 예측으로 폐기되는 작업이 생길 수 있습니다.
- KV 캐시(KV Cache)
- — Transformer가 이미 처리한 토큰의 key와 value 상태를 저장해 다음 생성 단계에서 같은 입력을 다시 계산하지 않도록 하는 메모리 구조입니다. 긴 대화나 코드 작업에서는 재사용으로 지연을 낮추지만, 저장 용량과 양자화에 따른 품질 저하가 문제가 될 수 있습니다.
- Mixture of Experts
- — 모델 전체 파라미터를 매 토큰마다 모두 활성화하지 않고 입력에 맞는 일부 Expert만 선택해 계산하는 구조입니다. 기사에 인용된 모바일 모델들은 토큰당 약 1B 파라미터만 활성화해 제한된 메모리와 연산 환경에서 응답 속도를 높였습니다.
기술
- LLMs
- Context Engineering
- RAG
- agentic workflows
- machine learning
- deep learning
- Prompt Engineering
- harness engineering
- Fine-tuning
- MCP
- Headlong
- exo
- Skill Lift
- Qwen3.8-27B
- Carnice-V3-27B
- GPT-5.6
- GLM-5.3
- Fable 5
- DeepSWE
- Pipette
- llama.cpp
- vLLM
- KV offload
- prefix reuse
- prefill/decode disaggregation
- Speculative Programmatic Tool Calling
- Muon
- AdamW
- Latent Dynamics Reasoning
- Chinchilla
활용 사례
- AI 애플리케이션 구축과 배포
- coding agent를 활용한 소프트웨어 개발
- 여러 agent의 협업과 지속 실행
- 기업용 MCP connector 권한 관리
- 온디바이스 LLM 추론
- 비용과 완료 작업을 함께 반영한 agent 벤치마크
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
