본문으로 건너뛰기

Nemotron 기반 적응형 Agentic Cybersecurity System 구축

공격 재시험과 검증 가능한 보상으로 Nemotron 탐지의 일반화를 높인 폐쇄 루프 보안 시스템

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

NVIDIA와 CrowdStrike는 격리된 NVIDIA 가속 컴퓨팅 인프라 환경에서 공격 에이전트와 방어 에이전트가 공격 실행, 텔레메트리 수집, 탐지 생성, 재시험을 반복하는 폐쇄 루프를 평가했습니다. 방어 harness는 Falcon 스키마 지식베이스, 텔레메트리 grounding, 특화 탐지 작성, artifact linting, detection replay, 독립 review의 여섯 장치를 결합해 Nemotron 3 Ultra의 조율과 맞춤형 Nemotron 3 Super의 탐지 생성을 분리했습니다. 9,349개의 탐지 생성·다단계 수정 예제로 학습한 Nemotron 3 Super는 NeMo Gym에서 쿼리 실행 결과를 검증받고, 반환 이벤트의 F1 overlap을 보상으로 NeMo RL 업데이트를 거쳤습니다. 기록 공격에 대한 평균 탐지율은 기본 harness의 16.5%에서 41.9%로 2.5배 높아졌고, 미공개 공격 8개를 대상으로 한 live-fire에서는 open pipeline 탐지의 45%가 일반화했으며 최종 gold 탐지는 3개로 8개 공격 전체를 포괄했습니다. 다만 단일 시나리오 계열, 작은 탐지 세트, 제한된 정상 트래픽, 세 차례 harness 실패가 포함된 시스템 수준 사례 연구이므로 일반적인 benchmark로 해석할 수 없습니다.

빠른 이해

새로운 점

범용 모델 하나에 의존하지 않고 Nemotron 3 Ultra의 방어 조율과 Nemotron 3 Super의 bounded detection expert를 분리한 뒤 공격 재시험·쿼리 실행·독립 review를 하나의 폐쇄 루프로 묶었습니다.

핵심 메커니즘

위협 목표를 red-agent harness에 입력하면 공격 trace와 Falcon telemetry가 생성되고, blue-agent harness가 이를 Falcon schema·domain context와 결합해 탐지 후보를 작성합니다. Artifact linting이 구조적 오류와 환경 종속 문자열을 걸러내고, detection replay가 기록 공격에서 실제 일치를 확인하며, 독립 judge가 행동 근거와 복수 신호 사용을 평가합니다. 통과한 탐지를 detection engine에 배포한 뒤 독립 seed 공격으로 재시험하고 결과를 red-agent에 돌려보내 우회 경로를 다시 찾습니다. Nemotron 3 Ultra는 조율을, post-trained Nemotron 3 Super는 탐지 작성·수정을 담당하며 NeMo Gym과 NeMo RL은 실행 결과 기반 보상으로 후자를 갱신합니다.

핵심 수치

  • 기록 공격 평균 탐지율: 16.5% -> 41.9%- 기본 harness와 Nemotron 3 Ultra 조합 대비 2.5배 개선; 각각 8개·6개 독립 seed session
  • open pipeline live-fire 일반화: 5/11, 45%- 미공개 공격 8개에서 최소 한 공격을 찾은 backtest 통과 탐지
  • frontier system live-fire 일반화: 10/35, 29%- 미공개 공격 8개에서 최소 한 공격을 찾은 backtest 통과 탐지
  • 탐지당 평균 포괄 공격 수: open pipeline 2.6개 vs frontier system 1.1개- 미공개 공격 8개 대상
  • quiet 탐지의 공격 포괄 범위: open pipeline 8/8 vs frontier system 7/8- 작동 탐지 중 정상 test traffic에서 조용한 탐지 기준
  • 최종 gold 탐지: open pipeline 3개 vs frontier system 0개- 행동 grounding, 복수 신호, 환경 종속 문자열 부재에 대한 독립 review 통과

섹션별 상세

01

공격과 방어의 폐쇄 루프

기존 red-and-blue 보안 훈련은 공격 실행, 텔레메트리 검토, 탐지 규칙 작성, 재시험 사이에 수동 인계가 있어 공격 변형과 반복 횟수가 제한됐습니다. 이 시스템은 위협 목표를 입력받아 red-agent harness가 격리 환경에서 공격 경로를 실행하고, Falcon endpoint sensor가 각 행동의 텔레메트리를 수집하는 순서로 시작합니다. blue-agent harness는 action trace와 센서 기록을 함께 받아 기존 탐지의 작동 여부와 가시성 공백을 파악한 뒤 후보 탐지를 만들고, validation harness가 문법·재실행·독립 review를 거쳐 통과한 규칙만 detection engine으로 보냅니다. 배포된 탐지는 독립 seed로 다시 실행한 공격의 결과와 함께 red-agent harness로 돌아가며, 에이전트는 탐지된 경로를 피해 대체 공격·우회 경로를 찾으므로 방어 범위와 공격 난도가 함께 갱신됩니다.
02

재현 가능한 격리 평가 환경

현실적인 공격 시험과 configuration 간 비교를 위해 NVIDIA는 가속 컴퓨팅 인프라를 표현한 정제된 자연어 사양을 제공했습니다. 에이전트 보조 workflow는 이 사양을 Falcon platform sensor가 장착된 격리 target cyber agent 환경으로 변환했고, 공격 경로와 관측 가능한 milestone을 사용해 에이전트의 자기 보고가 아닌 action trace와 sensor telemetry로 진행 상황을 측정했습니다. NVIDIA 보안 전문가는 환경과 threat path의 현실성을 확인했으며, 같은 검토 환경을 모든 공격 실행과 탐지 시험, 평가 지표에 재사용했습니다. 그 결과 각 configuration이 동일한 데이터 조건에서 비교됐지만, 정상 트래픽이 제한돼 실제 운영 환경의 false positive 성능까지 판단할 수 있는 구성은 아니었습니다.
03

탐지 생성을 위한 방어 harness

방어 harness는 Falcon sensor의 지원 schema·field·query syntax를 열거하는 지식베이스로 존재하지 않는 필드와 잘못된 쿼리를 막고, red-agent trace와 Falcon telemetry를 grounding 정보로 사용했습니다. 맞춤형 Nemotron 3 Super는 긴 workflow 조율과 분리된 bounded expert로서 탐지 작성과 수정을 맡았으며, artifact linting은 문법 오류와 미지원 필드, 특정 IP·host·user·subnet에 묶인 규칙을 거부했습니다. Detection replay는 후보 규칙을 기록된 공격 텔레메트리에 재실행해 실제 일치가 없으면 수정하도록 했고, 별도 judge는 행동 일치성·견고성·복수 신호 사용을 fresh context에서 평가했습니다. 여섯 장치가 실패 원인을 구조화된 feedback으로 돌려보내면서 그럴듯하지만 실행되지 않는 규칙을 반복 수정하는 흐름이 수동 detection-engineering review에 가까운 품질 기준을 갖췄습니다.
04

Nemotron 3 Super의 특화 학습

평가 configuration에서 Nemotron 3 Ultra는 공격 sequence 재구성, 탐지 절차 계획, 도구 호출을 맡고, fine-tuned Nemotron 3 Super는 탐지 생성과 repair만 처리해 범용 조율 문맥과 전문 작업을 분리했습니다. CrowdStrike는 Nemotron 3 Super를 NL2LogScale의 기반으로 사용한 뒤 cybersecurity 지식 continual pretraining, supervised fine-tuning, 검증 가능한 보상 기반 reinforcement learning을 적용했습니다. Fine-tuning 데이터는 59개 프로그램 생성 오류 유형을 포괄하는 탐지 생성·다단계 수정 예제 9,349개로 구성됐고, Nemotron 3 Super의 요청 rephrasing, 실제 Falcon LogScale 실행 오류, Nemotron 3 Ultra의 품질 검토 reasoning trace가 결합됐습니다. NeMo Gym은 생성 쿼리를 Falcon LogScale에서 실행하고 최대 다섯 번의 수정 기회를 제공했으며, 생성 쿼리와 기준 쿼리의 반환 이벤트 F1 overlap을 보상으로 삼아 NeMo RL이 모델을 업데이트했습니다.
05

Backtest와 live-fire 결과

기록된 공격에 대한 backtest에서 Nemotron 3 Ultra와 기본 harness 조합은 8개 독립 seed session 평균 16.5%의 생성 탐지만 공격을 찾았지만, 맞춤 harness·Nemotron 3 Super·domain context·도구·validation을 추가한 open configuration은 6개 session 평균 41.9%로 올라 2.5배 개선됐습니다. 이 수치는 개별 모델만의 ablation이 아니라 harness와 model stack 전체를 바꾼 pipeline의 결과입니다. 이후 미공개 공격 8개에 backtest 통과 탐지 11개를 배포했을 때 5개인 45%가 최소 한 공격을 찾았고, frontier system은 35개 중 10개인 29%가 작동했으며 탐지당 평균 포괄 공격 수는 각각 2.6개와 1.1개였습니다. 정상 test traffic에서 조용하고 독립 review를 통과해야 gold로 인정하는 추가 관문을 적용한 결과 open pipeline은 gold 탐지 3개를 만들었고 frontier system은 0개였으며, open gold 탐지 3개가 공격 8개 전체를 포괄했습니다.
06

시스템 수준 사례의 범위

frontier system은 backtest 통과 탐지 수가 더 많았지만, 최적화된 Nemotron open-model pipeline은 새 실행으로 일반화한 비율과 탐지당 평균 포괄 범위가 높았고 gold 판정을 받은 유일한 configuration이었습니다. 다만 평가는 하나의 scenario family와 작은 detection set에 한정돼 scenario 간 일반화 여부를 확인하지 못했고, 제한된 benign traffic 때문에 운영 false-positive 성능도 측정하지 못했습니다. Live-fire 8회 중 3회는 harness failure가 발생했지만 complete telemetry가 남아 평가에 포함됐습니다. 따라서 이 결과는 Nemotron, 특화 모델, harness, 결정적 validation을 결합하는 설계 방향을 보여주는 directional system-level case study이며 일반 benchmark 결과는 아닙니다.

용어 해설

Agentic Cybersecurity System
공격과 방어 작업을 여러 AI 에이전트가 장기간 조율하는 보안 시스템입니다. 공격 에이전트가 경로를 실행하고 Falcon 센서가 텔레메트리를 수집하면, 방어 에이전트가 탐지를 만들고 재실행으로 확인한 뒤 다시 공격 경로를 조정합니다. 수동 인계 대신 폐쇄 루프를 구성하는 점이 핵심입니다.
텔레메트리 그라운딩(Telemetry Grounding)
에이전트의 탐지 생성 결과를 실제 센서 이벤트와 공격 실행 기록에 연결하는 방식입니다. CrowdStrike Falcon 텔레메트리와 공격 trace를 근거로 사용해 관측되지 않은 관계나 존재하지 않는 필드의 생성을 줄이고, 관찰된 행동에 맞는 탐지를 만들도록 합니다.
탐지 재실행(Detection Replay)
후보 탐지 규칙을 공격 당시 수집한 텔레메트리에 다시 적용해 실제 이벤트를 찾는지 확인하는 절차입니다. 문법상 유효하지만 기록된 공격과 일치하지 않는 규칙을 탈락시키고, 실패 결과를 방어 에이전트에 돌려보내 수정 과정을 반복하게 합니다.
검증 가능한 보상 기반 강화학습(RLVR)
생성된 쿼리의 문법만 확인하지 않고 실제 실행 결과의 일치도를 보상으로 사용하는 강화학습 방식입니다. Falcon LogScale에서 생성 쿼리와 기준 쿼리를 실행한 뒤 반환 이벤트의 F1 overlap을 계산하고, 유효한 결과에는 보상을 주며 해결되지 않은 쿼리에는 0 보상을 줍니다.
그룹 상대 정책 최적화(Group Relative Policy Optimization)
여러 생성 결과의 상대적 보상을 비교해 모델 정책을 갱신하는 강화학습 최적화 방식입니다. 이 평가에서는 NeMo Gym이 쿼리를 실행해 검증 가능한 결과를 만들고, NeMo RL이 반환 이벤트 일치도에서 얻은 보상을 사용해 Nemotron 3 Super를 업데이트했습니다.

기술

  • NVIDIA Nemotron
  • Nemotron 3 Ultra
  • Nemotron 3 Super
  • CrowdStrike SafeMind
  • CrowdStrike Falcon
  • Falcon LogScale
  • NVIDIA NeMo Gym
  • NVIDIA NeMo RL
  • NeMo Megatron Bridge
  • NL2LogScale
  • reinforcement learning
  • supervised fine-tuning
  • continual pretraining

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 09. 02.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.