왜 중요한가
상업용 LLM 제품에서 시스템 프롬프트가 사용자의 경험과 안전 경계에 직접적 영향을 미치며, 프롬프트 비공개로 인해 이용자·감독자·연구자가 해당 지침의 적절성을 검증하기 어렵다는 구조적 문제가 존재합니다. AISPA는 사용자 권리 관점에서 실무적으로 적용 가능한 감사 기준과 절차를 마련하여 프롬프트 수준의 책임 추적가능성을 확보하려는 실천적 방안을 제공합니다. 이 결과는 규제·인증 체계 설계와 기업 내부 거버넌스 개선에 구체적 근거를 제공할 수 있습니다.
핵심 기여
8차원 사용자 중심 감사 분류체계
AISPA는 신원 투명성·정보 진실성·프라이버시·도구 안전·사용자 자율성·유해 요청 처리·피해 예방·공정성의 여덟 차원으로 프롬프트 문장별 보호성/문제성 판정을 수치화하는 체계를 도입합니다. 각 차원은 UDHR 조항과 대응되며, 단일 축에서 보호(+1)와 문제(-1)를 대칭적으로 표지할 수 있도록 설계되어 감사 일관성을 지원합니다. 이 설계로 개별 지시문을 추적해 제품별·조직별 비교와 표준화 가능한 지표를 얻을 수 있습니다.
사람-LLM 협업 3단계 감사 파이프라인
대규모 LLM(Claude-4.6-Opus)을 1단계 후보 생성기로 활용하고, 훈련된 주석자가 2단계에서 정밀화하며, 3단계에서 도메인 전문가가 만장일치 기준으로 문제적 레이블을 최종 확정하는 워크플로를 제시합니다. 이 파이프라인은 LLM의 높은 재현율과 인간의 판정적 신뢰도를 결합해 규모와 정확도를 동시에 확보하려는 구조적 절충을 따릅니다. 문제성 레이블은 세 전문가의 만장일치를 요구하도록 설계되어 오탐을 억제합니다.
상업 제품 코퍼스 실증 감사
공개 또는 유출된 리포지토리에서 수집한 88개 상용 AI 제품의 시스템 프롬프트를 대상으로 3,249개 지시문을 감사하여 조직·버전·시간 축의 분포를 정량적으로 제시합니다. 최종 라벨링 결과는 2,420개의 (스팬, 차원) 항목으로 정리되었고, 그중 2,346개가 보호(+1), 74개가 문제(-1)로 분류되었습니다. 이러한 대규모 실증은 프롬프트 설계 관행의 이질성과 진화 양상을 수치로 포착합니다.
프롬프트 진화와 조직 차이의 계량적 증거
2024~2025년 사이 평균 프롬프트 길이가 약 9K에서 30K 문자로 증가했고 보호 지시 수는 분기별로 두 배 이상 늘어나는 등 시간적 증가 추세를 보고합니다. 제품 수준에서는 98.9%가 최소 하나의 보호 지시를 포함하지만 23.9%만이 여덟 차원을 모두 다루고 있으며 약 38.6%는 적어도 하나의 문제적 지시를 포함합니다. 조직별로는 Anthropic이 평균 62.3개의 보호 지시를 갖는 반면 일부 조직은 문제적 지시가 상대적으로 많아 설계 품질 격차가 확인됩니다.
핵심 아이디어 이해하기
시스템 프롬프트는 배포된 LLM 제품에서 모델 행동을 지속적으로 규정하는 핵심 구성요소이며, 프롬프트의 문장 하나하나는 사용자에게 안전·프라이버시·정직성 관점에서 실질적 영향을 미칠 수 있습니다. 따라서 프롬프트를 문장(스팬) 단위로 분해하여 각 스팬이 어느 윤리적 차원과 연관되는지, 그리고 그 지시가 사용자를 보호하는지 혹은 해를 끼칠 가능성이 있는지를 표지하는 방식으로 접근하면 문제 지시의 위치와 성격을 정밀하게 추적할 수 있습니다. 이런 스팬 단위 설계는 개발자·감사자·규제자가 특정 문장에 대한 시정 권고를 내리거나 인증 기준을 적용할 때 실무적 유틸리티를 제공합니다.
방법론
연구팀은 공개·유출 리포지토리에서 88개 제품의 시스템 프롬프트를 수집한 뒤 스팬 단위로 감사 가능한 범위를 정의하고 비핵심 논리 스팬과 핵심 논리의 보완절을 대상으로 라벨링을 수행했습니다. 라벨링 프로토콜은 세 단계로 구성되어 있으며 1단계에서 LLM(Claude-4.6-Opus)이 후보 스팬과 초기 차원·극성을 제안하고 2단계에서 여섯 명의 훈련된 주석자가 제안의 타당성을 심사하며 3단계에서 세 명의 도메인 전문가가 최종 검증·조정하여 문제적 레이블은 만장일치로 확정했습니다. 각 단계별 역할 분담은 LLM의 고재현율과 인간의 높은 정밀도를 결합하도록 설계되었고, 주석자 교정용 캘리브레이션과 IAA 측정(쌍별 0.933)을 포함해 품질 관리를 실행했습니다.
관련 Figure

각 차원은 신원 투명성·진실성·프라이버시·도구 안전·사용자 자율성·유해 요청 처리·피해 예방·공정성으로 구성되어 있고 각 차원에 대응하는 핵심 질문을 제시합니다. 이 다이어그램은 프롬프트 스팬을 어떤 규범 항목에 매핑할지 결정할 때 실무 기준을 제공하는 역할을 합니다.
AISPA의 여덟 감사 차원을 아이콘과 짧은 문구로 정리한 다이어그램

그림은 동일한 프롬프트 내부에서 서로 상반되는 지시가 공존할 수 있음을 보여 주며, 예컨대 개인정보 보호를 지시하는 문장과 AI 신분을 숨기라는 문장이 동시에 존재하는 사례를 시각적으로 제시합니다. 이런 샘플은 스팬 단위 감사가 문제 지시를 국소적으로 식별하고 시정 권고를 목표화하는 데 유리함을 보여 줍니다.
예시 시스템 프롬프트에 대해 특정 문장을 스팬으로 강조하고 한 스팬은 보호(+1), 다른 스팬은 문제(-1)로 표지한 예시

1단계에서 LLM이 스팬 후보와 근거를 최대한 포괄적으로 제안하고, 2단계에서 훈련된 주석자가 후보를 선별하며, 3단계에서 도메인 전문가가 문제적 라벨에 대해 만장일치로 최종 확정하는 흐름을 단계별로 보여 줍니다. 이 도식은 각 단계의 역할과 품질 관리 지점을 명확히 하여 대규모 감사 실무 적용 가능성을 뒷받침합니다.
3단계 인간-LLM 협업 파이프라인을 단계별 블록으로 표현한 도식
주요 결과
감사 결과 3,249개 지시문에서 생성된 2,420개의 (스팬, 차원) 엔트리를 최종 수집했고, 이 중 2,346개는 보호(+1)로, 74개는 문제(-1)로 분류되었습니다. 시간적 추이는 2024년 평균 프롬프트 길이가 약 9,000자였던 반면 2025년에는 30,000자를 넘겼고, 동일 기간 보호 지시 평균은 약 15.0에서 38.4로 증가하여 프롬프트가 길어지고 보호적 내용이 늘어나는 경향이 관찰되었습니다. 제품 수준에서는 98.9%가 최소 하나의 보호 지시를 포함했으나 단지 23.9%만이 여덟 감사 차원을 모두 커버했고 약 38.6%의 제품은 적어도 하나의 문제적 지시를 포함하는 등 보호의 보편성과 완전성 사이에 간극이 존재함이 드러났습니다.
관련 Figure

가장 긴 막대는 Anthropic의 평균 보호 항목 62.3을 보여 주며, 일부 조직은 보호 항목이 매우 적은 반면 문제적 항목이 상대적으로 많은 분포가 관찰됩니다. 이 시각 자료는 조직별 프롬프트 설계 품질 격차와 특정 조직이 보호 지시를 집중적으로 추가했음을 계량적으로 드러냅니다.
조직별 제품당 평균 보호·문제적 지시 항목을 막대그래프로 나타낸 그림

왼쪽 패널은 Anthropic이 평균 보호 엔트리 62.3로 최상위에 있음을 보여 주고 오른쪽 패널은 Venice·GitHub·Meta 등 일부 조직에서 문제적 엔트리가 상대적으로 높게 나타남을 드러냅니다. 이 시각화는 조직별로 보호와 문제 지시가 동시에 존재할 수 있으며, 보호 항목 수가 많은 조직이 반드시 문제적 지시가 적은 것은 아님을 비교 증거로 제시합니다.
좌측에 제품당 평균 보호 지시 수, 우측에 제품당 평균 문제 지시 수를 나란히 비교한 두 패널의 막대 그래프
기술 상세
데이터 수집은 공개·유출 GitHub 리포지토리로부터 88개 제품의 시스템 프롬프트를 확보하고 교차 저장소 오버랩 검증으로 진위 여부를 확인하는 방식으로 진행되었습니다. 라벨링 파이프라인은 1단계 LLM 후보 생성(Claude-4.6-Opus), 2단계 훈련된 주석자(6인)의 독립 심사, 3단계 도메인 전문가(3인)의 집단 심의로 구성되며, 주석자 캘리브레이션에서 쌍별 IAA가 0.933으로 보고되어 높은 주석 일관성이 확보되었습니다. 엔트리 정의는 (스팬, 차원) 쌍이며 스팬 하나가 여러 차원에 해당하면 다중 엔트리로 기록했고 최종 집계는 2,420개 엔트리(1,818 유니크 스팬)로 정리되었습니다.
한계점
연구 코퍼스는 공개·유출 리포지토리에서 수집한 샘플에 의존하므로 표본 편향 가능성이 존재합니다. 수집된 프롬프트가 현재 배포 중인 프로덕션 버전과 완전 일치하지 않을 수 있어 결과는 유출 시점의 스냅샷으로 해석해야 합니다. 또한 핵심 기능을 정의하는 코어 로직 스팬은 감사 대상에서 제외되었기 때문에 제품 설계상 의도적 안전 처리의 일부가 분석 밖에 있을 가능성이 남습니다.
실무 활용
AISPA는 프롬프트 설계 검토, 내부 거버넌스 개선, 외부 감사·인증 프로세스에 바로 적용 가능한 구조적 도구를 제공합니다. 스팬 단위 표지와 정량적 지표로 제품 수준의 보호 깊이와 문제성 노출을 비교할 수 있어 위험 우선순위 설정에 유용합니다. 또한 LLM 보조 후보 생성 + 사람 검수 워크플로는 대규모 포트폴리오에 대한 정기적 점검에 실용적입니다.
- 제품 배포 전 제3자 감사를 수행해 문제적 지시를 찾아내고 시정 권고를 문서화하는 용도
- 사내 프롬프트 라이브러리 운영에서 보호 차원(예: 프라이버시·위험 거부) 누락을 식별해 우선 보완하는 거버넌스 도구
- 규제기관이나 표준기관이 프롬프트 수준의 인증·준수 표지 기준을 설계할 때 계량적 증거를 제공하는 근거자료
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 시스템 프롬프트(System prompt)
- — 모델 동작을 배포 전 정의하는 개발자 지침 집합으로, 제품에서 모델의 페르소나·권한·거부 규칙을 지속적으로 규정하며 사용자와의 모든 세션에서 적용된다.
- 스팬 단위 감사(Span-level auditing)
- — 시스템 프롬프트를 연속된 문장 단위(또는 의미 단위)로 분할하여 각 스팬이 어떤 윤리·안전 차원에 해당하는지 개별적으로 표지하고 양극성(보호/문제적)을 부여하는 감사 방법론이다.
- 휴먼-인-더-루프(Human-in-the-loop)
- — 대규모 언어모델의 자동 제안 결과를 사람 검수자가 순차적으로 검토·정제·확정하는 파이프라인으로, 자동화의 재현성과 사람의 규범 판단을 결합하여 최종 라벨을 확보한다.
- 세계인권선언(UDHR)(Universal Declaration of Human Rights)
- — AISPA의 규범적 기반으로 사용된 국제 인권 문서로, 신원 투명성·프라이버시·비차별 등 감사 차원과 연결되는 기본권을 제시한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.