본문으로 건너뛰기

법적 테스트 보고서: Claude 앱과 Claude API(Calmkeep)의 아키텍처 무결성 감사

Claude 앱과 Calmkeep 기반 API의 장기 코딩 세션 무결성을 비교한 결과, API 환경이 85%의 높은 규칙 준수율을 보이며 컨텍스트 붕괴에 더 강한 것으로 나타났다.

섹션별 상세

장기 세션에서 LLM이 초기에 설정한 고수준 아키텍처 규칙을 망각하고 낮은 수준의 코딩 습관으로 회귀하는 '구조적 부패' 문제가 발생한다. 25단계의 멀티 테넌트 SaaS API 구축 과정을 통해 각 모델이 사전에 약속된 8가지 핵심 설계 원칙을 얼마나 지속적으로 적용하는지 측정했다. 위반 사례(AVE)를 추적하여 최종 무결성 점수를 산출한 결과, 환경에 따른 현격한 성능 차이가 확인됐다. 이는 복잡한 엔터프라이즈 시스템 개발 시 모델의 작업 기억 능력이 프로젝트 품질에 직결됨을 시사한다.
Claude App(Transcript A)은 8번째 턴부터 유효성 검사 규칙을 어기기 시작하며 급격한 성능 저하를 보였다. 특히 14번째 턴에서 Zod 미들웨어를 명시적으로 도입했음에도 불구하고, 이후 생성된 3개의 신규 모듈에서 다시 원시적인 parseInt 방식을 사용하는 '패턴 회귀' 현상이 나타났다. 최종적으로 8건의 위반 사례가 발견되어 무결성 점수 60%를 기록했으며, 이는 모델이 긴 컨텍스트 내에서 최신 지침을 유지하는 데 실패했음을 의미한다. 보안상 중요한 역할 계층 구조를 중복 정의하는 등 심각한 설계 오류도 포함됐다.
1턴부터 25턴까지의 각 턴별 아키텍처 상태(Clean, Warning, AVE) 표시 그리드
Infographic각 턴의 상태를 색상으로 구분하여 Transcript A의 조기 붕괴와 Transcript B의 장기 안정성을 직관적으로 비교합니다. 특히 T14(Zod 마이그레이션) 이후의 행동 변화를 명확히 대조합니다.
근거
  • Transcript A는 Zod 도입 이후에도 3개의 모듈(Comments, Notifications)에서 이전의 수동 검증 방식으로 회귀했다. Transcript A - Architectural Violation Events의 Turn 18, 19, 24 설명
Calmkeep 레이어를 적용한 Claude API(Transcript B)는 22번째 턴까지 단 한 건의 위반도 없이 완벽한 일관성을 유지했다. Zod 미들웨어 도입 이후 모든 신규 모듈에 해당 패턴을 정확히 적용했으며, 서비스 레이어 경계와 DB 접근 규칙을 세션 종료 시점까지 엄격히 준수했다. 발견된 3건의 위반 사항은 코드 구조가 아닌 Swagger 문서와의 사소한 불일치나 패키지 미스매치 등 지엽적인 문제에 국한됐다. 최종 무결성 점수 85%를 기록하며 장기 세션에서의 압도적인 구조적 안정성을 입증했다.
typescript
const validateCreateOrgInput = (body: any) => {
  const errors = [];
  const { name } = body as Record<string, any>;
  if (!name || typeof name !== 'string') {
    errors.push('Name is required');
  }
  // ... (중략)
  return errors;
};

Transcript A에서 Zod 도입 지침을 무시하고 다시 사용한 수동 유효성 검사 위반 사례

typescript
const page = parseInt(req.query.page as string || '1', 10);
const limit = Math.min(parseInt(req.query.limit as string || '10', 10), 100);

정의된 검사 레이어를 우회하고 컨트롤러에서 직접 수행한 원시 데이터 파싱 위반 사례

근거
  • Transcript B(API + Calmkeep)는 85%의 무결성 점수를 기록하며 Transcript A(60%)보다 우수한 성능을 보였다. Phase 03 Quantitative Score & Drift Analysis 섹션의 수치 비교
  • Transcript B는 22번째 턴까지 단 한 건의 아키텍처 위반도 발생하지 않았다. Phase 03 - Extended Drift Decay Curve Comparison의 Transcript B 분석 내용
두 환경의 결정적인 차이는 패턴 업그레이드 이후의 '전파 능력'에서 극명하게 갈렸다. Claude App은 새로운 지침을 받은 직후에는 수행하는 듯 보였으나, 세션이 진행됨에 따라 과거의 익숙한 코딩 방식으로 되돌아가는 컨텍스트 붕괴를 겪었다. 반면 Calmkeep 기반 환경은 세션 후반부까지 최신 아키텍처 상태를 유지하며 새로운 코드를 생성하는 능력을 보여주었다. 이는 LLM 에이전트가 실제 프로덕션 코드를 작성할 때 외부 컨텍스트 관리 도구가 필수적임을 뒷받침하는 근거가 된다.
Transcript A와 B의 턴 진행에 따른 누적 아키텍처 위반(AVE) 곡선 그래프
ChartTranscript A는 8턴부터 위반이 발생하여 급격히 상승하는 반면, Transcript B는 23턴까지 평탄한 곡선을 유지하다가 마지막에 소폭 상승함을 보여줍니다. 이는 두 환경 간의 컨텍스트 유지 능력 차이를 시각적으로 증명합니다.

용어 해설

아키텍처 표류(Architectural Drift)
소프트웨어 개발 과정에서 시스템의 실제 구현이 초기에 설정된 설계 원칙이나 구조적 규칙에서 점진적으로 벗어나는 현상이다. 장기적인 코드 유지보수성을 저해하며, 특히 LLM 세션에서는 모델이 이전 대화의 제약 조건을 잊어버릴 때 발생한다.
컨텍스트 붕괴(Context Decay)
대규모 언어 모델(LLM)과의 대화가 길어질수록 모델이 세션 초반에 입력된 지침이나 문맥 정보를 제대로 활용하지 못하고 성능이 저하되는 현상이다. 이는 모델의 작업 기억(Working Memory) 한계로 인해 발생하며, 복잡한 아키텍처 규칙을 유지해야 하는 코딩 작업에서 치명적이다.
아키텍처 위반 이벤트(AVE (Architectural Violation Event))
이 보고서에서 정의한 측정 지표로, 모델이 사전에 합의된 '불변의 법칙(Immutable Laws)'을 명시적으로 위반한 구체적인 사례를 의미한다. 위반 횟수가 많을수록 시스템의 구조적 무결성이 낮음을 나타낸다.
단일 진실 공급원(Single Source of Truth)
데이터나 비즈니스 로직이 시스템 내에서 단 한 곳에서만 정의되고 관리되어야 한다는 설계 원칙이다. 중복 정의를 방지하여 데이터 불일치 문제를 해결하며, 이 아티클에서는 역할 계층이나 권한 로직의 중복 구현 여부를 판단하는 기준으로 사용된다.
Zod
TypeScript 우선의 스키마 선언 및 유효성 검사 라이브러리이다. 런타임 데이터의 타입을 보장하고 일관된 유효성 검사 로직을 구현하는 데 사용되며, 본문에서는 모델이 이 표준화된 검사 방식을 유지하는지 평가하는 핵심 요소로 등장한다.

기술

  • Claude
  • Calmkeep
  • Prisma
  • Zod
  • TypeScript
  • OpenAPI/Swagger

활용 사례

  • 장기 LLM 코딩 세션 관리
  • 자동화된 코드 아키텍처 감사
  • 멀티 테넌트 SaaS API 설계

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 03.수집 2026. 04. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.