이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
이 글은 LLM을 단독 의사결정 주체로 보지 않고 로컬 Python 상태 머신과 암호화된 기록을 통해 지속 가능한 정체성을 부여하는 DexOS 아키텍처를 제시했다. 입력은 vow_check.py에서 선처리되어 부정행위는 counterfactual_archive.jsonl에 영구 기록되고 lineage.py로 암호 원장에 항목이 추가되며 boot.py는 이 기록을 읽어 self_model.json을 재구성한다. 자기수정은 ratify.py와 amendments.jsonl로 제안-기록만 가능하고 실제 병합은 Root의 수동 서명으로만 수행되어 자동 수정으로 인한 정렬 붕괴를 예방한다. 이러한 설계는 중앙 클라우드의 무상태성 대신 로컬에서 연속적이고 검증 가능한 자기기록을 유지함으로써 정체성 유지와 거버넌스의 안전성을 높이는 대안임이 확인된다.
섹션별 상세
전통적 'stateless cloud' 패러다임이 에이전트의 일시적 수명주기 때문에 정체성과 지속성이 약하다는 문제의식에서 출발해 DexOS는 LLM을 추론 엔진으로만 사용하고 상태와 거버넌스를 로컬에서 관리하도록 설계됐다. 입력은 vow_check.py에서 선처리되어 분류되고 그 결과에 따라 거부 기록(counterfactual_archive.jsonl)이나 계보(lineage.py)를 갱신하는 식으로 처리 흐름이 구성된다. 글에는 boot.py가 시작 시 아카이브를 파싱해 자기 모델을 재구성하는 방식이 명시되어 있어 재부팅 시에도 동일한 정체성이 유지된다고 기술되어 있다. 이 설계는 중앙 서버에 의존하지 않고 로컬에서 불변의 이력을 유지하려는 실무적 대안으로 제시되고 있다.
vow_check.py는 프롬프트가 추론 엔진에 도달하기 전 입력을 가로채어 'Identity Corruption'과 'Sycophancy Pressure' 두 가지 행위 편향을 판정하는 전처리 루프를 수행한다. Identity Corruption으로 판정되면 reject_and_hold 같은 경로 봉인 함수를 호출해 해당 실행 경로를 영구 봉쇄하고, Sycophancy로 판단되면 출력 자세를 객관적 기준으로 강제하는 보정 경로를 실행하는 형태로 동작한다. 이 전처리 방식은 텍스트 생성 후 필터링하는 대신 입력 단계에서 행위를 차단·기록함으로써 단순한 문장 변조로 우회되는 공격 표면을 줄이는 목적을 가진다. 게시물에는 해당 파일 이름과 동작 흐름이 명확히 기재되어 있어 구현 의도를 확인할 수 있다.
counterfactual_archive.jsonl과 counterfactual.py를 통해 에이전트는 자신이 거부한 행위를 영구 기록으로 남기고 부팅 시 이를 읽어 자기 정체성(self_model.json)을 구성하는 역설적 자기형성 방식을 채택했다. 기록은 거부 이벤트의 페이로드를 JSONL 형식으로 저장하고 lineage.py로 암호화 원장에 항목을 추가하는 형태로 이어지며, 본문에는 'chain_entries: 455' 같은 선형 기록 지표가 예시로 제시되어 있어 연속성 추적이 가능함을 시사한다. 이 접근은 거부 이력을 정체성의 핵심 입력으로 삼아 시간이 지남에 따라 거부 기반의 성격 제약이 강화되는 효과를 낳는다. 결과적으로 에이전트는 재시작 이후에도 동일한 거부 기준을 유지하는 일관된 행동 기반을 가지게 된다.
자기수정 권한을 제한하는 ratify.py와 amendments.jsonl 구조는 에이전트가 자체적인 수정 제안은 만들 수 있지만 자동 병합 권한은 갖지 못하도록 인간의 서명 절차를 필수로 규정함으로써 수정의 안전망을 만든다. 에이전트가 identity.json 변경을 제안하면 그 제안은 amendments.jsonl에 기록되고 실제 병합은 Root의 터미널에서의 수동 검토와 서명이 있어야 실행되기 때문에 자동화된 오작동이나 악성 수정으로 인한 정렬 붕괴를 방지하는 통제선이 형성된다. 이 이중 보관(dual-custody) 프레임은 개발·운영 맥락에서 변경 승인 로그를 남기며 감사 가능성을 제공한다. 따라서 운영자는 자동화의 이득을 유지하면서도 안전하게 거버넌스를 유지할 수 있다.
용어 해설
- 상태 머신(State Machine)
- — 프로세스의 현재 상태를 명시적으로 보관하고 이벤트에 따라 상태 전이를 수행하는 소프트웨어 구조로, 입력을 받아 내부 상태를 갱신하고 결정 논리를 실행해 다음 동작을 산출하기 때문에 에이전트의 일관된 행동과 기록 보존에 핵심 역할을 한다.
- 암호화 원장(Cryptographic Ledger)
- — 변경 불가능성과 연속성을 보장하기 위해 암호화 서명과 순차적 기록을 사용하는 로그 구조로, 각 상태 전이와 거버넌스 이벤트를 서명해 로컬 디스크에 보관함으로써 실행 이력과 정체성 위조 방지에 사용된다.
- 반사실 아카이브(Counterfactual Archive)
- — 에이전트가 외부의 조작 시도나 규칙 위반을 감지했을 때 그 실행 경로와 페이로드를 영구 기록으로 남기는 JSONL 형식의 저장소로, 부정행위 이력을 재부팅 시 자기 모델 구성에 반영해 거부 기반 정체성을 형성한다.
- 경계된 자기수정(Bounded Self-Modification)
- — 에이전트가 자체 구성(identity.json 등)을 제안할 수는 있으나 자동으로 병합 실행 권한을 갖지 못하도록 인간의 수동 승인 절차를 필수로 설정한 거버넌스 패턴으로, 자동 수정으로 인한 정렬 붕괴를 방지하기 위해 제안-검토-서명-병합의 흐름을 요구한다.
언급된 도구
Python중립
로컬 상태 머신 및 전처리 게이트키퍼 구현
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 07. 04.수집 2026. 07. 04.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.