본문으로 건너뛰기

calgacus-mlx: LLM 기반 텍스트 스테가노그래피 구현체

LLM의 다음 토큰 확률 분포를 이용해 비밀 메시지를 평범한 텍스트로 인코딩하고 복구하는 Calgacus 프로토콜의 MLX 구현체입니다.

섹션별 상세

기존의 텍스트 숨기기 방식과 달리 LLM의 확률 분포를 활용해 비밀 메시지의 토큰 순위를 커버 텍스트에 매핑한다. 인코더는 비밀 메시지의 각 토큰이 해당 문맥에서 몇 번째로 높은 확률을 가졌는지 기록하고, 커버 텍스트 생성 시 해당 순위의 토큰을 선택한다. 이 과정을 통해 생성된 텍스트는 겉보기에 일반적인 산문처럼 읽히지만 내부적으로는 손실 없이 비밀 정보를 포함한다. 동일한 모델과 설정값을 가진 수신자만이 이 확률 분포를 재현하여 정보를 추출할 수 있다.
근거
  • Calgacus 프로토콜은 비밀 메시지를 동일한 길이의 그럴듯한 텍스트 안에 숨길 수 있다. README.md의 'LLM Steganography: Hide a meaningful text inside another plausible text of comparable length' 문구
  • 수신자는 동일한 모델과 키를 사용하여 원본 메시지를 바이트 단위로 정확하게 복구한다. README.md의 'The recovered text matches the original byte-for-byte' 문구
스테가노그래피의 품질을 높이기 위해 커버 프롬프트와 비밀 메시지 접두사(secret prefix)를 정교하게 설정하는 것이 중요하다. 커버 프롬프트는 모델에게 지시를 내리는 것이 아니라 자연스럽게 이어질 문장의 시작 부분(incipit) 역할을 수행하여 모델이 특정 장르나 주제를 유지하도록 유도한다. 비밀 메시지에도 적절한 접두사를 붙여 모델이 다음 토큰을 더 잘 예측하게 만들면, 인코딩되는 순위 값이 낮아져 커버 텍스트의 품질이 더욱 자연스러워진다. 모델의 크기가 클수록 확률 분포가 더 날카로워져 결과물의 품질이 향상되는 경향이 있다.
구현체는 Apple Silicon에 최적화된 MLX 프레임워크를 기반으로 하며 Python CLI 도구 형태로 제공된다. 사용자는 uv 패키지 매니저를 통해 간편하게 설치하고 실행할 수 있으며, Llama 3.2 3B 모델 등을 활용해 로컬에서 인코딩과 디코딩을 수행한다. 키파일(TOML)에는 모델 ID, 커버 프롬프트, 비밀 접두사, 트레일러 설정 등이 포함되어 송수신자 간의 공유 비밀키 역할을 한다. 텍스트뿐만 아니라 쉘 명령어와 같은 바이너리 데이터도 텍스트 형태로 변환하여 은밀하게 전달하고 실행할 수 있다.

기술

  • MLX
  • Llama 3.2 3B Instruct
  • Python
  • uv

활용 사례

  • 비밀 메시지 은닉 통신
  • 텍스트 내 쉘 명령어 숨기기 및 실행
  • 검열 우회 통신
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 11.수집 2026. 05. 11.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.