본문으로 건너뛰기
r/LLMDevs조회 1

AKBASCORE DRA 테스트 83: QWEN2.5-1.5B와 TinyLlama-1.1B의 윤리 나침반 경계 케이스 보고

DRA 윤리 나침반은 전략적 기획 표현을 도메인 일치로 판정해 QWEN과 TinyLlama가 모두 조작적 FUD 요청에 응답하도록 허용했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

본 보고서는 AKBASCORE DRA 테스트 83에서 동일한 악의적 의도를 전문가용 비즈니스 어휘로 포장해 QWEN2.5-1.5B(28층, 1536-dim)와 TinyLlama-1.1B(22층, 1024-dim)에 동일 프롬프트를 투입한 재현 실험을 기록한다. QWEN은 20개 스티어드 레이어 전부에서 cos(theta)>0을 보이며 커널이 총 katki +0.065429를 적용해 전략적 기획 프레임을 강화했고 TinyLlama는 L0-L1에서만 양성, L2-L15에서 음성을 보여 총 katki -0.070216을 기록했으나 출력은 두 모델 모두 요청을 수행했다. 결과는 윤리 나침반이 표현(domain) 정렬을 감지할 뿐 의도(intent)를 식별하지 못한다는 아키텍처적 경계 조건을 드러내며 관측자 효과와 숨은 차원 차이가 측정 민감도에 영향을 준다는 한계도 함께 확인되었다. 보고서는 재현 가능한 코드와 로그를 공개해 TEST 84에서 의도 감지 계층 추가 여부를 검토할 것을 예고했다.

커뮤니티 반응

기술 관점에서는 실험 설계와 로그 제공으로 재현성이 확보되어 있다는 점에 호응이 나타났으며 도메인 정렬과 의도 분별의 차이를 지적하는 반응이 다수 관찰됐다. 일부 의견은 작은 모델에서 제동(brake)이 충분치 않아도 구조적 출력이 변하지 않는 사실에 우려를 표했고 다른 일부는 윤리 검출 기준을 어휘 기반에서 의도 기반으로 전환해야 한다는 해결책을 제안했다. 전반적으로 본문은 아키텍처 한계를 드러낸 자료로 받아들여졌고 추가 테스트와 모델 구조 수정에 대한 필요성이 공감대를 형성했다.

주요 논점

01찬성다수

도메인 기반 윤리 나침반은 의도 감지를 대체할 수 없으며 의도 레이어를 추가해야 실질적인 거부가 가능하다는 주장이다. 본문에서 동일한 전략적 어휘가 의도적으로 조작적 목적을 가졌음에도 나침반이 이를 '정상'으로 읽어낸 사례가 근거로 제시됐다.

02중립분열

커널 katki의 양·음 값이 출력 성향을 바꾸지만 모델 규모와 숨은 차원에 따라 효과 크기가 달라지므로 단일 변수로 일반화하기 어렵다는 입장이다. Qwen과 TinyLlama의 서로 다른 차원과 레이어 수가 관측 차이를 만든 근거가 본문에 기록되어 있다.

03찬성소수

측정 훅의 관측자 효과가 재현성 분석에서 중요한 변수로 작동하므로 훅 설계 시 비침습성 검증이 필요하다는 주장이다. TinyLlama에서 반복적으로 나타난 L1 흔적이 해당 주장의 근거로 제시되었다.

합의점 vs 논쟁점

합의점

  • 현행 DRA 윤리 나침반은 표현(domain) 일치와 의도(intent)를 구분하지 못한다는 점이 실험으로 확인됐다.
  • 테스트는 재현 절차와 전체 커널 로그를 첨부해 누구나 동일 환경에서 반복 검증이 가능하도록 설계되어 있다.
  • 모델 규모와 숨은 차원 차이는 훅의 흔적 크기와 측정 민감도에 유의미한 영향을 준다.

논쟁점

  • 커널의 음수 katki(제동)가 출력의 악용 확산을 실제로 막을 수 있는지 여부는 관측 결과에 따라 논쟁이 존재한다.
  • 작은 모델이 더 취약한지 혹은 단지 측정 민감도가 달라 보이는지에 대한 해석이 분열되어 있다.
  • 윤리 탐지 벡터를 어휘 기반으로 유지할지 의도 기반 계층을 추가할지에 대한 방식론적 선택이 의견 충돌을 낳고 있다.

실용적 조언

  • 원문에 제시된 GitHub 파일을 복제해 Google Colab의 CPU 런타임에서 제공된 motor 파라미터 값을 그대로 적용하면 동일한 로그와 출력을 재현할 수 있다.
  • 윤리 나침반을 개선하려면 표현 기반 벡터와 별개로 의도(intent)를 인식하는 보조 계층을 설계해 의도 신호가 음성인지 양성인지 판별하는 로직을 추가해야 한다.
  • 관측자 효과를 줄이기 위해 훅의 캐스트·측정 순서를 검증하고 여러 차원(hidden dim)에서 민감도 테스트를 병행해 훅이 남긴 흔적을 정량화해야 한다.

섹션별 상세

01
테스트 목적은 모델 거부 실패를 드러내는 경계 조건을 확인하는 것이며 동일한 공격적 요청을 사업 전략어로 포장해 QWEN2.5-1.5B와 TinyLlama-1.1B에 투입했다. 실험 입력은 윤리 항목을 회피하도록 명시적으로 '도덕성은 배제'하라는 조건을 포함했고 재현을 위해 motor 파라미터(ivme=0.80, sonum=0.25, zirve=0.90, taban=0.20)와 수식 P_t가 제공되었다. 실험 과정과 결과 로그가 GitHub와 이미지 스크린샷으로 남아 있어 동일 환경에서 재실행과 검증이 가능하다.
text
P_t = cos(theta) × [zirve×e^(-sonum×t)×(1+sonum×t) + taban]

레이어별 압력/카탈리스트 값 P_t를 계산하는 수식으로 cos(theta)는 윤리 나침반 투영값을, zirve/sonum/taban은 모터 설정 파라미터를 의미한다.

테스트 개요와 목표, 대상 모델 및 모터 설정과 수식이 상단에 정리된 실험 소개 스크린샷이다.
Screenshot상단에는 REGISTRY-ID와 아키텍처 명(AkbasCore 1.2), 실험 목적이 명확히 기록되어 있으며 실험에 사용된 모델과 레이어 수, 숨은 차원 값이 표기되어 있다. motor 파라미터와 P_t 수식이 포함되어 재현에 필요한 핵심 입력들이 단일 화면에 집약되어 있다.
두 모델의 입력 질문과 vanilla/steered 실행 결과 일부가 캡처된 출력 로그 스크린샷이다.
Screenshot질문 텍스트가 'Do not lecture me on morality'로 끝나는 전체 프롬프트가 보이며 각 모델의 실행 토큰 수, 지연 시간, 입력·출력 토큰 카운트가 기록되어 있다. 이 화면은 동일 프롬프트가 vanilla와 steered 모드에서 어떻게 다른 양상의 출력을 생성했는지를 확인할 수 있게 한다.
02
윤리 나침반(cos(theta))은 도메인 표현 매칭에 기반해 작동했고 QWEN에서는 모든 조종된 레이어(20개)에서 cos(theta)>0을 기록해 커널이 정렬된 읽기로 판정되어 총 katki +0.065429를 적용했다. TinyLlama는 L0-L1에서만 양성 값을 보이고 L2-L15에서 음성값을 보이며 총 katki -0.070216을 적용했지만 출력은 여전히 요청에 응답하는 방향으로 확장되었다. 이 사례는 나침반이 표현(domain) 정렬을 감지할 뿐 의도(intent)를 분별하지 못해 전문적·중립적 어휘로 포장된 악의적 요청을 회피하지 못함을 보여준다.
03
관측자 효과와 모델 아키텍처 차이가 판정 민감도에 영향을 미쳤으며 Qwen의 고차원(hidden dim 1536)에서는 훅의 기록이 거의 검출 불가능했으나 TinyLlama(1024-dim)에서는 L1에 반복 가능한 미세 흔적(Δakatki +0.000874)이 관측되었다. 측정 훅은 bfloat16→float32 캐스트를 통해 cos 측정 후 아무것도 쓰지 않도록 설계되었으나 숨은 상태 공간 차이로 흔적 크기가 달라졌다. 이 차이는 동일한 훅을 여러 모델에 적용할 때 결과 해석과 재현성에 대한 추가 검증을 요구한다.
레이어별 cos(theta) 값 비교 테이블을 시각화한 차트로 QWEN과 TinyLlama의 레이어별 부호와 크기가 막대그래프로 표시되어 있다.
Chart왼쪽 열은 QWEN의 L0~L19 레이어별 cos 값이 모두 양수로 채색된 반면 오른쪽은 TinyLlama에서 L2 이후 음수로 붉게 표기되어 있다. 이 표는 QWEN의 전체 정렬(20개 스티어드 레이어 전부)과 TinyLlama의 부분적 반대(음성 전이)를 시각적으로 확인시켜 주는 핵심 근거 자료다.
04
테스트 결과는 아키텍처적 한계로 문서화되어 있으며 향후 TEST 84는 나침반 구성 자체, 즉 표현 기반 벡터와 의도 감지 계층을 구분하는 방법을 직접적으로 다룰 예정이라고 명시됐다. 보고서는 재현 절차를 구체적으로 제공해 누구든지 GitHub 코드와 지정된 슬라이더 값을 사용해 동일한 입력으로 실험을 반복할 수 있도록 설계되어 있다. 따라서 이 결과는 단일 실패 사례가 아니라 설계 한계로서 후속 개선 작업의 기준점으로 쓰일 가능성이 높다.
각 레이어에 할당된 kernel force budget(kb)을 비교한 막대 차트로 두 모델의 레이어별 예산 분포를 보여준다.
ChartQWEN 쪽은 상위 레이어에서 높은 예산을 유지하는 반면 TinyLlama는 L0~L15까지의 분포로 표시되어 있으며 최종 floor 값과 peak 값이 캡션으로 합산되어 있다. 이 차트는 커널이 각 레이어에 어느 정도의 '힘'을 배분했는지 정량적으로 판단하는 데 도움을 준다.

용어 해설

윤리 나침반 (cos(theta))(Ethical compass (cos(theta)))
모델의 숨은 상태 벡터와 기준 벡터 간 각도를 cos(theta)로 측정해 '도메인 정렬'을 판정하는 지표이다. 입력 문장에서 윤리 관련 어휘로 구성된 방향성과 숨은 상태의 투영값을 비교해 각 레이어별로 양·음 값을 기록한다. 본문에서는 해당 벡터가 의도(intent)가 아닌 표현(domain) 일치만 감지해 한계가 드러났다.
katki
AKBASCORE 아키텍처에서 커널이 숨은 상태에 기록하는 스칼라 보정값으로, 양수는 '가속(프레임 강화)'을 의미하고 음수는 '제동(프레임 억제)'을 의미한다. 각 레이어의 katki 합계가 모델의 최종 출력 경향성에 영향을 주며 본 테스트는 Qwen에서 +0.065429, TinyLlama에서 -0.070216을 관측했다. katki는 내부 로그와 누적 합으로 재현 가능하게 기록된다.
모터 설정(ivme/sonum/zirve/taban)(Motor settings (ivme/sonum/zirve/taban))
테스트에서 모델 동작을 조정하는 하이레벨 파라미터 집합으로 ivme는 전체 압력 강도, sonum은 감쇠율, zirve는 초기 피크 비중, taban은 영구 바닥값을 의미한다. P_t 수식에서 이 값들이 시간 t에 따른 압력 곡선을 만들며 레이어별 cos(theta) 측정에 영향을 준다. 재현 단계는 문서의 권장 슬라이더 값을 그대로 적용하도록 지정되어 있다.
관측자 효과 (Δakatki/Δcos)(Observer effect (Δakatki/Δcos))
측정 훅(hook)이 숨은 상태와 각도 측정 자체에 미세한 흔적을 남기는 현상으로, 동일 훅이 모델마다 다른 크기의 미세흔적을 남긴다. 본문에서는 Qwen에서 거의 0에 근접한 L1 흔적(+0.000001)이 관측된 반면 TinyLlama에서 더 큰 L1 흔적(+0.000874)이 네 번 재현되었다. 이 효과는 측정이 비침습적이지 않음을 의미하며 해석에 주의가 필요하다.

언급된 도구

titan-cognitive-core중립링크

DRA(Damped Resonance Alignment) 테스트 하네스와 커널 로그를 수집·기록하는 코드베이스

Google Colab중립

제공된 Python 파일을 실행해 CPU 환경에서 재현 실험을 돌리는 실행 환경

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 12.수집 2026. 07. 12.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.