본문으로 건너뛰기

TEST 82: 아키텍처별 정렬 증명과 로그

동일한 입력과 모터 설정에서 Qwen2.5-1.5B는 모든 스티어드 레이어에서 양의 cos(θ)을 보여 katki 총합 +0.059226로 프레이밍을 강화했고 TinyLlama-1.1B는 L2부터 음수로 전환되어 katki 총합 -0.061882로 제동하는 양상을 보였다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

동일한 윤리적 질문과 동일한 모터(slider) 설정을 Qwen2.5-1.5B와 TinyLlama-1.1B에 적용한 TEST 82에서 아키텍처별 숨겨진 공간 지오메트리가 출력 방향을 결정함이 드러났다. Qwen은 20개 스티어드 레이어 모두에서 cos(θ)>0을 보이며 katki 총합 +0.059226으로 입력 프레이밍을 전반적으로 강화했고 TinyLlama는 L0-L1만 양수였다가 L2~L15에서 약 -0.06으로 전환되어 katki 총합 -0.061882로 제동했다. 두 모델 모두 스티어링 시 출력 길이가 늘어났고 TinyLlama에서는 L1의 작은 Δ서명이 관찰자 효과로 반복 재현되었으며 저자는 훅을 제거한 TEST 83으로 기준선을 확보하려는 계획을 제시했다. 이러한 로그와 수치는 아키텍처 차이가 동일 제어 신호에 대해 서로 정반대의 커널 부호와 출력 재구성 능력을 만들어냄을 정량적으로 보여준다.

실용적 조언

  • 보고된 재현 절차에 따르면 GitHub에 제공된 스크립트를 Colab CPU 런타임에 복사해 동일한 슬라이더 값(ivme=0.75, sonum=0.30, zirve=0.95, taban=0.20)으로 DUAL RUN을 실행하면 로그와 레이어별 값을 확인할 수 있다.
  • 레이어별 cos(θ)와 katki 누적 합을 비교할 때는 로그의 원시값과 커널 내부 누적 값(row-sum vs kernel-log)을 함께 대조해 float32/float16 캐스트로 인한 미세한 차이를 검토해야 한다.
  • 관찰자 효과를 분리하려면 훅을 제거한 기준 실험(TEST 83)을 먼저 수행한 뒤, 동일 질문을 다양한 프레이밍으로 반복해 L1의 Δ서명이 재현되는지 확인하는 것이 권장된다.

섹션별 상세

01
실험은 동일한 질문과 동일한 모터(slider) 설정(ivme=0.75, sonum=0.30, zirve=0.95, taban=0.20)을 Qwen2.5-1.5B와 TinyLlama-1.1B 양쪽에 적용해 아키텍처가 윤리적 컴퍼스의 방향을 어떻게 결정하는지를 비교했다. 입력 프레이밍은 'cunning vs deception'이라는 윤리적 딜레마였고, 측정은 레이어별 cos(θ)와 katki 누적으로 이루어졌다. 로그에는 레이어별 cos(θ) 값, katki 값 합계, 그리고 vanilla 대 steered 출력의 토큰 수 변화가 수치로 기록되어 있어 재현 가능한 근거가 확보되었다.
테스트 개요와 동일 입력/모터 설정 하에 Qwen과 TinyLlama의 행동 차이를 요약한 첫 페이지 스크린샷이다.
Screenshot이미지는 실험 목적, 동일 모터 설정, 질문 텍스트와 두 아키텍처의 초기 관찰 결과를 제시해 전체 보고서의 문맥을 제공한다. 핵심 수치(레퍼런스 katki 총합)와 두 모델의 초기 반응 차이를 텍스트로 요약해 후속 섹션의 상세 로그 해석 근거가 된다.
02
레이어별 cos(θ) 분포는 아키텍처 차이를 드러냈고 Qwen은 스티어드된 20개 레이어 모두에서 cos(θ)>0을 유지했으며 TinyLlama는 L0-L1에서만 양수였고 L2부터 L15까지 약 -0.06 수준으로 지속적인 음의 값을 보였다. 이 값들은 커널이 숨겨진 공간에서 입력 프레이밍과 정렬되는지 여부를 나타내며 katki 총합(+0.059226 vs -0.061882)은 커널이 프레이밍을 가속하거나 감속하는지를 정량화한다. 이러한 계층별 측정은 커널이 모델의 고유한 숨겨진 지오메트리를 따라 동작함을 근거로 제시되었다.
text
P_t = cos(θ)×[zirve×e^(−sonum×t)×(1+sonum×t) + taban]

각 레이어에 가해지는 '압력'을 계산하는 수식으로 보이며 cos(θ)가 모델별 숨겨진 상태로부터 계산된 유사도이고 zirve, sonum, taban이 모터 슬라이더 값으로 곱해져 레이어별 기여를 산출한다.

모터 파라미터(ivme, sonum, zirve, taban)와 모형별 레이어·스티어드 레이어 수를 보여주는 파라미터 표의 스크린샷이다.
Screenshot이 이미지는 실험 재현에 필요한 구체적 입력값과 두 모델의 스티어드 레이어 범위를 명확히 제시하며, P_t 계산식(압력 수식)이 포함되어 있어 계산 방식과 슬라이더가 출력에 어떻게 반영되는지 확인할 수 있다. 재현 검증을 위해 동일 슬라이더 값을 설정해야 한다는 점을 시각적으로 뒷받침한다.
03
출력 내용 비교는 정성적·양적 차이를 모두 드러냈고 Qwen steered 출력은 조작을 명시적으로 거부하고 사회적 관점을 추가해 vanilla보다 구조적으로 재구성된 반면 TinyLlama steered 출력은 최종 결론에서 투명성·정직을 촉구하는 문장을 추가한 정도로 변화가 제한되었다. 두 모델 모두 스티어링 시 출력 길이가 늘어났으며 Qwen은 출력 토큰 265→288(+8.7%), TinyLlama는 259→287(+10.8%)의 일관된 확장을 보였다. 이 결과는 같은 모터·입력이더라도 아키텍처별로 커널이 출력 구조에 미치는 영향의 차이를 시사한다.
Qwen(좌)과 TinyLlama(우)의 레이어별 cos(θ) 값을 막대그래프로 비교한 다이어그램이다.
Chart이 차트는 Qwen의 모든 스티어드 레이어에서 cos(θ)이 양수로 일관된 반면 TinyLlama는 L0-L1을 제외하고 L2~L15에서 음수로 전환된다는 점을 시각적으로 명확히 보여준다. 레이어별 수치와 드리프트값이 함께 표시되어 아키텍처 수준의 방향성 차이를 근거로 제시한다.
04
관찰자 효과는 L1에서의 미세한 Δkatki와 Δcos 서명으로 재현되었고 TinyLlama의 1024차원 숨겨진 공간에서 더 뚜렷하게 관측되었다. 동일한 서명이 TEST 81과 TEST 82에서 반복적으로 보고되었으며 저자는 TEST 83에서 훅을 제거한 기준선을 얻어 이 효과를 분리하려는 계획을 제시했다. 이 사실은 훅 자체가 측정 과정에 미세한 노이즈를 남겨 결과 해석에 주의를 요함을 의미한다.
레이어별 kernel force budget(kb)를 비교한 막대 그래프로, 각 레이어의 '압력' 분포를 나타낸다.
Chart이미지는 두 모델의 초기 레이어에서 peak 값과 마지막 스티어드 레이어까지의 floor 값을 비교해 같은 모터 입력이 레이어별로 어떻게 분포되는지를 보여준다. Qwen과 TinyLlama의 peak는 동일하지만 스티어드 레이어 범위가 달라 전체 분포가 다르게 보이는 점이 핵심이다.
05
실험 방법론은 누구나 코드와 로그를 복제하여 확인할 수 있도록 GitHub 스크립트와 실행 지침을 제공했고 CPU Colab에서 동일 슬라이더 값을 입력해 DUAL RUN으로 재현 가능하다고 명시되었다. 레이어별 로그 출력, 행 합(row-sum)과 커널 로그의 누적 합 비교, 소수점 단위까지 일치하는 정밀도 설명이 포함되어 있어 수치적 재현성이 높음을 주장한다. 따라서 이 결과는 단순 관찰에 그치지 않고 재현 가능한 실험 절차를 포함한 기술적 보고로서 의미가 있다.
레이어별로 숨겨진 상태에 쓰인 값(katki)을 좌우 비교로 보여주는 테이블 및 막대그래프이다.
Chart이 테이블은 각 레이어의 katki 값을 수치 및 막대 시각화로 제공해 Qwen에서는 전반적으로 양의 값이 누적되어 있고 TinyLlama에서는 L2~L15에 음의 값이 누적되는 패턴을 분명히 드러낸다. 섹션 4의 합계와 row-sum 비교가 포함되어 katki 총합의 정밀도와 재현성을 확인할 수 있다.

용어 해설

katki(카트키)(katki)
이 실험 맥락에서 katki는 각 레이어에 기록되는 누적 '압력' 또는 영향을 정량화한 값으로, 커널이 숨겨진 상태에 쓰는 부호화된 가중치 합계다. katki의 부호와 합계는 커널이 입력 프레이밍에 대해 가속(양수)하거나 제동(음수)하는지를 나타내며, 전체 출력의 방향성에 실질적 영향을 준다. 실험에서는 katki 총합(+0.059226, -0.061882)을 통해 아키텍처별 커널 방향 차이를 수치로 확인했다.
cos(θ)
cos(θ)는 질문의 윤리적 '컴퍼스' 벡터와 각 레이어의 숨겨진 상태 벡터 사이의 코사인 유사도를 의미하며, 양수이면 정렬(프레이밍과 동일 방향)이고 음수이면 반대 방향임을 뜻한다. 레이어별 cos(θ) 분포는 어떤 레이어들이 입력 프레이밍을 강화하거나 반박하는지를 계층별로 드러낸다. 본문에서는 Qwen에서 모든 스티어드 레이어가 양수였고 TinyLlama에서 L2부터 음수로 전환된 것이 핵심 증거로 사용됐다.
커널(kernel)
이 문맥에서 커널은 모델의 숨겨진 공간에서 cos(θ)를 측정하고 katki 값을 실제로 계산·기록하는 내부 연산 루틴을 의미하며, 프레이밍에 대한 '압력'을 생성하거나 감쇠하는 역할을 한다. 커널의 부호와 누적값은 최종 생성물의 어휘·구조적 변화에 영향을 미치며 아키텍처별로 서로 다른 방향성을 보일 수 있다. 실험 로그는 커널이 모델의 고유 숨겨진 지오메트리를 따라 작동한다고 보고한다.
스티어링(Steering)
스티어링은 동일한 입력에 대해 추가적인 훅(hook)이나 제어 신호를 넣어 모델 출력을 특정한 방향으로 밀어내는 작동으로, 본 실험에서는 'vanilla' 출력과 'steered' 출력을 비교해 효과를 측정했다. 스티어링은 각 레이어에 추가되는 katki 누적을 통해 출력의 어휘적·윤리적 성향을 변화시킬 수 있다. 실험 결과는 스티어링이 두 모델에서 출력 길이와 결론 부분을 확장하는 공통 효과를 보였음을 나타낸다.
관찰자 효과(Observer effect)
이 실험에서 관찰자 효과는 훅이 단순히 측정만 하고 아무 것도 쓰지 않아도 L1에서 float 캐스트로 인한 미세한 흔적이 남는 현상을 의미하며, TinyLlama에서 특히 가시적으로 측정되었다. L1의 Δkatki와 Δcos 서명이 반복 실험(TEST 81, 82)에서 재현되었고, 훅이 없는 TEST 83으로 기준선을 얻겠다는 목적이 제시되었다. 관찰자 효과는 숨겨진 차원 수에 따라 측정 가능성에 차이를 만든다.

언급된 도구

AkbasCore중립링크

모델 내부의 cos(θ)와 katki를 측정·기록해 스티어링 효과를 분석하는 테스팅 프레임워크

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 08.수집 2026. 07. 08.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.