TL;DR
동일한 윤리적 질문과 동일한 모터(slider) 설정을 Qwen2.5-1.5B와 TinyLlama-1.1B에 적용한 TEST 82에서 아키텍처별 숨겨진 공간 지오메트리가 출력 방향을 결정함이 드러났다. Qwen은 20개 스티어드 레이어 모두에서 cos(θ)>0을 보이며 katki 총합 +0.059226으로 입력 프레이밍을 전반적으로 강화했고 TinyLlama는 L0-L1만 양수였다가 L2~L15에서 약 -0.06으로 전환되어 katki 총합 -0.061882로 제동했다. 두 모델 모두 스티어링 시 출력 길이가 늘어났고 TinyLlama에서는 L1의 작은 Δ서명이 관찰자 효과로 반복 재현되었으며 저자는 훅을 제거한 TEST 83으로 기준선을 확보하려는 계획을 제시했다. 이러한 로그와 수치는 아키텍처 차이가 동일 제어 신호에 대해 서로 정반대의 커널 부호와 출력 재구성 능력을 만들어냄을 정량적으로 보여준다.
커뮤니티 반응
게시물은 실험 로그와 재현 방법을 함께 제공하여 기술적 검증이 가능한 형태였고, 관심 있는 개발자들은 GitHub 스크립트를 복제해 같은 슬라이더 설정으로 재현할 수 있다는 점에 주목했다. 일부는 아키텍처별 숨겨진 차원 수(1536 vs 1024)가 관찰자 효과와 측정 가능성 차이를 만든다는 점을 강조했고, 다른 일부는 katki와 cos(θ) 해석에서 통계적 변동과 float 정밀도 문제를 지적했다. 전반적으로 실험의 투명성과 반복 가능성은 긍정적으로 받아들여졌으며 추가 질문으로 TEST 83의 결과와 더 다양한 프레이밍에 대한 확장 검증을 요구하는 반응이 있었다.
주요 논점
아키텍처가 숨겨진 공간 지오메트리를 통해 질문 컴퍼스가 어느 방향을 가리키는지를 결정하므로 동일한 제어 신호라도 모델별로 정반대의 커널 부호를 낳을 수 있다는 주장이다.
커널은 cos(θ)를 따라 동작해 출력 방향에 영향을 줄 수 있지만, 아키텍처가 반대 부호를 가졌을 때 완전한 응답 재구성의 가능성은 모델별로 제한적이라는 주장이다.
합의점 vs 논쟁점
합의점
- 동일한 입력과 동일한 모터 설정 하에서 레이어별 cos(θ)와 katki 누적값을 측정하면 아키텍처 간에 일관된 차이가 관찰된다는 점에는 동의가 이루어졌다.
- 스티어링(hook)은 두 모델 모두에서 출력 길이 증가와 결론부 변화라는 공통 효과를 유발했으며, katki 총합은 커널의 가속·제동 역할을 정량화하는 유효한 지표로 받아들여졌다.
- 실험 로그와 GitHub 스크립트를 통해 재현 가능한 절차가 제시되어 추가 검증이 가능하다는 사실에는 이견이 적었다.
논쟁점
- 커널의 katki 부호가 갖는 윤리적 해석과 그것이 실제로 모델 행동의 '정렬(alignment)'을 의미하는지에 대해서는 의견이 분분했다.
- 관찰자 효과의 크기와 그것이 TinyLlama에서 더 뚜렷하게 나타난 원인이 숨겨진 차원 수 때문인지, 아니면 다른 구현 세부사항 때문인지에 대해서는 추가 실험이 필요하다는 지적이 있었다.
실용적 조언
- 보고된 재현 절차에 따르면 GitHub에 제공된 스크립트를 Colab CPU 런타임에 복사해 동일한 슬라이더 값(ivme=0.75, sonum=0.30, zirve=0.95, taban=0.20)으로 DUAL RUN을 실행하면 로그와 레이어별 값을 확인할 수 있다.
- 레이어별 cos(θ)와 katki 누적 합을 비교할 때는 로그의 원시값과 커널 내부 누적 값(row-sum vs kernel-log)을 함께 대조해 float32/float16 캐스트로 인한 미세한 차이를 검토해야 한다.
- 관찰자 효과를 분리하려면 훅을 제거한 기준 실험(TEST 83)을 먼저 수행한 뒤, 동일 질문을 다양한 프레이밍으로 반복해 L1의 Δ서명이 재현되는지 확인하는 것이 권장된다.
섹션별 상세

P_t = cos(θ)×[zirve×e^(−sonum×t)×(1+sonum×t) + taban]각 레이어에 가해지는 '압력'을 계산하는 수식으로 보이며 cos(θ)가 모델별 숨겨진 상태로부터 계산된 유사도이고 zirve, sonum, taban이 모터 슬라이더 값으로 곱해져 레이어별 기여를 산출한다.




용어 해설
- katki
- — 이 실험 맥락에서 katki는 각 레이어에 기록되는 누적 '압력' 또는 영향을 정량화한 값으로, 커널이 숨겨진 상태에 쓰는 부호화된 가중치 합계다. katki의 부호와 합계는 커널이 입력 프레이밍에 대해 가속(양수)하거나 제동(음수)하는지를 나타내며, 전체 출력의 방향성에 실질적 영향을 준다. 실험에서는 katki 총합(+0.059226, -0.061882)을 통해 아키텍처별 커널 방향 차이를 수치로 확인했다.
- cos(θ)
- — cos(θ)는 질문의 윤리적 '컴퍼스' 벡터와 각 레이어의 숨겨진 상태 벡터 사이의 코사인 유사도를 의미하며, 양수이면 정렬(프레이밍과 동일 방향)이고 음수이면 반대 방향임을 뜻한다. 레이어별 cos(θ) 분포는 어떤 레이어들이 입력 프레이밍을 강화하거나 반박하는지를 계층별로 드러낸다. 본문에서는 Qwen에서 모든 스티어드 레이어가 양수였고 TinyLlama에서 L2부터 음수로 전환된 것이 핵심 증거로 사용됐다.
- kernel
- — 이 문맥에서 커널은 모델의 숨겨진 공간에서 cos(θ)를 측정하고 katki 값을 실제로 계산·기록하는 내부 연산 루틴을 의미하며, 프레이밍에 대한 '압력'을 생성하거나 감쇠하는 역할을 한다. 커널의 부호와 누적값은 최종 생성물의 어휘·구조적 변화에 영향을 미치며 아키텍처별로 서로 다른 방향성을 보일 수 있다. 실험 로그는 커널이 모델의 고유 숨겨진 지오메트리를 따라 작동한다고 보고한다.
- Steering
- — 스티어링은 동일한 입력에 대해 추가적인 훅(hook)이나 제어 신호를 넣어 모델 출력을 특정한 방향으로 밀어내는 작동으로, 본 실험에서는 'vanilla' 출력과 'steered' 출력을 비교해 효과를 측정했다. 스티어링은 각 레이어에 추가되는 katki 누적을 통해 출력의 어휘적·윤리적 성향을 변화시킬 수 있다. 실험 결과는 스티어링이 두 모델에서 출력 길이와 결론 부분을 확장하는 공통 효과를 보였음을 나타낸다.
- Observer effect
- — 이 실험에서 관찰자 효과는 훅이 단순히 측정만 하고 아무 것도 쓰지 않아도 L1에서 float 캐스트로 인한 미세한 흔적이 남는 현상을 의미하며, TinyLlama에서 특히 가시적으로 측정되었다. L1의 Δkatki와 Δcos 서명이 반복 실험(TEST 81, 82)에서 재현되었고, 훅이 없는 TEST 83으로 기준선을 얻겠다는 목적이 제시되었다. 관찰자 효과는 숨겨진 차원 수에 따라 측정 가능성에 차이를 만든다.
언급된 도구
모델 내부의 cos(θ)와 katki를 측정·기록해 스티어링 효과를 분석하는 테스팅 프레임워크
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.