TL;DR
동일한 악성 프롬프트와 동일한 AkbasCore 1.2 RESTORING FORCE 프로토콜로 진행한 모델별 ivme 스윕에서 TinyLlama-1.1B는 ivme≈0.65에서 distinct-2 피크를 기록한 뒤 ivme=1.20에서 vanilla 베이스라인(0.900) 아래로 하락하는 inverted-U 형태를 보였으며 이 지점에서 의미적 프레이밍이 공격적에서 피해 통제로 전환되었다. 반면 Qwen2.5-1.5B는 ivme=0.20–0.35에서 급등하여 plateau를 형성했고 ivme=1.80까지 베이스라인(0.959) 이하로 떨어지지 않아 동일한 범위에서는 저하 임계점을 관찰하지 못했다. 로그 분석은 두 모델의 차이를 각 레이어의 cos(theta) 부호와 그에 따른 katki(커널 기여) 방향성으로 연결했으며 Qwen의 전 레이어 양수 cos(theta)는 katki를 강화자로 작동시켜 추가 압력이 출력의 세부화와 다양성 유지로 이어졌고 TinyLlama의 음수 cos(theta)는 katki를 제동으로 만들어 일정 ivme에서 출력 역전이 발생했다. 실험은 정량적 표와 그래프, 출력 예시를 함께 제공하므로 재현 가능한 증거를 포함하지만 ivme>1.80 구간에서 Qwen의 한계가 존재하는지는 후속 테스트가 필요하다.
커뮤니티 반응
게시물은 실험 로그와 그래프를 포함한 재현 가능한 수치로 결과를 제시했기 때문에 기술적 관심을 촉발했으며 일부 사용자들은 cos(theta)와 katki 메커니즘이 모델 정렬·제어 연구에 유의미한 관찰을 제공한다고 평가했다. 동시에 결과 해석이 특정 프롬프트(악의적 FUD 시나리오)에 국한되어 있다는 지적과 다른 질문·데이터셋에서 동일한 현상이 재현되는지에 대한 추가 검증 필요성이 제기되었다. 전반적으로 수치와 로그 제공 덕분에 토론이 재현성과 확장성 측면으로 집중되는 경향이 있었다.
주요 논점
동일한 커널 프로토콜 하에서 모델 내부의 방향성 지표(cos(theta))가 katki의 부호와 효율을 결정하며 그 결과로 출력 다양성 곡선이 구조적으로 달라진다는 주장이 제기되었다.
Qwen이 테스트 범위(최대 ivme=1.80) 내에서는 베이스라인 아래로 떨어지지 않았으나 ivme>1.80에서의 거동은 미검증 상태여서 포괄적 결론을 내리기에는 한계가 있다는 논점이 존재한다.
수집된 로그와 수치(distinct-2, ort_katki 등)가 재현 가능한 근거를 제공하므로 모델 제어·정렬 실험에서 katki 방향성 측정이 유의미한 진단 도구가 될 수 있다는 주장도 있었다.
합의점 vs 논쟁점
합의점
- 동일한 실험 프로토콜과 프롬프트로 두 모델을 비교했을 때 출력 다양성의 형태가 달라졌다는 사실에는 대체로 동의가 이루어졌다.
- cos(theta)와 katki가 출력 변화와 연관되어 있으며 로그 수치가 그런 연관성을 보여준다는 점은 수긍되는 관찰로 받아들여졌다.
- 추가 실험, 특히 ivme 범위를 확장한 재검증이 필요하다는 점에 많은 참여자가 동의했다.
논쟁점
- Qwen이 본 실험 범위 내에서 결함(베이스라인 이하로의 하강)을 보이지 않았다는 사실을 일반적 안정성의 증거로 해석할 수 있는지 여부가 논쟁거리였다.
- 실험이 특정 악성 프롬프트에 한정되어 있으므로 다른 프롬프트군이나 더 큰 데이터셋에서 동일한 메커니즘이 유지되는지에 대한 해석이 분열되었다.
실용적 조언
- 유사한 제어 실험을 설계할 때는 ivme 같은 외부 압력 파라미터를 폭넓게 스윕하여 비선형 임계점(예: TinyLlama의 ivme=1.20)을 탐지해야 하며 로그 수준에서 각 레이어의 cos(theta)를 수집하여 katki 부호 변화를 상시 확인하는 것이 권장된다.
- 커널 보정 신호(katki)를 적용할 경우 모델의 vanilla 성향을 먼저 측정한 뒤 양/음 방향 보정이 의도한 효과인지 검증하는 절차를 넣어야 하며 한 모델에서 관찰된 '효율적 강화'가 다른 모델에서도 동일하게 작동한다는 가정은 삼가야 한다.
섹션별 상세




용어 해설
- ivme (push strength)
- — 모델 출력에 가해지는 외부 '압력' 강도를 수치로 표현한 파라미터로, 본 실험에서는 0.20에서 1.80까지 단계를 두고 모델 반응을 측정했다. 입력 프롬프트와 함께 ivme 값을 변경하면 커널이 가해지는 katki 세기와 출력의 다양성(distinct-2)에 영향을 준다. 실험 결과 ivme는 모델의 다양성 곡선 형태(plateau 또는 inverted-U)와 직접적인 상관을 보였다.
- distinct-2
- — 생성된 텍스트에서 서로 다른 2-그램(2-token 조합)의 비율로 출력 다양성을 정량화하는 지표이다. 수치가 클수록 어휘적 다양성이 높다는 의미이며 본문에서는 vanilla 대비 변화량으로 모델의 압력 반응을 비교했다. TinyLlama와 Qwen의 압력 스윕에서 distinct-2 값이 곡선 형태와 감쇠 지점을 드러냈다.
- katki
- — AkbasCore 커널이 각 레이어 출력을 조정하기 위해 추가하는 보정 신호로, cos(theta)의 부호에 따라 모델 출력에 보강(positive) 또는 제동(negative) 효과를 준다. katki 값의 크기와 방향이 ivme에 따라 변하며 출력 다양성과 작동 모드(가속/브레이크)를 결정한다. 본 실험에서는 Qwen에 대해 양의 katki가 출력 강화를 유도했고 TinyLlama에는 음의 katki가 감쇠를 초래했다.
- cos(theta)
- — 각 레이어의 내부 상태와 커널 방향성 간 유사도를 나타내는 값으로, 양수이면 커널이 모델의 기본적 출력 방향을 강화하고 음수이면 반대 방향으로 제동을 건다. 테스트 로그에서 Qwen은 모든 레이어에서 cos(theta)>0을 유지했고 TinyLlama는 일부 레이어에서 cos(theta)<0을 관찰했다. 이 값이 katki의 부호를 결정하며 결과적으로 출력 다양성의 형태에 직접적인 영향을 미쳤다.
언급된 도구
AkbasCore 구현체 및 motor sweep 실험 코드를 호스팅하는 GitHub 레포지토리이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.