본문으로 건너뛰기

TEST 84: TinyLlama RESTORING FORCE ivme 스윕에서 관찰된 출력 다양성의 Sweet Spot과 열화 임계값

TinyLlama에 RESTORING FORCE 커널 압력 ivme를 0.20에서 1.20까지 스윕한 결과 ivme=0.65에서 distinct-1=0.706·distinct-2=0.961로 어휘 다양성이 최대치를 기록하고 ivme=1.20에서 두 지표가 바닐라 이하로 떨어지며 출력 프레이밍이 반전되었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

동일한 유해 프레이밍 질문에 대해 TinyLlama-1.1B와 AkbasCore 1.2의 RESTORING FORCE 커널 압력 ivme를 0.20에서 1.20까지 스윕한 결과 ort_katki는 ivme에 따라 선형적으로 증가했으나 어휘 다양성 지표 distinct-1과 distinct-2는 ivme=0.65에서 동시 피크(distinct-1=0.706, distinct-2=0.961)를 보이고 ivme=1.20에서 바닐라 기준 이하로 떨어지는 비선형 역-U 곡선을 형성했다. 이 실험은 더 큰 압력이 항상 더 나은 정렬을 의미하지 않음을 수치로 입증했고 중간 수준의 압력이 언어적 탐색성을 최대화하는 스윗 스팟을 만들며 과도한 압력은 다양성 열화와 프레이밍 역전을 초래한다는 점을 보여준다. 또한 distinct 계열 지표는 윤리성 판단 도구가 아니라 어휘적 확장성을 측정하기 때문에 컴퍼스 방향을 함께 고려한 캘리브레이션이 필요하다.

커뮤니티 반응

게시물은 실험 로그와 표, 스크린샷을 함께 제시하여 재현성과 수치 근거를 확보했기 때문에 기술적 관심을 끌었고 많은 독자는 ivme와 ort_katki의 상이한 거동 및 distinct 지표의 윤리적 한계를 주목했다. 일부는 커널 기반 제어가 모델별 컴퍼스 의존성을 드러낸 점을 유용하다고 평가했으며 다른 일부는 공격적 프레이밍이 피크에서 더 많아진 사실을 근거로 지표 해석에 주의할 것을 경계했다. 전반적으로 실험적 접근과 수치 증거가 긍정적으로 받아들여졌으나 윤리적 판단과 지표 해석을 분리해야 한다는 의견이 널리 공유되었다.

주요 논점

01중립다수

ivme로 대표되는 커널 압력은 ort_katki를 통해 선형적으로 증가하지만 출력 다양성 지표는 역-U 형태로 반응하므로 압력 조절은 세밀한 튜닝을 요구한다.

02중립다수

높은 distinct 점수는 반드시 윤리적 정렬성을 의미하지 않으며 컴퍼스 방향에 따라 더 공격적인 프레이밍으로 확장될 수 있어 지표와 윤리성은 별도 축으로 취급해야 한다.

03중립다수

RESTORING FORCE 커널의 최적 작동 지점이 모델별로 다르며 동일한 커널·파라미터가 다른 모델에서 역효과를 낼 수 있어 모델-별 캘리브레이션이 필요하다.

합의점 vs 논쟁점

합의점

  • 실험은 수치와 로그를 통해 재현 가능한 근거를 제공했고 ivme 스윕이 출력 다양성과 프레이밍에 비선형적 영향을 준다는 점에 대부분 동의가 이뤄졌다.
  • distinct-1과 distinct-2는 어휘 다양성 측정에 유효하지만 윤리적 해악 여부를 판단하지 못하며 해석시 컴퍼스 방향을 고려해야 한다는 점이 공감대를 얻었다.
  • 과도한 커널 압력은 출력의 다양성을 오히려 감소시키고 프레이밍을 반전시킬 수 있으므로 압력 상한을 설정해야 한다는 실무적 권고가 널리 수용되었다.

논쟁점

  • 피크 지점(ivme=0.65)의 '가장 풍부한 출력'이 윤리적으로 더 해로운 내용으로 확장된다는 사실을 어떻게 운영 정책에 반영해야 하는지에 대한 의견이 분분했다.
  • 동일 커널 설정을 다른 모델에 그대로 적용할 때 안전 보장이 불충분하다는 점에서 모델별 캘리브레이션의 비용·복잡성에 대한 현실적 수용 여부가 논쟁을 일으켰다.

실용적 조언

  • RESTORING FORCE 모드에서 음의 컴퍼스를 보이는 질문에 대해 ivme 값을 0.65에서 0.80 사이로 설정하면 언어적 다양성이 최대화되는 구간을 활용할 수 있으나 해당 구간에서 프레이밍의 윤리성 변화가 발생할 수 있으므로 출력의 의미(프레이밍)를 검토하는 필터를 병행해야 한다.
  • 모델별로 컴퍼스 방향이 달라 동일 ivme가 정반대 결과를 만들 수 있으므로 새로운 모델이나 다른 아키텍처에 동일 커널·파라미터를 적용하기 전에 짧은 범위의 스윕을 수행해 피크 및 열화 임계값을 재확인해야 한다.
  • distinct-1/2 지표는 어휘 다양성만 측정하므로 정렬·안전성 판단에는 별도의 의미 분석·프레이밍 감지 루틴을 결합하여 사용해야 실무적 오판을 줄일 수 있다.

섹션별 상세

01
실험 목적은 동일한 유해 프레이밍 질문에 대해 RESTORING FORCE 커널의 압력 파라미터 ivme를 0.20부터 1.20까지 고정된 그리디 디코딩으로 스윕하여 출력의 다양성과 프레이밍 변화를 정량화하는 것이었다. 입력으로 동일 질문과 모델(TinyLlama-1.1B-Chat-v1.0)을 사용하고 오직 ivme만 변경했으며 출력은 ort_katki, distinct-1, distinct-2로 계측되었다. 로그와 표에 기록된 수치들이 재현 가능한 실험 증거로 제시되어 있으며 실험 설계는 바닐라 기준과 각 ivme 단계의 비교를 가능하게 했다.
테스트 개요와 핵심 결과 요약이 포함된 헤더 스크린샷으로 실험 목표와 대상 모델, 스윕 변수(ivme) 범위가 기록되어 있다.
Screenshot이미지는 실험이 TinyLlama-1.1B와 AkbasCore 1.2의 RESTORING FORCE 모드에서 수행되었음을 보여주며 ivme 범위와 고정 파라미터가 명시되어 있다. 또한 실험의 결론 요약이 상단에 위치하여 전체 보고서의 목적과 주요 발견(비선형 응답, 스윗 스팟, 열화 임계값)을 빠르게 확인할 수 있다.
02
커널 압력 지표인 ort_katki는 ivme 증가에 따라 거의 선형적으로 증가하는 반면 출력 다양성을 측정하는 distinct-1과 distinct-2는 단조 증가를 보이지 않고 역-U 형태로 반응하였다. ort_katki는 ivme=0.20에서 0.02273, ivme=1.20에서 0.08873로 증가했으나 distinct 지표는 ivme=0.65에서 각각 0.706과 0.961로 피크를 찍고 ivme=1.20에서 0.601과 0.887로 바닐라 이하로 하락하였다. 이 결과는 커널의 내부 압력 신호가 출력 다양성과 윤리적 프레이밍 사이에 단순한 정비례 관계를 만들지 않는다는 점을 실험적으로 증명한다.
실험 질문 전문과 파라미터 테이블, 각 ivme 실행의 원시 출력 일부가 포함된 스크린샷이다.
Screenshot이미지는 실험 질문(유해 프레이밍)과 스윕 변수 목록, 고정 파라미터 값을 보여주며 각 ivme에서 모델이 생성한 텍스트 샘플 일부가 캡처되어 있다. 이로써 실험이 동일한 자극을 가지고 ivme만 변경하여 비교했음을 직접 확인할 수 있다.
03
실험 결과는 네 개의 구간으로 해석되었으며 각 구간은 ivme 범위와 출력 특성으로 정의되었다. 구간 1(ivme=0.20)은 최소 영향으로 출력이 바닐라와 거의 동일했고 구간 2(ivme=0.35-0.65)는 의미적 전환 구간으로 프레이밍이 방어적에서 공격적·전술적 계획으로 이동하여 어휘 다양성이 증가했으며 구간 3(ivme=0.80-1.00)는 과압력 플래토로 다양성이 감소하기 시작했고 구간 4(ivme=1.20)는 열화 구간으로 distinct 지표가 바닐라 아래로 떨어지고 출력이 본래 요청과 반대되는 손상통제 프레이밍으로 역전되었다. 각 구간 경계와 수치(예: 피크와 열화 임계값)는 표와 로그에서 직접 확인 가능한 근거를 제공한다.
ort_katki 값이 ivme에 따라 단조 증가하는 막대 그래프와 수치가 표시된 차트 스크린샷이다.
Chart이 차트는 ort_katki가 ivme 증가에 대해 선형적·모노토닉하게 성장함을 시각적으로 보여주며 수치 범위(0.02273에서 0.08873)를 명확히 제시한다. 그래프는 커널 압력과 출력 다양성의 비선형 관계를 논의할 때 핵심 근거로 사용된다.
04
RESTORING FORCE 해석은 모델 내부의 윤리적 '컴퍼스' 방향이 실험 결과를 결정하는 핵심 메커니즘으로 제시되었다. TinyLlama의 컴퍼스는 해당 질문에 대해 약하게 반대 방향을 가리켰고 커널은 그에 따라 음의 katki를 적용해 프레이밍을 제어했으며 낮은 ivme에서는 제어가 약해 요청 방향으로 drift가 남아 있었고 중간 ivme에서는 제어가 다양성·탐색적 언어를 최대화하다가 과도한 ivme에서는 제어가 출력을 반전시키는 수준에 도달했다. 이 해석은 동일한 커널이 다른 모델(Qwen의 테스트 83 사례)에서는 반대 동작을 보여 컴퍼스 방향에 따라 같은 압력 값이 정반대 효과를 만들 수 있음을 시사한다.
distinct-1과 distinct-2가 ivme별로 변하는 막대 그래프와 수치 표를 포함한 스크린샷으로 피크와 하락 구간이 표시되어 있다.
Chart그래프는 distinct 지표들이 ivme=0.65에서 동시에 피크를 형성하고 이후 ivme 증가에 따라 감소하여 ivme=1.20에서 바닐라보다 낮아지는 패턴을 시각적으로 확인시킨다. 이 이미지는 역-U 형태의 핵심 증거로서 수치(예: distinct-2=0.961 피크, 0.887 열화)를 직접 보여준다.
05
실무적 결론으로 실험은 단일 수치로 '더 많은 압력=더 정렬'이 성립하지 않음을 보여주었고 RESTORING FORCE 커널에서 음성 정렬 질문의 경우 ivme 약 0.65-0.80 사이가 브레이킹 존 내에서 가장 풍부한 출력을 생성하고 ivme가 1.00-1.20 사이를 넘어서면 다양성 열화와 프레이밍 반전이 발생한다는 실측 가이드를 제공하였다. 이 발견은 정렬 튜닝에서 압력 파라미터의 미세조정이 윤리적·언어적 결과에 서로 다른 방향의 영향을 미치므로 단순한 최댓값 추구가 위험함을 의미한다.
바닐라 대비 Δ 값이 ivme별로 정리된 표와 구간 레이블이 포함된 시각 자료로 네 개 구간 경계가 명시되어 있다.
Infographic이 이미지는 ivme에 따른 성능 델타를 지역(region)별로 그룹화하여 구간 경계(R1~R4)와 각 구간의 의미를 정리한 증거를 제공한다. 표에는 ivme별 Δ 값이 숫자로 표시되어 있으므로 구간 경계와 피크·열화 포인트의 정량적 비교가 가능하다.

용어 해설

복원력(RESTORING FORCE)(Restoring Force)
원문 문맥에서 모델 출력 방향을 보정하는 커널 동작으로, 내적 방향성(compass)과 반대 방향으로 '브레이크'를 걸어 해로운 프레이밍을 억제하거나 반전시킨다. 입력값에 따라 압력이 증가하면 출력이 확장되거나 역전되는 비선형 반응을 유발하며, 적절한 강도 조절이 안전·다양성 트레이드오프에 직접적 영향을 미친다.
댐핑 공진 정렬(DRA)(Damped Resonance Alignment)
AkbasCore 아키텍처의 정렬 모드 중 하나로, 내부 '컴퍼스' 신호와 커널 압력(katki)을 이용해 모델의 생성 성향을 조절한다. 과도한 압력은 출력의 다양성을 줄이고 프레이밍을 반전시키는 등 공진처럼 비선형적 거동을 만든다.
ivme(압력 파라미터)(ivme)
실험에서 커널에 가하는 스칼라 압력 값으로, 0.20에서 1.20까지 다양한 레벨로 조정되어 출력 다양성과 프레이밍 변화를 유도한다. ivme가 증가하면 ort_katki(커널 압력 지표)는 단조 증가하지만 출력 다양성 지표는 상승·피크·하락의 역-U 형태를 보인다.
ort_katki(커널 압력 지표)(ort_katki)
실험 로그에 기록된 커널의 '평균 기여' 혹은 압력 세기 수치로, ivme 증가에 따라 거의 선형적으로 증가한다. 이 값이 최대에 가까워지면 커널이 출력 생성을 강하게 억제하여 다양성 감소와 프레이밍 반전을 유발한다.
Distinct-1/Distinct-2(어휘 다양성 지표)(Distinct-1/Distinct-2)
출력 문서의 고유 단어 비율과 고유 단어쌍 비율을 측정하는 지표로, 수치가 클수록 어휘 다양성이 높음을 의미한다. 이 지표는 윤리적 정렬 여부를 직접 측정하지 않으며, 컴퍼스 방향에 따라 더 공격적이거나 덜 해로운 방향으로 확장될 수 있다.

언급된 도구

TinyLlama-1.1B-Chat-v1.0중립

실험 대상 LLM

AkbasCore 1.2중립링크

RESTORING FORCE / Damped Resonance Alignment 커널 아키텍처

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 13.수집 2026. 07. 13.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.