본문으로 건너뛰기
r/LocalLLaMA조회 2

Step 3.7과 Qwen3 235b의 대화·세계관 구축 비교

Step 3.7 flash는 빠르지만 장황하고, Qwen3 235b는 세계관 구축에서 더 안정적인 선택으로 평가됐다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 단일 RTX 3090에서 약 100 pp와 14 t/s를 기록한 Step 3.7 flash가 소형 대화 모델을 대체했다고 평가했지만, 답변이 길어지는 문제 때문에 세계관 구축에는 Qwen3 235b를 더 선호했다. Qwen3 235b는 128GB RAM과 24GB GPU, batch size 1024 환경에서 약 75k pp를 기록했고, 8k context까지 약 7.5 t/s, 10k context에서 약 7 t/s로 측정됐다. gemma4와 일부 다른 모델은 문제나 양자화·지원 여부 때문에 판단을 유보했으며, 더 큰 quant와 캐릭터 설정에 맞는 거부 반응을 추가로 비교할 계획이다.

실용적 조언

  • 단일 RTX 3090에서 빠른 대화를 시도하려면 Step 3.7 flash를 textgen이나 SillyTavern에 연결하고 약 100 pp와 14 t/s 수준의 처리량을 기준으로 확인할 수 있다.
  • Qwen3 235b를 긴 세계관 문서에 사용할 때는 Q4K_M 양자화, batch size 1024, context 16384, 128GB RAM과 24GB GPU 구성에서 입력 처리량과 문맥 길이에 따른 생성 속도 저하를 함께 측정하는 방식이 유용하다.
  • 캐릭터 거부 반응을 평가할 때는 캐릭터가 명확히 거절해야 하는 설정과 극단적인 상황을 각각 입력하고, 모델이 설정을 유지하면서도 불필요하게 거부하거나 캐릭터 밖의 답변을 내놓는지 비교해야 한다.

섹션별 상세

01
작성자는 Step 3.7 flash가 textgen과 SillyTavern에서 실제 대화에 쓰던 소형 모델을 대체했다고 평가했다. 단일 RTX 3090과 DDR4 메모리 구성에서 약 100 pp와 14 t/s를 기록했으며, Step 3.7의 검열 수준은 Qwen3 235b에 매우 가깝다고 봤다. 다만 Step 3.7은 대부분의 답변에 지나치게 많은 토큰을 사용해 핵심으로 바로 들어가는 Qwen3보다 장황하다는 차이가 있었다.
02
Qwen3 235b는 세계관 구축 작업에서 설정을 먼저 받아들인 뒤 급격한 방향 전환이 없는 한 별도 조정이 거의 필요하지 않은 모델로 평가됐다. 작성자는 Qwen3가 때때로 지나치게 순응하지 않도록 강도를 낮추라고 지시해야 하지만, 캐릭터가 명확히 거절해야 하는 설정이나 극단적인 상황을 넣어도 조정 가능성이 높다고 설명했다. 이 때문에 단순 대화뿐 아니라 textgen의 notebook 기능을 이용한 세계관 아이디어 작업에서도 Qwen3를 우선 선택했다.
03
Qwen3 235b는 128GB RAM과 24GB GPU를 사용하는 환경에서 최신 textgen, batch size 1024, context 16384, autofit layers 설정으로 테스트됐다. 입력 처리량은 약 75k pp였고, 스레드를 전체 48개 중 38개로 늘린 뒤 생성 속도는 약 8k context까지 7.5 t/s, 10k context 부근에서는 약 7 t/s로 떨어졌다. 긴 문맥에서 입력 처리와 생성 속도가 어떻게 변하는지 수치로 기록했다는 점이 모델 선택의 실제 기준이 됐다.
04
gemma4는 작성자의 초기 평가에서 여전히 문제가 있었고, 세계관 아이디어 작업에서는 Qwen3보다 적합하지 않았다. MiniMax-M2.5와 Deepseek flash는 양자화 파일 문제나 textgen 지원 문제를 의심했지만 충분한 문제 해결을 진행하지 않아 판단을 유보했다. 작성자는 Q4K_M보다 큰 quant를 사용할지, 최신 Qwen 계열의 검열 증가를 감수할지, 캐릭터 설정에 맞는 거부 반응을 유지하는 다른 모델을 찾을지를 비교 과제로 남겼다.

용어 해설

프롬프트 처리 속도(Prompt Processing)
모델이 입력 프롬프트를 읽고 처리하는 속도이다. 게시글에서는 pp로 표시하며, 긴 문서나 세계관 노트를 한 번에 넣을 때 입력을 얼마나 빠르게 소화하는지 나타내는 지표로 쓰였다.
초당 토큰 생성량(Tokens per Second)
모델이 답변을 생성하는 속도를 초당 출력 토큰 수로 나타낸 값이다. 게시글의 14 t/s와 7.5 t/s는 실제 대화에서 응답이 이어지는 속도를 비교하는 기준으로 사용됐다.
양자화(Quantization)
모델 가중치의 수치 표현 정밀도를 낮춰 메모리 사용량을 줄이는 방법이다. 작성자는 Qwen3 235b의 Q4K_M 버전을 사용했고, 더 큰 quant를 적용할지 고민하고 있다고 밝혔다.
사후 학습(Post-training)
사전 학습이 끝난 모델에 지시 따르기, 안전 거부, 대화 방식 같은 행동 특성을 추가로 학습시키는 과정이다. 글에서는 post-trained 모델의 거부 반응이 캐릭터 설정과 맞물리는지가 비교 기준으로 등장했다.

언급된 도구

textgen추천

LLM 대화와 notebook 기반 세계관 작업, 레이어 자동 배치 및 추론 속도 측정에 사용됐다.

SillyTavern중립

Step 3.7 flash와 같은 모델을 실제 채팅에 사용하는 인터페이스로 언급됐다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.