TL;DR
작성자는 단일 RTX 3090에서 약 100 pp와 14 t/s를 기록한 Step 3.7 flash가 소형 대화 모델을 대체했다고 평가했지만, 답변이 길어지는 문제 때문에 세계관 구축에는 Qwen3 235b를 더 선호했다. Qwen3 235b는 128GB RAM과 24GB GPU, batch size 1024 환경에서 약 75k pp를 기록했고, 8k context까지 약 7.5 t/s, 10k context에서 약 7 t/s로 측정됐다. gemma4와 일부 다른 모델은 문제나 양자화·지원 여부 때문에 판단을 유보했으며, 더 큰 quant와 캐릭터 설정에 맞는 거부 반응을 추가로 비교할 계획이다.
실용적 조언
- 단일 RTX 3090에서 빠른 대화를 시도하려면 Step 3.7 flash를 textgen이나 SillyTavern에 연결하고 약 100 pp와 14 t/s 수준의 처리량을 기준으로 확인할 수 있다.
- Qwen3 235b를 긴 세계관 문서에 사용할 때는 Q4K_M 양자화, batch size 1024, context 16384, 128GB RAM과 24GB GPU 구성에서 입력 처리량과 문맥 길이에 따른 생성 속도 저하를 함께 측정하는 방식이 유용하다.
- 캐릭터 거부 반응을 평가할 때는 캐릭터가 명확히 거절해야 하는 설정과 극단적인 상황을 각각 입력하고, 모델이 설정을 유지하면서도 불필요하게 거부하거나 캐릭터 밖의 답변을 내놓는지 비교해야 한다.
섹션별 상세
용어 해설
- 프롬프트 처리 속도(Prompt Processing)
- — 모델이 입력 프롬프트를 읽고 처리하는 속도이다. 게시글에서는 pp로 표시하며, 긴 문서나 세계관 노트를 한 번에 넣을 때 입력을 얼마나 빠르게 소화하는지 나타내는 지표로 쓰였다.
- 초당 토큰 생성량(Tokens per Second)
- — 모델이 답변을 생성하는 속도를 초당 출력 토큰 수로 나타낸 값이다. 게시글의 14 t/s와 7.5 t/s는 실제 대화에서 응답이 이어지는 속도를 비교하는 기준으로 사용됐다.
- 양자화(Quantization)
- — 모델 가중치의 수치 표현 정밀도를 낮춰 메모리 사용량을 줄이는 방법이다. 작성자는 Qwen3 235b의 Q4K_M 버전을 사용했고, 더 큰 quant를 적용할지 고민하고 있다고 밝혔다.
- 사후 학습(Post-training)
- — 사전 학습이 끝난 모델에 지시 따르기, 안전 거부, 대화 방식 같은 행동 특성을 추가로 학습시키는 과정이다. 글에서는 post-trained 모델의 거부 반응이 캐릭터 설정과 맞물리는지가 비교 기준으로 등장했다.
언급된 도구
LLM 대화와 notebook 기반 세계관 작업, 레이어 자동 배치 및 추론 속도 측정에 사용됐다.
Step 3.7 flash와 같은 모델을 실제 채팅에 사용하는 인터페이스로 언급됐다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.