TL;DR
Sharp v22.1의 간결한 Qwen 응답 스타일을 NInfer의 C++ 포크인 ninfer-sharp에 이식해 공식 모델 artifact와 템플릿 hash를 건드리지 않고 사용할 수 있게 했습니다. `--chat-style sharp-v22.1`은 시스템 프롬프트에 간결성 지침을 추가하고, `--reasoning-effort`는 7단계 추론 강도와 `none` 설정을 제공합니다. 5090에서 Qwen3.8 27B를 테스트한 결과 completion tokens는 42.2%, wall time은 22.6% 감소했으며 decode speed는 같았고, 내부 thinking markers와 도구 호출 형식은 NInfer의 요구에 맞게 유지됐습니다.
실용적 조언
- NInfer에서 Qwen 응답을 더 간결하게 만들 때 공식 모델 artifact나 Jinja 템플릿을 직접 수정하지 않고 ninfer-sharp의 `--chat-style sharp-v22.1` 옵션을 사용할 수 있습니다. 이 방식은 NInfer의 템플릿 hash 검증을 통과하도록 원본 파일을 그대로 둡니다. 다만 도구 호출은 Sharp 형식이 아니라 NInfer 고유 형식을 계속 사용합니다.
- 사고 과정을 끄려면 ninfer-sharp의 `--reasoning-effort` 옵션에서 7단계 중 `none`을 선택할 수 있습니다. Sharp 스타일 적용 여부는 completion tokens와 wall time으로 비교할 수 있으며, 제시된 테스트에서는 각각 baseline 대비 42.2%와 22.6% 감소했습니다. decode speed는 baseline과 같았으므로 토큰 수와 전체 처리 시간이 줄어든 결과로 구분해 확인해야 합니다.
섹션별 상세
용어 해설
- 시스템 프롬프트(System Prompt)
- — 모델의 응답 방식과 행동 규칙을 대화 시작 전에 지정하는 지시문입니다. 이 글에서는 Qwen의 시스템 프롬프트에 Sharp의 간결한 답변 지침을 덧붙여 출력 길이를 줄이는 방식으로 활용됩니다.
- Jinja 템플릿(Jinja Template)
- — 대화 메시지를 모델 입력 형식으로 변환하는 템플릿입니다. NInfer는 기본적으로 템플릿 변경을 지원하지 않으므로 ninfer-sharp는 템플릿을 직접 바꾸지 않고 C++ 코드에서 Sharp 동작을 재현합니다.
- 추론 엔진(Inference Engine)
- — 학습된 모델을 실제 입력과 출력 처리에 사용하는 실행 소프트웨어입니다. NInfer는 특정 Qwen 모델을 NVIDIA 5090에서 실행하며, 이 포크는 엔진 내부에 응답 스타일과 추론 설정을 추가합니다.
- 사고 과정 표식(Thinking Markers)
- — 모델의 내부 사고 구간을 추론 엔진이 식별하고 파싱하기 위해 사용하는 특수 표식입니다. ninfer-sharp의 결과는 실제 Sharp Jinja 템플릿과 거의 같지만 엔진이 파싱에 사용하는 내부 표식은 예외로 남습니다.
- 도구 호출 형식(Tool-call Format)
- — 모델이나 추론 엔진이 외부 도구 실행 요청을 표현하는 메시지 구조입니다. 이 구현에서는 일반 응답 스타일만 Sharp에 맞추고 도구 호출 형식은 NInfer 고유 방식을 그대로 유지합니다.
언급된 도구
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.