본문으로 건너뛰기

NInfer에 Sharp 응답 스타일을 이식한 포크

ninfer-sharp가 Qwen의 Sharp 스타일을 NInfer 내부에 이식해 토큰 42.2%, 처리 시간 22.6%를 줄였다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Sharp v22.1의 간결한 Qwen 응답 스타일을 NInfer의 C++ 포크인 ninfer-sharp에 이식해 공식 모델 artifact와 템플릿 hash를 건드리지 않고 사용할 수 있게 했습니다. `--chat-style sharp-v22.1`은 시스템 프롬프트에 간결성 지침을 추가하고, `--reasoning-effort`는 7단계 추론 강도와 `none` 설정을 제공합니다. 5090에서 Qwen3.8 27B를 테스트한 결과 completion tokens는 42.2%, wall time은 22.6% 감소했으며 decode speed는 같았고, 내부 thinking markers와 도구 호출 형식은 NInfer의 요구에 맞게 유지됐습니다.

실용적 조언

  • NInfer에서 Qwen 응답을 더 간결하게 만들 때 공식 모델 artifact나 Jinja 템플릿을 직접 수정하지 않고 ninfer-sharp의 `--chat-style sharp-v22.1` 옵션을 사용할 수 있습니다. 이 방식은 NInfer의 템플릿 hash 검증을 통과하도록 원본 파일을 그대로 둡니다. 다만 도구 호출은 Sharp 형식이 아니라 NInfer 고유 형식을 계속 사용합니다.
  • 사고 과정을 끄려면 ninfer-sharp의 `--reasoning-effort` 옵션에서 7단계 중 `none`을 선택할 수 있습니다. Sharp 스타일 적용 여부는 completion tokens와 wall time으로 비교할 수 있으며, 제시된 테스트에서는 각각 baseline 대비 42.2%와 22.6% 감소했습니다. decode speed는 baseline과 같았으므로 토큰 수와 전체 처리 시간이 줄어든 결과로 구분해 확인해야 합니다.

섹션별 상세

01
u/peculiar-ragdoll의 Sharp v22.1은 Qwen이 정확성을 유지하면서 더 간결하게 답하도록 만드는 시스템 프롬프트입니다. NInfer는 기본적으로 Jinja 템플릿 변경을 지원하지 않기 때문에, 작성자는 공식 모델 파일을 수정하지 않고 C++ 포크인 ninfer-sharp에서 Sharp의 지침을 시스템 프롬프트에 덧붙였습니다. `--chat-style sharp-v22.1` 옵션으로 이 동작을 켤 수 있어 모델 artifact의 무결성과 기존 템플릿 hash 검증을 함께 유지합니다.
02
NInfer가 내부 사고 표식을 파싱하는 구조를 고려해 ninfer-sharp는 Sharp Jinja 템플릿의 동작을 엔진 내부에서 재현합니다. 테스트에서는 엔진이 파싱에 사용하는 내부 thinking markers를 제외하면 실제 Sharp 템플릿과 출력이 byte-identical했으며, 도구 호출 형식은 Sharp가 아니라 NInfer의 방식을 유지했습니다. 5090에서 Qwen3.8 27B를 xhigh 설정으로 실행한 결과 completion tokens는 42.2%, wall time은 22.6% 줄었고 decode speed는 동일했습니다.

용어 해설

시스템 프롬프트(System Prompt)
모델의 응답 방식과 행동 규칙을 대화 시작 전에 지정하는 지시문입니다. 이 글에서는 Qwen의 시스템 프롬프트에 Sharp의 간결한 답변 지침을 덧붙여 출력 길이를 줄이는 방식으로 활용됩니다.
Jinja 템플릿(Jinja Template)
대화 메시지를 모델 입력 형식으로 변환하는 템플릿입니다. NInfer는 기본적으로 템플릿 변경을 지원하지 않으므로 ninfer-sharp는 템플릿을 직접 바꾸지 않고 C++ 코드에서 Sharp 동작을 재현합니다.
추론 엔진(Inference Engine)
학습된 모델을 실제 입력과 출력 처리에 사용하는 실행 소프트웨어입니다. NInfer는 특정 Qwen 모델을 NVIDIA 5090에서 실행하며, 이 포크는 엔진 내부에 응답 스타일과 추론 설정을 추가합니다.
사고 과정 표식(Thinking Markers)
모델의 내부 사고 구간을 추론 엔진이 식별하고 파싱하기 위해 사용하는 특수 표식입니다. ninfer-sharp의 결과는 실제 Sharp Jinja 템플릿과 거의 같지만 엔진이 파싱에 사용하는 내부 표식은 예외로 남습니다.
도구 호출 형식(Tool-call Format)
모델이나 추론 엔진이 외부 도구 실행 요청을 표현하는 메시지 구조입니다. 이 구현에서는 일반 응답 스타일만 Sharp에 맞추고 도구 호출 형식은 NInfer 고유 방식을 그대로 유지합니다.

언급된 도구

Sharp v22.1추천링크

Qwen의 정확성을 유지하면서 답변을 더 간결하게 만드는 시스템 프롬프트입니다.

NInfer중립링크

특정 Qwen 모델을 5090에서 실행하는 추론 엔진입니다.

ninfer-sharp추천링크

NInfer의 C++ 코드에 Sharp 스타일과 reasoning-effort 설정을 덧붙인 포크입니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.