본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

superwhisper/s1-mini

영어 음성 인식 결과의 텍스트 정규화와 후처리596M total (0.44B non-embedding)약 1,000 tokens 권장 컨텍스트Apache 2.0 + naming clause

영어 ASR 결과에서 군더더기와 오류를 정리해 문체별 완성 문장으로 바꾸는 596M 모델

학습 방식 · Qwen/Qwen3-0.6B를 기반으로 영어 ASR 출력의 text normalization, inverse text normalization, punctuation, truecasing과 자기수정 교정에 맞춘 Fine-tuning을 적용했습니다.

TL;DR

S1-mini는 Qwen/Qwen3-0.6B를 기반으로 Fine-tuning한 596M 파라미터 ASR 후처리 전용 Causal language model입니다. 원시 음성 인식 문장에서 필러와 자기수정을 정리하고, 숫자·날짜·시간·통화·이메일 주소를 표기 형태로 변환하면서 구두점과 대소문자를 맞춥니다. 입력 상단의 Styling·Structure·Context control line이 출력 문체와 목록·이메일 구조를 결정하며, Qwen3의 thinking은 반드시 꺼야 합니다. 영어 7,519개 held-out 사례에서 94.8% token accuracy를 기록했고 Q4_K_M 양자화 빌드는 462 MiB로 노트북 CPU에서도 실행할 수 있습니다.

핵심 포인트

  • S1-mini는 Qwen/Qwen3-0.6B를 음성 인식 후처리 전용으로 Fine-tuning한 596M 파라미터 Causal language model입니다. 일반 대화나 지시 수행이 아니라 정해진 입력 형식에 따라 변환 작업 하나만 처리합니다. 약 1,000토큰 이하의 받아쓰기 결과를 기기 안에서 정리하는 용도에 맞습니다.
  • 원시 ASR 문장에서 필러와 반복을 제거하고 자기수정을 최종 발화로 교정합니다. 구어체 숫자·날짜·시간·통화·이메일 주소를 문자 표기로 바꾸며 구두점과 대소문자도 적용합니다. Styling·Structure·Context 세 축의 control line으로 문체와 출력 구조를 조절합니다.
  • Qwen3의 기본 thinking 동작을 끄고 빈 think block을 포함한 학습 입력 형식을 그대로 보내야 합니다. system prompt나 control line을 생략하거나 enable_thinking=False를 지정하지 않으면 빈 출력이나 깨진 결과가 발생할 수 있습니다. BF16 모델과 Q4_K_M GGUF 빌드 모두 greedy decoding을 전제로 합니다.

제한사항

  • v1은 영어만 처리하도록 학습됐습니다. 다른 언어의 ASR 결과에는 동일한 정규화 품질을 기대하기 어렵습니다. 다국어 입력을 전제로 한 모델이 아니므로 영어 전용 파이프라인에 배치해야 합니다.
  • 입력은 system prompt, control line, 원시 transcript 순서를 정확히 따라야 합니다. Styling은 casual·semi-casual·semi-formal·formal, Structure는 prose·lists, Context는 general·email 중 학습된 값만 사용해야 합니다. 이 형식이나 값이 달라지면 hallucination이나 깨진 출력이 발생할 수 있습니다.
  • Qwen3 템플릿의 thinking 기본값을 끄는 enable_thinking=False 설정이 필수입니다. 이를 생략하면 빈 think block만 출력하고 멈출 수 있습니다. 긴 transcript는 문장 경계에서 나누고 한 번에 약 1,000토큰 이하로 처리해야 합니다.

벤치마크

벤치마크지표비교
Held-out English test settoken accuracy94.8%

148

Likes

348

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.