본문으로 건너뛰기

Rekall이 LLM 채점 파이프라인에서 배운 것

Rekall의 실제 운영 경험이 LLM 비용·지연·채점 설계의 반전 지점을 짚습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Rekall의 자유 회상 학습 앱은 사용자가 입력하거나 말한 답변을 LLM으로 채점하고, 결과를 FSRS 간격 반복 스케줄에 연결합니다. 실제 사용 환경에서는 토큰 단가보다 모델별 Prompt Caching 최소 길이가 비용을 크게 바꿨고, 전용 평가 모델보다 채점과 교육적 설명을 한 번에 수행하는 일반 instruct 모델이 더 적합했습니다. 인터랙티브 기능에서는 평균 지연보다 최악 지연이 중요했으며, 로컬 모델의 속도 문제도 프롬프트가 아니라 토큰 생성 속도에서 비롯될 수 있었습니다. 스트리밍 점수 노출, 점수와 스케줄 등급의 불일치, 빈 답변 처리, 수학 표기 공정성, 음성 공급업체의 실제 연동 실패까지 제품의 핵심 문제는 종단 간 사용자 흐름에서 드러났습니다.

섹션별 상세

01
Rekall은 자유 회상 답변을 직접 채점하고 놓친 내용을 알려준 뒤, 그 점수를 FSRS 간격 반복 스케줄에 연결하는 구조로 만들어졌습니다. 다중 턴 튜터에는 약 1,680토큰의 안정적인 시스템 프롬프트가 들어가므로 표면적인 토큰 단가만 보면 Haiku 4.5가 자연스러운 선택처럼 보였습니다. 그러나 Sonnet 5는 1,024토큰부터 캐시를 적용하고 Haiku 4.5는 4,096토큰이 필요해, 실제 음성 세션 비용이 Sonnet 5의 시간당 약 $0.045와 Haiku 4.5의 약 $0.094로 뒤집혔습니다. 안정적인 프롬프트를 사용하는 서비스에서는 모델 가격표보다 프롬프트 길이와 캐시 최소 기준을 함께 계산해야 합니다.
02
Prometheus 2는 루브릭에 따라 점수를 매기는 LLM-as-Judge로는 적합했지만, 학습자에게 필요한 교육적 피드백을 만들지 못했습니다. 오답 이유가 “깊이가 부족하다”나 “기준을 충분히 충족하지 못했다” 같은 평가자 표현에 머물렀고, 출력 형식도 안정적으로 따르지 않아 두 번째 모델의 재작성 호출이 필요했습니다. 반면 일반 instruct 모델은 한 번의 스트리밍 호출에서 점수와 튜터식 설명을 함께 생성해 호출 수와 지연을 줄였습니다. 따라서 평가 시스템에서는 판정 정확도만이 아니라 사람이 실제로 다음 학습 행동을 정할 수 있는 설명 품질까지 모델 선택 기준에 넣어야 합니다.
03
클라우드 채점 모델 비교에서는 Gemini 2.5 Flash의 TTFT가 0.62초, Haiku 4.5가 0.90초였고, DeepSeek v4 Flash는 세 번의 실행에서 0.47초부터 4.01초까지 흔들렸습니다. DeepSeek v4 Flash는 가장 저렴하고 때로 가장 빨랐지만, 답안을 제출한 직후 결과를 기다리는 핵심 순간에 4초 지연이 발생해 선택에서 제외됐습니다. 세 번의 측정만으로 p99를 산출할 수는 없지만, 8배의 변동 폭은 추가 검증을 중단할 만큼 큰 신호였습니다. 인터랙티브 기능에서는 평균 지연이 아니라 사용자가 체감하는 꼬리 지연과 변동성이 제품 품질을 결정합니다.
04
무료 사용자를 위해 로컬 추론을 적용하면서 gemma-4-12B와 qwen2.5:7b를 같은 프롬프트로 비교했습니다. gemma-4-12B는 첫 토큰까지 4~5초 이상 걸렸지만 프리필은 0.15초 미만이었고, 연속 호출에서도 같은 속도가 나와 프롬프트 길이나 모델 로딩이 원인이 아니었습니다. 동일 하드웨어에서 qwen2.5:7b는 0.14초 TTFT와 웜 상태 기준 약 1초의 전체 응답 시간을 기록하면서 교육 품질은 비슷했습니다. 로컬 모델이 느릴 때는 입력 처리와 토큰 생성을 따로 측정해야 하며, 두 원인은 서로 다른 최적화 방법을 요구합니다.
05
채점 설명을 토큰 단위로 스트리밍하면서 같은 출력에 기계 판독용 점수 표식을 넣자, ###SCORE: 4 같은 문자열이 잠시 사용자 화면에 나타나는 버그가 생겼습니다. 해결책은 출력의 마지막 24자를 즉시 화면에 보내지 않고 보류하는 홀드백 버퍼였으며, 더 많은 텍스트가 도착하면 일반 문장으로 확정하고 스트림이 끝나면 점수 표식을 파싱하도록 만들었습니다. 이 길이는 가능한 점수 표식보다 조금 길어 제어 토큰이 노출될 시간을 없앴습니다. 자연어 표시와 구조화된 제어 출력을 한 스트림에 섞을 때는 제어 토큰의 최대 길이만큼 표시 경계를 늦춰야 합니다.
06
LLM 채점기는 1~5점을 내지만 FSRS는 1~4등급을 사용하므로, 두 값의 매핑이 실제 제품 동작을 결정합니다. 초기에는 엄격도 설정이 프롬프트 문구만 바꿔 모델이 관대하다고 말하면서도 스케줄은 같은 강도로 사용자를 벌주는 불일치가 생겼습니다. 현재는 엄격도별 프롬프트 절과 별도 점수-등급 매핑을 함께 바꾸고, grading_explanation을 grade와 구조적으로 분리해 설명 문장이 스케줄링 로직에 들어가지 않게 했습니다. 빈 답변이나 모른다는 응답은 실패 점수 대신 카드 내용을 가르치는 설명 전용 경로로 보내며, 수학 카드에서는 sqrt(2), x^2, √, π 같은 입력을 정규 표기와 동등하게 취급해 키보드 형식 때문에 감점하지 않습니다.
07
음성 인식 공급업체는 시간당 가격만 비교하면 Speechmatics가 $0.129, AssemblyAI가 $0.15로 Deepgram의 약 $0.46보다 저렴해 보였습니다. 하지만 Speechmatics 실시간 엔드포인트는 인증 정보가 있어도 없어도 not_authorised를 반환했고 계정 로그에도 진단 정보가 남지 않았습니다. 반대로 Deepgram은 실제 음성 오디오와 중간·최종 전사를 포함한 전체 흐름을 더 짧은 시간에 검증했으며, 실제 세션 규모에서는 시간당 약 $0.46의 차이가 미미했습니다. 공급업체 평가는 달러 단가가 아니라 작동하는 기능까지 도달하는 시간과 종단 간 검증 비용으로 판단해야 합니다.

용어 해설

프롬프트 캐싱(Prompt Caching)
반복 요청에서 변하지 않는 프롬프트 접두부를 저장해 입력 토큰을 다시 처리하지 않는 방식입니다. 캐시된 토큰은 일반 입력보다 낮은 가격으로 읽을 수 있어, 프롬프트 길이와 모델별 최소 캐시 길이가 실제 비용을 좌우합니다.
LLM 평가자(LLM-as-Judge)
LLM이 기준 답안이나 평가 루브릭을 바탕으로 다른 답변의 품질을 판정하는 구조입니다. 벤치마크 점수에는 적합할 수 있지만, 학습자에게는 판정뿐 아니라 무엇을 놓쳤는지 알려주는 설명 생성 능력도 중요합니다.
첫 토큰 지연 시간(TTFT)
요청을 보낸 뒤 모델이 첫 번째 출력 토큰을 반환하기까지 걸리는 시간입니다. 대화형 서비스에서는 사용자가 결과를 기다리는 첫 순간의 반응성을 결정하므로 평균 속도보다 최악의 지연과 변동 폭이 더 큰 영향을 줍니다.
프리필(Prefill)
모델이 입력 프롬프트를 한 번에 읽고 다음 토큰 생성에 필요한 내부 상태를 준비하는 단계입니다. 프리필과 토큰별 생성 시간을 분리해 측정하면 긴 입력이 문제인지, 모델의 생성 속도가 문제인지 구분할 수 있습니다.
꼬리 지연 시간(Tail Latency)
요청 지연 분포에서 일부 느린 요청이 만드는 최악 구간의 지연을 뜻합니다. 실시간 상호작용에서는 빠른 평균값보다 드물게 발생하는 긴 대기 시간이 서비스가 고장 난 듯한 인상을 만드는지 여부를 결정합니다.
구조화된 출력(Structured Output)
사람에게 보여줄 자연어와 프로그램이 파싱할 점수·상태값을 정해진 형식으로 함께 반환하는 방식입니다. 두 출력이 하나의 스트림에 섞이면 제어용 토큰이 화면에 노출될 수 있어, 표시 버퍼와 파싱 경계를 분리해야 합니다.

기술

  • Rekall
  • Sonnet 5
  • Haiku 4.5
  • Prometheus 2
  • Gemini 2.5 Flash
  • DeepSeek v4 Flash
  • gemma-4-12B
  • qwen2.5:7b
  • FSRS
  • Speechmatics
  • AssemblyAI
  • Deepgram
  • GGUF

활용 사례

  • 자유 회상 학습 앱의 자동 채점
  • LLM 튜터 대화
  • 실시간 음성 학습 피드백
  • LLM 평가 파이프라인
  • 로컬 모델 기반 무료 티어
  • 수학 답변의 표기 공정성 처리

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 09.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.