이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
이 게시물은 LLMs, STT, TTS 서비스를 비용과 기능 기준으로 비교하는 공개 데이터베이스를 공유한다. LLMs에는 입력·출력 Token Cost, Context Window, Max Output Tokens, Token/s, Cache, Modalities를 기록하고, STT에는 분당 요금·언어·화자 분리·Streaming·Realtime 지원을 기록한다. TTS에는 100만 문자당 요금, 언어, Voice Cloning 지원, Time to First Byte, 출력 형식을 정리한다. 데이터는 매주와 주요 릴리스마다 갱신되며, 회원가입 없이 비교 페이지와 Markdown·JSON 형식으로 접근할 수 있다.
섹션별 상세
공유된 데이터베이스는 LLMs, STT, TTS를 각각 다른 비용 단위와 기능 기준으로 비교하도록 구성됐다. LLMs는 입력·출력 Token Cost와 Context Window, Max Output Tokens, Token/s, Cache, Modalities를 함께 기록하고, STT는 분당 요금과 지원 언어 및 diarization·streaming·realtime 같은 기능을 기준으로 삼는다. TTS는 100만 문자당 요금, 언어, Voice Cloning 지원, Time to First Byte, 출력 형식을 비교 대상으로 둔다.
데이터는 매주 갱신되고 주요 릴리스가 나올 때마다 업데이트되며, 회원가입 없이 접근할 수 있다. 전체 데이터베이스와 비교 페이지가 별도로 제공되고, 같은 내용은 Markdown 파일과 JSON 저장소에서도 확인할 수 있다. 따라서 서비스별 가격과 기능을 직접 대조하거나 JSON 데이터를 다른 도구에서 재사용하는 출발점으로 활용할 수 있다.
용어 해설
- 컨텍스트 윈도(Context Window)
- — 모델이 한 번의 요청에서 입력으로 처리할 수 있는 토큰의 최대 범위이다. 대화 기록이나 문서가 이 범위를 넘으면 일부 내용이 추론에 포함되지 않으므로, 모델 비교에서 긴 입력 지원 여부를 판단하는 핵심 기준이 된다.
- 토큰 비용(Token Cost)
- — LLM이 입력과 출력으로 처리하는 토큰 양에 따라 부과되는 사용 요금이다. 게시물의 비교 기준은 입력 토큰과 출력 토큰의 단가를 나누어 기록하므로, 같은 모델이라도 요청 구성에 따른 비용 차이를 계산할 수 있다.
- 화자 분리(Diarization)
- — 음성 신호를 분석해 발화 구간을 화자별로 나누는 기능이다. STT 서비스 비교에서 여러 사람이 참여한 녹음의 대화 흐름을 구분할 수 있는지 판단하는 기준으로 쓰이며, 게시물은 이를 Capabilities 항목에 포함한다.
- 첫 바이트 지연 시간(Time to First Byte)
- — 요청을 보낸 뒤 생성된 음성 데이터의 첫 바이트가 도착할 때까지 걸리는 시간이다. TTS 응답의 초기 지연을 비교하는 지표로, 실시간 음성 애플리케이션에서 사용자가 음성 출력을 받기 시작하는 시점을 가늠하는 데 쓰인다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 09. 03.수집 2026. 09. 03.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.