TL;DR
작성자는 오래된 무료 LLM API 비교표 대신 Groq, Google AI Studio, OpenRouter, Cloudflare Workers AI, Token Harbor에 새 계정을 만들고 같은 Python 작업과 긴 컨텍스트 검색 테스트를 실행했습니다. 다섯 서비스 모두 신용카드 없이 사용할 수 있었지만, Groq는 8K TPM 때문에 긴 입력에 제약이 있었고 Google AI Studio와 OpenRouter는 첫 요청에서 각각 503과 429를 반환했습니다. Cloudflare Workers AI는 토큰과 Account ID를 포함한 설정이 가장 복잡했으며, Token Harbor는 최신 대형 무료 모델을 제공하는 대신 고정 토큰 한도가 아닌 7일 단위 퍼센트로 사용량을 표시했습니다. 짧은 요청에는 Groq, 큰 무료 컨텍스트에는 Google AI Studio, 모델 선택에는 OpenRouter, 최신 무료 모델에는 Token Harbor가 적합하지만 실제 제품에는 재시도와 유료 대체 경로가 필요합니다.
실용적 조언
- 짧은 요청을 빠르게 처리하는 스크립트에는 Groq를 우선 고려하되, 긴 프롬프트를 보낼 때는 8K TPM 제한을 먼저 계산해야 합니다.
- 큰 무료 컨텍스트가 필요하면 Google AI Studio를 후보로 둘 수 있지만 503 재시도 가능성과 무료 서비스의 데이터 약관을 함께 확인해야 합니다.
- OpenRouter를 사용할 때는 무료 라우트가 429를 반환할 수 있으므로 지수 백오프 재시도와 유료 fallback을 구현하는 편이 안전합니다.
- Cloudflare Workers AI는 토큰, Account ID, REST 설정을 미리 준비하고 thinking 출력이 필요한지 확인한 뒤 neurons 한도 안에서 요청량을 설계해야 합니다.
- Token Harbor는 무료 모델 수보다 최신 모델의 크기를 중시할 때 선택할 수 있지만, 퍼센트로 표시되는 rolling 7-day 한도는 공식 토큰 수로 간주하지 않는 편이 안전합니다.
섹션별 상세
용어 해설
- 긴 컨텍스트(Long Context)
- — 한 번의 API 요청에 매우 많은 입력 토큰을 넣어 처리하는 방식입니다. 이 글에서는 일반적인 긴 프롬프트를 API가 수용하는지와 실제 처리 시간을 측정하는 기준으로 사용됐습니다. 모델 성능보다 입력 한도와 요청 안정성을 비교하는 데 중요합니다.
- 분당 요청 수(RPM)
- — API가 1분 동안 허용하는 요청 횟수입니다. Groq의 무료 한도는 30 RPM으로 표시됐으며, 짧은 요청을 빠르게 반복하는 스크립트에서는 일일 토큰 수보다 먼저 병목이 될 수 있습니다.
- 분당 토큰 수(TPM)
- — API가 1분 동안 처리하도록 허용한 입력·출력 토큰의 양입니다. Groq의 8K TPM처럼 값이 작으면 하루 총량이 충분해도 긴 프롬프트 한 번을 처리하기 어려울 수 있습니다.
- 429 오류(429 Error)
- — 요청이 너무 많거나 공유된 상위 시스템의 용량이 부족할 때 API가 반환하는 상태 코드입니다. OpenRouter에서는 무료 라우트가 혼잡해 첫 요청이 429로 거절됐지만 재시도 후 같은 테스트가 통과했습니다.
- Neuron 사용량(Neuron)
- — Cloudflare Workers AI가 무료 사용량을 계산하는 단위입니다. 이 글의 계정에는 하루 10K neurons 한도가 표시됐고, 테스트 뒤 대시보드에는 2.02K가 사용된 것으로 나타났습니다.
언급된 도구
무료 LLM API로 짧은 Python 요청과 7,521 입력 토큰의 긴 컨텍스트 요청 처리
프로젝트 기반 무료 LLM API와 84,424 입력 토큰 컨텍스트 처리
여러 무료 모델 라우트를 제공하는 API 플랫폼
REST API를 통한 무료 모델 실행과 neurons 단위 사용량 관리
최신 대형 무료 모델을 제공하는 API 플랫폼
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.