본문으로 건너뛰기

무료 LLM API 5종 직접 비교

다섯 무료 LLM API를 같은 Python 작업과 긴 컨텍스트로 시험해 서비스별 한도와 실패 지점을 비교했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 오래된 무료 LLM API 비교표 대신 Groq, Google AI Studio, OpenRouter, Cloudflare Workers AI, Token Harbor에 새 계정을 만들고 같은 Python 작업과 긴 컨텍스트 검색 테스트를 실행했습니다. 다섯 서비스 모두 신용카드 없이 사용할 수 있었지만, Groq는 8K TPM 때문에 긴 입력에 제약이 있었고 Google AI Studio와 OpenRouter는 첫 요청에서 각각 503과 429를 반환했습니다. Cloudflare Workers AI는 토큰과 Account ID를 포함한 설정이 가장 복잡했으며, Token Harbor는 최신 대형 무료 모델을 제공하는 대신 고정 토큰 한도가 아닌 7일 단위 퍼센트로 사용량을 표시했습니다. 짧은 요청에는 Groq, 큰 무료 컨텍스트에는 Google AI Studio, 모델 선택에는 OpenRouter, 최신 무료 모델에는 Token Harbor가 적합하지만 실제 제품에는 재시도와 유료 대체 경로가 필요합니다.

실용적 조언

  • 짧은 요청을 빠르게 처리하는 스크립트에는 Groq를 우선 고려하되, 긴 프롬프트를 보낼 때는 8K TPM 제한을 먼저 계산해야 합니다.
  • 큰 무료 컨텍스트가 필요하면 Google AI Studio를 후보로 둘 수 있지만 503 재시도 가능성과 무료 서비스의 데이터 약관을 함께 확인해야 합니다.
  • OpenRouter를 사용할 때는 무료 라우트가 429를 반환할 수 있으므로 지수 백오프 재시도와 유료 fallback을 구현하는 편이 안전합니다.
  • Cloudflare Workers AI는 토큰, Account ID, REST 설정을 미리 준비하고 thinking 출력이 필요한지 확인한 뒤 neurons 한도 안에서 요청량을 설계해야 합니다.
  • Token Harbor는 무료 모델 수보다 최신 모델의 크기를 중시할 때 선택할 수 있지만, 퍼센트로 표시되는 rolling 7-day 한도는 공식 토큰 수로 간주하지 않는 편이 안전합니다.

섹션별 상세

01
작성자는 오래된 비교 목록을 대신해 Groq, Google AI Studio, OpenRouter, Cloudflare Workers AI, Token Harbor에 직접 가입하고 동일한 Python 작업과 긴 컨텍스트 검색 요청을 보냈습니다. SDK 재시도를 끈 상태에서 첫 오류를 관찰했으며, 모델 자체의 성능을 겨루는 벤치마크가 아니라 무료 API의 실제 사용 가능성, 설정 시간, 일반 작업 처리 여부를 측정했습니다. 다섯 서비스 모두 신용카드 없이 작동했지만 무료 한도의 단위와 오류 양상이 서로 달랐습니다.
02
Groq는 Google 로그인 뒤 1~2분 만에 키를 만들 수 있었고 30 RPM, 1K RPD, 8K TPM, 2M TPD가 표시됐습니다. 8K TPM 제약 때문에 긴 입력을 7,521토큰으로 줄였고 2.13초 만에 처리했지만 Python 답변의 설명 문장 하나가 틀렸습니다. 따라서 짧고 빠른 요청에는 적합하지만 하루 총량보다 한 번에 넣을 수 있는 입력 크기가 더 큰 제약으로 작용했습니다.
03
Google AI Studio는 프로젝트를 만들거나 선택해야 해서 첫 키까지 3~4분이 걸렸고 일반 Python 작업은 6.54초에 통과했습니다. 첫 긴 컨텍스트 요청은 503으로 실패했지만 수동 재시도에서 84,424 입력 토큰을 24.35초에 처리했으며, API에는 84.4K 프롬프트 토큰이 기록됐고 할당량 화면에는 64.72K TPM 피크가 표시됐습니다. 두 수치가 서로 다른 방식으로 계산됐을 가능성이 남아 있어 사용량 기준을 확인해야 하며, 비공개 데이터에는 Google의 무료 서비스 데이터 약관을 별도로 살펴야 합니다.
04
OpenRouter는 카드와 별도 이메일 인증 없이 가입할 수 있고 무료 모델 요청 50회를 하루에 제공했지만 잔여 요청 수를 명확히 확인하기 어려웠습니다. 무료 upstream pool이 혼잡해 일반 작업과 긴 요청 모두 첫 시도에서 429를 반환했지만 재시도 후 긴 요청은 80,464 입력 토큰을 9.35초에 처리했고 대시보드에는 약 81.1K 토큰과 0달러 지출이 기록됐습니다. 이 서비스에서는 일일 요청 수보다 무료 라우트의 순간적인 가용성이 실제 사용성을 좌우했습니다.
05
Cloudflare Workers AI는 범위가 제한된 토큰, Account ID, 별도의 REST URL이 필요해 다섯 서비스 중 설정에 가장 오래 걸렸습니다. Gemma는 처음에 thinking에 출력 예산을 모두 사용해 화면에 답을 내놓지 않았지만 thinking을 끄자 유효한 JSON을 반환했고, 이후 Python 함수는 한 가지 예외 상황을 놓쳤습니다. 20K 단어 컨텍스트는 프록시를 거쳐 실패했지만 10K 단어로 줄인 요청은 42,268 입력 토큰을 5.93초에 처리했으며 대시보드에는 하루 10K neurons 중 2.02K가 사용된 것으로 표시됐습니다.
06
Token Harbor는 이메일 인증과 키 생성을 포함해 약 2분 만에 준비됐고 일반 Python 작업은 1.84초, 긴 요청은 63,887 입력 토큰을 24.62초에 처리했습니다. 무료 모델 목록은 짧지만 DeepSeek V4 Flash, Qwen3.8 27B, MiMo V2.5처럼 작성자가 더 최신이고 큰 모델로 평가한 항목을 제공했으며, 약 70K 토큰 사용 뒤 7일 단위 퍼센트 표시가 0%에서 3%로 변했습니다. 이를 바탕으로 한 2~2.5M 수준의 추정치는 공식 한도가 아니므로 고정 토큰 한도가 필요한 운영 환경에서는 불확실성이 남습니다.

용어 해설

긴 컨텍스트(Long Context)
한 번의 API 요청에 매우 많은 입력 토큰을 넣어 처리하는 방식입니다. 이 글에서는 일반적인 긴 프롬프트를 API가 수용하는지와 실제 처리 시간을 측정하는 기준으로 사용됐습니다. 모델 성능보다 입력 한도와 요청 안정성을 비교하는 데 중요합니다.
분당 요청 수(RPM)
API가 1분 동안 허용하는 요청 횟수입니다. Groq의 무료 한도는 30 RPM으로 표시됐으며, 짧은 요청을 빠르게 반복하는 스크립트에서는 일일 토큰 수보다 먼저 병목이 될 수 있습니다.
분당 토큰 수(TPM)
API가 1분 동안 처리하도록 허용한 입력·출력 토큰의 양입니다. Groq의 8K TPM처럼 값이 작으면 하루 총량이 충분해도 긴 프롬프트 한 번을 처리하기 어려울 수 있습니다.
429 오류(429 Error)
요청이 너무 많거나 공유된 상위 시스템의 용량이 부족할 때 API가 반환하는 상태 코드입니다. OpenRouter에서는 무료 라우트가 혼잡해 첫 요청이 429로 거절됐지만 재시도 후 같은 테스트가 통과했습니다.
Neuron 사용량(Neuron)
Cloudflare Workers AI가 무료 사용량을 계산하는 단위입니다. 이 글의 계정에는 하루 10K neurons 한도가 표시됐고, 테스트 뒤 대시보드에는 2.02K가 사용된 것으로 나타났습니다.

언급된 도구

Groq추천

무료 LLM API로 짧은 Python 요청과 7,521 입력 토큰의 긴 컨텍스트 요청 처리

Google AI Studio추천

프로젝트 기반 무료 LLM API와 84,424 입력 토큰 컨텍스트 처리

OpenRouter중립

여러 무료 모델 라우트를 제공하는 API 플랫폼

Cloudflare Workers AI중립

REST API를 통한 무료 모델 실행과 neurons 단위 사용량 관리

Token Harbor추천

최신 대형 무료 모델을 제공하는 API 플랫폼

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 03.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.