TL;DR
동일한 GPT-5.4 에이전트를 사용해 OpenAI의 SimpleQA 1000문항을 테스트한 결과 검색 공급자에 따라 최종 정답률이 달라졌으며 Firecrawl이 947개 정답으로 94.7%를 기록해 가장 높은 정확도를 보였다. 실험은 질문당 최대 20회의 검색·추출 호출 제한과 OpenAI의 SimpleQA 채점 프롬프트에 의한 GPT-5.4 자동 채점을 일관된 평가 방식으로 적용했고 모든 공급자가 90% 이상의 정답률을 달성해 검색 보강이 모델 성능을 크게 향상시켰다. Claude Native Search가 상대적으로 낮은 수치를 보였으나 반복 실험과 자동 채점 방식의 한계 때문에 추가 검증이 필요하며 검색 결과의 관련성·추출 용이성이 최종 정확도에 직접적인 영향을 미친다는 결론이 도출되었다.
주요 논점
검색 공급자는 LLM 기반 질의응답 정확도에 실질적인 영향을 미치며 우수한 검색 결과를 제공하는 공급자가 더 높은 정답률을 달성했다.
검색 보강 없이 GPT-5.4는 43.8%에 그쳤고 검색을 결합하면 90% 이상으로 상승하여 검색 레이어가 핵심 성능 결정 요소가 되었다.
Claude Native Search가 이번 실험에서 가장 낮은 정확도를 보였지만 자동 채점과 반복 횟수, 구현 세부조건 때문에 추가 검증이 필요하다.
합의점 vs 논쟁점
합의점
- 동일한 GPT-5.4 에이전트 환경에서 검색을 붙이면 모델의 정답률이 크게 향상된다는 점에 대체로 동의가 이루어졌다.
- 네 공급자 모두 90% 이상의 정답률을 기록해 검색 기반 QA 설정이 높은 성능을 낼 수 있음이 확인되었다.
논쟁점
- Claude 네이티브 검색이 실험에서 최하위를 기록한 사실은 일부에서 구현·설정 차이에 따른 결과일 수 있다는 이유로 논쟁이 발생할 소지가 있다.
실용적 조언
- 검색 기반 QA 시스템을 구축할 때 동일한 LLM과 호출 제한 하에서 여러 검색 공급자를 비교하는 것이 권장된다. 이는 검색 결과의 관련성, 문서 추출 용이성, 응답 지연이 최종 정답률에 직결되기 때문이다. 본 실험처럼 반복 테스트와 일관된 자동 채점을 도입하면 공급자 비교 시 편향을 줄일 수 있다.
섹션별 상세
이미지 분석

그래프는 각 공급자별로 1,000건을 입력했을 때 정답 수와 오답 수를 수치로 병기하며 Firecrawl이 947개 정답(94.7%)으로 가장 높고 Claude Native Search가 905개 정답(90.5%)으로 가장 낮음을 보여준다. 시각적 폭은 정답 비율의 차이를 직관적으로 드러내며 오른쪽에 정답과 오답의 정확한 개수와 백분율이 표기되어 결과 해석을 용이하게 한다.
SimpleQA 1000문항에 대해 Firecrawl·Exa·Parallel·Claude 네 검색 공급자의 정답·오답 수를 막대형 흐름 차트로 시각화한 그래프이다.

두 번째 이미지는 동일한 데이터의 미리보기 버전으로, Firecrawl 947개 정답(94.7%), Exa 919개 정답(91.9%), Parallel 910개 정답(91.0%), Claude Native Search 905개 정답(90.5%)이라는 핵심 수치를 재확인하게 한다. 차트는 검색이 없는 기준치(43.8%)와의 대비를 직접 표기하지는 않지만 본문 수치와 합쳐 읽을 때 검색 보강의 영향이 크다는 해석을 보조한다.
첫 번째 이미지의 다른 해상도 버전으로 네 공급자의 정답·오답 비율을 동일한 형식으로 반복한 차트이다.
용어 해설
- SimpleQA 벤치마크(SimpleQA)
- — SimpleQA는 단일 질문에 대해 외부 자료 검색을 통해 정답을 찾는 능력을 평가하는 벤치마크로, 질문별로 검색·추출 호출을 허용하여 검색 공급자와 모델의 상호작용 성능을 측정하는 데 사용된다. 이 벤치마크는 검색 기반 보강 기법이 얼마나 정확한 문서·정보를 찾아 모델의 답변 품질에 기여하는지를 평가하는 데 적합하다. 공개 점수는 모델이 검색 없이 답변했을 때의 기준 성능과 검색을 붙였을 때의 개선 폭을 비교하는 데 기준이 된다.
- 웹 검색 공급자(Web Search Provider)
- — 웹 검색 공급자는 질의에 대해 외부 문서나 텍스트를 찾아 반환하는 서비스로, 검색 결과의 관련성·정확성·추출 가능성이 LLM의 최종 답변 정확도에 직접적인 영향을 미친다. 검색 공급자는 색인·랭킹·요약·추출 API를 통해 모델이 참조할 텍스트를 제공하며 호출 제한과 응답 품질이 전체 파이프라인 성능을 결정한다. 동일한 LLM과 제어된 실험에서 검색 공급자 간 결과 차이는 주로 검색결과의 정확도와 추출 효율성에서 기인한다.
- 채점 프롬프트(Grading Prompt)
- — 채점 프롬프트는 LLM을 이용해 응답의 정오를 자동 판정하기 위한 텍스트 지침으로, 정답 기준과 비교 방법을 구체적으로 명시해 모델이 답변의 정밀도를 판단하게 한다. 게시글에서는 OpenAI의 공식 SimpleQA 채점 프롬프트를 사용해 GPT-5.4가 직접 채점을 수행하였고, 이 과정은 사람 심사 대신 일관된 자동 평가를 제공한다. 채점 프롬프트의 설계는 자동 채점의 편향과 민감도에 영향을 줄 수 있으므로 결과 해석 시 고려 요소가 된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.