실용적 조언
- 정부 사이트처럼 캡차가 까다로운 곳은 Serper API와 Google Dorks 조합으로 PDF를 직접 찾는 것이 유리하다.
- 에이전트의 컨텍스트 윈도우를 아끼기 위해 원문 전체를 전달하지 말고 LLM으로 정형화된 JSON만 추출하여 전달하라.
섹션별 상세
실시간 스크래핑 대신 리눅스 크론탭과 Serper API의 Google Dorks를 활용하여 새벽 시간에 PDF 링크를 미리 추출하는 방식을 채택했다. 이는 웹사이트 레이아웃 변경이나 캡차 문제를 우회하고 에이전트의 실행 속도를 높이는 핵심 전략이다.
추출된 PDF 데이터는 pdfplumber로 텍스트화한 뒤 Groq에서 실행되는 Llama-3 모델을 거쳐 엄격한 타입의 JSON으로 변환된다. 이 과정에서 불필요한 텍스트를 제거하고 정형화된 데이터만 추출하여 비동기 SQLite 캐시에 저장함으로써 데이터 일관성을 확보했다.
에이전트와 데이터 소스를 연결하기 위해 FastAPI로 MCP 프록시 서버를 구축하여 CrewAI 에이전트가 단 50ms 만에 JSON 데이터를 가져올 수 있게 구현했다. 기존의 실시간 브라우저 제어 방식보다 응답 지연 시간을 획기적으로 단축하고 컨텍스트 윈도우 초과 문제를 방지했다.
용어 해설
- 구글 도킹(Google Dorks)
- — 고급 검색 연산자를 사용하여 일반적인 검색으로는 찾기 어려운 특정 파일 형식이나 보안 취약점, 민감한 정보를 찾아내는 기법이다. 이 게시물에서는 정부 포털의 PDF 링크를 직접 추출하기 위해 Serper API와 함께 사용됐다.
- 모델 컨텍스트 프로토콜(MCP)
- — Model Context Protocol의 약자로, AI 모델이 외부 도구나 데이터 소스와 표준화된 방식으로 통신할 수 있게 돕는 프로토콜이다. 여기서는 에이전트와 SQLite 캐시를 연결하는 프록시 서버 구축에 활용됐다.
- 엄격한 타입 지정 JSON(Strictly Typed JSON)
- — LLM이 생성하는 출력을 사전에 정의된 스키마나 데이터 구조에 정확히 맞추도록 강제하는 방식이다. 비정형 텍스트 데이터를 정형화된 데이터베이스에 저장하거나 후속 프로세스에서 오류 없이 처리하기 위해 필수적이다.
언급된 도구
CrewAI추천
SDR 에이전트 오케스트레이션 프레임워크
Groq추천
Llama-3 모델을 통한 고속 텍스트-JSON 변환 추론 엔진
Serper API추천
Google Dorks를 활용한 검색 결과 및 PDF 링크 추출
pdfplumber중립
PDF 파일에서 텍스트 데이터 추출
FastAPI추천
MCP 프록시 서버 구축을 위한 웹 프레임워크
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 26.수집 2026. 04. 26.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



