TL;DR
이 글은 Amazon Bedrock AgentCore의 관리형 브라우저를 활용해 RSS로 수집한 웹페이지를 안정적으로 렌더링하고, 전처리된 텍스트를 Bedrock 모델로 분석해 요약·주제·엔티티·임베딩을 생성해 OpenSearch Serverless에 색인하는 엔드투엔드 파이프라인을 소개한다. 주요 설계는 EventBridge→Lambda로 수집을 트리거하고 S3 업로드를 SQS로 연결해 처리 단계를 비동기 분리하는 구조로 신뢰성과 확장성을 확보한다. AgentCore 렌더링은 안정성이 장점이나 각 렌더당 10–30초 소요로 비용이 크므로 S3 기반 중복 확인과 HTML 정제가 비용·출력 품질 관점에서 핵심이라는 교훈을 제시한다.
섹션별 상세

- EventBridge 스케줄이 15분마다 Lambda를 트리거해 RSS 피드를 검사하고 중복을 S3 URL 해시로 제거한다. — 본문의 'RSS feed collection' 설명에서 EventBridge 스케줄과 15분 단위 트리거, URL 해시를 사용한 중복 제거를 기술한 부분.
- AgentCore 브라우저는 JavaScript로 렌더링되는 페이지를 완전하게 캡처해 이후 AI 추출의 입력으로 사용한다. — 본문 'Browser-based content retrieval' 단락과 아키텍처 도식에서 Playwright 통해 원격 브라우저로 렌더링하고 스크린샷·이미지를 캡처해 S3에 업로드한다고 명시.
- 정제된 텍스트에서 생성한 벡터 임베딩을 OpenSearch Serverless에 색인하면 의미 기반 검색이 가능해진다. — 본문 'Indexing and semantic search'와 'AI-powered content analysis'에서 임베딩을 생성해 OpenSearch Serverless에 저장한다고 명시.
- AgentCore 렌더링은 각 요청당 10~30초가 소요되며 단순 HTTP 요청보다 비용이 많이 든다. — 본문 'Lessons learned'의 성능·비용 관련 단락에서 테스트 결과로 10–30초 사이 소요와 비용이 더 높음을 언급.
용어 해설
- AgentCore 브라우저(AgentCore Browser)
- — AgentCore 브라우저는 Amazon Bedrock AgentCore가 제공하는 관리형 원격 브라우저로서 Playwright를 통해 CDP(WebSocket)를 사용해 페이지를 렌더링한다. 자바스크립트로 동적 생성되는 요소가 많은 페이지도 완전한 렌더링 결과와 스크린샷, 이미지를 확보해 후속 AI 처리에 필요한 완전한 문맥을 전달한다. 이 때문에 전통적인 HTTP 기반 스크래퍼가 깨지는 사이트 구조 변화에서도 더 안정적으로 콘텐츠를 수집할 수 있다.
- 벡터 임베딩(Vector embeddings)
- — 벡터 임베딩은 텍스트를 고차원 벡터로 변환해 의미적 유사도를 계산할 수 있게 하는 표현 방식이다. 본 솔루션에서는 Amazon Bedrock로 생성한 임베딩을 Amazon OpenSearch Serverless에 저장해 키워드 검색으로는 찾기 어려운 개념적 연관 문서를 검색할 수 있게 한다. 임베딩 기반 검색은 경쟁 인텔리전스와 트렌드 발굴에서 용어 차이 때문에 놓치는 관련 정보를 발견하는 데 유용하다.
- Playwright over CDP
- — Playwright over CDP는 Playwright가 Chrome DevTools Protocol을 통해 원격 브라우저 세션을 제어하는 방식으로, Lambda에서 브라우저를 직접 호스팅하지 않고 원격 AgentCore 인스턴스를 제어한다. 이 접근법은 페이지가 로드된 후 동적 콘텐츠가 안정적으로 반영된 최종 렌더링을 캡처하는 입력을 제공한다. 캡처된 HTML, 스크린샷, 이미지가 S3에 구조화되어 업로드되면 이후 파이프라인이 이를 신뢰하여 처리할 수 있다.
- SQS 비동기 분리(SQS decoupling)
- — SQS 비동기 분리는 수집 단계와 처리 단계를 메시지 큐로 분리해 서로의 실패가 전체 파이프라인을 중단하지 않게 하는 설계 패턴이다. 이 솔루션에서는 S3 업로드 이벤트가 SQS로 전달되고, 처리 Lambda가 큐에서 메시지를 읽어 HTML 정제 및 AI 호출을 수행한다. Dead-letter queue를 통해 자동 재시도와 실패 처리를 지원해 안정성을 높인다.
- Readability와 html-to-text(Readability / html-to-text)
- — Readability는 웹페이지에서 주 콘텐츠를 식별해 핵심 본문을 추출하는 라이브러리이고, html-to-text는 대용량 HTML을 단순 텍스트로 변환해 토큰 비용을 줄이는 전처리 도구다. 본 파이프라인은 1MB 이상인 대형 HTML은 html-to-text로 단순화하고, 소형 문서는 Readability로 본문과 대표 이미지를 추출해 LLM 입력 토큰을 절감한다. 이 단계는 안정적이고 일관된 AI 출력물을 얻기 위한 전제 조건으로 설계되었다.
기술
- Amazon Bedrock AgentCore
- Amazon Bedrock
- Amazon OpenSearch Serverless
- Playwright (CDP)
- AWS Lambda
- Amazon S3
- Amazon SQS
- Amazon Cognito
- Amazon ECS Fargate
- MCP (Model Context Protocol)
- Amazon CloudFront
- html-to-text
- Mozilla Readability
활용 사례
- 경쟁사 블로그·제품 발표·보도자료를 모니터링해 신규 기능·가격·전략 변화를 파악하는 경쟁 인텔리전스
- 산업 뉴스·애널리스트 보고서·무역 간행물을 실시간으로 모니터링해 신흥 기술·트렌드를 탐색하는 시장 조사
- 여러 출처에서 콘텐츠를 수집해 대상 독자에게 가장 관련성 높은 자료를 선정하는 콘텐츠 큐레이션
- 규제 웹사이트와 뉴스 소스를 감시해 비즈니스에 영향을 줄 수 있는 규정 변화나 공지를 탐지하는 컴플라이언스 모니터링
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.