TL;DR
MarketDaily는 새벽에 개인화된 금융 리포트를 정시로 보내기 위해 9개 모델 평의회·심판 체인·결정적 감사 게이트로 구성된 다층 신뢰성 아키텍처를 도입했습니다. 구조적 우선순위는 가격 대비 MA20/MA50 같은 방향 판단을 코드가 결정하고 LLM은 제한된 영역(논제·리스크·lean)에만 의견을 제공하도록 설계해 할루시네이션과 침묵성 품질 저하를 줄였습니다. 최종 HTML에는 운용 경험에서 나온 30개의 결정적 검사가 적용되며 HIGH 실패 시 60초 대기와 더 강한 모델 재생성, 최종적으로는 LLM을 배제한 결정적 대체 보고서로 대체해 잘못된 정보가 사용자에게 도달하지 않게 합니다.
섹션별 상세
용어 해설
- LLM 평의회(LLM council)
- — 여러 독립 LLM 좌석이 동일 입력을 받아 의견(lean, conviction, thesis, key_risk)을 JSON으로 제출하고 합의를 구성하는 아키텍처로, 모델별 자유도는 구조적 제약(예: 방향 잠금)으로 제한됩니다. 입력은 실시간 시장 데이터·구조적 규칙이고 출력은 합의·이견 요약이며 다중 공급자 장애나 할루시네이션을 줄이는 데 사용됩니다.
- 심판(요약·중재기)(Judge)
- — 평의회 좌석들이 반환한 JSON 의견을 받아 합의와 분쟁을 종합적으로 요약하는 LLM 체인 또는 체인 집합으로, 체인 실패 시 가장 높은 신념(conviction) 좌석을 그대로 사용할 수 있는 퇴로를 포함합니다. 입력은 좌석 의견, 출력은 합성된 결론이며 신뢰성 확보용 중재 공정 역할을 합니다.
- 결과 감사 게이트(Audit gate)
- — 최종 HTML 출력에 대해 코드로 결정되는 30개의 결정적 검사 세트를 순차적으로 실행해 형식·사실·안전 문제를 걸러내는 방어층으로, 높은 심각도(HIGH) 실패 시 재시도·강력 모델 강제·결국은 결정적 대체 보고서로 전환하는 정책을 포함합니다. 운영 중 반복 실패 항목은 영구 검사로 등록됩니다.
- 쿼터 공학(Quota engineering)
- — 모델 좌석을 공급자·모델·무료티어 특성에 따라 조합해 전체 시스템 가용성을 최대화하는 전략으로, 벤치마크 중심 선택 대신 분산된 쿼터 소유성을 우선시합니다. 목표는 동시 쿼터 고갈 같은 상관 실패를 회피해 새벽 시간대 안정적 전송을 확보하는 것입니다.
- 결정적 대체 경로(Deterministic fallback)
- — LLM 생성이 감사에서 HIGH로 판정되거나 다중 체인 실패 시 LLM을 완전히 배제한 코드 조합 보고서로 되돌아가는 안전 메커니즘으로, 가격 레벨 등 수치 정보를 의도적으로 제거해 잘못된 정보가 사용자에게 발송되지 않게 설계됩니다. 핵심은 '절대 전송'과 '절대 가짜 전송 금지'를 분리하는 데 있습니다.
근거 모음
- 작성자는 75일 차 운영에 1,800개가 넘는 커밋 기록을 보유하며 현재 21명의 구독자에게 서비스를 제공하고 있다고 밝혔습니다. — 도입부에서 운영 기간(75일), 커밋 수(1,800+), 활성 구독자 수(21명)가 나열되어 있습니다.
- 평의회는 9개의 구성 좌석으로 운영되며 공급자는 Gemini ×2, Groq, 로컬 GPU(Ollama), Cloudflare Workers AI ×2, OpenRouter, Cerebras, OpenAI 등 7곳입니다. — 평의회 구성 목록이 본문에 직접 열거되어 있습니다.
- Groq의 무료 티어는 분당 8,000 TPM과 모델별 일일 200,000 TPD 제한을 가지고 있으며, 평의회 좌석이 동일 버킷을 공유하면 토큰 소진으로 보고 지연이 발생한다고 기술했습니다; 실제로 한 사례에서 평의회 좌석이 197,364 토큰을 소비해 45개의 리포트 호출이 백업 모델로 넘어가 그날 저녁 소화가 1시간 35분 지연되었습니다. — 본문의 쿼터 사례 설명에서 Groq 한도의 수치와 실제 토큰 소비·지연 사례가 제시되어 있습니다.
- 어떤 모델이 프롬프트의 가격을 '385.25'에서 '385.00'으로 바꿔 허위 정밀도를 만들었고, 그 모델은 가격을 다루는 곳에서 영구 배제되었습니다. — 본문에 가격 표기 변경 사례(385.25→385.00)와 그 모델의 제재가 서술되어 있습니다.
- 원문에는 '31 checks'로 기술했으나 정정 공지를 통해 실제로는 30개의 검사만 실효적이며 하나는 문서스트링 예제로 존재해 발동할 수 없다고 밝혔습니다. — 글 말미의 Correction(2026-08-02)에서 검사 수 정정이 명시되어 있습니다.
기술
- Gemini
- Groq
- Ollama
- Cloudflare Workers AI
- OpenRouter
- Cerebras
- OpenAI
- HTML
- CSS
활용 사례
- 사용자별 맞춤형 금융 이메일 리포트 자동 생성
- 시장 개장 전 정시 발송이 필수인 고신뢰성 배치 작업
- LLM 출력의 결정적 검증이 필요한 고위험 콘텐츠 파이프라인
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.