본문으로 건너뛰기

9개 모델 LLM 평의회로 매일 금융 뉴스레터 운영

다중 LLM 평의회·심판·30개 검사로 금융 뉴스레터 신뢰성을 설계했다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

MarketDaily는 새벽에 개인화된 금융 리포트를 정시로 보내기 위해 9개 모델 평의회·심판 체인·결정적 감사 게이트로 구성된 다층 신뢰성 아키텍처를 도입했습니다. 구조적 우선순위는 가격 대비 MA20/MA50 같은 방향 판단을 코드가 결정하고 LLM은 제한된 영역(논제·리스크·lean)에만 의견을 제공하도록 설계해 할루시네이션과 침묵성 품질 저하를 줄였습니다. 최종 HTML에는 운용 경험에서 나온 30개의 결정적 검사가 적용되며 HIGH 실패 시 60초 대기와 더 강한 모델 재생성, 최종적으로는 LLM을 배제한 결정적 대체 보고서로 대체해 잘못된 정보가 사용자에게 도달하지 않게 합니다.

섹션별 상세

단일 모델 + 폴백 구조는 형식적 오류를 잡을 수 있어도 '조용한 품질 저하'를 막지 못한다는 문제가 핵심이었습니다; 모델이 예외를 내지 않고 그럴듯한 얕은 분석을 반환하면 사용자가 먼저 문제를 발견하게 됩니다. 이를 해결하기 위해 저자는 방향 결정과 같은 치명적 권한을 코드로 고정하고 LLM은 안전한 범위(논제, 리스크, lean 등)에서만 작동하게 분리했습니다. 결과적으로 출력의 형식은 유지하면서도 내용 깊이와 일관성을 코드·다중 모델 합의·결정적 감사로 보강할 수 있었습니다.
평의회 설계는 9개 좌석을 7개 공급자에 분산해 쿼터 상관 실패를 회피하도록 설계되었고, 각 좌석은 동일한 시장 데이터와 구조적 제약(예: 가격 대 MA20/MA50에 따른 방향 잠금)을 받습니다. 좌석은 숫자를 출력하지 않는 JSON 의견(lean, conviction, thesis, key_risk)을 제출하고, 시스템은 좌석 간 불일치를 측정해 불일치가 큰 종목은 보수적 문구와 하향 보정된 신뢰도로 표시합니다. 이는 개별 모델 신뢰성 대신 좌석 구성이 장애 파괴범위를 줄이는 실무적 방어라는 점을 보여줍니다.
심판(judge)은 평의회 좌석 의견을 종합해 합의와 이견을 만들어내는 역할을 하며 자체적인 폴백 체인을 갖습니다; 체인 전체가 실패하면 가장 높은 conviction을 낸 좌석의 논제를 그대로 사용하도록 명시해 서비스는 항상 부분 결과를 반환합니다. 이 설계는 '전송을 놓치지 않기'와 '쓰레기를 보내지 않기'라는 서로 다른 두 요구사항을 별도 메커니즘으로 보장합니다. 평의회가 불충분하면 단일 모델 경로로 처리하는 등 비차단성(fail-safe)을 유지합니다.
감사 게이트는 최종 HTML에 대해 원문에서 오류로 이어졌던 실제 사례들을 기반으로 설계된 30개의 결정적 검사를 실행합니다; 검사에는 시제 규율, 보유 주식 누락, 거짓 URL·플레이스홀더·허위 수익 추정, 프롬프트 누출, CSS 미정의 클래스, 잘림 감지 등이 포함됩니다. HIGH로 판단되는 경우 60초 대기 후 더 강력한 모델로 재생성하고 여전히 실패하면 LLM을 배제한 코드 조합 보고서를 발송합니다. 이 흐름은 잘못된 수치·문구가 사용자 메일로 나가는 것을 막기 위한 최종 방어선 역할을 합니다.
운영 중 세 건의 실전 사고가 방어층을 강화하는 계기가 되었습니다. 첫째는 공급자 429(쿼터 소진)로 인해 재시도 로직이 전체 실행을 지연시켜 발송이 5시간 늦어진 사례로, 고쳐진 규칙은 연속 2회의 429를 쿼터 소진으로 판단해 해당 좌석을 당일 차단하는 것입니다. 둘째는 LLM이 CSS 클래스명을 근사치로 발명해 스타일이 깨진 사건으로, 해결은 미정의 클래스 검사와 미스매치명을 알려진 클래스에 매핑하거나 알 수 없는 클래스는 제거하는 결정적 수리층을 추가한 것입니다. 셋째는 모든 무료 쿼터가 동시 소진되어 모델이 약화되며 이유 설명 길이가 정상(중간값 107–197자)에서 대폭 줄어든 사례로, 생산 이력을 기준으로 중간값이 80자 미만이면 시스템 붕괴로 간주해 경보를 올리도록 통계 기반 검출을 도입했습니다.
결론적으로 운영자는 '9개 모델이 더 똑똑해서'가 아니라 방향을 코드로 고정하고 LLM을 구조적 안전범위에 가두며 결정적 감사를 통해 모든 실패 모드를 포착하는 아키텍처를 목표로 했습니다. 저자의 경험은 고위험 서비스에서 신뢰성은 모델 성능이 아니라 아키텍처와 운영 규칙으로 만든다는 점을 실무 데이터와 사고 사례로 뒷받침합니다. 다음 글에서는 각 감사 검사 항목의 분류와 실패 모드를 자세히 다룰 예정이라고 밝혔습니다.

용어 해설

LLM 평의회(LLM council)
여러 독립 LLM 좌석이 동일 입력을 받아 의견(lean, conviction, thesis, key_risk)을 JSON으로 제출하고 합의를 구성하는 아키텍처로, 모델별 자유도는 구조적 제약(예: 방향 잠금)으로 제한됩니다. 입력은 실시간 시장 데이터·구조적 규칙이고 출력은 합의·이견 요약이며 다중 공급자 장애나 할루시네이션을 줄이는 데 사용됩니다.
심판(요약·중재기)(Judge)
평의회 좌석들이 반환한 JSON 의견을 받아 합의와 분쟁을 종합적으로 요약하는 LLM 체인 또는 체인 집합으로, 체인 실패 시 가장 높은 신념(conviction) 좌석을 그대로 사용할 수 있는 퇴로를 포함합니다. 입력은 좌석 의견, 출력은 합성된 결론이며 신뢰성 확보용 중재 공정 역할을 합니다.
결과 감사 게이트(Audit gate)
최종 HTML 출력에 대해 코드로 결정되는 30개의 결정적 검사 세트를 순차적으로 실행해 형식·사실·안전 문제를 걸러내는 방어층으로, 높은 심각도(HIGH) 실패 시 재시도·강력 모델 강제·결국은 결정적 대체 보고서로 전환하는 정책을 포함합니다. 운영 중 반복 실패 항목은 영구 검사로 등록됩니다.
쿼터 공학(Quota engineering)
모델 좌석을 공급자·모델·무료티어 특성에 따라 조합해 전체 시스템 가용성을 최대화하는 전략으로, 벤치마크 중심 선택 대신 분산된 쿼터 소유성을 우선시합니다. 목표는 동시 쿼터 고갈 같은 상관 실패를 회피해 새벽 시간대 안정적 전송을 확보하는 것입니다.
결정적 대체 경로(Deterministic fallback)
LLM 생성이 감사에서 HIGH로 판정되거나 다중 체인 실패 시 LLM을 완전히 배제한 코드 조합 보고서로 되돌아가는 안전 메커니즘으로, 가격 레벨 등 수치 정보를 의도적으로 제거해 잘못된 정보가 사용자에게 발송되지 않게 설계됩니다. 핵심은 '절대 전송'과 '절대 가짜 전송 금지'를 분리하는 데 있습니다.

근거 모음

근거
  • 작성자는 75일 차 운영에 1,800개가 넘는 커밋 기록을 보유하며 현재 21명의 구독자에게 서비스를 제공하고 있다고 밝혔습니다. 도입부에서 운영 기간(75일), 커밋 수(1,800+), 활성 구독자 수(21명)가 나열되어 있습니다.
  • 평의회는 9개의 구성 좌석으로 운영되며 공급자는 Gemini ×2, Groq, 로컬 GPU(Ollama), Cloudflare Workers AI ×2, OpenRouter, Cerebras, OpenAI 등 7곳입니다. 평의회 구성 목록이 본문에 직접 열거되어 있습니다.
  • Groq의 무료 티어는 분당 8,000 TPM과 모델별 일일 200,000 TPD 제한을 가지고 있으며, 평의회 좌석이 동일 버킷을 공유하면 토큰 소진으로 보고 지연이 발생한다고 기술했습니다; 실제로 한 사례에서 평의회 좌석이 197,364 토큰을 소비해 45개의 리포트 호출이 백업 모델로 넘어가 그날 저녁 소화가 1시간 35분 지연되었습니다. 본문의 쿼터 사례 설명에서 Groq 한도의 수치와 실제 토큰 소비·지연 사례가 제시되어 있습니다.
  • 어떤 모델이 프롬프트의 가격을 '385.25'에서 '385.00'으로 바꿔 허위 정밀도를 만들었고, 그 모델은 가격을 다루는 곳에서 영구 배제되었습니다. 본문에 가격 표기 변경 사례(385.25→385.00)와 그 모델의 제재가 서술되어 있습니다.
  • 원문에는 '31 checks'로 기술했으나 정정 공지를 통해 실제로는 30개의 검사만 실효적이며 하나는 문서스트링 예제로 존재해 발동할 수 없다고 밝혔습니다. 글 말미의 Correction(2026-08-02)에서 검사 수 정정이 명시되어 있습니다.

기술

  • Gemini
  • Groq
  • Ollama
  • Cloudflare Workers AI
  • OpenRouter
  • Cerebras
  • OpenAI
  • HTML
  • CSS

활용 사례

  • 사용자별 맞춤형 금융 이메일 리포트 자동 생성
  • 시장 개장 전 정시 발송이 필수인 고신뢰성 배치 작업
  • LLM 출력의 결정적 검증이 필요한 고위험 콘텐츠 파이프라인
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 06.수집 2026. 08. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.