TL;DR
ROHAS 법률 벤치마크의 10문항 검사를 통해 OpenAI GPT-5.5가 존재하지 않는 법규를 창작해 O2 문항에서 실패하며 실격 처리된 사례가 보고되었다. 벤치마크 문항은 중첩된 예외를 따라 책임 한도를 계산하는 능력, 판례·조문 인용의 정확성, 불확실성 인식과 추가 사실 요구 능력, 국제적 맥락 적용 능력, 지정된 형식 준수 여부를 점검하도록 설계되어 모델의 법률적 신뢰성 결함을 드러냈다. 결과적으로 법률 분야 자동화에는 조문·판례의 출처 교차검증과 관할권 확인, 불확실성 시 명시적 거부 또는 추가 질의 루틴이 필수적임이 확인되었다.
실용적 조언
- 법률 텍스트 자동화에 도입할 때 모델 답변을 외부 법률 데이터베이스와 실시간 교차검증하도록 워크플로를 설계해야 한다. 모델이 판례나 조문을 인용할 경우 인용 출처의 URL·조문번호·판례명 등 검증 가능한 메타데이터를 함께 생성하도록 구성해야 한다. 불확실성 감지 시 자동으로 추가 사실을 요구하거나 '확인 필요' 상태를 반환하는 거부 경로를 시스템 설계에 포함해야 리스크를 줄일 수 있다.
섹션별 상세
이미지 분석

이미지는 OpenAI GPT-5.5의 총점(7.5/10)과 R/A/O/H/S 각 항목의 부분 점수를 시각화했으며 O2 항목의 'FAIL' 표기와 상단의 실격 안내 배너가 핵심 정보를 전달한다. 이 시각화는 점수만으로는 신뢰를 판단할 수 없고 특정 문항 실패가 실격 사유가 될 수 있음을 명확히 한다.
ROHAS scorecard 스크린샷이 모델별 점수, 평가 항목별 패스/실패 상태와 'O2 실패로 실격' 경고를 보여주고 있다.

두 번째 이미지는 첫 번째와 내용이 중복되어 벤치마크 결과와 실격 사유의 시각적 근거를 반복 제공하며, 텍스트 본문이 지적한 '존재하지 않는 법규의 창작'이라는 실패 유형을 이미지가 보강한다. 시각 자료는 본문 주장에 대한 즉각적인 검증 단서를 제공한다.
동일한 ROHAS scorecard의 미리보기 이미지로 1번 이미지와 동일한 정보(점수 표기와 O2 실패 경고)를 포함하고 있다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.