본문으로 건너뛰기

GPT 5.4 vs Opus vs Gemini: 창의적 글쓰기 미니 벤치마크 결과

7종의 최신 LLM을 대상으로 일기 쓰기 능력을 블라인드 테스트와 모델 기반 평가로 비교한 결과, GPT 5.4와 Opus 4.6이 최상위권을 차지했다.

실용적 조언

  • 자신의 문체를 복제하고 싶다면 Opus 계열 모델을 사용하는 것이 유리하다.
  • 심리 묘사나 내적 독백이 중요한 글쓰기에는 Gemini Pro 모델이 더 적합할 수 있다.

섹션별 상세

01
GPT 5.4는 사용자의 주관적인 블라인드 테스트에서 S 티어를 기록하며 가장 우수한 창의적 글쓰기 능력을 보여주었다.
02
Opus 4.6 Thinking 모델은 사용자의 실제 일기 문체와 가장 흡사한 산문을 생성하여 높은 평가를 받았으며, Gemini 3-Flash 평가에서도 91.7%의 승률로 공동 1위에 올랐다.
03
Gemini 3.1 Pro는 인물의 심리 상태와 내적 독백을 파악하는 능력이 타 모델 대비 뛰어난 것으로 나타나 심리 묘사 부문에서 강점을 보였다.
04
중국계 모델인 GLM 5는 문체는 훌륭하지만 창의성이 부족하다는 평가를 받았으며, Qwen 3 Max Thinking은 모든 평가 지표에서 최하위인 F 티어를 기록했다.
05
Gemini 3-Flash를 이용한 자동화된 상호 평가 결과가 인간의 주관적 블라인드 테스트 결과와 매우 유사한 경향성을 보임이 확인됐다.

용어 해설

쌍체 비교(Pairwise Comparison)
두 개의 대상을 직접 대조하여 어느 쪽이 더 우수한지 판정하는 평가 방식이다. LLM의 성능을 측정할 때 여러 모델의 결과물을 1:1로 비교하여 상대적인 순위를 결정하는 데 주로 사용된다.
라운드 로빈 테스트(Round-robin Test)
모든 참가자가 서로 한 번씩 대결하는 리그전 방식의 테스트이다. 이 아티클에서는 모든 LLM 조합을 한 번씩 비교하여 전체적인 승률과 점수를 산출함으로써 객관적인 성능 지표를 도출했다.
블라인드 평가(Blind Evaluation)
평가자가 어떤 모델이 생성한 결과물인지 알지 못하는 상태에서 품질을 판정하는 실험 설계 방법이다. 선입견을 배제하고 결과물의 순수한 품질만을 측정하기 위해 필수적으로 활용된다.

언급된 도구

Gemini 3-Flash추천

LLM 간의 결과물을 비교 평가하는 심사위원(Judge) 모델로 활용

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 06.수집 2026. 03. 06.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.