TL;DR
작성자는 Python과 PySide6로 구축한 실제 데스크톱 애플리케이션에서 DeepSeek V4 Flash (0731)와 DeepSeek V4 Pro (0813)를 6가지 코드 검토 작업으로 비교했습니다. 동일한 세션·프롬프트·도구를 사용하고 239개 주장을 코드와 대조한 결과, 사실 정확도는 Pro 95.9%와 Flash 95.7%로 거의 같았습니다. Flash는 세 가지 잠재 버그를 모두 찾고 약 9배 저렴했지만 구조적 결과가 적었고, Pro는 어려운 사실 오류 없이 폭넓은 구조 검토를 수행했지만 실행 간 깊이 편차가 약 2.7배였습니다. 따라서 Flash로 저비용 버그 탐색을 시작한 뒤 Pro로 검증과 최종 정리를 맡기는 조합이 단일 모델보다 적합하다는 결론입니다.
실용적 조언
- 실제 버그와 예외 경로를 찾는 초기 점검에는 Flash를 먼저 투입하는 방식이 적합합니다. Flash는 Pro보다 약 9배 저렴한 요청 할당량으로 세 가지 기준 버그를 모두 찾았고 반복 실행도 안정적이었습니다. 다만 자동 코드 수정으로 이어지기 전에는 빈 필터 목록처럼 그럴듯한 허위 경보가 실제 코드에 존재하는지 확인해야 합니다.
- 구조 검토, 리팩터링 계획, 문서화, 정확한 줄 참조가 필요한 단계에는 Pro를 사용하는 편이 안전합니다. Pro는 169개 주장 모두에서 어려운 사실 오류가 없었고 구조적 문제를 더 폭넓게 포착했습니다. 한 번의 실행만으로 완전한 감사를 끝내지 말고, 결과 깊이의 변동을 줄이기 위해 두 번 실행하거나 Flash 결과와 교차 검증해야 합니다.
- 운영 흐름은 Flash의 저비용 스캔 뒤 Pro의 확인과 최종 정리로 구성하는 것이 권장됩니다. Pro가 Flash의 주장 약 70개를 확인하면서 실제 버그 두 건과 해석상 부정확성 세 건을 구분했기 때문에, 이 순서가 탐지 범위와 결과 신뢰도를 함께 높였습니다. 모델 출력이 실제 코드 변경을 유발할 때는 확인된 주장과 추정성 경고를 분리해 적용해야 합니다.
섹션별 상세
이미지 분석

이미지는 벤치마크 대상 프로젝트의 코드베이스 지식 그래프를 시각화한 자료로, 여러 모듈과 구성 요소 사이의 연결 구조를 한눈에 파악하게 합니다. 본문은 이 그래프를 약 7천 줄 규모의 다단계 콘텐츠 파이프라인을 검토하는 작업의 규모와 맥락을 보여주는 자료로 사용합니다.
Python과 PySide6 데스크톱 애플리케이션 코드베이스의 지식 그래프를 담은 스크린샷입니다.
용어 해설
- 실행 간 일관성(Run-to-run consistency)
- — 동일한 프롬프트와 도구를 사용해도 실행마다 결과의 깊이와 발견 항목이 얼마나 일정한지를 뜻합니다. 이 벤치마크에서는 같은 작업을 새 세션에서 반복해 모델 출력의 변동 폭을 비교했습니다.
- 잠재 버그(Latent Bug)
- — 현재 코드에 실제로 존재하지만 일반적인 실행이나 표면적인 검토에서는 드러나지 않는 결함입니다. 이 테스트에서는 사전에 수작업으로 확인한 세 가지 버그를 기준으로 모델이 스스로 찾아낸 개수를 측정했습니다.
- 주장 정확도(Claim Accuracy)
- — 모델 출력에서 추출한 개별 사실 주장이 실제 코드와 일치하는 비율입니다. 239개 원자적 주장을 익명화한 뒤 두 명의 검증자가 코드와 대조해 정확도와 오류 유형을 판정했습니다.
- 지침 준수(Instruction Adherence)
- — 프로젝트 내부 규칙이나 사용자 지시가 작업 요구와 충돌할 때 모델이 명시된 제한을 따르는 정도입니다. AGENTS.md가 수정하지 말라고 지정한 모듈을 대상으로 두 모델 모두 5점 만점에 5점을 기록했습니다.
- MCP 서버(MCP)
- — 코딩 에이전트가 파일 검색, 코드베이스 문맥 조회, 데이터베이스 질의 같은 외부 도구를 일관된 방식으로 호출하게 하는 연결 계층입니다. 이 벤치마크에서는 두 모델에 동일한 MCP 서버와 LSP 도구를 제공했습니다.
언급된 도구
동일한 프롬프트와 도구 환경에서 두 모델을 실행한 CLI coding agent
세션 간 코드베이스 문맥을 저장하고 조회하는 MCP 서버
Python 타입 검사와 정적 분석을 수행하는 LSP 도구
모델 출력에서 추출한 주장을 실제 코드와 대조한 제3의 검증 모델
복잡한 다단계 추론과 계획을 지원하는 MCP 서버
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.