본문으로 건너뛰기

AutoBe: 엔드투엔드 백엔드 생성을 위한 새로운 벤치마크 공개

자연어 요청 한 번으로 요구사항 분석부터 SDK까지 생성하는 AutoBe 벤치마크에서 GLM 5와 Qwen 3.5가 우수한 성능을 기록했다.

커뮤니티 반응

작성자가 제시한 구조화된 평가 방식에 대해 긍정적인 반응이며, 특히 로컬 모델의 선전에 주목하고 있습니다.

주요 논점

01찬성다수

구조화된 함수 호출 방식이 모델의 코딩 능력을 객관적으로 측정하는 데 효과적이다.

02중립소수

벤치마크 데이터셋이 4개로 적어 일반화하기에는 아직 이르다는 신중한 입장이다.

합의점 vs 논쟁점

합의점

  • 정적 분석을 통한 자동 채점 방식이 평가의 객관성을 높였다는 점에 동의한다.
  • 하네스 설계가 모델 성능만큼이나 결과물 품질에 중요하다는 점을 인정한다.

논쟁점

  • 특정 함수 호출 패턴에 익숙한 모델이 실제 코딩 실력보다 과대평가되었을 가능성이 제기된다.

실용적 조언

  • 백엔드 생성 시 비정형 코드 생성보다 스키마 기반의 함수 호출을 활용하면 품질을 높일 수 있다.
  • Qwen 3.5와 같은 고성능 오픈소스 모델을 활용해 비용 효율적인 개발 파이프라인 구축이 가능하다.

섹션별 상세

AutoBe 벤치마크는 자연어 요청을 기반으로 요구사항 분석, ERD, OpenAPI 명세, E2E 테스트, NestJS 구현, 타입 세이프 SDK 등 총 6가지 결과물을 생성한다. 각 단계는 비정형 코드를 생성하는 대신 구조화된 함수 호출을 통해 미리 정의된 AST를 채우는 방식으로 작동한다. 정적 분석을 기반으로 한 100점 만점의 채점 루브릭을 사용하여 누가 실행하더라도 동일한 점수가 나오도록 설계되었다. 이러한 구조적 접근은 모델의 단순 생성 능력을 넘어 시스템 설계 역량을 측정하는 데 중점을 둔다.
벤치마크 결과 GLM 5가 1위를 차지했으며 Qwen 3.5-27B 모델이 최상위권 모델들의 바로 뒤를 잇는 놀라운 성능을 보였다. 일부 로컬 모델들도 엔터프라이즈급 백엔드를 생성하며 100% 컴파일 성공률을 기록하는 성과를 거두었다. 작성자는 하네스가 구조화되어 있다면 백엔드 생성 품질은 모델의 명성보다 하네스 설계 자체에 더 큰 영향을 받는다고 분석했다. 이는 적절한 프레임워크가 뒷받침될 경우 중소형 모델로도 충분히 실무 수준의 코드를 생성할 수 있음을 시사한다.
프론티어 모델을 사용한 전체 벤치마크 실행 비용은 모델당 약 1,000달러에서 1,500달러에 달하는 것으로 나타났다. 이에 따라 다음 라운드에서는 입력 토큰당 0.25달러 이하의 저비용 모델이나 64GB 통합 메모리 노트북에서 실행 가능한 로컬 모델로 대상을 한정할 계획이다. 현재 상위권에 포진한 모델들 대부분이 이미 이 기준을 충족하고 있어 비용 효율적인 AI 개발 환경 구축이 가능함을 보여준다. 다만 4개의 참조 프로젝트만을 사용했기에 절차적 함수 호출 지시를 잘 따르는 모델에 유리할 수 있다는 한계가 존재한다.

용어 해설

함수 호출(Function Calling)
LLM이 외부 도구나 API를 실행하기 위해 필요한 인자값을 구조화된 데이터 형식으로 생성하는 기술이다. 모델이 비정형 텍스트 대신 미리 정의된 스키마에 맞춰 출력하도록 유도하여 시스템 간 상호운용성을 높인다.
추상 구문 트리(AST)
프로그래밍 언어로 작성된 소스 코드의 구조를 트리 형태로 표현한 자료구조이다. AutoBe 벤치마크에서는 모델이 생성한 결과물을 정형화된 트리 구조에 채워 넣음으로써 정적 분석과 평가를 용이하게 한다.
정적 분석(Static Analysis)
프로그램을 실제로 실행하지 않고 코드 자체를 분석하여 오류나 구조적 결함을 찾아내는 방법이다. 이 벤치마크에서는 100점 만점의 채점 기준을 정적 분석으로 자동화하여 평가의 객관성과 재현성을 확보했다.

언급된 도구

NestJS추천

백엔드 구현 프레임워크

OpenAPI중립

API 명세 정의

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 04.수집 2026. 05. 04.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.