본문으로 건너뛰기

로컬 코딩 모델 7종의 레시피북 제작 벤치마크

동일한 4단계 웹 제작 작업에서 Qwen 3.6 35B가 페이지 연결과 도구 호출을 가장 안정적으로 처리했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Lemonade의 OpenAI 호환 API와 자체 harness로 7개 로컬 모델에 동일한 4단계 레시피북 제작 작업을 맡겼습니다. 모델들은 도구 호출과 공통 .md 파일을 활용한 연속 작업에는 대체로 성공했지만, 여러 HTML 페이지를 index.html에 연결하는 구조에서 반복적으로 실패했습니다. Qwen 3.6 35B가 기능·디자인·도구 호출을 모두 충족해 우승했으며, Deepseek V4 Flash는 Q2 양자화에서도 짧고 안정적인 추론과 뛰어난 도구 호출로 높은 평가를 받았습니다. 반면 Qwen3.8 27B는 외형은 좋았지만 독립 HTML만 생성했고, Nemotron 3.5 Lightning 30B는 빠른 Q8 실행 가능성에 비해 코딩과 추론 품질이 낮았습니다.

실용적 조언

  • 여러 단계의 코딩 작업을 평가할 때는 공통 .md 파일에 프로젝트 구조와 경로를 기록하면 새 채팅 컨텍스트에서도 이전 작업을 이어 가는 데 도움이 됩니다. 이 글의 실험에서는 대부분의 모델이 64K 이하의 컨텍스트에서 기존 작업을 이어 갔습니다. 다만 harness가 전달하는 폴더 경로가 실제 작업 경로와 일치하는지 먼저 점검해야 중첩 폴더로 인한 혼란을 줄일 수 있습니다.
  • 웹사이트 생성 모델을 비교할 때는 시각적 완성도만 보지 말고 index.html에서 모든 페이지에 실제로 접근할 수 있는지, 후속 프롬프트가 기존 파일을 수정하는지, 도구 호출 실패 뒤 작업을 재개하는지를 따로 기록하는 편이 적절합니다. 이 벤치마크에서는 Qwen3.8 27B처럼 외형은 좋지만 페이지 연결을 빠뜨린 사례가 있었습니다. 미리보기 단계에서 콘솔뿐 아니라 실제 탐색 경로까지 검증하면 이런 구조적 실패를 더 분명하게 구분할 수 있습니다.

섹션별 상세

01
작성자는 동일한 4개 프롬프트를 새 채팅 컨텍스트에서 7개 로컬 모델에 순서대로 입력하고, 오류를 모델이 잡지 못했을 때만 수정 요청을 추가했습니다. Windows에서 직접 만든 harness와 Lemonade의 OpenAI 호환 API를 사용했으며, 파일 생성·수정용 도구 호출과 HTML 미리보기를 포함했습니다. 다만 미리보기는 콘솔 확인에만 쓰였고 모델이 결과물을 직접 검증하지 못했으며, 폴더명이 중복되는 harness 문구 버그도 모든 모델에 동일하게 적용했습니다.
02
레시피북 작업은 index.html로 접근하는 환영 페이지와 양파 재료 페이지를 만든 뒤 감자·콩 재료 페이지, 콩·감자·양파 레시피와 팬케이크 레시피를 차례로 추가하는 방식이었습니다. 마지막에는 각 모델에 환영 페이지나 특정 문장을 짧게 수정하도록 요청해 기존 구조를 이어받는 능력과 변경 처리 속도를 비교했습니다. 모든 모델이 도구 호출 자체는 대체로 수행했지만, 여러 페이지를 한 사이트 안에서 연결하는 과정에서는 대부분 길게 사고를 반복하거나 구조를 잃었습니다.
03
Qwen 3.6 35B가 이 조건에서 유일하게 완전히 작동하는 결과물을 만들었고, 도구 호출 오류 없이 귀여운 디자인과 페이지 연결을 유지했습니다. 다만 중첩 폴더를 생성한 뒤 후속 확장에서 경로를 혼동해 작성자가 경로 문구를 다시 바꿔야 했습니다. 반대로 Qwen3.8 27B는 외형은 가장 나아 보였지만 각 페이지를 독립 HTML로 만들어 index.html에서 접근할 수 없었고, 이후 수정 요청을 별도로 받은 결과는 공정한 비교에서 제외됐습니다.
04
작성자는 Deepseek V4 Flash를 짧지도 길지도 않은 추론과 뛰어난 도구 호출을 가진 상위권 모델로 평가했으며, 12 tokens per second를 넘겼다면 일상용으로 고려했을 것이라고 적었습니다. Ling 3.0 Flash는 문자 그대로의 프롬프트 준수는 강했지만 도구 호출이 몇 차례 실패하자 응답을 멈췄고, Laguna S2.1은 긴 자기수정 반복 뒤 두 번째 페이지만 로드되는 결과를 만들었습니다. Nemotron 3.5 Lightning 30B는 Q8 실행 속도와 통합 시스템 적합성은 긍정적이었지만 코딩 능력과 추론, SVG 일러스트 품질은 낮게 평가됐습니다.

용어 해설

양자화(Quantization)
모델 가중치를 더 적은 비트로 표현해 메모리 사용량을 줄이는 기법입니다. 이 글에서는 Q2, Q4, Q8처럼 서로 다른 양자화 수준으로 모델을 로컬에서 실행하고, 품질과 속도의 차이를 비교하는 기준으로 쓰였습니다.
도구 호출(Tool Calls)
모델이 파일 생성·수정이나 명령 실행 같은 외부 도구를 호출해 작업을 수행하는 방식입니다. 이 벤치마크에서는 웹사이트 파일을 만들고 고치는 과정에서 호출 성공 여부와 오류 대응을 함께 평가했습니다.
컨텍스트 창(Context Window)
모델이 한 세션에서 처리할 수 있는 대화와 작업 정보의 범위입니다. 글에서는 공통 Markdown 파일을 프로젝트 기억으로 사용해 여러 단계의 작업을 이어 가면서 대부분 64K 이하의 컨텍스트를 유지했습니다.
전문가 혼합 구조(Mixture of Experts)
여러 전문가 모듈 가운데 일부만 선택해 입력을 처리하는 모델 구조입니다. Nemotron 3.5 Lightning 30B는 30B MoE 모델로 소개됐으며, 작성자는 통합 메모리 시스템에서 Q8로 실행할 수 있는 빠른 모델이라는 점을 평가했습니다.

언급된 도구

Lemonade중립

Windows에서 작성자가 만든 harness와 연결해 로컬 모델을 OpenAI 호환 API로 실행하는 데 사용됐습니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.