본문으로 건너뛰기

Kimi K3, GPT 5.6 Sol, DeepSeek v4 Flash, Qwen 3.6 27B의 회로 설계 벤치마크 결과

네 개 LLM을 동일한 회로 설계 과제로 비교한 결과 Kimi K3와 GPT 5.6 Sol이 상대적으로 안정적인 설계를 제공했고 DeepSeek와 Qwen은 반복 시도와 설계 전략에서 실패가 잦았다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 네 개의 LLM을 동일한 회로 설계 과제로 벤치마크하여 활성 밴드패스 필터(30 Hz 및 25 kHz 컷오프)와 입력 80V AC에서 +17.3V 및 -3.7V를 만드는 전원부 설계를 비교했다. 밴드패스 과제에서는 모든 모델이 유효한 회로를 제안했으나 Kimi K3와 GPT 5.6 Sol은 한 번의 응답으로 정확한 해를 제시했고 DeepSeek와 Qwen은 반복 질의가 필요했다. 전원부 과제에서는 Kimi K3가 반복 보정 후 목표 전압을 달성한 반면 GPT 5.6 Sol은 양의 레일만 정확했고 DeepSeek와 Qwen은 SMPS 시도에서 실패가 발생했다. 이러한 결과는 회로 설계 검증에 시뮬레이션과 반복 보정이 필수적임을 시사한다.

실용적 조언

  • 벤치마크나 검증을 할 때 의도적으로 흔하지 않은 설계 수치와 요구조건을 사용하면 모델이 기존 웹 설계를 그대로 인용하는 것을 어느 정도 방지할 수 있다.
  • LLM이 제안한 회로는 반드시 회로 시뮬레이터로 재검증하고, 특히 전원부와 같이 안정성이 필요한 부분은 반복적 보정과 추가 요구조건을 통해 설계를 강화해야 한다.
  • 한 모델이 한 번에 완성된 설계를 제시하더라도 음의 레일처럼 미세한 목표에서는 드리프트나 안정성 문제를 확인해야 하므로 실무 적용에는 충분한 시험과 여유 설계가 필요하다.

섹션별 상세

01
첫 번째 비교 과제는 활성 밴드패스 필터 설계로서 목표 컷오프 주파수는 저역 30 Hz와 고역 25 kHz였다. 입력으로 주파수 목표와 op-amp 기반 회로 구성 제약을 주었고, 각 모델은 회로 토폴로지와 소자값을 제안하는 방식으로 출력했다. 실험 결과 모든 모델이 밴드패스 설계를 충족하는 회로를 제시했으나 Kimi K3와 GPT 5.6 Sol은 한 번의 응답으로 정확한 주파수 응답을 제시한 반면 DeepSeek v4 Flash와 Qwen 3.6 27B은 여러 번의 반복 질의를 거쳐야 올바른 응답에 도달했다.
LTspice 화면 캡처로서 활성 밴드패스 필터와 전원부 회로가 배치된 회로도와 관련 텍스트 주석을 포함하고 있다.
Screenshot이미지는 회로 토폴로지와 op-amp 연결, 전원 레일 연결 상태를 시각적으로 보여주며 설계자가 시뮬레이션으로 검증한 회로 구성을 확인할 수 있다. 이미지의 텍스트에는 컷오프 주파수(30 Hz 및 25 kHz)와 전원부 목표(+17.3V, -3.7V) 같은 실험 조건이 명시되어 있어 벤치마크 결과와 직접적으로 연결되는 근거를 제공한다.
02
두 번째 비교 과제는 입력 80V AC에서 출력 +17.3V DC와 -3.7V DC를 얻는 전원부 설계였으며 설계 제약은 양쪽 레일을 모두 얻는 것이었다. 각 모델은 변압·정류·레귤레이터 또는 스위칭 회로 등 서로 다른 접근을 제안했고 Kimi K3는 반복 시도 끝에 단순 정류와 스텝다운 레귤레이터를 조합하여 목표 전압을 달성한 회로를 제시했다. GPT 5.6 Sol은 양의 레일 +17.3V는 정확히 설계했으나 음의 레일은 목표에 이르지 못하고 전압이 drift하는 문제가 관측되었고 DeepSeek 및 Qwen은 스위치 모드 전원(SMPS) 구성 시도에서 구조적 실패가 발생했다.
03
모델별 접근 방식 차이는 응답 반복성 및 설계 전략에서 명확히 드러났으며 일부 모델은 한 번에 완성된 솔루션을 제시하고 일부는 반복적 수정을 필요로 했다. Kimi K3와 GPT 5.6 Sol은 회로 토폴로지를 바로 결정하고 적절한 소자값을 제시하는 경향을 보였고 DeepSeek와 Qwen은 초기 설계에서 더 공격적인 구조(예: 펄스 발생기 기반 SMPS)를 선택하여 안정성 문제로 이어졌다. 이러한 차이는 실험자가 초기에 제시한 '이상한' 수치 사용 의도와 맞물려 웹에서 이미 존재하는 설계의 단순 재사용을 회피하도록 만든 조건에서 관찰되었다.
04
종합적으로 보면 설계 과제별로 모델의 강점과 한계가 달랐으며 특히 전원부처럼 물리적 안정성 요구가 높은 과제에서 성능 차이가 커졌다. 한 번에 정확한 설계 제안 능력은 실무에서 빠른 프로토타입 생성에 유리하지만 음의 레일처럼 민감한 목표에서는 반복적 검증과 보정이 필요하다는 점이 드러났다. 실험자는 모델이 제안한 솔루션을 회로 시뮬레이션으로 검증하고 수정하는 과정이 필수적임을 관찰했다.

용어 해설

벤치마킹(Benchmarking)
벤치마킹은 여러 시스템을 동일한 조건과 과업으로 비교하여 성능을 계량화하는 절차로서 입력 데이터와 평가 기준을 고정하고 각 시스템의 출력 정확도, 반복성, 필요 반복 횟수 등을 측정하는 방식으로 수행된다.
추론(인퍼런스)(Inference)
Inference는 학습된 모델이 주어진 입력으로부터 출력 결과를 생성하는 과정으로서 지연(latency), 반복 호출 시의 안정성, 그리고 설계 문제에 대한 일회성 해답 제공 능력과 반복적 개선 능력으로 평가되는 작업이다.
평가 지표(Evaluation Metric)
평가 지표는 비교 실험에서 성능을 수치화하는 기준으로서 회로 설계의 경우 목표 주파수와 출력 전압의 정확도, 반복 시도 횟수, 설계 완성도 같은 정량적·정성적 항목을 포함하여 해석한다.

언급된 도구

Kimi K3추천

회로 설계 과제에 응답하는 LLM

GPT 5.6 Sol추천

회로 설계 과제에 응답하는 LLM

DeepSeek v4 Flash비추천

회로 설계 과제에 응답하는 LLM

Qwen 3.6 27B비추천

회로 설계 과제에 응답하는 LLM

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 21.수집 2026. 07. 21.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.