본문으로 건너뛰기
HF Daily Papers조회 3

비교 진화로 스스로 개선하는 코딩 에이전트

MGM은 여러 task와 계통의 실패·성공 기록을 비교해 coding-agent scaffold를 더 정확하게 고칩니다.

용어 해설

반응 규범(Reaction Norm)
같은 유전자형이 서로 다른 환경에서 어떤 표현형을 내는지 나타내는 성능 패턴입니다. 이 논문에서는 하나의 coding agent가 여러 task에서 반복적으로 실패하거나 일관되지 않게 행동하는 기록을 비교해 task 우연과 agent 구조의 결함을 구분하는 진단 근거로 사용합니다.
계통 간 교배(Cross-Lineage Hybridization)
서로 다른 계통의 agent가 같은 task를 수행한 trajectory를 비교해 한쪽의 성공 또는 상호 보완적인 실패 패턴을 다른 계통의 수정에 활용하는 연산입니다. 소스 파일을 직접 합치지 않고 target agent가 전달 가능한 행동 특성을 추출해 자신의 코드 구조에 맞게 적용합니다.
Hamming 거리(Hamming Distance)
두 개의 같은 길이 벡터에서 서로 다른 위치의 개수를 세는 거리입니다. 시뮬레이션에서는 agent의 binary genotype과 oracle genotype 사이의 불일치 locus 수로 사용하며, 값이 0이면 모든 scaffold 능력이 oracle과 일치합니다.
Thompson Sampling
각 후보의 성공 확률에 대한 posterior에서 값을 무작위로 뽑아 탐색과 활용을 함께 수행하는 선택 방법입니다. MGM은 node와 subtree의 성공·실패 기록으로 Beta posterior를 만들고, 다음 evaluation 또는 expansion 대상을 결정하는 데 사용합니다.
가산 적합도 지형(Additive Fitness Landscape)
agent의 성능을 여러 독립적인 genotype 위치의 정답 여부로 표현하는 통제된 모델입니다. 각 task는 특정 locus 묶음이 모두 올바른지로 성공이 결정되고, self-modification은 관찰된 실패를 근거로 일부 locus를 수정해 oracle까지의 Hamming 거리를 줄입니다.
유전자형과 표현형(Genotype–Phenotype)
여기서 genotype은 agent의 실행 가능한 source code와 보조 scaffold이고 phenotype은 task를 실행한 trajectory와 성공·실패 결과입니다. MGM은 archive에 두 정보를 함께 저장해 코드 자체를 직접 해석하기보다 여러 환경에서 드러난 행동 차이를 self-modification의 입력으로 사용합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 07.수집 2026. 08. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.