본문으로 건너뛰기

외부 메모리가 다른 원 배치를 찾은 기록

고정 언어 모델과 외부 메모리가 기존 해와 비동형인 26개 원 배치를 찾았지만 메모리 효과의 대조 실험은 남아 있습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Dropstone 연구진은 고정된 언어 모델이 이전 시도의 요약을 저장하는 외부 메모리와 결합된 상태에서, 26개 원을 단위 정사각형에 배치하는 탐색 문제의 기존 해와 다른 접촉 그래프를 산출한 한 사례를 기록했습니다. 최종 배치는 반지름 합 2.635917599028과 최대 제약 위반량 2.78e-17을 기록했지만, 여섯 개의 공개 결과가 이 점수를 넘으며 메모리 루프만의 최고 점수도 2.635907462261입니다. 저자들은 91회 시도와 214,223바이트의 reasoning trace를 공개하고, 48개 접촉 간선과 다른 차수 수열을 이용해 기록군과의 비동형성을 확인했습니다. 다만 메모리 없는 동일 예산의 반복 실험을 아직 수행하지 않았고 메모리 루프 구현도 공개하지 않아, 외부 메모리가 새로운 탐색 분지로의 이동을 일으켰다는 일반적 결론은 아직 성립하지 않습니다.

섹션별 상세

01
이 연구는 외부 메모리를 사용하는 고정 언어 모델이 공개된 해를 그대로 검색하거나 현재 최선 해를 국소적으로 다듬는 대신 다른 탐색 분지에 도달했는지 확인하려는 실험입니다. 저자들은 이를 검색 결과 재현이 아닌 독립성, 보간을 벗어난 구조, 현재 incumbent에서의 국소 하강 경로 부재, 정확한 검증이라는 네 조건으로 나눴습니다. 이 가운데 모델이 학습 데이터에서 좌표를 검색하지 못했다는 판단은 trace 속 자기 보고에 의존하므로 가장 약한 근거로 취급했습니다.
02
최종 파일 pack26-discovery/gen3b-best.json은 26개 원의 좌표와 반지름으로 구성되며 반지름 합 2.635917599028, 최대 제약 위반량 2.78e-17을 기록했습니다. 동일한 원 배치 문제에서 AlphaEvolve는 2.63586276, FICO Xpress는 2.63591551을 기록했지만, Packomania 기록 2.635983084919와 ShinkaEvolve 2.635983283 등 여섯 결과가 더 높은 점수를 냈습니다. 따라서 이 결과의 중심은 최고 점수나 기록 경신이 아니라 공개 해와 다른 구조를 정확한 산술로 확인한 데 있습니다.
단위 정사각형 안에 배치한 26개 원 두 구성을 좌우로 비교하는 그림입니다.
Diagram왼쪽 자체 배치는 청록색, 오른쪽 기록군은 주황색으로 표시되며 각 원 사이의 접촉 간선이 겹쳐 있습니다. 그림 하단에는 자체 배치가 반지름 합 2.635917599028, 접촉 48개, 벽 접촉 14개이고 기록군이 2.635983084919, 접촉 58개, 벽 접촉 20개라는 수치가 적혀 있습니다. 시각적 비교는 자체 배치가 기록군보다 접촉 구조가 성기다는 본문의 구조 비교와 연결됩니다.
03
저자들은 1e-7 접촉 기준으로 자체 배치의 접촉 간선 48개와 벽 접촉 14개를 기록군의 58개와 20개에 비교했습니다. 자체 배치의 차수 수열은 22222333334444444444555556이고 기록군은 22333444444444455556666667이므로, 재라벨링해도 보존되는 차수 수열이 달라 두 접촉 그래프가 비동형임을 판정할 수 있습니다. 자체 배치는 기록군과 비슷한 목적값을 유지하면서 접촉 간선이 열 개, 벽 접촉이 여섯 개 적은 더 성긴 구조입니다.
자체 26개 원 배치와 기록군의 접촉 그래프를 동일한 인덱스 기준으로 겹쳐 비교한 도식입니다.
Diagram왼쪽의 Ours와 오른쪽의 Record family는 각각 원의 위치와 접촉 간선을 함께 표시합니다. 자체 배치에는 48개 접촉과 14개 벽 접촉, 기록군에는 58개 접촉과 20개 벽 접촉이 나타나며 색이 다른 간선이 두 구조의 차이를 드러냅니다. 이 그림은 인덱스 matching에 따른 비교라서, 재라벨링에 영향을 받지 않는 차수 수열 비교보다 약한 구조 비교라는 본문의 조건도 함께 반영합니다.
두 원 배치에서 원 하나가 접촉하는 다른 원의 수를 차수별로 비교한 막대그래프입니다.
Chart자체 배치는 차수 2와 3의 원이 각각 5개, 차수 4가 10개, 차수 5가 5개, 차수 6이 1개이며 차수 7은 없습니다. 기록군은 차수 2가 2개, 3이 3개, 4가 10개, 5가 4개, 6이 6개, 7이 1개로 더 높은 차수에 집중됩니다. 두 차수 수열이 다르다는 사실은 원의 라벨을 바꿔도 유지되므로 접촉 그래프가 비동형이라는 판정의 직접 근거가 됩니다.
04
현재 incumbent는 26개 원이 모두 접촉하는 LP 검증 국소 최적해였고, 여기에 500초 동안 perturbation과 simulated annealing을 적용해 약 3e-7의 개선만 얻었습니다. 우승 배치 방향으로 시험한 모든 국소 이동은 목적값을 낮췄으므로, 기록된 실험 안에서는 incumbent에서 새 배치로 이어지는 내림 경로가 확인되지 않았습니다. 다만 원 배치 문제 자체가 여러 탐색 분지를 갖기 때문에 다른 접촉 그래프의 발견만으로 외부 메모리의 인과적 효과를 확정할 수는 없습니다.
05
91회 시도는 32.4시간 동안 진행됐고 73회는 유효, 18회는 무효였으며 무효 시도는 모두 0점을 받았습니다. 최선 점수는 2번의 2.080에서 시작해 77번 시도에서 2.627796에서 2.635871로 크게 상승했고, 이후 79번의 2.635903과 84번의 2.635907로 이어졌습니다. 외부 메모리가 누적되면서 AVOID 기록이 길고 구체적으로 변했지만 후반에도 무효 시도가 남아 오류가 단조롭게 줄었다고 볼 수는 없습니다.
06
최종 점수는 하나의 구성 요소가 단독으로 만든 결과가 아닙니다. 메모리 루프의 최고 점수는 2.635907462261이었고, 이후 사람이 작성한 LP 반지름 최적화와 구조 재배치가 2.635912195016으로 올렸으며, 모델 호출이 없는 seed와 parent sweep이 최종 2.635917599028을 만들었습니다. 따라서 AlphaEvolve와 Friedman 2012에 대한 메모리 루프의 격차는 루프 결과에 이미 들어 있지만, FICO Xpress를 넘은 2.09e-6의 격차를 메모리 루프만의 성과로 표현할 수 없습니다.
07
가장 중요한 대조 실험은 동일한 내부 평가 예산을 쓰는 memory-free random restart입니다. 저자들은 이 실험에서 2.63586276에 도달하는 횟수와 자체 배치의 차수 수열 22222333334444444444555556을 얻는 횟수를 세어야 한다고 적었지만 아직 실행하지 않았습니다. 다른 문제의 기록을 섞어 제공하는 shuffled-memory 실험과 계획 대비 실제 프로그램의 일치율을 측정하는 fidelity 실험도 외부 메모리의 내용 효과와 단순한 추가 문맥 효과를 가르는 데 필요합니다.

용어 해설

접촉 그래프(Contact Graph)
원형 배치에서 서로 맞닿은 원을 꼭짓점과 간선으로 표현한 구조입니다. 각 원은 꼭짓점이 되고, 두 원의 거리가 반지름 합과 같으면 접촉 간선이 됩니다. 원의 배치가 기존 해와 구조적으로 같은지 비교하는 데 쓰입니다.
국소 하강(Local Descent)
현재 해 주변에서 목적함수를 점진적으로 개선하는 탐색 방식입니다. 인접한 상태로 이동할 때마다 점수가 좋아지는 경로를 따라가므로 현재 해가 속한 탐색 분지 안의 개선에 적합합니다. 다른 접촉 그래프에 도달하려면 먼저 점수가 낮아지는 이동이 필요할 수 있다는 한계가 있습니다.
테스트 시점 학습(Test-Time Learning)
모델 가중치를 다시 학습하지 않고 실행 중 얻은 피드백이나 경험을 이후 입력에 반영하는 방식입니다. 이 글에서는 고정된 언어 모델이 시도 결과를 외부 메모리에 기록하고 다음 프로그램 생성 때 관련 기록을 검색합니다. 가중치 변경 없이 반복 시도의 전략을 누적한다는 점이 핵심입니다.
정확 산술(Exact Arithmetic)
부동소수점 오차에 의존하지 않고 제약 조건을 엄밀한 산술 기준으로 검사하는 계산 방식입니다. 이 글의 verifier는 모든 원이 단위 정사각형 안에 있고 서로 겹치지 않는지 확인하며 최대 제약 위반량을 산출합니다. 보고된 배치의 독립 검증과 허용오차 비교에 사용됩니다.
상보적 학습 시스템(Complementary Learning Systems)
반복 경험에서 일반 패턴을 느리게 추출하는 학습 체계와 개별 사건을 빠르게 보존하는 기억 체계가 서로 다른 역할을 맡는다는 이론입니다. 저자들은 고정 모델과 외부 episodic memory의 조합을 이 관점에서 설계했습니다. 다만 생물학적 hippocampus를 구현했다거나 이론 자체를 새롭게 검증했다고 주장하지는 않습니다.

기술

  • JavaScript
  • Node 18+
  • SLSQP
  • simulated annealing
  • LP
  • AlphaEvolve
  • FICO Xpress
  • ShinkaEvolve
  • OpenEvolve
  • ThetaEvolve

활용 사례

  • 검증 가능한 수학적·알고리즘적 발견
  • 고정 언어 모델의 반복 코드 생성
  • 실패 기록을 활용한 program search
  • 외부 메모리의 provenance와 integrity 평가
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 31.수집 2026. 08. 31.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.