TL;DR
Dropstone 연구진은 고정된 언어 모델이 이전 시도의 요약을 저장하는 외부 메모리와 결합된 상태에서, 26개 원을 단위 정사각형에 배치하는 탐색 문제의 기존 해와 다른 접촉 그래프를 산출한 한 사례를 기록했습니다. 최종 배치는 반지름 합 2.635917599028과 최대 제약 위반량 2.78e-17을 기록했지만, 여섯 개의 공개 결과가 이 점수를 넘으며 메모리 루프만의 최고 점수도 2.635907462261입니다. 저자들은 91회 시도와 214,223바이트의 reasoning trace를 공개하고, 48개 접촉 간선과 다른 차수 수열을 이용해 기록군과의 비동형성을 확인했습니다. 다만 메모리 없는 동일 예산의 반복 실험을 아직 수행하지 않았고 메모리 루프 구현도 공개하지 않아, 외부 메모리가 새로운 탐색 분지로의 이동을 일으켰다는 일반적 결론은 아직 성립하지 않습니다.
섹션별 상세



용어 해설
- 접촉 그래프(Contact Graph)
- — 원형 배치에서 서로 맞닿은 원을 꼭짓점과 간선으로 표현한 구조입니다. 각 원은 꼭짓점이 되고, 두 원의 거리가 반지름 합과 같으면 접촉 간선이 됩니다. 원의 배치가 기존 해와 구조적으로 같은지 비교하는 데 쓰입니다.
- 국소 하강(Local Descent)
- — 현재 해 주변에서 목적함수를 점진적으로 개선하는 탐색 방식입니다. 인접한 상태로 이동할 때마다 점수가 좋아지는 경로를 따라가므로 현재 해가 속한 탐색 분지 안의 개선에 적합합니다. 다른 접촉 그래프에 도달하려면 먼저 점수가 낮아지는 이동이 필요할 수 있다는 한계가 있습니다.
- 테스트 시점 학습(Test-Time Learning)
- — 모델 가중치를 다시 학습하지 않고 실행 중 얻은 피드백이나 경험을 이후 입력에 반영하는 방식입니다. 이 글에서는 고정된 언어 모델이 시도 결과를 외부 메모리에 기록하고 다음 프로그램 생성 때 관련 기록을 검색합니다. 가중치 변경 없이 반복 시도의 전략을 누적한다는 점이 핵심입니다.
- 정확 산술(Exact Arithmetic)
- — 부동소수점 오차에 의존하지 않고 제약 조건을 엄밀한 산술 기준으로 검사하는 계산 방식입니다. 이 글의 verifier는 모든 원이 단위 정사각형 안에 있고 서로 겹치지 않는지 확인하며 최대 제약 위반량을 산출합니다. 보고된 배치의 독립 검증과 허용오차 비교에 사용됩니다.
- 상보적 학습 시스템(Complementary Learning Systems)
- — 반복 경험에서 일반 패턴을 느리게 추출하는 학습 체계와 개별 사건을 빠르게 보존하는 기억 체계가 서로 다른 역할을 맡는다는 이론입니다. 저자들은 고정 모델과 외부 episodic memory의 조합을 이 관점에서 설계했습니다. 다만 생물학적 hippocampus를 구현했다거나 이론 자체를 새롭게 검증했다고 주장하지는 않습니다.
기술
- JavaScript
- Node 18+
- SLSQP
- simulated annealing
- LP
- AlphaEvolve
- FICO Xpress
- ShinkaEvolve
- OpenEvolve
- ThetaEvolve
활용 사례
- 검증 가능한 수학적·알고리즘적 발견
- 고정 언어 모델의 반복 코드 생성
- 실패 기록을 활용한 program search
- 외부 메모리의 provenance와 integrity 평가
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

