본문으로 건너뛰기

EdgeBench: 실제 환경 상호작용에서 관찰된 로그-시그모이드 학습 법칙과 장시간 에이전트 학습 속도

134개 실제 과제와 약 38,000시간의 에이전트 상호작용을 분석한 결과 평균 성능은 로그-시그모이드 함수로 시간에 따라 예측 가능하며 최신 모델 세대에서는 학습속도가 약 세 달마다 두 배로 증가했다.

용어 해설

로그-시그모이드 스케일링 법칙(Log-Sigmoid Scaling Law)
환경 상호작용 시간 t에 대한 평균 성능 S(t)를 Smax/(1+(t_mid/t)^β)로 모델링하는 함수 형태로, 시간 로그 좌표에서 급격한 전이와 포화를 동시에 설명하여 장시간 학습 곡선을 정량화한다.
프런티어 확장 프로세스(Frontier Expansion)
작업을 점수 단위 노드의 그래프로 보고 이미 획득된 단위가 이웃의 잠긴 단위를 영향으로 잠금 해제하면서 전선(frontier)이 확장되는 동적 과정으로, 집단 평균에서 로그 시간의 시그모이드 곡선을 유도하는 기작이다.
심사자 기반 피드백(Judge-mediated Feedback)
로컬 검증으로 얻는 빠른 피드백과 제출을 통해 은닉 데이터로 평가하는 외부 심사자 피드백을 병렬로 운영해 에이전트가 오버피팅을 피하면서 실질적 개선을 학습하도록 만드는 평가 프로토콜 구성이다.
작업 그래프(Task Graph)
성과를 구성하는 여러 점수 단위를 노드로 보고 단위 간 영향도를 엣지로 표현한 잠재 그래프이며, 그래프 구조와 혼합 성질이 학습 전개 속도와 로그 시간 좌표의 성질을 결정한다.
상호작용 수평선(인터랙션 호라이즌)(Interaction Horizon)
단일 과제에 대해 에이전트가 연속적으로 작업할 수 있는 시간 길이로, EdgeBench에서는 최소 12시간을 기준으로 삼아 장시간 학습 동역학을 관찰하도록 설계되었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 06.수집 2026. 07. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.