Mirror Descent로 Attention 성능 극대화: 토큰 선택의 새로운 지평
Softmax Attention 메커니즘에서 Mirror Descent 알고리즘의 수렴 특성과 암묵적 편향을 분석하여 lp 노름 기반의 일반화된 최대 마진 SVM으로의 수렴을 증명했다.
머신러닝 분야의 저명한 학술지인 Journal of Machine Learning Research의 최신 연구 논문과 이론적 연구 결과를 제공합니다.
Softmax Attention 메커니즘에서 Mirror Descent 알고리즘의 수렴 특성과 암묵적 편향을 분석하여 lp 노름 기반의 일반화된 최대 마진 SVM으로의 수렴을 증명했다.
가우시안 베이지안 네트워크의 한계화 문제를 해결하는 새로운 그래프 구조를 제안하고, 잠재 변수 모델 최적화와 신경망 학습 사이의 이중성을 입증하여 효율적인 인과 추론 알고리즘을 제시한다.
해밀턴 동역학의 심플렉틱 오일러 방법을 활용하여 교대 미러 하강법(AMD)의 수정된 해밀턴 보존량을 분석하고 개선된 후회도 및 이중성 격차 경계를 제시한다.
비음수 직교 제약 조건을 활용해 비지도 특성 선택과 스펙트럴 클러스터링을 결합하고 알고리즘의 수렴성을 이론적으로 증명한 연구이다.
생물학적 뉴런의 활동을 Hawkes processes로 모델링하고 국소적 학습 규칙만으로 분류 작업을 수행할 수 있음을 수학적으로 증명한 연구이다.
경험적 가능도를 활용하여 소규모 샘플 환경에서도 문맥적 밴딧 정책의 가치를 정확히 평가하고 불확실성을 정량화하는 베이지안 추론 방법이 개발됐다.
전방 강도 함수를 활용하여 동적 예측 변수를 포함한 대규모 시계열 데이터의 이벤트 발생 시간 예측과 불확실성을 효율적으로 정량화하는 프레임워크를 설계했습니다.
순차적 데이터 업데이트 환경에서 변분 근사를 활용한 베이지안 사후 분포가 전체 데이터를 한꺼번에 처리한 결과와 점근적으로 동일함을 수학적으로 증명했다.
확산 모델이 데이터의 분해 가능한 저차원 구조를 활용하여 비모수적 밀도 추정에서 최적의 수렴 속도를 달성함을 이론적으로 증명했다.
유한한 너비와 깊이의 신경망을 가우시안 프로세스 혼합 모델로 근사하고 바세르슈타인 거리를 통해 수학적으로 증명 가능한 오차 범위를 제공하는 프레임워크를 제안한다.
딥러닝 모델의 예측 유효성을 실시간 모멘트 기반 투영으로 감지하여 불필요한 재학습을 방지하고 연산 효율을 극대화하는 프레임워크를 제안한다.
과매개변수화된 선형 회귀에서 릿지리스 보간기의 고차원 분포를 가우시안 시퀀스 모델과 연결하여 정밀하게 규명하고 일반화된 리스크와 교차 검증의 최적성을 증명했다.
성향 점수 정렬과 퓨즈드 라쏘를 결합하여 데이터 적응형 소그룹을 형성하고 이질적 처치 효과를 해석 가능하게 추정하는 방법론을 제안한다.
복소수 뉴런이 실수 뉴런보다 표현력이 뛰어남을 이론적으로 규명하고, 위상 재매개변수화를 통해 학습 수렴 속도를 선형 수준으로 개선하는 방법을 제시한다.
엔트로피 정규화를 도입하여 기존 평균장 변분 추론의 독립성 가정을 완화하고, Sinkhorn 알고리즘을 통해 계산 효율성과 통계적 정확도를 동시에 확보한 Xi-변분 추론(Xi-VI) 방법론을 제안한다.
중첩된 데이터 구조를 가진 계층적 환경에서 인과 추론을 수행하기 위해 구조적 인과 모델을 확장하고 do-calculus를 일반화한 새로운 식별 기법을 제안한다.
확률적 밴딧 환경에서 특정 임계치를 초과하는 우수 암을 식별하기 위해 고정 예산이나 시간 제한 없이 언제든 결과를 도출할 수 있는 매개변수 없는 샘플링 규칙인 APGAI를 제안한다.
로컬 차분 프라이버시로 인한 노이즈 문제를 해결하기 위해 모델 반전과 가중 평균화 기법을 도입하여 분류 성능을 획기적으로 개선한 연구이다.
데이터 증강 기반의 대조 학습을 활용하여 신경망 제약 없이 이론적으로 최적인 수렴 속도를 달성하는 새로운 비모수적 밀도 추정 방법론을 제안한다.
심층 ReLU 신경망이 Sobolev 공간과 Barron 클래스에서 Riesz 기저를 형성함을 증명하여 차원의 저주 없이 함수 근사가 가능함을 수학적으로 분석했다.
리만 매니폴드 제약 조건 하에서 비매끄러운 비볼록 목적 함수를 최적화하는 블록 메이저라이제이션-미니마이제이션(BMM) 알고리즘의 수렴성과 반복 복잡도를 이론적으로 규명했다.
트랜스포머 모델이 횔더 연속 함수 클래스를 근사할 때 차원의 저주를 극복할 수 있음을 이론적으로 증명하고 구체적인 네트워크 구조적 조건을 제시한다.