본문으로 건너뛰기
Alfredo Canziani조회 1

NYU 딥러닝 강의: Softer Perceptron과 다중 클래스 분류

Softer Perceptron의 경사 하강법 학습 원리와 이진 교차 엔트로피에서 소프트맥스로 이어지는 다중 클래스 분류 메커니즘이 핵심이다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Softer Perceptron의 학습은 경사 하강법을 기반으로 이진 교차 엔트로피 손실 함수를 최적화하며 이루어진다. 손실 함수의 기하학적 해석은 가중치 업데이트의 원리를 보여주며, 이진 분류에서 다중 클래스 분류로의 확장은 소프트맥스 함수의 도입으로 구현된다. 소프트맥스 함수는 로짓을 확률 분포로 변환하며, 다중 클래스 퍼셉트론에서 각 클래스에 대한 확률을 계산하는 핵심 메커니즘으로 작동한다.

챕터별 상세

00:00

강의 소개 및 지난 수업 복습

강의는 Softer Perceptron의 학습 과정에서 다룬 경사 하강법의 수학적 유도 과정을 복습하며 시작한다. 이전 수업에서 다룬 편미분과 연쇄 법칙의 적용 사례를 통해 학습의 기초를 재확인한다. Softer Perceptron의 구조적 특징과 학습 목표를 다시 한번 명확히 한다.

Softer Perceptron은 이진 분류를 위한 퍼셉트론의 변형 모델이다.

01:14

이진 교차 엔트로피 손실 함수

이진 분류 문제에서 모델의 성능을 평가하기 위해 이진 교차 엔트로피 손실 함수를 사용한다. 손실 함수는 실제 값과 모델의 예측 값 사이의 차이를 측정한다. 이 함수는 확률 분포 간의 거리를 최소화하는 방향으로 학습을 유도한다.

교차 엔트로피는 두 확률 분포 사이의 차이를 측정하는 지표이다.

01:26

이진 교차 엔트로피 기울기 계산

손실 함수의 가중치에 대한 기울기를 구하기 위해 편미분을 수행한다. 연쇄 법칙을 적용하여 손실 함수를 가중치로 미분한다. 이 과정에서 가중치와 입력 벡터의 내적에 대한 기울기가 도출된다.

기울기(gradient)는 손실 함수를 최소화하는 방향을 알려준다.

01:40

음의 로그 우도

이진 교차 엔트로피 손실 함수는 음의 로그 우도와 동일한 형태를 가진다. 모델이 정답 클래스를 예측할 확률을 최대화하는 것이 손실 함수를 최소화하는 것과 같다. 로그를 취함으로써 곱셈 연산을 덧셈 연산으로 변환하여 계산 효율성을 높인다.

로그 우도는 확률의 곱을 로그의 합으로 바꾸어 계산을 용이하게 한다.

08:38

확률적 경사 하강법 (SGD)

전체 데이터셋 대신 하나의 샘플을 사용하여 가중치를 업데이트하는 확률적 경사 하강법을 적용한다. 각 샘플에 대해 기울기를 계산하고 가중치를 이동시킨다. 이 방식은 학습 속도를 향상시키고 지역 최솟값에서 탈출하는 데 도움을 준다.

SGD는 데이터가 많을 때 효율적인 학습 방법이다.

09:12

방향 도함수

가중치 공간에서 손실 함수가 가장 가파르게 감소하는 방향을 찾기 위해 방향 도함수를 사용한다. 기울기 벡터는 손실 함수가 가장 빠르게 증가하는 방향을 나타내며, 그 반대 방향이 최적화 방향이다. 이 방향으로 가중치를 업데이트하여 손실을 줄인다.

방향 도함수는 특정 방향으로의 변화율을 의미한다.

11:45

Softer Perceptron 손실 함수

Softer Perceptron의 손실 함수는 이진 교차 엔트로피를 기반으로 구성된다. 이 함수는 모델의 예측값과 실제값 사이의 오차를 확률적으로 계산한다. 가중치 업데이트 규칙은 이 손실 함수의 기울기를 따라 결정된다.

Softer Perceptron은 퍼셉트론의 출력을 확률로 해석한다.

13:00

손실 함수의 기하학적 해석

가중치 공간에서 손실 함수의 변화를 기하학적으로 해석한다. 손실 함수가 형성하는 곡면 위에서 가중치가 이동하는 경로를 시각화한다. 가중치 업데이트는 곡면의 경사를 따라 최솟값으로 수렴하는 과정이다.

최적화 과정은 손실 곡면에서의 하강으로 이해할 수 있다.

17:30

소프트맥스 함수

이진 분류에서 다중 클래스 분류로 확장하기 위해 소프트맥스 함수를 도입한다. 소프트맥스는 로짓 벡터를 확률 분포로 변환하여 각 클래스에 속할 확률을 계산한다. 이 과정에서 지수 함수와 전체 합을 사용하여 정규화를 수행한다.

소프트맥스는 다중 클래스 분류의 표준 출력층 활성화 함수이다.

25:00

다중 클래스 분류

다중 클래스 분류에서는 각 클래스에 대한 로짓을 계산하고 소프트맥스를 통해 확률을 구한다. 가장 높은 확률을 가진 클래스를 예측값으로 선택한다. 학습 과정에서는 정답 클래스의 확률을 최대화하는 방향으로 가중치를 조정한다.

다중 클래스 분류는 클래스 간의 상호 배타성을 가정한다.

27:50

원-핫 인코딩

다중 클래스 분류에서 정답 클래스를 표현하기 위해 원-핫 인코딩을 사용한다. 정답 클래스에 해당하는 인덱스만 1이고 나머지는 0인 벡터로 변환한다. 이를 통해 손실 함수 계산 시 정답 클래스에 대한 확률만 고려할 수 있다.

원-핫 인코딩은 범주형 데이터를 수치화하는 방법이다.

30:35

소프트맥스 유도

소프트맥스 함수의 미분 과정을 상세히 유도한다. 지수 함수의 미분과 몫의 미분 규칙을 적용하여 기울기를 계산한다. 이 과정에서 소프트맥스 함수의 출력값과 정답 벡터 간의 관계가 드러난다.

소프트맥스의 미분은 출력값과 정답의 차이로 표현된다.

35:00

소프트맥스와 다중 클래스 퍼셉트론

소프트맥스 함수를 다중 클래스 퍼셉트론에 적용하여 학습 규칙을 정립한다. 가중치 행렬을 사용하여 각 클래스에 대한 로짓을 계산하고, 이를 소프트맥스로 변환한다. 학습은 정답 클래스의 확률을 최대화하는 방향으로 수행된다.

다중 클래스 퍼셉트론은 행렬 연산을 통해 클래스별 점수를 계산한다.

40:00

소프트맥스와 다중 클래스 퍼셉트론 (계속)

소프트맥스 함수의 매개변수 베타를 조절하여 모델의 결정 경계를 변화시킨다. 베타가 커질수록 모델은 더 확신을 가진 예측을 수행한다. 이 과정에서 결정 경계의 변화를 수학적으로 분석한다.

베타는 모델의 확신도를 조절하는 하이퍼파라미터이다.

42:00

다중 클래스 퍼셉트론의 학습 규칙

다중 클래스 퍼셉트론의 가중치 업데이트 규칙을 최종적으로 정리한다. 정답 클래스와 예측 클래스의 차이를 이용하여 가중치를 조정한다. 이 규칙은 전체 클래스에 대한 확률 분포를 고려하여 학습을 수행한다.

학습 규칙은 손실 함수의 기울기를 따라 가중치를 갱신한다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 22.수집 2026. 07. 22.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.