용어 해설
- 부호 비트 반전(Sign-Bit Flip)
- — 부동 소수점 수의 가장 앞자리인 부호 비트를 0에서 1로 또는 1에서 0으로 바꾸는 행위이다. 이는 가중치의 크기는 유지하면서 방향만 정반대로 바꾸어 신경망의 연산 결과를 완전히 왜곡시킨다. 단 몇 개의 비트 반전만으로도 모델 전체의 성능을 붕괴시킬 수 있는 치명적인 공격 수단이 된다.
- 데이터 불필요 공격(Data-Free Attack)
- — 학습 데이터나 검증 데이터에 대한 접근 없이 모델의 가중치 정보만으로 수행하는 공격 방식이다. 공격자가 실제 데이터를 확보하기 어려운 환경에서도 모델의 구조적 특징이나 가중치 분포만을 분석하여 취약점을 찾아낼 수 있어 보안 위협이 매우 높다.
- 전문가 혼합 모델(Mixture-of-Experts)
- — 입력 데이터에 따라 전체 파라미터 중 일부 전문가(Expert) 네트워크만 활성화하여 연산하는 아키텍처이다. 효율적인 추론이 가능하지만, 특정 전문가의 가중치가 오염될 경우 해당 전문가를 거치는 모든 토큰의 표현력이 파괴되어 모델 전체의 추론 능력이 상실될 수 있다.
코드 예제
def dnl_attack(theta, k, L):
theta_L = parameters_in_first_L_layers(theta)
sorted_theta = sort_descending_by_magnitude(theta_L)
K = top_k_entries(sorted_theta)
# For CNNs: enforce at most one selected entry per kernel
for theta_i in K:
theta_i = -theta_i # flip sign bit
return thetaDNL(Deep Neural Lesion) Pass-free 공격의 핵심 로직을 구현한 의사코드
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

