본문으로 건너뛰기

AI가 고래 울음에서 생명의 나무를 듣다

일반 오디오 모델이 고래 울음에서 진화적 관계를 포착했다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

특정 동물 소리로 학습하지 않은 CLAP과 AST가 대중음악과 팟캐스트 학습만으로도 해양 포유류의 진화적 관계를 오디오 임베딩에 담았다. Watkins Marine Mammal Sound Database의 약 1,700개 클립과 32개 종을 2-D 공간에 배치하자 돌고래, 수염고래, 벨루가가 분리됐으며, 결과는 생물 음향학 전문 모델인 BEATs-bio와 비슷했다. FiftyOne 데모에서는 CLAP, AST, BEATs-bio, MFCC를 비교하고 "barking seal" 같은 텍스트로 관련 클립을 검색할 수 있다. MFCC는 종 간 구조가 뭉개진 반면 CLAP은 예시 오디오 없이도 검색을 수행했다.

실용적 조언

  • 공개된 FiftyOne 데모 notebook을 실행하면 해양 포유류 오디오 자료를 모델별로 비교할 수 있다. 약 1,700개 클립과 32개 종을 대상으로 CLAP, AST, BEATs-bio, MFCC의 임베딩 플롯과 검색 결과를 차례로 확인하면 표현 공간이 계통 정보를 담는 방식을 재현할 수 있다. 오디오 예시 없이 "barking seal"을 입력하는 검색도 함께 시험할 수 있다.

섹션별 상세

01
대중음악과 팟캐스트로 학습한 CLAP과 AST가 특정 동물 소리를 학습하지 않았는데도 해양 포유류의 진화적 관계를 벡터 공간에 담았다. 약 1,700개의 오디오 클립과 32개 종을 처리한 2-D 임베딩 플롯에서 돌고래, 수염고래, 벨루가가 서로 분리됐다. 이는 일반 목적 오디오 모델의 표현이 생물 음향학 전문 모델인 BEATs-bio와 비슷한 계통 정보를 포착했다는 뜻이다.
02
FiftyOne 데모는 모델이 만든 임베딩을 2-D 공간에 배치하고, 사용자가 종별 군집이 형성되는 과정을 직접 확인하도록 구성됐다. CLAP, AST, BEATs-bio, MFCC를 번갈아 선택해 표현 방식에 따른 차이를 비교할 수 있으며, MFCC에서는 종 간 구조가 선명하지 않고 뒤섞인 결과가 나왔다. 논문 속 상관계수로만 접하던 계통 관계를 실제 소리 재생과 시각적 탐색으로 연결한 점이 핵심이다.
03
텍스트로 "barking seal"을 입력하면 예시 오디오 없이 CLAP이 관련 클립을 검색한다. 모델은 텍스트와 오디오를 같은 표현 공간에서 연결해 검색어와 어울리는 물개 울음 샘플을 찾아낸다. Watkins Marine Mammal Sound Database의 자료에는 1949년에 녹음된 최초의 해양 포유류 수중 녹음인 벨루가 자료도 포함됐다.

용어 해설

계통 발생(Phylogeny)
생물 종이 공통 조상에서 어떻게 갈라져 현재의 계통을 이루었는지 나타내는 개념이다. 이 글에서는 고래와 돌고래 등 해양 포유류의 울음소리 특징이 진화적 관계와 함께 분리되는지를 뜻한다.
오디오 임베딩(Audio Embeddings)
음성이나 환경음 같은 오디오를 숫자 벡터로 변환한 표현이다. 비슷한 소리는 벡터 공간에서 가깝게 배치되므로 모델이 학습한 소리의 구조를 시각화하거나 검색하는 데 활용된다.
생물 음향학(Bioacoustics)
동물과 생물이 내는 소리를 기록하고 분석하는 분야다. 이 사례에서는 특정 동물 소리로 학습한 전문 모델과 일반 오디오 모델의 해양 포유류 분류 성능을 비교하는 기준으로 쓰였다.
멜 주파수 켑스트럼 계수(MFCC)
소리의 주파수 특성을 사람의 청각 지각에 가까운 방식으로 수치화하는 전통적 음향 특징이다. 글의 비교에서는 모델 기반 임베딩보다 종 간 관계를 덜 선명하게 표현해 결과가 뭉개졌다.

언급된 도구

FiftyOne중립

해양 포유류 오디오 클립의 임베딩을 시각화하고 모델별 결과를 비교하며 검색하는 공개 데모 notebook을 제공한다.

CLAP중립

텍스트와 오디오를 연결해 임베딩을 생성하고 예시 오디오 없이 검색어에 맞는 고래와 물개 클립을 찾는다.

AST중립

일반 목적 오디오 임베딩을 생성해 해양 포유류 종과 진화적 관계가 벡터 공간에서 분리되는 양상을 비교한다.

BEATs-bio중립

일반 오디오 모델인 CLAP과 AST의 결과를 비교하는 생물 음향학 전문 모델로 사용됐다.

MFCC중립

전통적인 음향 특징 표현으로 사용됐으며, 임베딩 플롯에서 종 간 구조가 뚜렷하게 분리되지 않았다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.