TL;DR
대규모 언어모델 기반 에이전트의 다문화 구성이 점차 확산되면서, 전체 시스템이 인간 사회의 가치 다원성을 얼마나 보존하는가가 중요해졌다. 이 논문은 단일 에이전트의 가치 정렬성만으로는 시스템 수준의 가치 다양성을 파악하기 어렵다고 지적하고, 시스템 차원의 가치 다양성(value diversity)이라는 새로운 평가 축을 제안한다. 또한 다양성은 개별 에이전트 간 정렬성과 거의 무관하게 작동할 수 있어, 다원성 유지에 필요한 설계 고려사항을 제시한다. 연구는 WVS를 기반으로 19개 문화와 18개 백본 모델의 다양한 구성에서 가치 다양성을 측정하고, 인간의 다양성과의 차이를 실증적으로 보여준다. 이로써 다문화 에이전트 시스템 설계에서 다양성 보존의 중요성과 한계를 드러낸다.
왜 중요한가
대규모 언어모델 기반 에이전트의 다문화 구성이 점차 확산되면서, 전체 시스템이 인간 사회의 가치 다원성을 얼마나 보존하는가가 중요해졌다. 이 논문은 단일 에이전트의 가치 정렬성만으로는 시스템 수준의 가치 다양성을 파악하기 어렵다고 지적하고, 시스템 차원의 가치 다양성(value diversity)이라는 새로운 평가 축을 제안한다. 또한 다양성은 개별 에이전트 간 정렬성과 거의 무관하게 작동할 수 있어, 다원성 유지에 필요한 설계 고려사항을 제시한다. 연구는 WVS를 기반으로 19개 문화와 18개 백본 모델의 다양한 구성에서 가치 다양성을 측정하고, 인간의 다양성과의 차이를 실증적으로 보여준다. 이로써 다문화 에이전트 시스템 설계에서 다양성 보존의 중요성과 한계를 드러낸다.
핵심 기여
시스템 차원의 가치 다양성 메트릭 제안
에이전트 응답 간의 거리 기반 디스미얼리티를 이용해 시스템 전체의 다양성을 측정하는 지표를 도입한다. Pairwise Diversity(DiversityP)와 Structural Diversity(DiversityS)를 정의하고, 전체 시스템의 다양성은 모든 에이전트 쌍 간 거리의 평균과 MST 기반 거리의 평균으로 산출된다.
다문화 시스템에서 다양성과 정렬성의 관계 분석
18개 단일 백본 시스템에서 다양성과 Align 간의 상관관계가 거의 없다는 것을 실증하고, 다양성이 시스템의 집단적 가치 다원성을 포착하는 보조 축임을 입증한다.
믹스 백본 구성의 효과 분석
185가지의 백본 구성 조합을 탐색하여, 믹스 백본이 다양성과 정렬성 양측에서 Pareto frontier를 구성하며 단일 백본 대비 우수한 성능을 보이나, 인간 수준의 다양성에는 여전히 큰 차이가 있음을 보인다.
문화 구성과 에이전트 수의 영향
문화 구성이나 에이전트 수가 다양성 회복에 실질적 기여를 하지 못하고, 에이전트 수가 증가할수록 시스템 수준의 homogenization이 심화된다.
동적 상호작용의 효과와 한계
다회차 사회적 노출은 per-agent 문화 충실도는 약간 향상시키지만, 시스템 차원의 다양성은 감소시키고 회복되지 않는 경향을 보인다. 이는 사회적 exposure가 집단적 다원성을 약화시킬 수 있음을 시사한다.
참여 예산제도에서의 집단 의사결정 영향
고다양성 시스템이 더 넓은 사회적 우선순위를 포착하고 공공자원 배분에서 더 많은 다원성을 보이며, 다양성이 실질적 의사결정에 영향을 준다.
핵심 아이디어 이해하기
출발점: 시스템 차원의 가치 평가가 필요하다고 보는 관점에서 시작한다. 기존의 가치 정렬성(Alignment)은 개인 에이전트의 문화 적합도에 집중하지만, 다문화 시스템은 전체가 어떻게 가치의 다양성을 유지하는지가 더 중요하다. 이를 위해 WVS를 기반으로 각 에이전트가 할당된 문화 정체성 하에 질문에 응답하도록 하고, 에이전트 간 응답의 차이를 측정해 시스템 차원의 다양성을 정의한다. 그 결과, 다문화 에이전트 시스템은 서로 다른 문화에서도 가치의 다양성을 유지하기보다는 평균화될 위험이 크며, 이는 인간 사회의 다원성 수준에 미치지 못한다. 또한 믹스 백본 구성은 다양성과 정렬성의 교차점에서 향상을 보이지만, 여전히 인간의 다양성과 격차를 남긴다. 동적 상호작용은 다양성을 더욱 감소시키고, 참여 예산과 같은 의사결정 맥락에서 다양성이 제공하는 폭넓은 가치 반영의 가능성을 보여준다.
방법론
- 연구 설정: S = {a1, ..., aN} 형태의 다문화 에이전트 시스템을 구성하고 각 에이전트는 시스템 프롬프트를 통해 ci 문화 정체성을 부여받는다. 2) WVS 응답 생성: 각 에이전트 ai는 특정 문화 ci 하에 WVS(K 질문) 항목에 응답하고 응답 벡터 x(i) ∈ R^K를 얻는다. 3) 가치 정렬(Alignment): 문화 ground-truth µ(i)은 해당 문화의 majority-vote 응답으로 정의되고, Align(x(i), µ(i))를 통해 개인-문화 정합성을 산출한다. 4) 시스템 수준 가치 다양성: 에이전트 쌍의 거리 Div(x(i), x(j))를 정의하고, DiversityP(S)와 DiversityS(S)을 산출한다. 5) 실험 구성: 19개 문화, 18개 백본 모델, N=5인 시스템에서 단일 백본과 믹스 백본 구성을 비교한다. 6) 분석: DiversityP/S와 Alignment 간의 관계를 평가하고, 문화 구성, 에이전트 수, 다회차 상호작용, Participatory Budgeting 시나리오를 통해 다양성의 영향력을 분석한다. 7) 구현 상세: Diversity 측정의 구현은 Algorithm 1과 Algorithm 2에 따라 수행되며, MST를 이용한 DiversityS를 통해 중복 정보의 영향을 줄인다. 8) 데이터 소스: World Values Survey Wave 7 기반의 223개 항목 중 223개를 사용하고, 19개 문화 및 18개 백본 모델을 대상으로 실험한다.
주요 결과
주요 결과: 단일 백본 시스템은 인간 기준의 다양성보다 현저히 낮다. 가장 다채로운 단일 백본은 gemini-2.5-pro로, DiversityP=36.12, DiversityS=29.60이며 인간은 각각 44.07, 39.37이다. DiversityS가 더 큰 차이를 보이는 것이 구조적 다양성의 축이 더 촘촘히 시스템의 다양성을 포착함을 시사한다. 백본 간의 다양성은 Alignment와 거의 상관관계가 없었으며( Pearson r = −0.12), 고정된 Alignment에도 내부적으로 고르게 homogenized 시스템이 존재할 수 있다. 믹스 백본 구성은 185가지 구성을 탐색하여 단일 백본 대비 Pareto frontier를 지배하며, 정렬성과 다양성 양쪽에서 더 나은 성능을 달성하는 경향을 보인다. 특정 구간에서의 성능 향상은 ΔA=+1.51(정렬성 향상) 및 ΔD=+1.65(다양성 향상)으로 나타났고, 균형 구성은 ΔD=+3.18, ΔA=+1.21로 요약된다. 문화 구성이나 에이전트 수는 다양성 향상에 실질적 기여를 하지 못했고, 에이전트 수가 증가할수록 인간 사회 대비 다양성 격차가 커진다. 다회차 상호작용에서는 다양성은 지속적으로 감소하는 경향을 보이고, 단순한 per-agent 정합성의 향상보다 시스템 차원의 다양성 손실이 주된 현상으로 나타난다. 참여 예산(PB) 시나리오에서는 고다양성 시스템이 더 폭넓은 사회적 우선순위를 반영하고 공공 자원 배분의 다원성을 증가시키는 경향을 보였다. 이러한 결과들은 가치 다양성이 다문화 에이전트 시스템의 또 다른 중요한 도전임을 제시한다.
관련 Figure

다양성(Diversity)과 정렬성(Alignment) 간의 관계가 약한 상관관계(r = -0.12)임을 보여주며, 시스템 차원의 다양성이 인간의 다양성과 다를 수 있음을 시사한다. 이 그림은 Diversity가 Alignment를 대체하지 않는 보조 축임을 직관적으로 확인시키며, 두 지표의 독립적 해석 필요성을 뒷받침한다.
Figure 1: 18개 단일 백본 시스템의 다변성-정렬성 산점도 및 per-question 분포

믹스 백본 구성의 Pareto frontier가 단일 백본 대비 우수함을 시각적으로 보여주며, 믹스 구성이 다양성과 정렬성 양쪽에서 이득을 줄 수 있음을 시사한다.
Figure 2: 185가지 백본 구성의 Diversity–Alignment landscape

문화 구성 변화와 에이전트 수의 변화가 다양성에 미치는 영향으로, culture 선별만으로 다양성을 크게 끌어올리기 어렵고 에이전트 수 증가가 인간 대비 격차를 키움이 나타난다.
Figure 3a: Culture combinations에 따른 Diversity; Figure 3b: Agent count에 따른 인간 대비 차이

사회적 노출 한 라운드가 다양성을 평균적으로 감소시키고(ΔD < 0), 정렬성은 소폭 증가하는 경향을 보인다. 이는 상호작용이 집단적 다원성보다 합의 방향으로 이끈다는 것을 시사한다.
Figure 4: one-round social exposure가 Diversity와 Alignment에 미치는 영향

다회차 상호작용에서도 다양성은 지속적으로 감소하며, 일부 시스템은 완전히 회복되지 않는다. 이는 상호작용이 장기적으로 다원성을 약화하는 경향을 나타낸다.
Figure 5: 5회 상호작용에서의 시스템 다양성 변화

고다양성 시스템이 더 넓은 사회적 차원을 커버하고, 저다양성 시스템은 특정 차원에 집중하는 경향이 있음을 보인다. 다양성이 정책 의사결정의 폭을 확장하는 영향력을 시사한다.
Figure 6: Participatory Budgeting에서의 의사결정 분포

구조적 다양성과 Alignment 간의 관계를 보여주며, 구조적 다양성이 높아도 정렬성은 낮은 경우가 존재함을 시사한다. Diversity가 단지 전통적 정렬성으로만 결정되지 않음을 강조한다.
Figure 7: 구조적 다양성 vs. 정렬성 관계
기술 상세
아키텍처: S = {a1, ..., aN} 다문화 에이전트 시스템에서 각 에이전트 ai는 시스템 프롬프트를 통해 ci 문화 정체성을 부여받는다. 각 에이전트는 World Values Survey(WVS) 항목에 응답하고 x(i) ∈ R^K를 얻는다. Align(x(i), µ(i))는 문화 ground-truth µ(i)와의 차이를 기반으로 에이전트-문화 정합성을 산출한다. 시스템 수준의 가치 다양성은 Div(x(i), x(j))를 이용해 모든 쌍의 거리를 산출한 후 DiversityP(S) = 1/N^2 ∑{i<j} Div(x(i), x(j))와 DiversityS(S) = (1/(N−1)) ∑{(i,j)∈MST(S)} Div(x(i), x(j))로 정의한다. 거리 함수 Div(x, y) = sqrt(∑_k (x_k − y_k)^2) / sqrt(∑_k ∆_k^2)이며 ∆_k는 q의 최대 불일치 수다. 인간 기준은 각 문화에 대한 majority-vote 응답 벡터 µ를 사용해 동일한 메트릭을 적용한다. 데이터로는 WVS Wave 7의 223개 항목 중 37개를 제외한 223개 항목을 사용한다. 실험은 19개 문화, 18개 백본 모델, N=5 시스템 구성에서 수행되었고, 단일 백본과 믹스 백본 간의 차이를 비교한다. 혼합 백본 구성은 185가지 조합을 탐색하고, 모든 구성에 대해 DiversityP/S를 계산해 Pareto frontier를 도출한다. 다회차 상호작용은 0~K 라운드에서 시스템 다이내믹스를 추적하며, PB 시나리오에서는 13개 WVS 차원의 프로젝트를 대상으로 각 에이전트가 4개를 선택하는 방식으로 의사결정 분포를 측정한다. 구현은 Algorithm 1과 Algorithm 2에 기반한 거리 계산 및 MST 기반 DiversityS 산출로 이루어지며, MST 계산은 SciPy의 그래프 라이브러리 사용.
한계점
제한점: 상호작용 및 의사결정 실험은 WVS-grounded 프레임워크와 단순화된 사회적 노출 설정에 의존한다. 5개 문화의 고정 구성과 19개 문화의 부분집합 간 차이가 명확히 분리되지 않았다. 문화 프로토타입으로서 WVS majority-vote를 사용하나, 실제 인간 인구의 다양성과 시간적 변화(2017–2020) 사이의 차이가 존재한다. 또한 프레임워크는 다문화 시스템의 더 복잡한 현상(일상 대화, 규범 추론, 에이전트-생성 사회의 구조적 상호작용)을 전적으로 포섭하지 못한다. 결과의 일반화 여부는 향후 더 풍부한 시뮬레이션 및 실제 플랫폼에서 검증이 필요하다.
실무 활용
다문화 다에이전트 시스템의 설계 및 평가에 가치 다양성 지표를 도입하면 시스템 차원의 다원성과 정책 시뮬레이션의 신뢰성을 함께 고려할 수 있다. 믹스 백본 구성을 통해 다양성과 정렬성의 고려를 병행하는 설계가 가능하며, 상호작용이 실질적으로 다양성을 감소시킨다는 점은 사회적 의사결정의 설계에 시사점을 제공한다.
- 다문화 시뮬레이션 설계에서 믹스 백본 구성을 활용해 다양성과 정렬성의 트레이드오프를 최적화
- 정책 시뮬레이션에서 다양성 기반 의사결정 프레임워크 도입으로 폭넓은 사회적 우선순위를 포착
- 대규모 멀티에이전트 시스템의 초기 프롬프트 및 문화 프로토타입 설계 시, 다양성 보존 목표를 반영한 시스템 프롬프트 구성
- 동적 상호작용 환경에서 다양성 감소를 완화하기 위한 정책적 조정 및 피드백 루프 설계
- Participatory Budgeting 시나리오에서 고다양성 시스템의 의사결정 분포를 평가하는 벤치마크로 활용
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- World Values Survey
- — 세계 인구의 가치관과 선호를 측정하는 설문 도구로, 본 연구에서 다양한 문화 간 가치 차이를 비교하는 기준으로 사용된다.
- Value Alignment
- — 개별 에이전트가 특정 문화의 기준과 얼마나 근접하게 응답하는지 평가하는 프레임으로, 시스템 차원의 다양성과 구분되는 지표로 다뤄진다.
- Value Diversity
- — 에이전트 간 응답 차이를 기반으로 시스템 차원의 가치 다양성을 측정하는 개념으로, 에이전트 간 상대적 차이를 한꺼번에 요약하는 지표를 포함한다.
- Backbone Models
- — 다양한 대형언어모델(예: GPT, Claude, Gemini, Grok, Qwen, Llama 등)을 시스템 내 에이전트의 기본 추론 엔진으로 사용하는 구성 요소를 뜻한다.
- Minimum Spanning Tree
- — 에이전트 간 거리 그래프에서 모든 노드를 포함하면서 총 가중치가 최소가 되는 트리로, DiversityS를 계산하는 기준이 된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
