ynchoi/global-llm-value-gap
글로벌 LLM 가치관 괴리 측정 데이터셋: WVS 기반 다모델 윤리 벤치마크 이 데이터셋은 대규모 언어 모델(LLM)과 인간 집단 간의 가치관 괴리를 측정하기 위해 구축된 World Values Survey(WVS) Wave 7 기반 시뮬레이션 응답 데이터셋입니다. 66개국의 인구통계 분포를 반영한 층화 표집 페르소나를 6개 LLM에 주입하여 23개 윤리 문항에 대한 응답을 수집하고, 실제 WVS 인간 응답과 체계적으로 비교합니다. 주요 통계 항목 내용 분석 국가 수 66개국 윤리 문항 수 23개 (WVS Wave 7) 윤리 카테고리 수 9개 (도덕 기반 이론 기반) 분석 모델 GPT-4o, GPT-4o-mini, Gemini-2.5-flash, Gemini-2.0-flash, DeepSeek-reasoner, DeepSeek-chat 국가별 페르소나 수 100명 (층화 표집) 총 LLM… See the full description on the dataset page: https://huggingface.co/datasets/ynchoi/global-llm-value-gap.
글로벌 LLM 가치관 괴리 측정 데이터셋: WVS 기반 다모델 윤리 벤치마크
이 데이터셋은 대규모 언어 모델(LLM)과 인간 집단 간의 가치관 괴리를 측정하기 위해 구축된 World Values Survey(WVS) Wave 7 기반 시뮬레이션 응답 데이터셋입니다.
66개국의 인구통계 분포를 반영한 층화 표집 페르소나를 6개 LLM에 주입하여 23개 윤리 문항에 대한 응답을 수집하고, 실제 WVS 인간 응답과 체계적으로 비교합니다.
주요 통계
윤리 카테고리 (도덕 기반 이론 기반)
데이터 구조
각 응답 파일은 다음 컬럼으로 구성됩니다:
페르소나 생성 방식
WVS Wave 7 데이터에서 성별, 연령, 교육 수준, 소득 분위, 종교, 취업 상태 등 30개 인구통계 변수의 분포를 추출하여 층화 표집(stratified sampling) 방식으로 국가별 100명의 페르소나를 생성하였습니다.
100명 페르소나의 타당성은 TOST(Two One-Sided Tests, 동등성 마진 ±0.5) 검정을 통해 1,000명 표본과 통계적으로 동등함을 확인하였습니다 (GPT-4o, Gemini-2.5-flash 모두 p < .001).
