CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia

📅 2026-08-28
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
为了解决大型语言模型在多轮文化相关对话中的不足,研究引入了CultureConverse系统,通过模拟和评估10个东亚及东南亚地区内的多语言对话来提高助手的文化适应性。
📝 Abstract
Current cultural evaluations for large language models (LLMs) often reduce culture to single-turn factual recall via MCQs, failing to capture a common use case: users seeking practical help over multiple turns in culturally grounded scenarios. We introduce CultureConverse, a scalable, multilingual simulation and evaluation harness for culturally grounded assistant dialogue that covers 10 East and Southeast Asian regions, 58 subgroup identities, and 7 domains. Each simulated and evaluated episode produces a scored interaction where the assistant assists the user and infers cultural constraints from partial information. The resulting CultureConverse-DS dataset contains 14,610 benchmark (evaluation) episodes and 274,295 oracle-guided (gold-mode) dialogues. In our benchmark evaluation of 18 models, GPT-5 mini achieves the highest assistance quality. Human annotation experiments suggest that our evaluation framework is a sufficient proxy for human judgment. Performance gains from fine-tuning on 27,860 high-quality CultureConverse-DS samples improve in-domain assistance and transfer out-of-domain to cultural MCQ and safety classification benchmarks. We release the harness, both splits, and judge prompts to support interactive evaluation of cultural competency.
Problem

Research questions and friction points this paper is trying to address.

cultural evaluations
large language models
multilingual
multi-turn dialogue
culturally grounded assistance
Innovation

Methods, ideas, or system contributions that make the work stand out.

multilingual
multi-turn dialogue
cultural grounding
simulation harness
assistant evaluation
💼 Related Jobs
No related jobs found.
B
Bryan Chen Zhengyu Tan
Singapore University of Technology and Design (SUTD), Singapore; Agency for Science, Technology and Research (A*STAR), Singapore
Weihua Zheng
Weihua Zheng
A*STAR
Multilingual LLMCultural LLM
Thong T. Doan
Thong T. Doan
AI Resident at FSoft AI Center
Multimodal LearningLarge Language Model
B
Bich Ngoc Doan
École Polytechnique Fédérale de Lausanne (EPFL), Lausanne, Switzerland
J
Jia Wang Peh
Singapore University of Technology and Design (SUTD), Singapore
Xiaoyuan Yi
Xiaoyuan Yi
Senior Researcher, Microsoft Research Asia
Natural Language GenerationSocietal AILarge Language ModelResponsible AI
Jing Yao
Jing Yao
Microsoft Research Asia
Large Language ModelNatural Language ProcessingInformation Retrieval
X
Xing Xie
Microsoft Research Asia (MSRA), Beijing, China
Nancy F. Chen
Nancy F. Chen
ISCA Fellow, AAIA Fellow, Multimodal Generative AI Group Leader, AI for Education Head at A*STAR
Agentic AILarge Language ModelsConversational AI
Zhengyuan Liu
Zhengyuan Liu
Institute for Infocomm Research (I2R) - A*STAR; IEEE Senior Member.
Natural Language ProcessingArtificial IntelligenceHuman-Centered AI
JinYeong Bak
JinYeong Bak
College of Computing, Sungkyunkwan University
Artificial IntelligenceConversation Modeling
W
Wafi Shamdi
Universiti Brunei Darussalam (UBD), Brunei Darussalam
S
Soo Kai Chie
Universiti Brunei Darussalam (UBD), Brunei Darussalam
L
Liew Yu Siong
Universiti Brunei Darussalam (UBD), Brunei Darussalam
A
Aina Azyyati Binti Mohamad Rezal
Universiti Brunei Darussalam (UBD), Brunei Darussalam
L
Lew Yan Yan Vanessa
Universiti Brunei Darussalam (UBD), Brunei Darussalam
H
Huadan Wu
China University of Petroleum (East China), Qingdao, China
D
Dylan Raharja
Singapore University of Technology and Design (SUTD), Singapore
N
Nadya Yuki Wangsajaya
Nanyang Technological University (NTU), Singapore
A
Akane Fukushige
Kyoto University, Kyoto, Japan
K
Kazushi Kato
Kyoto University, Kyoto, Japan
Koji Inoue
Koji Inoue
Kyoto University
Spoken Dialogue SystemHuman-Robot InteractionTurn-Taking
Tatsuya Kawahara
Tatsuya Kawahara
Professor, School of Informatics, Kyoto University
Speech Processingspeech recognitionNatural Language Processingdialogue
Jaehyung Seo
Jaehyung Seo
Korea University
Natural Language GenerationCommonsense ReasoningHallucinationKnowledge Editing
Dongjun Kim
Dongjun Kim
Stanford University
Machine LearningArtificial Intelligence