SWORD: Wikidata-based Distortions Reveal Hidden Cross-Lingual Inconsistencies in LLM Factual Error Rejection

📅 2026-09-08
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
本文通过创建SWORD基准,使用Wikidata生成事实错误的语句来评估多语言模型在拒绝事实错误方面的一致性,揭示了模型对不同语言处理能力的不对称性。
📝 Abstract
Modern LLMs demonstrate impressive multilingual performance, yet standard benchmarks primarily reward selecting correct answers rather than evaluating genuine factual understanding. We introduce Systematic Wikidata-based Object-Relation Distortion (SWORD), a benchmark that evaluates whether models consistently reject factual errors across languages. SWORD generates syntactically well-formed but factually incorrect statements in eight widely spoken languages through controlled perturbations of Wikidata triples, ranging from random entity substitutions to semantically plausible property-based selections. Our distortion-based evaluation surfaces two critical insights that remain entirely obscured by conventional benchmarks. First, models counterintuitively achieve higher accuracy on semantically plausible distortions than on nonsensical random substitutions, suggesting reliance on distributional familiarity rather than genuine factual verification. Second, models exhibiting comparable baseline accuracy across languages show substantial performance degradation specifically on (East) Asian languages when presented with distorted statements, with cross-lingual performance gaps reaching up to 28 percentage points (49\% relative reduction) in some models. These findings demonstrate that multilingual factual reasoning involves asymmetric capabilities that aggregate accuracy metrics systematically obscure.
Problem

Research questions and friction points this paper is trying to address.

LLMs
multilingual performance
factual understanding
cross-lingual inconsistencies
Wikidata
Innovation

Methods, ideas, or system contributions that make the work stand out.

SWORD
Wikidata-based distortions
cross-lingual inconsistencies
factual error rejection
multilingual models
🔎 Similar Papers
2024-06-20International Conference on Computational LinguisticsCitations: 2
💼 Related Jobs
No related jobs found.
S
Sanghyeok Park
Soongsil University, Seoul, Republic of Korea
M
Minji Kang
Soongsil University, Seoul, Republic of Korea
H
Hosung Kwak
KAIST, Daejeon, Republic of Korea
J
Jinhyuk Yun
Soongsil University, Seoul, Republic of Korea