Institution profile

Quebec Artificial Intelligence Institute

Academic institutionnorthamerica · ca
Official website
Research library1linked papers
Opportunities0open roles
Selected work

Representative Papers

Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia

Dec 03, 2025

Existing evaluation methods inadequately measure large language model (LLM) agents’ cooperative generalization capability in novel, mixed-motive social scenarios. Method: We conduct a systematic zero-shot evaluation on the Concordia multi-agent simulation platform, assessing LLM agents’ ability to recognize and realize mutual benefit across diverse social interaction tasks—including negotiation and collective action—using a novel quantitative framework for general cooperative intelligence. This framework emphasizes high-generalization dimensions such as persuasion and norm enforcement. Contribution/Results: Empirical analysis of NeurIPS 2024 Concordia Competition data reveals substantial limitations in current LLM agents’ cross-context cooperative generalization, particularly in dynamic coordination and implicit norm modeling. Our work establishes a new paradigm for benchmarking and diagnosing cooperative intelligence, advancing both methodological rigor and diagnostic precision in multi-agent cooperation research.

2 citationsRead paper
Recent publications

Latest Papers

Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia

Dec 03, 2025

Existing evaluation methods inadequately measure large language model (LLM) agents’ cooperative generalization capability in novel, mixed-motive social scenarios. Method: We conduct a systematic zero-shot evaluation on the Concordia multi-agent simulation platform, assessing LLM agents’ ability to recognize and realize mutual benefit across diverse social interaction tasks—including negotiation and collective action—using a novel quantitative framework for general cooperative intelligence. This framework emphasizes high-generalization dimensions such as persuasion and norm enforcement. Contribution/Results: Empirical analysis of NeurIPS 2024 Concordia Competition data reveals substantial limitations in current LLM agents’ cross-context cooperative generalization, particularly in dynamic coordination and implicit norm modeling. Our work establishes a new paradigm for benchmarking and diagnosing cooperative intelligence, advancing both methodological rigor and diagnostic precision in multi-agent cooperation research.

2 citationsRead paper