AMONGAGENTS: Evaluating Large Language Models in the Interactive Text-Based Social Deduction Game
Fuente:
arXiv
Saved in:
| Main Authors: | Chi, Yizhou, Mao, Lingjun, Tang, Zineng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Grounding Language in Multi-Perspective Referential Communication
by: Tang, Zineng, et al.
Published: (2024)
by: Tang, Zineng, et al.
Published: (2024)
Evaluating Model Perception of Color Illusions in Photorealistic Scenes
by: Mao, Lingjun, et al.
Published: (2024)
by: Mao, Lingjun, et al.
Published: (2024)
Evaluating the Deductive Competence of Large Language Models
by: Seals, Spencer M., et al.
Published: (2023)
by: Seals, Spencer M., et al.
Published: (2023)
Neural Synchrony Between Socially Interacting Language Models
by: Zhang, Zhining, et al.
Published: (2026)
by: Zhang, Zhining, et al.
Published: (2026)
Fine-Grained and Thematic Evaluation of LLMs in Social Deduction Game
by: Kim, Byungjun, et al.
Published: (2024)
by: Kim, Byungjun, et al.
Published: (2024)
Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies
by: Song, Zirui, et al.
Published: (2025)
by: Song, Zirui, et al.
Published: (2025)
Toward Honest Language Models for Deductive Reasoning
by: Liu, Jiarui, et al.
Published: (2025)
by: Liu, Jiarui, et al.
Published: (2025)
Investigating the Robustness of Deductive Reasoning with Large Language Models
by: Hoppe, Fabian, et al.
Published: (2025)
by: Hoppe, Fabian, et al.
Published: (2025)
Monte Carlo Planning with Large Language Model for Text-Based Game Agents
by: Shi, Zijing, et al.
Published: (2025)
by: Shi, Zijing, et al.
Published: (2025)
Multicultural Spyfall: Assessing LLMs through Dynamic Multilingual Social Deduction Game
by: Wibowo, Haryo Akbarianto, et al.
Published: (2026)
by: Wibowo, Haryo Akbarianto, et al.
Published: (2026)
The Role of Deductive and Inductive Reasoning in Large Language Models
by: Cai, Chengkun, et al.
Published: (2024)
by: Cai, Chengkun, et al.
Published: (2024)
How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment
by: Ansell, Rebecca, et al.
Published: (2026)
by: Ansell, Rebecca, et al.
Published: (2026)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
by: Chen, Michael K., et al.
Published: (2025)
by: Chen, Michael K., et al.
Published: (2025)
Hidden in Plain Text: Measuring LLM Deception Quality Against Human Baselines Using Social Deduction Games
by: Kao, Christopher, et al.
Published: (2026)
by: Kao, Christopher, et al.
Published: (2026)
SQLBench: A Comprehensive Evaluation for Text-to-SQL Capabilities of Large Language Models
by: Zhang, Bin, et al.
Published: (2024)
by: Zhang, Bin, et al.
Published: (2024)
Hypothesis Testing Prompting Improves Deductive Reasoning in Large Language Models
by: Li, Yitian, et al.
Published: (2024)
by: Li, Yitian, et al.
Published: (2024)
Comparing Inferential Strategies of Humans and Large Language Models in Deductive Reasoning
by: Mondorf, Philipp, et al.
Published: (2024)
by: Mondorf, Philipp, et al.
Published: (2024)
Structure Guided Prompt: Instructing Large Language Model in Multi-Step Reasoning by Exploring Graph Structure of the Text
by: Cheng, Kewei, et al.
Published: (2024)
by: Cheng, Kewei, et al.
Published: (2024)
TurnaboutLLM: A Deductive Reasoning Benchmark from Detective Games
by: Yuan, Yuan, et al.
Published: (2025)
by: Yuan, Yuan, et al.
Published: (2025)
Deductive Closure Training of Language Models for Coherence, Accuracy, and Updatability
by: Akyürek, Afra Feyza, et al.
Published: (2024)
by: Akyürek, Afra Feyza, et al.
Published: (2024)
Images are Worth Variable Length of Representations
by: Mao, Lingjun, et al.
Published: (2025)
by: Mao, Lingjun, et al.
Published: (2025)
BAMBOO: A Comprehensive Benchmark for Evaluating Long Text Modeling Capacities of Large Language Models
by: Dong, Zican, et al.
Published: (2023)
by: Dong, Zican, et al.
Published: (2023)
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
by: Hudi, Frederikus, et al.
Published: (2025)
by: Hudi, Frederikus, et al.
Published: (2025)
Data Analysis and Performance Evaluation of Simulation Deduction Based on LLMs
by: Zhang, Shansi, et al.
Published: (2025)
by: Zhang, Shansi, et al.
Published: (2025)
ItD: Large Language Models Can Teach Themselves Induction through Deduction
by: Sun, Wangtao, et al.
Published: (2024)
by: Sun, Wangtao, et al.
Published: (2024)
Werewolf Arena: A Case Study in LLM Evaluation via Social Deduction
by: Bailis, Suma, et al.
Published: (2024)
by: Bailis, Suma, et al.
Published: (2024)
Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
by: Wu, Da, et al.
Published: (2023)
by: Wu, Da, et al.
Published: (2023)
Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
by: Sarkar, Bidipta, et al.
Published: (2025)
by: Sarkar, Bidipta, et al.
Published: (2025)
Toward Mechanistic Explanation of Deductive Reasoning in Language Models
by: Maltoni, Davide, et al.
Published: (2025)
by: Maltoni, Davide, et al.
Published: (2025)
A Survey on Large Language Model-Based Social Agents in Game-Theoretic Scenarios
by: Feng, Xiachong, et al.
Published: (2024)
by: Feng, Xiachong, et al.
Published: (2024)
SocialEval: Evaluating Social Intelligence of Large Language Models
by: Zhou, Jinfeng, et al.
Published: (2025)
by: Zhou, Jinfeng, et al.
Published: (2025)
Can Large Language Models Master Complex Card Games?
by: Wang, Wei, et al.
Published: (2025)
by: Wang, Wei, et al.
Published: (2025)
Evaluating and Improving Graph to Text Generation with Large Language Models
by: He, Jie, et al.
Published: (2025)
by: He, Jie, et al.
Published: (2025)
A Necessary Step toward Faithfulness: Measuring and Improving Consistency in Free-Text Explanations
by: Zhao, Lingjun, et al.
Published: (2025)
by: Zhao, Lingjun, et al.
Published: (2025)
ByteSized32Refactored: Towards an Extensible Interactive Text Games Corpus for LLM World Modeling and Evaluation
by: Wang, Haonan, et al.
Published: (2025)
by: Wang, Haonan, et al.
Published: (2025)
Evaluating Large Language Models as Expert Annotators
by: Tseng, Yu-Min, et al.
Published: (2025)
by: Tseng, Yu-Min, et al.
Published: (2025)
Bayesian Social Deduction with Graph-Informed Language Models
by: Rahimirad, Shahab, et al.
Published: (2025)
by: Rahimirad, Shahab, et al.
Published: (2025)
A Comparative Evaluation of Large Language Models for Persian Sentiment Analysis and Emotion Detection in Social Media Texts
by: Tohidi, Kian, et al.
Published: (2025)
by: Tohidi, Kian, et al.
Published: (2025)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
by: Gui, Jiayi, et al.
Published: (2024)
by: Gui, Jiayi, et al.
Published: (2024)
Assessing the Reliability of Large Language Models for Deductive Qualitative Coding: A Comparative Study of ChatGPT Interventions
by: Hila, Angjelin, et al.
Published: (2025)
by: Hila, Angjelin, et al.
Published: (2025)
Similar Items
-
Grounding Language in Multi-Perspective Referential Communication
by: Tang, Zineng, et al.
Published: (2024) -
Evaluating Model Perception of Color Illusions in Photorealistic Scenes
by: Mao, Lingjun, et al.
Published: (2024) -
Evaluating the Deductive Competence of Large Language Models
by: Seals, Spencer M., et al.
Published: (2023) -
Neural Synchrony Between Socially Interacting Language Models
by: Zhang, Zhining, et al.
Published: (2026) -
Fine-Grained and Thematic Evaluation of LLMs in Social Deduction Game
by: Kim, Byungjun, et al.
Published: (2024)