NegotiationToM: A Benchmark for Stress-testing Machine Theory of Mind on Negotiation Surrounding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chan, Chunkit, Jiayang, Cheng, Yim, Yauwai, Deng, Zheye, Fan, Wei, Li, Haoran, Liu, Xin, Zhang, Hongming, Wang, Weiqi, Song, Yangqiu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating and Enhancing LLMs Agent based on Theory of Mind in Guandan: A Multi-Player Cooperative Game under Imperfect Information
par: Yim, Yauwai, et autres
Publié: (2024)
par: Yim, Yauwai, et autres
Publié: (2024)
Text-Tuple-Table: Towards Information Integration in Text-to-Table Generation via Global Tuple Extraction
par: Deng, Zheye, et autres
Publié: (2024)
par: Deng, Zheye, et autres
Publié: (2024)
LLM-Hanabi: Evaluating Multi-Agent Gameplays with Theory-of-Mind and Rationale Inference in Imperfect Information Collaboration Game
par: Liang, Fangzhou, et autres
Publié: (2025)
par: Liang, Fangzhou, et autres
Publié: (2025)
Persona Knowledge-Aligned Prompt Tuning Method for Online Debate
par: Chan, Chunkit, et autres
Publié: (2024)
par: Chan, Chunkit, et autres
Publié: (2024)
XToM: Exploring the Multilingual Theory of Mind for Large Language Models
par: Chan, Chunkit, et autres
Publié: (2025)
par: Chan, Chunkit, et autres
Publié: (2025)
Structuring the Unstructured: A Systematic Review of Text-to-Structure Generation for Agentic AI with a Universal Evaluation Framework
par: Deng, Zheye, et autres
Publié: (2025)
par: Deng, Zheye, et autres
Publié: (2025)
GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity Theory
par: Fan, Wei, et autres
Publié: (2024)
par: Fan, Wei, et autres
Publié: (2024)
Constrained Reasoning Chains for Enhancing Theory-of-Mind in Large Language Models
par: Lin, Zizheng, et autres
Publié: (2024)
par: Lin, Zizheng, et autres
Publié: (2024)
ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household Activities
par: Su, Ying, et autres
Publié: (2024)
par: Su, Ying, et autres
Publié: (2024)
ChatGPT Evaluation on Sentence Level Relations: A Focus on Temporal, Causal, and Discourse Relations
par: Chan, Chunkit, et autres
Publié: (2023)
par: Chan, Chunkit, et autres
Publié: (2023)
InteGround: On the Evaluation of Verification and Retrieval Planning in Integrative Grounding
par: Jiayang, Cheng, et autres
Publié: (2025)
par: Jiayang, Cheng, et autres
Publié: (2025)
EventGround: Narrative Reasoning by Grounding to Eventuality-centric Knowledge Graphs
par: Jiayang, Cheng, et autres
Publié: (2024)
par: Jiayang, Cheng, et autres
Publié: (2024)
DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
par: Mo, Yunxiang, et autres
Publié: (2025)
par: Mo, Yunxiang, et autres
Publié: (2025)
Negotiating States of Mind
par: Jaskov, Lena
Publié: (2025)
par: Jaskov, Lena
Publié: (2025)
SessionIntentBench: A Multi-task Inter-session Intention-shift Modeling Benchmark for E-commerce Customer Behavior Understanding
par: Yang, Yuqi, et autres
Publié: (2025)
par: Yang, Yuqi, et autres
Publié: (2025)
MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation Dataset
par: Wang, Weiqi, et autres
Publié: (2024)
par: Wang, Weiqi, et autres
Publié: (2024)
PrivLM-Bench: A Multi-level Privacy Evaluation Benchmark for Language Models
par: Li, Haoran, et autres
Publié: (2023)
par: Li, Haoran, et autres
Publié: (2023)
Legal Rule Induction: Towards Generalizable Principle Discovery from Analogous Judicial Precedents
par: Fan, Wei, et autres
Publié: (2025)
par: Fan, Wei, et autres
Publié: (2025)
CANDLE: Iterative Conceptualization and Instantiation Distillation from Large Language Models for Commonsense Reasoning
par: Wang, Weiqi, et autres
Publié: (2024)
par: Wang, Weiqi, et autres
Publié: (2024)
From Automation to Autonomy: A Survey on Large Language Models in Scientific Discovery
par: Zheng, Tianshi, et autres
Publié: (2025)
par: Zheng, Tianshi, et autres
Publié: (2025)
CLR-Fact: Evaluating the Complex Logical Reasoning Capability of Large Language Models over Factual Knowledge
par: Zheng, Tianshi, et autres
Publié: (2024)
par: Zheng, Tianshi, et autres
Publié: (2024)
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
INFERENCEDYNAMICS: Efficient Routing Across LLMs through Structured Capability and Knowledge Profiling
par: Shi, Haochen, et autres
Publié: (2025)
par: Shi, Haochen, et autres
Publié: (2025)
A Benchmark for Multi-Party Negotiation Games from Real Negotiation Data
par: Benac, Leo, et autres
Publié: (2026)
par: Benac, Leo, et autres
Publié: (2026)
Privacy Checklist: Privacy Violation Detection Grounding on Contextual Integrity Theory
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
AbsPyramid: Benchmarking the Abstraction Ability of Language Models with a Unified Entailment Graph
par: Wang, Zhaowei, et autres
Publié: (2023)
par: Wang, Zhaowei, et autres
Publié: (2023)
ECon: On the Detection and Resolution of Evidence Conflicts
par: Jiayang, Cheng, et autres
Publié: (2024)
par: Jiayang, Cheng, et autres
Publié: (2024)
Let's Negotiate! A Survey of Negotiation Dialogue Systems
par: Zhan, Haolan, et autres
Publié: (2024)
par: Zhan, Haolan, et autres
Publié: (2024)
Negotiating Asylum
Publié: (2021)
Publié: (2021)
Negotiating Migrations
par: Hofmann, Daniela, et autres
Publié: (2024)
par: Hofmann, Daniela, et autres
Publié: (2024)
Negotiating Dissidence
par: Van de Peer, Stefanie
Publié: (2023)
par: Van de Peer, Stefanie
Publié: (2023)
Negotiating the North
par: Semple, Sarah, et autres
Publié: (2020)
par: Semple, Sarah, et autres
Publié: (2020)
Documents similaires
-
Evaluating and Enhancing LLMs Agent based on Theory of Mind in Guandan: A Multi-Player Cooperative Game under Imperfect Information
par: Yim, Yauwai, et autres
Publié: (2024) -
Text-Tuple-Table: Towards Information Integration in Text-to-Table Generation via Global Tuple Extraction
par: Deng, Zheye, et autres
Publié: (2024) -
LLM-Hanabi: Evaluating Multi-Agent Gameplays with Theory-of-Mind and Rationale Inference in Imperfect Information Collaboration Game
par: Liang, Fangzhou, et autres
Publié: (2025) -
Persona Knowledge-Aligned Prompt Tuning Method for Online Debate
par: Chan, Chunkit, et autres
Publié: (2024) -
XToM: Exploring the Multilingual Theory of Mind for Large Language Models
par: Chan, Chunkit, et autres
Publié: (2025)