Towards Objectively Benchmarking Social Intelligence for Language Agents at Action Level
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Chenxu, Dai, Bin, Liu, Huaping, Wang, Baoyuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SocialVeil: Probing Social Intelligence of Language Agents under Communication Barriers
di: Xuan, Keyang, et al.
Pubblicazione: (2026)
di: Xuan, Keyang, et al.
Pubblicazione: (2026)
Towards Robust Deep Reinforcement Learning against Environmental State Perturbation
di: Wang, Chenxu, et al.
Pubblicazione: (2025)
di: Wang, Chenxu, et al.
Pubblicazione: (2025)
DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle
di: Lei, Fangyu, et al.
Pubblicazione: (2025)
di: Lei, Fangyu, et al.
Pubblicazione: (2025)
Token-Level Uncertainty-Aware Objective for Language Model Post-Training
di: Liu, Tingkai, et al.
Pubblicazione: (2025)
di: Liu, Tingkai, et al.
Pubblicazione: (2025)
Towards Collaborative Intelligence: Propagating Intentions and Reasoning for Multi-Agent Coordination with Large Language Models
di: Qiu, Xihe, et al.
Pubblicazione: (2024)
di: Qiu, Xihe, et al.
Pubblicazione: (2024)
SDPO: Segment-Level Direct Preference Optimization for Social Agents
di: Kong, Aobo, et al.
Pubblicazione: (2025)
di: Kong, Aobo, et al.
Pubblicazione: (2025)
A Proactive Multi-Agent Dialogue Framework for Assessing Social Language Disorder Traits in Autism
di: Hu, Chuanbo, et al.
Pubblicazione: (2026)
di: Hu, Chuanbo, et al.
Pubblicazione: (2026)
MetaAligner: Towards Generalizable Multi-Objective Alignment of Language Models
di: Yang, Kailai, et al.
Pubblicazione: (2024)
di: Yang, Kailai, et al.
Pubblicazione: (2024)
ANGO: A Next-Level Evaluation Benchmark For Generation-Oriented Language Models In Chinese Domain
di: Wang, Bingchao
Pubblicazione: (2024)
di: Wang, Bingchao
Pubblicazione: (2024)
EgoSocialArena: Benchmarking the Social Intelligence of Large Language Models from a First-person Perspective
di: Hou, Guiyang, et al.
Pubblicazione: (2024)
di: Hou, Guiyang, et al.
Pubblicazione: (2024)
Empowering Large Language Model Agents through Action Learning
di: Zhao, Haiteng, et al.
Pubblicazione: (2024)
di: Zhao, Haiteng, et al.
Pubblicazione: (2024)
Mobile-MMLU: A Mobile Intelligence Language Understanding Benchmark
di: Bsharat, Sondos Mahmoud, et al.
Pubblicazione: (2025)
di: Bsharat, Sondos Mahmoud, et al.
Pubblicazione: (2025)
SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents
di: Zhou, Xuhui, et al.
Pubblicazione: (2023)
di: Zhou, Xuhui, et al.
Pubblicazione: (2023)
Characteristic AI Agents via Large Language Models
di: Wang, Xi, et al.
Pubblicazione: (2024)
di: Wang, Xi, et al.
Pubblicazione: (2024)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
di: Deng, Shihan, et al.
Pubblicazione: (2024)
di: Deng, Shihan, et al.
Pubblicazione: (2024)
Towards Adaptive Mechanism Activation in Language Agent
di: Huang, Ziyang, et al.
Pubblicazione: (2024)
di: Huang, Ziyang, et al.
Pubblicazione: (2024)
A Multi-Task Role-Playing Agent Capable of Imitating Character Linguistic Styles
di: Chen, Siyuan, et al.
Pubblicazione: (2024)
di: Chen, Siyuan, et al.
Pubblicazione: (2024)
HarmonyGuard: Toward Safety and Utility in Web Agents via Adaptive Policy Enhancement and Dual-Objective Optimization
di: Chen, Yurun, et al.
Pubblicazione: (2025)
di: Chen, Yurun, et al.
Pubblicazione: (2025)
Probabilistic Modeling of Intentions in Socially Intelligent LLM Agents
di: Xia, Feifan, et al.
Pubblicazione: (2025)
di: Xia, Feifan, et al.
Pubblicazione: (2025)
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
di: Wang, Shouju, et al.
Pubblicazione: (2026)
di: Wang, Shouju, et al.
Pubblicazione: (2026)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
di: Hu, He, et al.
Pubblicazione: (2025)
di: Hu, He, et al.
Pubblicazione: (2025)
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
di: Xu, Weikai, et al.
Pubblicazione: (2025)
di: Xu, Weikai, et al.
Pubblicazione: (2025)
Extracting Training Dialogue Data from Large Language Model based Task Bots
di: Zhang, Shuo, et al.
Pubblicazione: (2026)
di: Zhang, Shuo, et al.
Pubblicazione: (2026)
ReachAgent: Enhancing Mobile Agent via Page Reaching and Operation
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
di: Li, Junlong, et al.
Pubblicazione: (2025)
di: Li, Junlong, et al.
Pubblicazione: (2025)
Thought-Path Contrastive Learning via Premise-Oriented Data Augmentation for Logical Reading Comprehension
di: Wang, Chenxu, et al.
Pubblicazione: (2024)
di: Wang, Chenxu, et al.
Pubblicazione: (2024)
EscapeBench: Towards Advancing Creative Intelligence of Language Model Agents
di: Qian, Cheng, et al.
Pubblicazione: (2024)
di: Qian, Cheng, et al.
Pubblicazione: (2024)
Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
di: Qi, Yunjia, et al.
Pubblicazione: (2025)
di: Qi, Yunjia, et al.
Pubblicazione: (2025)
D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
di: Chen, Sen, et al.
Pubblicazione: (2025)
di: Chen, Sen, et al.
Pubblicazione: (2025)
SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades
di: Lam, Man Ho, et al.
Pubblicazione: (2026)
di: Lam, Man Ho, et al.
Pubblicazione: (2026)
Humanity in AI: Detecting the Personality of Large Language Models
di: Zhan, Baohua, et al.
Pubblicazione: (2024)
di: Zhan, Baohua, et al.
Pubblicazione: (2024)
DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory
di: Wang, Yutong, et al.
Pubblicazione: (2024)
di: Wang, Yutong, et al.
Pubblicazione: (2024)
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
di: Ye, Fangda, et al.
Pubblicazione: (2026)
di: Ye, Fangda, et al.
Pubblicazione: (2026)
Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning
di: Luo, Qi, et al.
Pubblicazione: (2025)
di: Luo, Qi, et al.
Pubblicazione: (2025)
Level-Navi Agent: A Framework and benchmark for Chinese Web Search Agents
di: Hu, Chuanrui, et al.
Pubblicazione: (2024)
di: Hu, Chuanrui, et al.
Pubblicazione: (2024)
MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs
di: Hsu, Hsin-Ling, et al.
Pubblicazione: (2026)
di: Hsu, Hsin-Ling, et al.
Pubblicazione: (2026)
TestAgent: Automatic Benchmarking and Exploratory Interaction for Evaluating LLMs in Vertical Domains
di: Wang, Wanying, et al.
Pubblicazione: (2024)
di: Wang, Wanying, et al.
Pubblicazione: (2024)
A Survey on Large Language Model-Based Social Agents in Game-Theoretic Scenarios
di: Feng, Xiachong, et al.
Pubblicazione: (2024)
di: Feng, Xiachong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SocialVeil: Probing Social Intelligence of Language Agents under Communication Barriers
di: Xuan, Keyang, et al.
Pubblicazione: (2026) -
Towards Robust Deep Reinforcement Learning against Environmental State Perturbation
di: Wang, Chenxu, et al.
Pubblicazione: (2025) -
DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle
di: Lei, Fangyu, et al.
Pubblicazione: (2025) -
Token-Level Uncertainty-Aware Objective for Language Model Post-Training
di: Liu, Tingkai, et al.
Pubblicazione: (2025) -
Towards Collaborative Intelligence: Propagating Intentions and Reasoning for Multi-Agent Coordination with Large Language Models
di: Qiu, Xihe, et al.
Pubblicazione: (2024)