SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Zixiang, Wang, Yanbo, Huang, Yue, Ye, Jiayi, Zhuang, Haomin, Song, Zirui, Gao, Lang, Wang, Chenxi, Chen, Zhaorun, Zhou, Yujun, Li, Sixian, Pan, Wang, Zhao, Yue, Zhao, Jieyu, Zhang, Xiangliang, Chen, Xiuying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DyFlow: Dynamic Workflow Framework for Agentic Reasoning
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
Under the Shadow of Babel: How Language Shapes Reasoning in LLMs
di: Wang, Chenxi, et al.
Pubblicazione: (2025)
di: Wang, Chenxi, et al.
Pubblicazione: (2025)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
di: Bao, Han, et al.
Pubblicazione: (2024)
di: Bao, Han, et al.
Pubblicazione: (2024)
Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
Social Science Meets LLMs: How Reliable Are Large Language Models in Social Simulations?
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
Evaluate Bias without Manual Test Sets: A Concept Representation Perspective for LLMs
di: Gao, Lang, et al.
Pubblicazione: (2025)
di: Gao, Lang, et al.
Pubblicazione: (2025)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs
di: Huang, Yue, et al.
Pubblicazione: (2026)
di: Huang, Yue, et al.
Pubblicazione: (2026)
Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
Dissecting Logical Reasoning in LLMs: A Fine-Grained Evaluation and Supervision Study
di: Zhou, Yujun, et al.
Pubblicazione: (2025)
di: Zhou, Yujun, et al.
Pubblicazione: (2025)
Dual Optimal: Make Your LLM Peer-like with Dignity
di: Wang, Xiangqi, et al.
Pubblicazione: (2026)
di: Wang, Xiangqi, et al.
Pubblicazione: (2026)
Beyond Single-Value Metrics: Evaluating and Enhancing LLM Unlearning with Cognitive Diagnosis
di: Lang, Yicheng, et al.
Pubblicazione: (2025)
di: Lang, Yicheng, et al.
Pubblicazione: (2025)
Decoding Echo Chambers: LLM-Powered Simulations Revealing Polarization in Social Networks
di: Wang, Chenxi, et al.
Pubblicazione: (2024)
di: Wang, Chenxi, et al.
Pubblicazione: (2024)
Word Form Matters: LLMs' Semantic Reconstruction under Typoglycemia
di: Wang, Chenxi, et al.
Pubblicazione: (2025)
di: Wang, Chenxi, et al.
Pubblicazione: (2025)
Exploring Multi-Temperature Strategies for Token- and Rollout-Level Control in RLVR
di: Zhuang, Haomin, et al.
Pubblicazione: (2025)
di: Zhuang, Haomin, et al.
Pubblicazione: (2025)
AIRGuard: Guarding Agent Actions with Runtime Authority Control
di: Qin, Suliu, et al.
Pubblicazione: (2026)
di: Qin, Suliu, et al.
Pubblicazione: (2026)
Do LLMs "Feel"? Emotion Circuits Discovery and Control
di: Wang, Chenxi, et al.
Pubblicazione: (2025)
di: Wang, Chenxi, et al.
Pubblicazione: (2025)
Evaluating and Mitigating Bias in AI-Based Medical Text Generation
di: Chen, Xiuying, et al.
Pubblicazione: (2025)
di: Chen, Xiuying, et al.
Pubblicazione: (2025)
AgentClick: A Skill-Based Human-in-the-Loop Review Layer for Terminal AI Agents
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
Reliable Control-Point Selection for Steering Reasoning in Large Language Models
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
Choosing Among Undesirable Options: Children Consider Desirability of Available Choices in Evaluation of Socially Mindful Actions
di: Sixian Li, et al.
Pubblicazione: (2024)
di: Sixian Li, et al.
Pubblicazione: (2024)
Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression
di: Zeng, Lingjie, et al.
Pubblicazione: (2026)
di: Zeng, Lingjie, et al.
Pubblicazione: (2026)
Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models
di: Gao, Lang, et al.
Pubblicazione: (2024)
di: Gao, Lang, et al.
Pubblicazione: (2024)
SenseMath: Do LLMs Have Number Sense? Evaluating Shortcut Use, Judgment, and Generation
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
Emergent Social Intelligence Risks in Generative Multi-Agent Systems
di: Huang, Yue, et al.
Pubblicazione: (2026)
di: Huang, Yue, et al.
Pubblicazione: (2026)
ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
Defending Jailbreak Prompts via In-Context Adversarial Game
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
BioMaze: Benchmarking and Enhancing Large Language Models for Biological Pathway Reasoning
di: Zhao, Haiteng, et al.
Pubblicazione: (2025)
di: Zhao, Haiteng, et al.
Pubblicazione: (2025)
Achieving Social Optimum and Budget Balance via a Joint Electricity-Carbon Pricing Mechanism
di: Chen, Yue, et al.
Pubblicazione: (2023)
di: Chen, Yue, et al.
Pubblicazione: (2023)
Causally-Enhanced Reinforcement Policy Optimization
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
di: Huang, Yue, et al.
Pubblicazione: (2025)
di: Huang, Yue, et al.
Pubblicazione: (2025)
ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services
di: Ji, Fengxian, et al.
Pubblicazione: (2026)
di: Ji, Fengxian, et al.
Pubblicazione: (2026)
My Favorite Streamer is an LLM: Discovering, Bonding, and Co-Creating in AI VTuber Fandom
di: Ye, Jiayi, et al.
Pubblicazione: (2025)
di: Ye, Jiayi, et al.
Pubblicazione: (2025)
Digital Exclusion and Health Literacy Among Older Adults: The Mediating Effects of Social Support and Self‐Efficacy
di: Chenxi Zhou, et al.
Pubblicazione: (2025)
di: Chenxi Zhou, et al.
Pubblicazione: (2025)
ChemOrch: Empowering LLMs with Chemical Intelligence via Synthetic Instructions
di: Huang, Yue, et al.
Pubblicazione: (2025)
di: Huang, Yue, et al.
Pubblicazione: (2025)
Rethinking Scientific Summarization Evaluation: Grounding Explainable Metrics on Facet-aware Benchmark
di: Chen, Xiuying, et al.
Pubblicazione: (2024)
di: Chen, Xiuying, et al.
Pubblicazione: (2024)
Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence
di: Song, Linxin, et al.
Pubblicazione: (2026)
di: Song, Linxin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DyFlow: Dynamic Workflow Framework for Agentic Reasoning
di: Wang, Yanbo, et al.
Pubblicazione: (2025) -
Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models
di: Xu, Zixiang, et al.
Pubblicazione: (2025) -
Under the Shadow of Babel: How Language Shapes Reasoning in LLMs
di: Wang, Chenxi, et al.
Pubblicazione: (2025) -
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
di: Bao, Han, et al.
Pubblicazione: (2024) -
Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search
di: Wang, Yanbo, et al.
Pubblicazione: (2025)