SocialBench: Sociality Evaluation of Role-Playing Conversational Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Hongzhan, Chen, Hehong, Yan, Ming, Xu, Wenshen, Gao, Xing, Shen, Weizhou, Quan, Xiaojun, Li, Chenliang, Zhang, Ji, Huang, Fei, Zhou, Jingren |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Small LLMs Are Weak Tool Learners: A Multi-LLM Agent
di: Shen, Weizhou, et al.
Pubblicazione: (2024)
di: Shen, Weizhou, et al.
Pubblicazione: (2024)
SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
di: Yang, Ziyi, et al.
Pubblicazione: (2025)
di: Yang, Ziyi, et al.
Pubblicazione: (2025)
Knowledge Distillation of Black-Box Large Language Models
di: Chen, Hongzhan, et al.
Pubblicazione: (2024)
di: Chen, Hongzhan, et al.
Pubblicazione: (2024)
PsyPlay: Personality-Infused Role-Playing Conversational Agents
di: Yang, Tao, et al.
Pubblicazione: (2025)
di: Yang, Tao, et al.
Pubblicazione: (2025)
QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
di: Wan, Fanqi, et al.
Pubblicazione: (2025)
di: Wan, Fanqi, et al.
Pubblicazione: (2025)
CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation
di: Tu, Quan, et al.
Pubblicazione: (2024)
di: Tu, Quan, et al.
Pubblicazione: (2024)
CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning
di: Lu, Zhiyuan, et al.
Pubblicazione: (2026)
di: Lu, Zhiyuan, et al.
Pubblicazione: (2026)
Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping
di: Peng, Miao, et al.
Pubblicazione: (2026)
di: Peng, Miao, et al.
Pubblicazione: (2026)
Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization
di: Gao, Shiping, et al.
Pubblicazione: (2026)
di: Gao, Shiping, et al.
Pubblicazione: (2026)
One Model, All Roles: Multi-Turn, Multi-Agent Self-Play Reinforcement Learning for Conversational Social Intelligence
di: Jiang, Bowen, et al.
Pubblicazione: (2026)
di: Jiang, Bowen, et al.
Pubblicazione: (2026)
MERRY: Semantically Decoupled Evaluation of Multimodal Emotional and Role Consistencies of Role-Playing Agents
di: Wang, Zhenyu, et al.
Pubblicazione: (2026)
di: Wang, Zhenyu, et al.
Pubblicazione: (2026)
XQSV: A Structurally Variable Network to Imitate Human Play in Xiangqi
di: Zhou, Chenliang
Pubblicazione: (2024)
di: Zhou, Chenliang
Pubblicazione: (2024)
Emerging Roles of Receptor‐Like Proteins in Plant Immunity: Crosstalk, Signalling Networks and Prospects for Disease Resistance Breeding
di: Chenfei Gao, et al.
Pubblicazione: (2025)
di: Chenfei Gao, et al.
Pubblicazione: (2025)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
di: Wang, Junyang, et al.
Pubblicazione: (2024)
di: Wang, Junyang, et al.
Pubblicazione: (2024)
LARP: Language-Agent Role Play for Open-World Games
di: Yan, Ming, et al.
Pubblicazione: (2023)
di: Yan, Ming, et al.
Pubblicazione: (2023)
Stabilizing Policy Optimization via Logits Convexity
di: Chen, Hongzhan, et al.
Pubblicazione: (2026)
di: Chen, Hongzhan, et al.
Pubblicazione: (2026)
Discriminative Policy Optimization for Token-Level Reward Models
di: Chen, Hongzhan, et al.
Pubblicazione: (2025)
di: Chen, Hongzhan, et al.
Pubblicazione: (2025)
QwenLong-CPRS: Towards $\infty$-LLMs with Dynamic Context Optimization
di: Shen, Weizhou, et al.
Pubblicazione: (2025)
di: Shen, Weizhou, et al.
Pubblicazione: (2025)
Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
di: Wang, Junyang, et al.
Pubblicazione: (2024)
di: Wang, Junyang, et al.
Pubblicazione: (2024)
GOAT-Bench: Safety Insights to Large Multimodal Models through Meme-Based Social Abuse
di: Lin, Hongzhan, et al.
Pubblicazione: (2024)
di: Lin, Hongzhan, et al.
Pubblicazione: (2024)
Mutual-Taught for Co-adapting Policy and Reward Models
di: Shi, Tianyuan, et al.
Pubblicazione: (2025)
di: Shi, Tianyuan, et al.
Pubblicazione: (2025)
QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management
di: Shen, Weizhou, et al.
Pubblicazione: (2025)
di: Shen, Weizhou, et al.
Pubblicazione: (2025)
InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psychological Interviews
di: Wang, Xintao, et al.
Pubblicazione: (2023)
di: Wang, Xintao, et al.
Pubblicazione: (2023)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
di: Luo, Fuwen, et al.
Pubblicazione: (2025)
di: Luo, Fuwen, et al.
Pubblicazione: (2025)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents
di: Zhang, Rongsheng, et al.
Pubblicazione: (2026)
di: Zhang, Rongsheng, et al.
Pubblicazione: (2026)
GenSim: A General Social Simulation Platform with Large Language Model based Agents
di: Tang, Jiakai, et al.
Pubblicazione: (2024)
di: Tang, Jiakai, et al.
Pubblicazione: (2024)
AgentSocialBench: Evaluating Privacy Risks in Human-Centered Agentic Social Networks
di: Wang, Prince Zizhuang, et al.
Pubblicazione: (2026)
di: Wang, Prince Zizhuang, et al.
Pubblicazione: (2026)
LLM-Enhanced Multiple Instance Learning for Joint Rumor and Stance Detection with Social Context Information
di: Yang, Ruichao, et al.
Pubblicazione: (2025)
di: Yang, Ruichao, et al.
Pubblicazione: (2025)
SI-Bench: Benchmarking Social Intelligence of Large Language Models in Human-to-Human Conversations
di: Huang, Shuai, et al.
Pubblicazione: (2025)
di: Huang, Shuai, et al.
Pubblicazione: (2025)
Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning
di: Lei, Xuanyu, et al.
Pubblicazione: (2025)
di: Lei, Xuanyu, et al.
Pubblicazione: (2025)
Rethinking Role-Playing Evaluation: Anonymous Benchmarking and a Systematic Study of Personality Effects
di: Peng, Ji-Lun, et al.
Pubblicazione: (2026)
di: Peng, Ji-Lun, et al.
Pubblicazione: (2026)
Explainable Ethical Assessment on Human Behaviors by Generating Conflicting Social Norms
di: Sun, Yuxi, et al.
Pubblicazione: (2025)
di: Sun, Yuxi, et al.
Pubblicazione: (2025)
SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual Worlds
di: Wang, Lei, et al.
Pubblicazione: (2024)
di: Wang, Lei, et al.
Pubblicazione: (2024)
WritingBench: A Comprehensive Benchmark for Generative Writing
di: Wu, Yuning, et al.
Pubblicazione: (2025)
di: Wu, Yuning, et al.
Pubblicazione: (2025)
Unveiling the Secrets of Engaging Conversations: Factors that Keep Users Hooked on Role-Playing Dialog Agents
di: Zhang, Shuai, et al.
Pubblicazione: (2024)
di: Zhang, Shuai, et al.
Pubblicazione: (2024)
ProFuser: Progressive Fusion of Large Language Models
di: Shi, Tianyuan, et al.
Pubblicazione: (2024)
di: Shi, Tianyuan, et al.
Pubblicazione: (2024)
SHARP: Unlocking Interactive Hallucination via Stance Transfer in Role-Playing LLMs
di: Kong, Chuyi, et al.
Pubblicazione: (2024)
di: Kong, Chuyi, et al.
Pubblicazione: (2024)
MMRole: A Comprehensive Framework for Developing and Evaluating Multimodal Role-Playing Agents
di: Dai, Yanqi, et al.
Pubblicazione: (2024)
di: Dai, Yanqi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Small LLMs Are Weak Tool Learners: A Multi-LLM Agent
di: Shen, Weizhou, et al.
Pubblicazione: (2024) -
SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
di: Yang, Ziyi, et al.
Pubblicazione: (2025) -
Knowledge Distillation of Black-Box Large Language Models
di: Chen, Hongzhan, et al.
Pubblicazione: (2024) -
PsyPlay: Personality-Infused Role-Playing Conversational Agents
di: Yang, Tao, et al.
Pubblicazione: (2025) -
QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
di: Wan, Fanqi, et al.
Pubblicazione: (2025)