Role-Playing Evaluation for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Boudouri, Yassine El, Nuninger, Walter, Alvarez, Julian, Peter, Yvan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EmoNeXt: an Adapted ConvNeXt for Facial Emotion Recognition
por: Boudouri, Yassine El, et al.
Publicado: (2025)
por: Boudouri, Yassine El, et al.
Publicado: (2025)
RPGBENCH: Evaluating Large Language Models as Role-Playing Game Engines
por: Yu, Pengfei, et al.
Publicado: (2025)
por: Yu, Pengfei, et al.
Publicado: (2025)
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
por: Wang, Zekun Moore, et al.
Publicado: (2023)
por: Wang, Zekun Moore, et al.
Publicado: (2023)
On the Decision-Making Abilities in Role-Playing using Large Language Models
por: Shen, Chenglei, et al.
Publicado: (2024)
por: Shen, Chenglei, et al.
Publicado: (2024)
Orca: Enhancing Role-Playing Abilities of Large Language Models by Integrating Personality Traits
por: Huang, Yuxuan
Publicado: (2024)
por: Huang, Yuxuan
Publicado: (2024)
RoleCraft-GLM: Advancing Personalized Role-Playing in Large Language Models
por: Tao, Meiling, et al.
Publicado: (2023)
por: Tao, Meiling, et al.
Publicado: (2023)
Moral Susceptibility and Robustness under Persona Role-Play in Large Language Models
por: Costa, Davi Bastos, et al.
Publicado: (2025)
por: Costa, Davi Bastos, et al.
Publicado: (2025)
Rehearse With User: Personalized Opinion Summarization via Role-Playing based on Large Language Models
por: Zhang, Yanyue, et al.
Publicado: (2025)
por: Zhang, Yanyue, et al.
Publicado: (2025)
LLM Discussion: Enhancing the Creativity of Large Language Models via Discussion Framework and Role-Play
por: Lu, Li-Chun, et al.
Publicado: (2024)
por: Lu, Li-Chun, et al.
Publicado: (2024)
Fine-Grained Behavior Simulation with Role-Playing Large Language Model on Social Media
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
Show, Don't Tell: Evaluating Large Language Models Beyond Textual Understanding with ChildPlay
por: de Carvalho, Gonçalo Hora, et al.
Publicado: (2024)
por: de Carvalho, Gonçalo Hora, et al.
Publicado: (2024)
The Oscars of AI Theater: A Survey on Role-Playing with Language Models
por: Chen, Nuo, et al.
Publicado: (2024)
por: Chen, Nuo, et al.
Publicado: (2024)
Evaluating the Role of Large Language Models in Legal Practice in India
por: Hemrajani, Rahul
Publicado: (2025)
por: Hemrajani, Rahul
Publicado: (2025)
Quantifying Risk Propensities of Large Language Models: Ethical Focus and Bias Detection through Role-Play
por: Zeng, Yifan, et al.
Publicado: (2024)
por: Zeng, Yifan, et al.
Publicado: (2024)
VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing
por: Xu, Jiacheng, et al.
Publicado: (2026)
por: Xu, Jiacheng, et al.
Publicado: (2026)
Evaluating Contrast Localizer for Identifying Causal Units in Social & Mathematical Tasks in Language Models
por: Jamaa, Yassine, et al.
Publicado: (2025)
por: Jamaa, Yassine, et al.
Publicado: (2025)
Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends
por: Wang, Ye, et al.
Publicado: (2026)
por: Wang, Ye, et al.
Publicado: (2026)
Role-Play Zero-Shot Prompting with Large Language Models for Open-Domain Human-Machine Conversation
por: Njifenjou, Ahmed, et al.
Publicado: (2024)
por: Njifenjou, Ahmed, et al.
Publicado: (2024)
Credence Calibration Game? Calibrating Large Language Models through Structured Play
por: Fang, Ke, et al.
Publicado: (2025)
por: Fang, Ke, et al.
Publicado: (2025)
Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation
por: Jain, Daksh, et al.
Publicado: (2025)
por: Jain, Daksh, et al.
Publicado: (2025)
Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models
por: Cao, Jiaqi, et al.
Publicado: (2025)
por: Cao, Jiaqi, et al.
Publicado: (2025)
Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
por: Deng, Yang, et al.
Publicado: (2023)
por: Deng, Yang, et al.
Publicado: (2023)
Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models
por: Shah, Arya, et al.
Publicado: (2026)
por: Shah, Arya, et al.
Publicado: (2026)
From Persona to Personalization: A Survey on Role-Playing Language Agents
por: Chen, Jiangjie, et al.
Publicado: (2024)
por: Chen, Jiangjie, et al.
Publicado: (2024)
Evaluating LLM-Generated Versus Human-Authored Responses in Role-Play Dialogues
por: Lu, Dongxu, et al.
Publicado: (2025)
por: Lu, Dongxu, et al.
Publicado: (2025)
Memory-Driven Role-Playing: Evaluation and Enhancement of Persona Knowledge Utilization in LLMs
por: Wang, Kai, et al.
Publicado: (2026)
por: Wang, Kai, et al.
Publicado: (2026)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
por: Fang, Wenkai, et al.
Publicado: (2025)
por: Fang, Wenkai, et al.
Publicado: (2025)
VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents
por: Wu, Weihao, et al.
Publicado: (2025)
por: Wu, Weihao, et al.
Publicado: (2025)
The Roles of English in Evaluating Multilingual Language Models
por: Poelman, Wessel, et al.
Publicado: (2024)
por: Poelman, Wessel, et al.
Publicado: (2024)
CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual Worlds
por: Wang, Lei, et al.
Publicado: (2024)
por: Wang, Lei, et al.
Publicado: (2024)
DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents
por: Zhang, Rongsheng, et al.
Publicado: (2026)
por: Zhang, Rongsheng, et al.
Publicado: (2026)
Rethinking Role-Playing Evaluation: Anonymous Benchmarking and a Systematic Study of Personality Effects
por: Peng, Ji-Lun, et al.
Publicado: (2026)
por: Peng, Ji-Lun, et al.
Publicado: (2026)
Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play
por: Shi, Yemin, et al.
Publicado: (2025)
por: Shi, Yemin, et al.
Publicado: (2025)
GameTraversalBenchmark: Evaluating Planning Abilities Of Large Language Models Through Traversing 2D Game Maps
por: Nasir, Muhammad Umair, et al.
Publicado: (2024)
por: Nasir, Muhammad Umair, et al.
Publicado: (2024)
BaiJia: A Large-Scale Role-Playing Agent Corpus of Chinese Historical Characters
por: Bai, Ting, et al.
Publicado: (2024)
por: Bai, Ting, et al.
Publicado: (2024)
Unplug and Play Language Models: Decomposing Experts in Language Models at Inference Time
por: Yang, Nakyeong, et al.
Publicado: (2024)
por: Yang, Nakyeong, et al.
Publicado: (2024)
Evaluating Quantized Large Language Models
por: Li, Shiyao, et al.
Publicado: (2024)
por: Li, Shiyao, et al.
Publicado: (2024)
Analyzing the Role of Semantic Representations in the Era of Large Language Models
por: Jin, Zhijing, et al.
Publicado: (2024)
por: Jin, Zhijing, et al.
Publicado: (2024)
LLM-KT: Aligning Large Language Models with Knowledge Tracing using a Plug-and-Play Instruction
por: Wang, Ziwei, et al.
Publicado: (2025)
por: Wang, Ziwei, et al.
Publicado: (2025)
SPFT-SQL: Enhancing Large Language Model for Text-to-SQL Parsing by Self-Play Fine-Tuning
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
Ejemplares similares
-
EmoNeXt: an Adapted ConvNeXt for Facial Emotion Recognition
por: Boudouri, Yassine El, et al.
Publicado: (2025) -
RPGBENCH: Evaluating Large Language Models as Role-Playing Game Engines
por: Yu, Pengfei, et al.
Publicado: (2025) -
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
por: Wang, Zekun Moore, et al.
Publicado: (2023) -
On the Decision-Making Abilities in Role-Playing using Large Language Models
por: Shen, Chenglei, et al.
Publicado: (2024) -
Orca: Enhancing Role-Playing Abilities of Large Language Models by Integrating Personality Traits
por: Huang, Yuxuan
Publicado: (2024)