OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Yulin, Long, Zimo, Guo, Jiahe, Sui, Xingyu, Fu, Xing, Zhao, Weixiang, Zhao, Yanyan, Qin, Bing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent
di: Sui, Xingyu, et al.
Pubblicazione: (2026)
di: Sui, Xingyu, et al.
Pubblicazione: (2026)
ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support Agents
di: Fu, Xing, et al.
Pubblicazione: (2026)
di: Fu, Xing, et al.
Pubblicazione: (2026)
Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
di: Guo, Jiahe, et al.
Pubblicazione: (2026)
di: Guo, Jiahe, et al.
Pubblicazione: (2026)
Lens: Rethinking Multilingual Enhancement for Large Language Models
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Chain of Strategy Optimization Makes Large Language Models Better Emotional Supporter
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Both Matter: Enhancing the Emotional Intelligence of Large Language Models without Compromising the General Intelligence
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
On Memory Construction and Retrieval for Personalized Conversational Agents
di: Pan, Zhuoshi, et al.
Pubblicazione: (2025)
di: Pan, Zhuoshi, et al.
Pubblicazione: (2025)
A Personalized Conversational Benchmark: Towards Simulating Personalized Conversations
di: Li, Li, et al.
Pubblicazione: (2025)
di: Li, Li, et al.
Pubblicazione: (2025)
ConflictBench: Evaluating Human-AI Conflict via Interactive and Visually Grounded Environments
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Enhancing Personality Recognition in Dialogue by Data Augmentation and Heterogeneous Conversational Graph Networks
di: Fu, Yahui, et al.
Pubblicazione: (2024)
di: Fu, Yahui, et al.
Pubblicazione: (2024)
Psychological Counseling Cannot Be Achieved Overnight: Automated Psychological Counseling Through Multi-Session Conversations
di: Wang, Junzhe, et al.
Pubblicazione: (2025)
di: Wang, Junzhe, et al.
Pubblicazione: (2025)
SAPT: A Shared Attention Framework for Parameter-Efficient Continual Learning of Large Language Models
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
CARE-Bench: A Benchmark of Diverse Client Simulations Guided by Expert Principles for Evaluating LLMs in Psychological Counseling
di: Wang, Bichen, et al.
Pubblicazione: (2025)
di: Wang, Bichen, et al.
Pubblicazione: (2025)
RKLD: Reverse KL-Divergence-based Knowledge Distillation for Unlearning Personal Information in Large Language Models
di: Wang, Bichen, et al.
Pubblicazione: (2024)
di: Wang, Bichen, et al.
Pubblicazione: (2024)
Large Language Model Agents Are Not Always Faithful Self-Evolvers
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning
di: Cheng, Xiang, et al.
Pubblicazione: (2026)
di: Cheng, Xiang, et al.
Pubblicazione: (2026)
Revealing Personality Traits: A New Benchmark Dataset for Explainable Personality Recognition on Dialogues
di: Sun, Lei, et al.
Pubblicazione: (2024)
di: Sun, Lei, et al.
Pubblicazione: (2024)
Rethinking Experience Utilization in Self-Evolving Language Model Agents
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
PrivacyBench: A Conversational Benchmark for Evaluating Privacy in Personalized AI
di: Mukhopadhyay, Srija, et al.
Pubblicazione: (2025)
di: Mukhopadhyay, Srija, et al.
Pubblicazione: (2025)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
di: Ma, Qiyao, et al.
Pubblicazione: (2026)
di: Ma, Qiyao, et al.
Pubblicazione: (2026)
GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations
di: Yang, Jingbo, et al.
Pubblicazione: (2026)
di: Yang, Jingbo, et al.
Pubblicazione: (2026)
PersonalHomeBench: Evaluating Agents in Personalized Smart Homes
di: Bharadwaj, Manasa, et al.
Pubblicazione: (2026)
di: Bharadwaj, Manasa, et al.
Pubblicazione: (2026)
From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents
di: Uddin, Md Nayem, et al.
Pubblicazione: (2026)
di: Uddin, Md Nayem, et al.
Pubblicazione: (2026)
Personalized Turn-Level User Conversation Satisfaction Benchmark
di: Wang, Zhefan, et al.
Pubblicazione: (2026)
di: Wang, Zhefan, et al.
Pubblicazione: (2026)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
On Safety Risks in Experience-Driven Self-Evolving Agents
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
Learning to Learn from Multimodal Experience
di: Sui, Xingyu, et al.
Pubblicazione: (2026)
di: Sui, Xingyu, et al.
Pubblicazione: (2026)
BenchPreS: A Benchmark for Context-Aware Personalized Preference Selectivity of Persistent-Memory LLMs
di: Yoon, Sangyeon, et al.
Pubblicazione: (2026)
di: Yoon, Sangyeon, et al.
Pubblicazione: (2026)
MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare
di: Wang, Yihao, et al.
Pubblicazione: (2026)
di: Wang, Yihao, et al.
Pubblicazione: (2026)
Crafting Personalized Agents through Retrieval-Augmented Generation on Editable Memory Graphs
di: Wang, Zheng, et al.
Pubblicazione: (2024)
di: Wang, Zheng, et al.
Pubblicazione: (2024)
Designing Memory-Augmented AR Agents for Spatiotemporal Reasoning in Personalized Task Assistance
di: Choi, Dongwook, et al.
Pubblicazione: (2025)
di: Choi, Dongwook, et al.
Pubblicazione: (2025)
PersonaLens: A Benchmark for Personalization Evaluation in Conversational AI Assistants
di: Zhao, Zheng, et al.
Pubblicazione: (2025)
di: Zhao, Zheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent
di: Sui, Xingyu, et al.
Pubblicazione: (2026) -
ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support Agents
di: Fu, Xing, et al.
Pubblicazione: (2026) -
Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment
di: Zhao, Weixiang, et al.
Pubblicazione: (2025) -
When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
di: Guo, Jiahe, et al.
Pubblicazione: (2026) -
Lens: Rethinking Multilingual Enhancement for Large Language Models
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)