TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent
Fuente:
arXiv
Guardado en:
| Autores principales: | Sui, Xingyu, Zhao, Yanyan, Hu, Yulin, Guo, Jiahe, Zhao, Weixiang, Qin, Bing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents
por: Hu, Yulin, et al.
Publicado: (2026)
por: Hu, Yulin, et al.
Publicado: (2026)
When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
por: Guo, Jiahe, et al.
Publicado: (2026)
por: Guo, Jiahe, et al.
Publicado: (2026)
Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support Agents
por: Fu, Xing, et al.
Publicado: (2026)
por: Fu, Xing, et al.
Publicado: (2026)
Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
Learning to Learn from Multimodal Experience
por: Sui, Xingyu, et al.
Publicado: (2026)
por: Sui, Xingyu, et al.
Publicado: (2026)
Chain of Strategy Optimization Makes Large Language Models Better Emotional Supporter
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction
por: Guo, Jiahe, et al.
Publicado: (2026)
por: Guo, Jiahe, et al.
Publicado: (2026)
AgentOrchestra: Orchestrating Multi-Agent Intelligence with the Tool-Environment-Agent(TEA) Protocol
por: Zhang, Wentao, et al.
Publicado: (2025)
por: Zhang, Wentao, et al.
Publicado: (2025)
Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
Lens: Rethinking Multilingual Enhancement for Large Language Models
por: Zhao, Weixiang, et al.
Publicado: (2024)
por: Zhao, Weixiang, et al.
Publicado: (2024)
Benchmark Health Index: A Systematic Framework for Benchmarking the Benchmarks of LLMs
por: Zhu, Longyuan, et al.
Publicado: (2026)
por: Zhu, Longyuan, et al.
Publicado: (2026)
M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark
por: Zhou, Yang, et al.
Publicado: (2025)
por: Zhou, Yang, et al.
Publicado: (2025)
HEART: A Unified Benchmark for Assessing Humans and LLMs in Emotional Support Dialogue
por: Iyer, Laya, et al.
Publicado: (2026)
por: Iyer, Laya, et al.
Publicado: (2026)
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
por: Zhao, Weixiang, et al.
Publicado: (2024)
por: Zhao, Weixiang, et al.
Publicado: (2024)
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
por: Li, Xuzhao, et al.
Publicado: (2025)
por: Li, Xuzhao, et al.
Publicado: (2025)
IntentionESC: An Intention-Centered Framework for Enhancing Emotional Support in Dialogue Systems
por: Zhang, Xinjie, et al.
Publicado: (2025)
por: Zhang, Xinjie, et al.
Publicado: (2025)
EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents
por: Liu, Yunqi, et al.
Publicado: (2026)
por: Liu, Yunqi, et al.
Publicado: (2026)
GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis
por: Yu, Bo, et al.
Publicado: (2026)
por: Yu, Bo, et al.
Publicado: (2026)
MoodBench 1.0: An Evaluation Benchmark for Emotional Companionship Dialogue Systems
por: Jing, Haifeng, et al.
Publicado: (2025)
por: Jing, Haifeng, et al.
Publicado: (2025)
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents
por: Qiao, Chuhan, et al.
Publicado: (2026)
por: Qiao, Chuhan, et al.
Publicado: (2026)
AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
por: Wang, Ruipeng, et al.
Publicado: (2026)
por: Wang, Ruipeng, et al.
Publicado: (2026)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
por: Deng, Yayue, et al.
Publicado: (2025)
por: Deng, Yayue, et al.
Publicado: (2025)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
por: He, Pengfei, et al.
Publicado: (2025)
por: He, Pengfei, et al.
Publicado: (2025)
CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials
por: Xu, Chengliang, et al.
Publicado: (2026)
por: Xu, Chengliang, et al.
Publicado: (2026)
FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning
por: Wang, Zeyu, et al.
Publicado: (2026)
por: Wang, Zeyu, et al.
Publicado: (2026)
ToolCritic: Detecting and Correcting Tool-Use Errors in Dialogue Systems
por: Hamad, Hassan, et al.
Publicado: (2025)
por: Hamad, Hassan, et al.
Publicado: (2025)
Emotional Support with LLM-based Empathetic Dialogue Generation
por: Wang, Shiquan, et al.
Publicado: (2025)
por: Wang, Shiquan, et al.
Publicado: (2025)
MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use
por: Liu, Wenrui, et al.
Publicado: (2025)
por: Liu, Wenrui, et al.
Publicado: (2025)
SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy
por: Xiao, Peiyao, et al.
Publicado: (2026)
por: Xiao, Peiyao, et al.
Publicado: (2026)
From Stateless to Situated: Building a Psychological World for LLM-Based Emotional Support
por: Zhao, Boning, et al.
Publicado: (2026)
por: Zhao, Boning, et al.
Publicado: (2026)
MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents
por: Zhao, Pengxiang, et al.
Publicado: (2025)
por: Zhao, Pengxiang, et al.
Publicado: (2025)
AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence
por: Lubrano, Kate M., et al.
Publicado: (2026)
por: Lubrano, Kate M., et al.
Publicado: (2026)
SWE Context Bench: A Benchmark for Context Learning in Coding
por: Zhu, Jiayuan, et al.
Publicado: (2026)
por: Zhu, Jiayuan, et al.
Publicado: (2026)
MCPToolBench++: A Large Scale AI Agent Model Context Protocol MCP Tool Use Benchmark
por: Fan, Shiqing, et al.
Publicado: (2025)
por: Fan, Shiqing, et al.
Publicado: (2025)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
por: Guo, Zhengkang, et al.
Publicado: (2026)
por: Guo, Zhengkang, et al.
Publicado: (2026)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
por: Song, Yuanyi, et al.
Publicado: (2025)
por: Song, Yuanyi, et al.
Publicado: (2025)
NuHF Claw: A Risk Constrained Cognitive Agent Framework for Human Centered Procedure Support in Digital Nuclear Control Rooms
por: Xiao, Xingyu, et al.
Publicado: (2026)
por: Xiao, Xingyu, et al.
Publicado: (2026)
Ejemplares similares
-
OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents
por: Hu, Yulin, et al.
Publicado: (2026) -
When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
por: Guo, Jiahe, et al.
Publicado: (2026) -
Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement
por: Zhao, Weixiang, et al.
Publicado: (2025) -
ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support Agents
por: Fu, Xing, et al.
Publicado: (2026) -
Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities
por: Zhao, Weixiang, et al.
Publicado: (2025)