SAGE: A Top-Down Bottom-Up Knowledge-Grounded User Simulator for Multi-turn AGent Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Shea, Ryan, Lu, Yunan, Qiu, Liang, Yu, Zhou |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Bottom-Up and Top-Down Analysis of Values, Agendas, and Observations in Corpora and LLMs
by: Friedman, Scott E., et al.
Published: (2024)
by: Friedman, Scott E., et al.
Published: (2024)
MAGPIE: A benchmark for Multi-AGent contextual PrIvacy Evaluation
by: Juneja, Gurusha, et al.
Published: (2025)
by: Juneja, Gurusha, et al.
Published: (2025)
MAGPIE: A dataset for Multi-AGent contextual PrIvacy Evaluation
by: Juneja, Gurusha, et al.
Published: (2025)
by: Juneja, Gurusha, et al.
Published: (2025)
Top-Down or Bottom-Up? Complexity Analyses of Synchronous Multiparty Session Types
by: Udomsrirungruang, Thien, et al.
Published: (2024)
by: Udomsrirungruang, Thien, et al.
Published: (2024)
Joint Top-Down and Bottom-Up Frameworks for 3D Visual Grounding
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
When is a Bottom-Up Deterministic Tree Translation Top-Down Deterministic?
by: Maneth, Sebastian, et al.
Published: (2025)
by: Maneth, Sebastian, et al.
Published: (2025)
Holistic Automated Red Teaming for Large Language Models through Top-Down Test Case Generation and Multi-turn Interaction
by: Zhang, Jinchuan, et al.
Published: (2024)
by: Zhang, Jinchuan, et al.
Published: (2024)
AutoSpec: An Agentic Framework for Automatically Drafting Patent Specification
by: Shea, Ryan, et al.
Published: (2025)
by: Shea, Ryan, et al.
Published: (2025)
PQR: A Framework to Generate Diverse and Realistic User Queries that Elicit QA Agent Failures
by: Lu, Yunan, et al.
Published: (2026)
by: Lu, Yunan, et al.
Published: (2026)
Synthetic Users, Real Differences: an Evaluation Framework for User Simulation in Multi-Turn Conversations
by: Liu, Yu Lu, et al.
Published: (2026)
by: Liu, Yu Lu, et al.
Published: (2026)
A Fairness-Driven Method for Learning Human-Compatible Negotiation Strategies
by: Shea, Ryan, et al.
Published: (2024)
by: Shea, Ryan, et al.
Published: (2024)
SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation
by: Li, Xiaoyuan, et al.
Published: (2026)
by: Li, Xiaoyuan, et al.
Published: (2026)
SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions
by: Wang, Tianyu, et al.
Published: (2026)
by: Wang, Tianyu, et al.
Published: (2026)
LocalRQA: From Generating Data to Locally Training, Testing, and Deploying Retrieval-Augmented QA Systems
by: Yu, Xiao, et al.
Published: (2024)
by: Yu, Xiao, et al.
Published: (2024)
Is Length Really A Liability? An Evaluation of Multi-turn LLM Conversations using BoolQ
by: Neergaard, Karl, et al.
Published: (2026)
by: Neergaard, Karl, et al.
Published: (2026)
Top-Down vs. Bottom-Up Approaches for Automatic Educational Knowledge Graph Construction in CourseMapper
by: Ain, Qurat Ul, et al.
Published: (2025)
by: Ain, Qurat Ul, et al.
Published: (2025)
ConvergeWriter: Data-Driven Bottom-Up Article Construction
by: Ji, Binquan, et al.
Published: (2025)
by: Ji, Binquan, et al.
Published: (2025)
ReAGent: A Model-agnostic Feature Attribution Method for Generative Language Models
by: Zhao, Zhixue, et al.
Published: (2024)
by: Zhao, Zhixue, et al.
Published: (2024)
Bottom-Up Perspectives on AI Governance: Insights from User Reviews of AI Products
by: Pasch, Stefan
Published: (2025)
by: Pasch, Stefan
Published: (2025)
Leveraging Bottom-Up and Top-Down Attention for Few-Shot Object Detection
by: Chen, Xianyu, et al.
Published: (2020)
by: Chen, Xianyu, et al.
Published: (2020)
SMILE: Single-turn to Multi-turn Inclusive Language Expansion via ChatGPT for Mental Health Support
by: Qiu, Huachuan, et al.
Published: (2023)
by: Qiu, Huachuan, et al.
Published: (2023)
MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
by: Acikgoz, Emre Can, et al.
Published: (2025)
by: Acikgoz, Emre Can, et al.
Published: (2025)
Facilitating Multi-turn Function Calling for LLMs via Compositional Instruction Tuning
by: Chen, Mingyang, et al.
Published: (2024)
by: Chen, Mingyang, et al.
Published: (2024)
Data Augmentation of Multi-turn Psychological Dialogue via Knowledge-driven Progressive Thought Prompting
by: Jiang, Jiyue, et al.
Published: (2024)
by: Jiang, Jiyue, et al.
Published: (2024)
MIDAS: Multi-level Intent, Domain, And Slot Knowledge Distillation for Multi-turn NLU
by: Li, Yan, et al.
Published: (2024)
by: Li, Yan, et al.
Published: (2024)
GMTRouter: Personalized LLM Router over Multi-turn User Interactions
by: Xie, Encheng, et al.
Published: (2025)
by: Xie, Encheng, et al.
Published: (2025)
The Need for a Socially-Grounded Persona Framework for User Simulation
by: Venkit, Pranav Narayanan, et al.
Published: (2026)
by: Venkit, Pranav Narayanan, et al.
Published: (2026)
StoryBox: Collaborative Multi-Agent Simulation for Hybrid Bottom-Up Long-Form Story Generation Using Large Language Models
by: Chen, Zehao, et al.
Published: (2025)
by: Chen, Zehao, et al.
Published: (2025)
SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants?
by: Dou, Yao, et al.
Published: (2025)
by: Dou, Yao, et al.
Published: (2025)
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
by: Abdulhai, Marwa, et al.
Published: (2025)
by: Abdulhai, Marwa, et al.
Published: (2025)
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
by: Song, Jialin, et al.
Published: (2026)
by: Song, Jialin, et al.
Published: (2026)
SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2025)
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2025)
MultiHal: Multilingual Dataset for Knowledge-Graph Grounded Evaluation of LLM Hallucinations
by: Lavrinovics, Ernests, et al.
Published: (2025)
by: Lavrinovics, Ernests, et al.
Published: (2025)
A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations
by: Tan, Andong, et al.
Published: (2026)
by: Tan, Andong, et al.
Published: (2026)
M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs
by: Ha, Junwoo, et al.
Published: (2025)
by: Ha, Junwoo, et al.
Published: (2025)
Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models
by: Ibrahim, Lujain, et al.
Published: (2025)
by: Ibrahim, Lujain, et al.
Published: (2025)
EventGround: Narrative Reasoning by Grounding to Eventuality-centric Knowledge Graphs
by: Jiayang, Cheng, et al.
Published: (2024)
by: Jiayang, Cheng, et al.
Published: (2024)
SPASM: Stable Persona-driven Agent Simulation for Multi-turn Dialogue Generation
by: Luo, Han, et al.
Published: (2026)
by: Luo, Han, et al.
Published: (2026)
What Are They Talking About? A Benchmark of Knowledge-Grounded Discussion Summarization
by: Zhou, Weixiao, et al.
Published: (2025)
by: Zhou, Weixiao, et al.
Published: (2025)
X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates
by: Kim, Hyunjun, et al.
Published: (2025)
by: Kim, Hyunjun, et al.
Published: (2025)
Similar Items
-
Bottom-Up and Top-Down Analysis of Values, Agendas, and Observations in Corpora and LLMs
by: Friedman, Scott E., et al.
Published: (2024) -
MAGPIE: A benchmark for Multi-AGent contextual PrIvacy Evaluation
by: Juneja, Gurusha, et al.
Published: (2025) -
MAGPIE: A dataset for Multi-AGent contextual PrIvacy Evaluation
by: Juneja, Gurusha, et al.
Published: (2025) -
Top-Down or Bottom-Up? Complexity Analyses of Synchronous Multiparty Session Types
by: Udomsrirungruang, Thien, et al.
Published: (2024) -
Joint Top-Down and Bottom-Up Frameworks for 3D Visual Grounding
by: Liu, Yang, et al.
Published: (2024)