EscapeBench: Towards Advancing Creative Intelligence of Language Model Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Qian, Cheng, Han, Peixuan, Luo, Qinyu, He, Bingxiang, Chen, Xiusi, Zhang, Yuji, Du, Hongyi, Yao, Jiarui, Yang, Xiaocheng, Zhang, Denghui, Li, Yunzhu, Ji, Heng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals
by: Han, Peixuan, et al.
Published: (2025)
by: Han, Peixuan, et al.
Published: (2025)
Current Agents Fail to Leverage World Model as Tool for Foresight
by: Qian, Cheng, et al.
Published: (2026)
by: Qian, Cheng, et al.
Published: (2026)
CreativityBench: Evaluating Agent Creative Reasoning via Affordance-Based Tool Repurposing
by: Qian, Cheng, et al.
Published: (2026)
by: Qian, Cheng, et al.
Published: (2026)
DecisionFlow: Advancing Large Language Model as Principled Decision Maker
by: Chen, Xiusi, et al.
Published: (2025)
by: Chen, Xiusi, et al.
Published: (2025)
Veri-R1: Toward Precise and Faithful Claim Verification via Online Reinforcement Learning
by: He, Qi, et al.
Published: (2025)
by: He, Qi, et al.
Published: (2025)
ModelingAgent: Bridging LLMs and Mathematical Modeling for Real-World Challenges
by: Qian, Cheng, et al.
Published: (2025)
by: Qian, Cheng, et al.
Published: (2025)
MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents
by: Zhu, Kunlun, et al.
Published: (2025)
by: Zhu, Kunlun, et al.
Published: (2025)
Toward Suppliers' Green Innovation: The Role of Buyers' Environmental Information Disclosure
by: Bingxiang Li, et al.
Published: (2025)
by: Bingxiang Li, et al.
Published: (2025)
RM-R1: Reward Modeling as Reasoning
by: Chen, Xiusi, et al.
Published: (2025)
by: Chen, Xiusi, et al.
Published: (2025)
Executable Code Actions Elicit Better LLM Agents
by: Wang, Xingyao, et al.
Published: (2024)
by: Wang, Xingyao, et al.
Published: (2024)
Aegis:An Advanced LLM-Based Multi-Agent for Intelligent Functional Safety Engineering
by: Shi, Lu, et al.
Published: (2024)
by: Shi, Lu, et al.
Published: (2024)
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
by: Ji, Haonian, et al.
Published: (2025)
by: Ji, Haonian, et al.
Published: (2025)
Advances in Artificial Intelligence: A Review for the Creative Industries
by: Anantrasirichai, Nantheera, et al.
Published: (2025)
by: Anantrasirichai, Nantheera, et al.
Published: (2025)
Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
by: Sun, Chenkai, et al.
Published: (2025)
by: Sun, Chenkai, et al.
Published: (2025)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
by: Liu, Jiayu, et al.
Published: (2025)
by: Liu, Jiayu, et al.
Published: (2025)
Atomic Reasoning for Scientific Table Claim Verification
by: Zhang, Yuji, et al.
Published: (2025)
by: Zhang, Yuji, et al.
Published: (2025)
Beyond Sample-Level Feedback: Using Reference-Level Feedback to Guide Data Synthesis
by: Mehri, Shuhaib, et al.
Published: (2025)
by: Mehri, Shuhaib, et al.
Published: (2025)
SMART: Self-Aware Agent for Tool Overuse Mitigation
by: Qian, Cheng, et al.
Published: (2025)
by: Qian, Cheng, et al.
Published: (2025)
A Desideratum for Conversational Agents: Capabilities, Challenges, and Future Directions
by: Acikgoz, Emre Can, et al.
Published: (2025)
by: Acikgoz, Emre Can, et al.
Published: (2025)
UserBench: An Interactive Gym Environment for User-Centric Agents
by: Qian, Cheng, et al.
Published: (2025)
by: Qian, Cheng, et al.
Published: (2025)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
by: Guo, Zhengkang, et al.
Published: (2026)
by: Guo, Zhengkang, et al.
Published: (2026)
Autonomous Agents for Scientific Discovery: Orchestrating Scientists, Language, Code, and Physics
by: Zhou, Lianhao, et al.
Published: (2025)
by: Zhou, Lianhao, et al.
Published: (2025)
BuilderBench: The Building Blocks of Intelligent Agents
by: Ghugare, Raj, et al.
Published: (2025)
by: Ghugare, Raj, et al.
Published: (2025)
oMeBench: Towards Robust Benchmarking of LLMs in Organic Mechanism Elucidation and Reasoning
by: Xu, Ruiling, et al.
Published: (2025)
by: Xu, Ruiling, et al.
Published: (2025)
Which LLM Multi-Agent Protocol to Choose?
by: Du, Hongyi, et al.
Published: (2025)
by: Du, Hongyi, et al.
Published: (2025)
PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning
by: Li, Bingxuan, et al.
Published: (2026)
by: Li, Bingxuan, et al.
Published: (2026)
PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent
by: Nie, Hongyi, et al.
Published: (2026)
by: Nie, Hongyi, et al.
Published: (2026)
Treatment of abdominal migraine in an 8‐year‐old child with calcitonin gene‐related peptide receptor antagonist: A case report
by: Yunzhu Tang, et al.
Published: (2025)
by: Yunzhu Tang, et al.
Published: (2025)
Toward Greater Autonomy in Materials Discovery Agents: Unifying Planning, Physics, and Scientists
by: Zhou, Lianhao, et al.
Published: (2025)
by: Zhou, Lianhao, et al.
Published: (2025)
GuessBench: Sensemaking Multimodal Creativity in the Wild
by: Zhu, Zifeng, et al.
Published: (2025)
by: Zhu, Zifeng, et al.
Published: (2025)
Creative Agents: Empowering Agents with Imagination for Creative Tasks
by: Cai, Penglin, et al.
Published: (2023)
by: Cai, Penglin, et al.
Published: (2023)
Augmenting Interface Usability Heuristics for Reliable Computer-Use Agents
by: Liu, Jiateng, et al.
Published: (2026)
by: Liu, Jiateng, et al.
Published: (2026)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
by: Liu, Xiao, et al.
Published: (2024)
by: Liu, Xiao, et al.
Published: (2024)
Sensitivity Meets Sparsity: The Impact of Extremely Sparse Parameter Patterns on Theory-of-Mind of Large Language Models
by: Wu, Yuheng, et al.
Published: (2025)
by: Wu, Yuheng, et al.
Published: (2025)
OSExpert: Computer-Use Agents Learning Professional Skills via Exploration
by: Liu, Jiateng, et al.
Published: (2026)
by: Liu, Jiateng, et al.
Published: (2026)
Tell Me More! Towards Implicit User Intention Understanding of Language Model Driven Agents
by: Qian, Cheng, et al.
Published: (2024)
by: Qian, Cheng, et al.
Published: (2024)
ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation
by: Liu, Yinuo, et al.
Published: (2026)
by: Liu, Yinuo, et al.
Published: (2026)
InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?
by: Wang, Qiyao, et al.
Published: (2026)
by: Wang, Qiyao, et al.
Published: (2026)
Dynamic 3D Gaussian Tracking for Graph-Based Neural Dynamics Modeling
by: Zhang, Mingtong, et al.
Published: (2024)
by: Zhang, Mingtong, et al.
Published: (2024)
EHR Interaction Between Patients and AI: NoteAid EHR Interaction
by: Zhang, Xiaocheng, et al.
Published: (2023)
by: Zhang, Xiaocheng, et al.
Published: (2023)
Similar Items
-
SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals
by: Han, Peixuan, et al.
Published: (2025) -
Current Agents Fail to Leverage World Model as Tool for Foresight
by: Qian, Cheng, et al.
Published: (2026) -
CreativityBench: Evaluating Agent Creative Reasoning via Affordance-Based Tool Repurposing
by: Qian, Cheng, et al.
Published: (2026) -
DecisionFlow: Advancing Large Language Model as Principled Decision Maker
by: Chen, Xiusi, et al.
Published: (2025) -
Veri-R1: Toward Precise and Faithful Claim Verification via Online Reinforcement Learning
by: He, Qi, et al.
Published: (2025)