VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
Fuente:
arXiv
Saved in:
| Main Authors: | He, Wei, Sun, Yueqing, Hao, Hongyan, Hao, Xueyuan, Xia, Zhikang, Gu, Qi, Han, Chengcheng, Zhao, Dengchang, Su, Hui, Zhang, Kefeng, Gao, Man, Su, Xi, Cai, Xiaodong, Cai, Xunliang, Yang, Yu, Zhao, Yunke |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
by: Shi, Wentao, et al.
Published: (2026)
by: Shi, Wentao, et al.
Published: (2026)
ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training
by: Tu, Dunwei, et al.
Published: (2026)
by: Tu, Dunwei, et al.
Published: (2026)
$V_0$: A Generalist Value Model for Any Policy at State Zero
by: Zhang, Yi-Kai, et al.
Published: (2026)
by: Zhang, Yi-Kai, et al.
Published: (2026)
$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts
by: Zhang, Yi-Kai, et al.
Published: (2026)
by: Zhang, Yi-Kai, et al.
Published: (2026)
AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
by: Wang, Ruipeng, et al.
Published: (2026)
by: Wang, Ruipeng, et al.
Published: (2026)
TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training
by: Yang, Jinluan, et al.
Published: (2026)
by: Yang, Jinluan, et al.
Published: (2026)
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
by: Qin, Jiayu, et al.
Published: (2025)
by: Qin, Jiayu, et al.
Published: (2025)
C2T: A Classifier-Based Tree Construction Method in Speculative Decoding
by: Huo, Feiye, et al.
Published: (2025)
by: Huo, Feiye, et al.
Published: (2025)
ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair
by: Li, Jia, et al.
Published: (2026)
by: Li, Jia, et al.
Published: (2026)
GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
by: Li, Hongxiang, et al.
Published: (2025)
by: Li, Hongxiang, et al.
Published: (2025)
ShortcutsBench: A Large-Scale Real-world Benchmark for API-based Agents
by: Shen, Haiyang, et al.
Published: (2024)
by: Shen, Haiyang, et al.
Published: (2024)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
by: Qian, Yulei, et al.
Published: (2024)
by: Qian, Yulei, et al.
Published: (2024)
Unraveling the Mystery of Scaling Laws: Part I
by: Su, Hui, et al.
Published: (2024)
by: Su, Hui, et al.
Published: (2024)
LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
by: He, Hang, et al.
Published: (2025)
by: He, Hang, et al.
Published: (2025)
Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning
by: Zhu, Jiapeng, et al.
Published: (2026)
by: Zhu, Jiapeng, et al.
Published: (2026)
CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
by: Yao, Zhiyuan, et al.
Published: (2026)
by: Yao, Zhiyuan, et al.
Published: (2026)
OpenClawBench: Benchmarking Process-side Anomalies in Real-world Agent Execution Trajectories
by: Liu, Yibing, et al.
Published: (2026)
by: Liu, Yibing, et al.
Published: (2026)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
by: Zhao, Fei, et al.
Published: (2025)
by: Zhao, Fei, et al.
Published: (2025)
ManiSkill-HAB: A Benchmark for Low-Level Manipulation in Home Rearrangement Tasks
by: Shukla, Arth, et al.
Published: (2024)
by: Shukla, Arth, et al.
Published: (2024)
PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management
by: Zhao, Yuxuan, et al.
Published: (2026)
by: Zhao, Yuxuan, et al.
Published: (2026)
MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use
by: Liu, Wenrui, et al.
Published: (2025)
by: Liu, Wenrui, et al.
Published: (2025)
Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability
by: wang, Jiaming, et al.
Published: (2025)
by: wang, Jiaming, et al.
Published: (2025)
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
by: Zhao, Haochen, et al.
Published: (2024)
by: Zhao, Haochen, et al.
Published: (2024)
ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making
by: Dai, Liu, et al.
Published: (2025)
by: Dai, Liu, et al.
Published: (2025)
CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks
by: Fu, Lingyue, et al.
Published: (2025)
by: Fu, Lingyue, et al.
Published: (2025)
REALM-Bench: A Benchmark for Evaluating Multi-Agent Systems on Real-world, Dynamic Planning and Scheduling Tasks
by: Geng, Longling, et al.
Published: (2025)
by: Geng, Longling, et al.
Published: (2025)
Cross-Organ and Cross-Scanner Adenocarcinoma Segmentation using Rein to Fine-tune Vision Foundation Models
by: Cai, Pengzhou, et al.
Published: (2024)
by: Cai, Pengzhou, et al.
Published: (2024)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
by: Li, Hao, et al.
Published: (2026)
by: Li, Hao, et al.
Published: (2026)
Nanoscale Radiotheranostics for Cancer Treatment: From Bench to Bedside
by: Xiaodan Jiao, et al.
Published: (2024)
by: Xiaodan Jiao, et al.
Published: (2024)
Deterministic Expander Routing: Faster and More Versatile
by: Chang, Yi-Jun, et al.
Published: (2024)
by: Chang, Yi-Jun, et al.
Published: (2024)
MVISU-Bench: Benchmarking Mobile Agents for Real-World Tasks by Multi-App, Vague, Interactive, Single-App and Unethical Instructions
by: Huang, Zeyu, et al.
Published: (2025)
by: Huang, Zeyu, et al.
Published: (2025)
LastingBench: Defend Benchmarks Against Knowledge Leakage
by: Fang, Yixiong, et al.
Published: (2025)
by: Fang, Yixiong, et al.
Published: (2025)
GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection
by: Wu, Zheng, et al.
Published: (2026)
by: Wu, Zheng, et al.
Published: (2026)
PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis
by: Li, Dexiang, et al.
Published: (2026)
by: Li, Dexiang, et al.
Published: (2026)
LCO: LLM-based Constraint Optimization for Safer Agentic LLMs in Real-world Tasks
by: Wan, Jiayong, et al.
Published: (2026)
by: Wan, Jiayong, et al.
Published: (2026)
Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks
by: Bigeard, Antoine, et al.
Published: (2025)
by: Bigeard, Antoine, et al.
Published: (2025)
Enhancement of Photo‐ and Electrocatalytic H 2 O 2 Production by the Reversible Catechol‐to‐ o ‐Benzoquinone Transformation in Polydopamine
by: Yueqing Jia, et al.
Published: (2025)
by: Yueqing Jia, et al.
Published: (2025)
Constraining the Secluded and Catalyzed Annihilation Dark Matter with Fermi-LAT and Planck Data
by: Su, Yu-Hang, et al.
Published: (2025)
by: Su, Yu-Hang, et al.
Published: (2025)
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
by: Chen, Chen, et al.
Published: (2025)
by: Chen, Chen, et al.
Published: (2025)
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
by: Huang, Yao, et al.
Published: (2025)
by: Huang, Yao, et al.
Published: (2025)
Similar Items
-
AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
by: Shi, Wentao, et al.
Published: (2026) -
ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training
by: Tu, Dunwei, et al.
Published: (2026) -
$V_0$: A Generalist Value Model for Any Policy at State Zero
by: Zhang, Yi-Kai, et al.
Published: (2026) -
$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts
by: Zhang, Yi-Kai, et al.
Published: (2026) -
AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
by: Wang, Ruipeng, et al.
Published: (2026)