TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Yuanzhe, Huang, Zisu, Wang, Zhengyuan, Tian, Muzhao, Guo, Zhengkang, Zhang, Chenyang, Zhou, Shuaiyu, Hu, Zengjie, Li, Dailin, Xu, Jingwen, Wang, Kaimin, Liu, Wenhao, Li, Tianlong, Yue, Fengpeng, Hong, Feng, Liu, Cao, Zeng, Ke |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CSSG: Measuring Code Similarity with Semantic Graphs
par: Lu, Yiyang, et autres
Publié: (2026)
par: Lu, Yiyang, et autres
Publié: (2026)
Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction
par: Tian, Muzhao, et autres
Publié: (2026)
par: Tian, Muzhao, et autres
Publié: (2026)
BatCoder: Self-Supervised Bidirectional Code-Documentation Learning via Back-Translation
par: Xu, Jingwen, et autres
Publié: (2026)
par: Xu, Jingwen, et autres
Publié: (2026)
TripTailor: A Real-World Benchmark for Personalized Travel Planning
par: Shen, Yuanzhe, et autres
Publié: (2025)
par: Shen, Yuanzhe, et autres
Publié: (2025)
RECAST: Expanding the Boundaries of LLMs' Complex Instruction Following with Multi-Constraint Data
par: Guo, Zhengkang, et autres
Publié: (2025)
par: Guo, Zhengkang, et autres
Publié: (2025)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
par: Zhang, Yibo, et autres
Publié: (2026)
par: Zhang, Yibo, et autres
Publié: (2026)
Benchmark^2: Systematic Evaluation of LLM Benchmarks
par: Qian, Qi, et autres
Publié: (2026)
par: Qian, Qi, et autres
Publié: (2026)
IntentionReasoner: Facilitating Adaptive LLM Safeguards through Intent Reasoning and Selective Query Refinement
par: Shen, Yuanzhe, et autres
Publié: (2025)
par: Shen, Yuanzhe, et autres
Publié: (2025)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
par: Gao, Zeyu, et autres
Publié: (2025)
par: Gao, Zeyu, et autres
Publié: (2025)
CookBench: A Long-Horizon Embodied Planning Benchmark for Complex Cooking Scenarios
par: Cai, Muzhen, et autres
Publié: (2025)
par: Cai, Muzhen, et autres
Publié: (2025)
LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
par: Song, Zhiheng, et autres
Publié: (2026)
par: Song, Zhiheng, et autres
Publié: (2026)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
par: Ding, Shuangrui, et autres
Publié: (2026)
par: Ding, Shuangrui, et autres
Publié: (2026)
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios
par: Meng, Jinxiang, et autres
Publié: (2026)
par: Meng, Jinxiang, et autres
Publié: (2026)
StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios
par: Wang, Sizhe, et autres
Publié: (2026)
par: Wang, Sizhe, et autres
Publié: (2026)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
par: Wu, Yao, et autres
Publié: (2026)
par: Wu, Yao, et autres
Publié: (2026)
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
par: Yang, Chenghao, et autres
Publié: (2025)
par: Yang, Chenghao, et autres
Publié: (2025)
LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios
par: Chen, Tianyu, et autres
Publié: (2026)
par: Chen, Tianyu, et autres
Publié: (2026)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
par: Qiu, Lu, et autres
Publié: (2024)
par: Qiu, Lu, et autres
Publié: (2024)
AudioMarkBench: Benchmarking Robustness of Audio Watermarking
par: Liu, Hongbin, et autres
Publié: (2024)
par: Liu, Hongbin, et autres
Publié: (2024)
S2R-Bench: A Sim-to-Real Evaluation Benchmark for Autonomous Driving
par: Wang, Li, et autres
Publié: (2025)
par: Wang, Li, et autres
Publié: (2025)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
par: Long, Xiang, et autres
Publié: (2026)
par: Long, Xiang, et autres
Publié: (2026)
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
par: Lu, Xudong, et autres
Publié: (2026)
par: Lu, Xudong, et autres
Publié: (2026)
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
par: Li, Zhang, et autres
Publié: (2026)
par: Li, Zhang, et autres
Publié: (2026)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
par: Yang, Jie, et autres
Publié: (2026)
par: Yang, Jie, et autres
Publié: (2026)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
par: Luo, Haotian, et autres
Publié: (2025)
par: Luo, Haotian, et autres
Publié: (2025)
LifeBench: A Benchmark for Long-Horizon Multi-Source Memory
par: Cheng, Zihao, et autres
Publié: (2026)
par: Cheng, Zihao, et autres
Publié: (2026)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks
par: Chen, Xueyao, et autres
Publié: (2026)
par: Chen, Xueyao, et autres
Publié: (2026)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation
par: Gong, Han, et autres
Publié: (2026)
par: Gong, Han, et autres
Publié: (2026)
ItinBench: Benchmarking Planning Across Multiple Cognitive Dimensions with Large Language Models
par: Wang, Tianlong, et autres
Publié: (2026)
par: Wang, Tianlong, et autres
Publié: (2026)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
par: Guo, Zhengkang, et autres
Publié: (2026)
par: Guo, Zhengkang, et autres
Publié: (2026)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
Eltrombopag Inhibited Liver Cancer by Enhancing SMYD4 Protein Degradationvia TRIP12 Ubiquitinase
par: Jiale Li, et autres
Publié: (2025)
par: Jiale Li, et autres
Publié: (2025)
SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascading
par: Shen, Yuanzhe, et autres
Publié: (2025)
par: Shen, Yuanzhe, et autres
Publié: (2025)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
par: Li, Keyu, et autres
Publié: (2026)
par: Li, Keyu, et autres
Publié: (2026)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
par: Shi, Yuzhen, et autres
Publié: (2026)
par: Shi, Yuzhen, et autres
Publié: (2026)
RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation
par: Wang, Yanli, et autres
Publié: (2024)
par: Wang, Yanli, et autres
Publié: (2024)
Documents similaires
-
CSSG: Measuring Code Similarity with Semantic Graphs
par: Lu, Yiyang, et autres
Publié: (2026) -
Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction
par: Tian, Muzhao, et autres
Publié: (2026) -
BatCoder: Self-Supervised Bidirectional Code-Documentation Learning via Back-Translation
par: Xu, Jingwen, et autres
Publié: (2026) -
TripTailor: A Real-World Benchmark for Personalized Travel Planning
par: Shen, Yuanzhe, et autres
Publié: (2025) -
RECAST: Expanding the Boundaries of LLMs' Complex Instruction Following with Multi-Constraint Data
par: Guo, Zhengkang, et autres
Publié: (2025)