MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
Fuente:
arXiv
Guardado en:
| Autores principales: | Song, Zhiheng, Zhang, Jingshuai, Qin, Chuan, Wang, Chao, Chen, Chao, Xu, Longfei, Liu, Kaikui, Chu, Xiangxiang, Zhu, Hengshu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DSFNet: Learning Disentangled Scenario Factorization for Multi-Scenario Route Ranking
por: Yu, Jiahao, et al.
Publicado: (2024)
por: Yu, Jiahao, et al.
Publicado: (2024)
GenMRP: A Generative Multi-Route Planning Framework for Efficient and Personalized Real-Time Industrial Navigation
por: Wang, Chengzhang, et al.
Publicado: (2026)
por: Wang, Chengzhang, et al.
Publicado: (2026)
Towards Full Candidate Interaction: A Comprehensive Comparison Network for Better Route Recommendation
por: Guo, Hanyu, et al.
Publicado: (2025)
por: Guo, Hanyu, et al.
Publicado: (2025)
SCASRec: A Self-Correcting and Auto-Stopping Model for Generative Route List Recommendation
por: Chen, Chao, et al.
Publicado: (2026)
por: Chen, Chao, et al.
Publicado: (2026)
IntTravel: A Real-World Dataset and Generative Framework for Integrated Multi-Task Travel Recommendation
por: Yan, Huimin, et al.
Publicado: (2026)
por: Yan, Huimin, et al.
Publicado: (2026)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
por: Gao, Zeyu, et al.
Publicado: (2025)
por: Gao, Zeyu, et al.
Publicado: (2025)
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
por: Wu, Qinzhuo, et al.
Publicado: (2026)
por: Wu, Qinzhuo, et al.
Publicado: (2026)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
por: Deng, Shihan, et al.
Publicado: (2024)
por: Deng, Shihan, et al.
Publicado: (2024)
IntRR: A Framework for Integrating SID Redistribution and Length Reduction
por: Wang, Zesheng, et al.
Publicado: (2026)
por: Wang, Zesheng, et al.
Publicado: (2026)
MobileAgentBench: An Efficient and User-Friendly Benchmark for Mobile LLM Agents
por: Wang, Luyuan, et al.
Publicado: (2024)
por: Wang, Luyuan, et al.
Publicado: (2024)
MobileWorldBench: Towards Semantic World Modeling For Mobile Agents
por: Li, Shufan, et al.
Publicado: (2025)
por: Li, Shufan, et al.
Publicado: (2025)
Generative Organizational Behavior Simulation using Large Language Model based Autonomous Agents: A Holacracy Perspective
por: Zhu, Chen, et al.
Publicado: (2024)
por: Zhu, Chen, et al.
Publicado: (2024)
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
por: Lu, Xudong, et al.
Publicado: (2026)
por: Lu, Xudong, et al.
Publicado: (2026)
MVISU-Bench: Benchmarking Mobile Agents for Real-World Tasks by Multi-App, Vague, Interactive, Single-App and Unethical Instructions
por: Huang, Zeyu, et al.
Publicado: (2025)
por: Huang, Zeyu, et al.
Publicado: (2025)
Job-SDF: A Multi-Granularity Dataset for Job Skill Demand Forecasting and Benchmarking
por: Chen, Xi, et al.
Publicado: (2024)
por: Chen, Xi, et al.
Publicado: (2024)
HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Device Scenarios
por: Wang, Jun, et al.
Publicado: (2024)
por: Wang, Jun, et al.
Publicado: (2024)
Effective Probabilistic Time Series Forecasting with Fourier Adaptive Noise-Separated Diffusion
por: Wang, Xinyan, et al.
Publicado: (2025)
por: Wang, Xinyan, et al.
Publicado: (2025)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
por: Shen, Yuanzhe, et al.
Publicado: (2026)
por: Shen, Yuanzhe, et al.
Publicado: (2026)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
por: Qiu, Lu, et al.
Publicado: (2024)
por: Qiu, Lu, et al.
Publicado: (2024)
Towards Efficient Resume Understanding: A Multi-Granularity Multi-Modal Pre-Training Approach
por: Jiang, Feihu, et al.
Publicado: (2024)
por: Jiang, Feihu, et al.
Publicado: (2024)
MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
por: Kong, Quyu, et al.
Publicado: (2025)
por: Kong, Quyu, et al.
Publicado: (2025)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
por: Zhang, Yibo, et al.
Publicado: (2026)
por: Zhang, Yibo, et al.
Publicado: (2026)
MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control
por: Lee, Juyong, et al.
Publicado: (2024)
por: Lee, Juyong, et al.
Publicado: (2024)
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
por: Xu, Weikai, et al.
Publicado: (2025)
por: Xu, Weikai, et al.
Publicado: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
por: Wu, Yao, et al.
Publicado: (2026)
por: Wu, Yao, et al.
Publicado: (2026)
KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation
por: Chen, Tongbo, et al.
Publicado: (2026)
por: Chen, Tongbo, et al.
Publicado: (2026)
MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion
por: Feng, Yunfei, et al.
Publicado: (2026)
por: Feng, Yunfei, et al.
Publicado: (2026)
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
por: Zhang, Qiaohong, et al.
Publicado: (2026)
por: Zhang, Qiaohong, et al.
Publicado: (2026)
On Supporting IP Routing in the Next Generation of Mobile Systems
por: Hellaoui, Hamed, et al.
Publicado: (2025)
por: Hellaoui, Hamed, et al.
Publicado: (2025)
IntSR: An Integrated Generative Framework for Search and Recommendation
por: Yan, Huimin, et al.
Publicado: (2025)
por: Yan, Huimin, et al.
Publicado: (2025)
VenusBench-Mobile: A Challenging and User-Centric Benchmark for Mobile GUI Agents with Capability Diagnostics
por: Gong, Yichen, et al.
Publicado: (2026)
por: Gong, Yichen, et al.
Publicado: (2026)
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
por: Hou, Yutao, et al.
Publicado: (2026)
por: Hou, Yutao, et al.
Publicado: (2026)
MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents
por: Im, Youngmin, et al.
Publicado: (2025)
por: Im, Youngmin, et al.
Publicado: (2025)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
por: Zong, Xuanjun, et al.
Publicado: (2025)
por: Zong, Xuanjun, et al.
Publicado: (2025)
TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
por: Chu, Zhaoyang, et al.
Publicado: (2026)
por: Chu, Zhaoyang, et al.
Publicado: (2026)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
por: Liu, Guangyi, et al.
Publicado: (2026)
por: Liu, Guangyi, et al.
Publicado: (2026)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
por: Ding, Shuangrui, et al.
Publicado: (2026)
por: Ding, Shuangrui, et al.
Publicado: (2026)
MobilePortrait: Real-Time One-Shot Neural Head Avatars on Mobile Devices
por: Jiang, Jianwen, et al.
Publicado: (2024)
por: Jiang, Jianwen, et al.
Publicado: (2024)
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
por: Yang, Chenghao, et al.
Publicado: (2025)
por: Yang, Chenghao, et al.
Publicado: (2025)
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios
por: Meng, Jinxiang, et al.
Publicado: (2026)
por: Meng, Jinxiang, et al.
Publicado: (2026)
Ejemplares similares
-
DSFNet: Learning Disentangled Scenario Factorization for Multi-Scenario Route Ranking
por: Yu, Jiahao, et al.
Publicado: (2024) -
GenMRP: A Generative Multi-Route Planning Framework for Efficient and Personalized Real-Time Industrial Navigation
por: Wang, Chengzhang, et al.
Publicado: (2026) -
Towards Full Candidate Interaction: A Comprehensive Comparison Network for Better Route Recommendation
por: Guo, Hanyu, et al.
Publicado: (2025) -
SCASRec: A Self-Correcting and Auto-Stopping Model for Generative Route List Recommendation
por: Chen, Chao, et al.
Publicado: (2026) -
IntTravel: A Real-World Dataset and Generative Framework for Integrated Multi-Task Travel Recommendation
por: Yan, Huimin, et al.
Publicado: (2026)