Enregistré dans:
| Auteurs principaux: | Ma, Haoxuan, Lai, Guannan, Ye, Han-Jia |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.17814 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Routing Collapses: On the Degenerate Convergence of LLM Routers
par: Lai, Guannan, et autres
Publié: (2026)
par: Lai, Guannan, et autres
Publié: (2026)
LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
RouterBench: A Benchmark for Multi-LLM Routing System
par: Hu, Qitian Jason, et autres
Publié: (2024)
par: Hu, Qitian Jason, et autres
Publié: (2024)
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
par: Yao, Xincheng, et autres
Publié: (2026)
par: Yao, Xincheng, et autres
Publié: (2026)
WritingBench: A Comprehensive Benchmark for Generative Writing
par: Wu, Yuning, et autres
Publié: (2025)
par: Wu, Yuning, et autres
Publié: (2025)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
par: Ouyang, Kun, et autres
Publié: (2024)
par: Ouyang, Kun, et autres
Publié: (2024)
Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values
par: Dong, Haonan, et autres
Publié: (2026)
par: Dong, Haonan, et autres
Publié: (2026)
Capability Instruction Tuning: A New Paradigm for Dynamic LLM Routing
par: Zhang, Yi-Kai, et autres
Publié: (2025)
par: Zhang, Yi-Kai, et autres
Publié: (2025)
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
par: Zhou, Baichuan, et autres
Publié: (2024)
par: Zhou, Baichuan, et autres
Publié: (2024)
BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology
par: Mitchener, Ludovico, et autres
Publié: (2025)
par: Mitchener, Ludovico, et autres
Publié: (2025)
CombiBench: Benchmarking LLM Capability for Combinatorial Mathematics
par: Liu, Junqi, et autres
Publié: (2025)
par: Liu, Junqi, et autres
Publié: (2025)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
par: Ji, Haoxuan, et autres
Publié: (2024)
par: Ji, Haoxuan, et autres
Publié: (2024)
OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks
par: Peng, Zhihao, et autres
Publié: (2025)
par: Peng, Zhihao, et autres
Publié: (2025)
TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering
par: Ji, An-Yang, et autres
Publié: (2026)
par: Ji, An-Yang, et autres
Publié: (2026)
LLM-Powered AI Agent Systems and Their Applications in Industry
par: Liang, Guannan, et autres
Publié: (2025)
par: Liang, Guannan, et autres
Publié: (2025)
IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations
par: Fu, Deqing, et autres
Publié: (2024)
par: Fu, Deqing, et autres
Publié: (2024)
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
NarraBench: A Comprehensive Framework for Narrative Benchmarking
par: Hamilton, Sil, et autres
Publié: (2025)
par: Hamilton, Sil, et autres
Publié: (2025)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
par: Gao, Tianyi, et autres
Publié: (2025)
par: Gao, Tianyi, et autres
Publié: (2025)
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
par: Zhang, Xinyu, et autres
Publié: (2026)
par: Zhang, Xinyu, et autres
Publié: (2026)
Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models
par: Liu, Zeyu, et autres
Publié: (2025)
par: Liu, Zeyu, et autres
Publié: (2025)
SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation
par: Chen, Jingxuan, et autres
Publié: (2024)
par: Chen, Jingxuan, et autres
Publié: (2024)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference
par: Ma, Siyuan, et autres
Publié: (2026)
par: Ma, Siyuan, et autres
Publié: (2026)
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
par: Chen, Ziyang, et autres
Publié: (2026)
par: Chen, Ziyang, et autres
Publié: (2026)
CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following
par: Ma, Yinghao, et autres
Publié: (2025)
par: Ma, Yinghao, et autres
Publié: (2025)
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
par: Song, Zhiheng, et autres
Publié: (2026)
par: Song, Zhiheng, et autres
Publié: (2026)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
par: Xue, Kaiwen, et autres
Publié: (2026)
par: Xue, Kaiwen, et autres
Publié: (2026)
VL-RouterBench: A Benchmark for Vision-Language Model Routing
par: Huang, Zhehao, et autres
Publié: (2025)
par: Huang, Zhehao, et autres
Publié: (2025)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
par: Tang, Anke, et autres
Publié: (2024)
par: Tang, Anke, et autres
Publié: (2024)
GridRoute: A Benchmark for LLM-Based Route Planning with Cardinal Movement in Grid Environments
par: Li, Kechen, et autres
Publié: (2025)
par: Li, Kechen, et autres
Publié: (2025)
MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agents
par: Tan, Haoran, et autres
Publié: (2025)
par: Tan, Haoran, et autres
Publié: (2025)
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
par: Li, Jiachun, et autres
Publié: (2026)
par: Li, Jiachun, et autres
Publié: (2026)
T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning
par: Wang, Qinsi, et autres
Publié: (2026)
par: Wang, Qinsi, et autres
Publié: (2026)
FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning
par: Wang, Zeyu, et autres
Publié: (2026)
par: Wang, Zeyu, et autres
Publié: (2026)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
par: Pan, Yaning, et autres
Publié: (2025)
par: Pan, Yaning, et autres
Publié: (2025)
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
par: Chen, Yelin, et autres
Publié: (2026)
par: Chen, Yelin, et autres
Publié: (2026)
MU-Bench: A Multitask Multimodal Benchmark for Machine Unlearning
par: Cheng, Jiali, et autres
Publié: (2024)
par: Cheng, Jiali, et autres
Publié: (2024)
SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval
par: Li, Ningyuan, et autres
Publié: (2026)
par: Li, Ningyuan, et autres
Publié: (2026)
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
par: Chen, Lei, et autres
Publié: (2024)
par: Chen, Lei, et autres
Publié: (2024)
Documents similaires
-
When Routing Collapses: On the Degenerate Convergence of LLM Routers
par: Lai, Guannan, et autres
Publié: (2026) -
LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing
par: Li, Hao, et autres
Publié: (2026) -
RouterBench: A Benchmark for Multi-LLM Routing System
par: Hu, Qitian Jason, et autres
Publié: (2024) -
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
par: Yao, Xincheng, et autres
Publié: (2026) -
WritingBench: A Comprehensive Benchmark for Generative Writing
par: Wu, Yuning, et autres
Publié: (2025)