VL-RouterBench: A Benchmark for Vision-Language Model Routing
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Zhehao, Lin, Baijiong, Zhang, Jingyuan, Wang, Jingying, Liu, Yuhang, Lu, Ning, Li, Tao, Huang, Xiaolin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RouterBench: A Benchmark for Multi-LLM Routing System
di: Hu, Qitian Jason, et al.
Pubblicazione: (2024)
di: Hu, Qitian Jason, et al.
Pubblicazione: (2024)
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
di: Chen, Shuhao, et al.
Pubblicazione: (2024)
di: Chen, Shuhao, et al.
Pubblicazione: (2024)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
di: Huang, Jiameng, et al.
Pubblicazione: (2025)
di: Huang, Jiameng, et al.
Pubblicazione: (2025)
Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
RAIN-Merging: A Gradient-Free Method to Enhance Instruction Following in Large Reasoning Models with Preserved Thinking Format
di: Huang, Zhehao, et al.
Pubblicazione: (2026)
di: Huang, Zhehao, et al.
Pubblicazione: (2026)
T2I-ConBench: Text-to-Image Benchmark for Continual Post-training
di: Huang, Zhehao, et al.
Pubblicazione: (2025)
di: Huang, Zhehao, et al.
Pubblicazione: (2025)
A Comprehensive Study on Quantization Techniques for Large Language Models
di: Lang, Jiedong, et al.
Pubblicazione: (2024)
di: Lang, Jiedong, et al.
Pubblicazione: (2024)
RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs
di: Huang, Zhongzhan, et al.
Pubblicazione: (2025)
di: Huang, Zhongzhan, et al.
Pubblicazione: (2025)
Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router
di: Shao, Chenyang, et al.
Pubblicazione: (2025)
di: Shao, Chenyang, et al.
Pubblicazione: (2025)
Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
di: Zhang, Haozhen, et al.
Pubblicazione: (2025)
di: Zhang, Haozhen, et al.
Pubblicazione: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
di: Tang, Haochun, et al.
Pubblicazione: (2026)
di: Tang, Haochun, et al.
Pubblicazione: (2026)
RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
di: Jin, Ruihan, et al.
Pubblicazione: (2025)
di: Jin, Ruihan, et al.
Pubblicazione: (2025)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
di: Zhang, Jingyi, et al.
Pubblicazione: (2025)
di: Zhang, Jingyi, et al.
Pubblicazione: (2025)
R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?
di: Zhang, Jingyi, et al.
Pubblicazione: (2026)
di: Zhang, Jingyi, et al.
Pubblicazione: (2026)
VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
di: Xu, Xin, et al.
Pubblicazione: (2026)
di: Xu, Xin, et al.
Pubblicazione: (2026)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
UserSumBench: A Benchmark Framework for Evaluating User Summarization Approaches
di: Wang, Chao, et al.
Pubblicazione: (2024)
di: Wang, Chao, et al.
Pubblicazione: (2024)
Can Large Language Models Solve Robot Routing?
di: Huang, Zhehui, et al.
Pubblicazione: (2024)
di: Huang, Zhehui, et al.
Pubblicazione: (2024)
PairBench: Are Vision-Language Models Reliable at Comparing What They See?
di: Feizi, Aarash, et al.
Pubblicazione: (2025)
di: Feizi, Aarash, et al.
Pubblicazione: (2025)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
di: Lee, Jaeho, et al.
Pubblicazione: (2025)
di: Lee, Jaeho, et al.
Pubblicazione: (2025)
ELITR-Bench: A Meeting Assistant Benchmark for Long-Context Language Models
di: Thonet, Thibaut, et al.
Pubblicazione: (2024)
di: Thonet, Thibaut, et al.
Pubblicazione: (2024)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
di: Zhang, Yongting, et al.
Pubblicazione: (2024)
di: Zhang, Yongting, et al.
Pubblicazione: (2024)
OrcaRouter: A Production-Oriented LLM Router with Hybrid Offline-Online Learning
di: Bao, Zhenghua, et al.
Pubblicazione: (2026)
di: Bao, Zhenghua, et al.
Pubblicazione: (2026)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
di: Tang, Anke, et al.
Pubblicazione: (2024)
di: Tang, Anke, et al.
Pubblicazione: (2024)
HypoBench: Towards Systematic and Principled Benchmarking for Hypothesis Generation
di: Liu, Haokun, et al.
Pubblicazione: (2025)
di: Liu, Haokun, et al.
Pubblicazione: (2025)
Toward Super Agent System with Hybrid AI Routers
di: Yao, Yuhang, et al.
Pubblicazione: (2025)
di: Yao, Yuhang, et al.
Pubblicazione: (2025)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
di: Li, Lijun, et al.
Pubblicazione: (2024)
di: Li, Lijun, et al.
Pubblicazione: (2024)
MemRouter: Memory-as-Embedding Routing for Long-Term Conversational Agents
di: Hu, Tianyu, et al.
Pubblicazione: (2026)
di: Hu, Tianyu, et al.
Pubblicazione: (2026)
Token-Level LLM Collaboration via FusionRoute
di: Xiong, Nuoya, et al.
Pubblicazione: (2026)
di: Xiong, Nuoya, et al.
Pubblicazione: (2026)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
di: Chow, Wei, et al.
Pubblicazione: (2025)
di: Chow, Wei, et al.
Pubblicazione: (2025)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
di: Long, Xiang, et al.
Pubblicazione: (2026)
di: Long, Xiang, et al.
Pubblicazione: (2026)
AfroBench: How Good are Large Language Models on African Languages?
di: Ojo, Jessica, et al.
Pubblicazione: (2023)
di: Ojo, Jessica, et al.
Pubblicazione: (2023)
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
MolLangBench: A Comprehensive Benchmark for Language-Prompted Molecular Structure Recognition, Editing, and Generation
di: Cai, Feiyang, et al.
Pubblicazione: (2025)
di: Cai, Feiyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RouterBench: A Benchmark for Multi-LLM Routing System
di: Hu, Qitian Jason, et al.
Pubblicazione: (2024) -
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
di: Chen, Shuhao, et al.
Pubblicazione: (2024) -
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
di: Huang, Jiameng, et al.
Pubblicazione: (2025) -
Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
di: Liu, Yuhang, et al.
Pubblicazione: (2025) -
RAIN-Merging: A Gradient-Free Method to Enhance Instruction Following in Large Reasoning Models with Preserved Thinking Format
di: Huang, Zhehao, et al.
Pubblicazione: (2026)