Gespeichert in:
| Hauptverfasser: | Huang, Zhongzhan, Ling, Guoming, Lin, Yupei, Chen, Yandong, Zhong, Shanshan, Wu, Hefeng, Lin, Liang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2503.10657 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2025)
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2025)
Neural Chain-of-Thought Search: Searching the Optimal Reasoning Path to Enhance Large Language Models
von: Ling, Guoming, et al.
Veröffentlicht: (2026)
von: Ling, Guoming, et al.
Veröffentlicht: (2026)
Let's Think Outside the Box: Exploring Leap-of-Thought in Large Language Models with Creative Humor Generation
von: Zhong, Shanshan, et al.
Veröffentlicht: (2023)
von: Zhong, Shanshan, et al.
Veröffentlicht: (2023)
AssoCiAm: A Benchmark for Evaluating Association Thinking while Circumventing Ambiguity
von: Liu, Yifan, et al.
Veröffentlicht: (2025)
von: Liu, Yifan, et al.
Veröffentlicht: (2025)
VL-RouterBench: A Benchmark for Vision-Language Model Routing
von: Huang, Zhehao, et al.
Veröffentlicht: (2025)
von: Huang, Zhehao, et al.
Veröffentlicht: (2025)
Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router
von: Shao, Chenyang, et al.
Veröffentlicht: (2025)
von: Shao, Chenyang, et al.
Veröffentlicht: (2025)
AttNS: Attention-Inspired Numerical Solving For Limited Data Scenarios
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2023)
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2023)
How Robust Are Router-LLMs? Analysis of the Fragility of LLM Routing Capabilities
von: Kassem, Aly M., et al.
Veröffentlicht: (2025)
von: Kassem, Aly M., et al.
Veröffentlicht: (2025)
TagRouter: Learning Route to LLMs through Tags for Open-Domain Text Generation Tasks
von: Chen, Zhou, et al.
Veröffentlicht: (2025)
von: Chen, Zhou, et al.
Veröffentlicht: (2025)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
HKCanto-Eval: A Benchmark for Evaluating Cantonese Language Understanding and Cultural Comprehension in LLMs
von: Cheng, Tsz Chung, et al.
Veröffentlicht: (2025)
von: Cheng, Tsz Chung, et al.
Veröffentlicht: (2025)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
von: Du, Junjia, et al.
Veröffentlicht: (2025)
von: Du, Junjia, et al.
Veröffentlicht: (2025)
UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs
von: He, Chaoqun, et al.
Veröffentlicht: (2024)
von: He, Chaoqun, et al.
Veröffentlicht: (2024)
CFBench: A Comprehensive Constraints-Following Benchmark for LLMs
von: Zhang, Tao, et al.
Veröffentlicht: (2024)
von: Zhang, Tao, et al.
Veröffentlicht: (2024)
StackEval: Benchmarking LLMs in Coding Assistance
von: Shah, Nidhish, et al.
Veröffentlicht: (2024)
von: Shah, Nidhish, et al.
Veröffentlicht: (2024)
Mirror Gradient: Towards Robust Multimodal Recommender Systems via Exploring Flat Local Minima
von: Zhong, Shanshan, et al.
Veröffentlicht: (2024)
von: Zhong, Shanshan, et al.
Veröffentlicht: (2024)
MoExtend: Tuning New Experts for Modality and Task Extension
von: Zhong, Shanshan, et al.
Veröffentlicht: (2024)
von: Zhong, Shanshan, et al.
Veröffentlicht: (2024)
OmniRouter: Budget and Performance Controllable Multi-LLM Routing
von: Mei, Kai, et al.
Veröffentlicht: (2025)
von: Mei, Kai, et al.
Veröffentlicht: (2025)
Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
von: Zhang, Haozhen, et al.
Veröffentlicht: (2025)
von: Zhang, Haozhen, et al.
Veröffentlicht: (2025)
RouteLLM: Learning to Route LLMs with Preference Data
von: Ong, Isaac, et al.
Veröffentlicht: (2024)
von: Ong, Isaac, et al.
Veröffentlicht: (2024)
ASR: Attention-alike Structural Re-parameterization
von: Zhong, Shanshan, et al.
Veröffentlicht: (2023)
von: Zhong, Shanshan, et al.
Veröffentlicht: (2023)
MemRouter: Memory-as-Embedding Routing for Long-Term Conversational Agents
von: Hu, Tianyu, et al.
Veröffentlicht: (2026)
von: Hu, Tianyu, et al.
Veröffentlicht: (2026)
Isolating Language-Coding from Problem-Solving: Benchmarking LLMs with PseudoEval
von: Wu, Jiarong, et al.
Veröffentlicht: (2025)
von: Wu, Jiarong, et al.
Veröffentlicht: (2025)
LatEval: An Interactive LLMs Evaluation Benchmark with Incomplete Information from Lateral Thinking Puzzles
von: Huang, Shulin, et al.
Veröffentlicht: (2023)
von: Huang, Shulin, et al.
Veröffentlicht: (2023)
StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
von: Yang, Jialin, et al.
Veröffentlicht: (2025)
von: Yang, Jialin, et al.
Veröffentlicht: (2025)
Router Upcycling: Leveraging Mixture-of-Routers in Mixture-of-Experts Upcycling
von: Ran, Junfeng, et al.
Veröffentlicht: (2025)
von: Ran, Junfeng, et al.
Veröffentlicht: (2025)
A Causality-aware Paradigm for Evaluating Creativity of Multimodal Large Language Models
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2025)
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2025)
UoR-NCL at SemEval-2025 Task 1: Using Generative LLMs and CLIP Models for Multilingual Multimodal Idiomaticity Representation
von: Markchom, Thanet, et al.
Veröffentlicht: (2025)
von: Markchom, Thanet, et al.
Veröffentlicht: (2025)
GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving
von: Zhang, Jiaxin, et al.
Veröffentlicht: (2024)
von: Zhang, Jiaxin, et al.
Veröffentlicht: (2024)
MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs
von: Zhang, Mengyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Mengyuan, et al.
Veröffentlicht: (2024)
RouteNator: A Router-Based Multi-Modal Architecture for Generating Synthetic Training Data for Function Calling LLMs
von: Belavadi, Vibha, et al.
Veröffentlicht: (2025)
von: Belavadi, Vibha, et al.
Veröffentlicht: (2025)
Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
von: Sun, Shengyin, et al.
Veröffentlicht: (2025)
von: Sun, Shengyin, et al.
Veröffentlicht: (2025)
MiLiC-Eval: Benchmarking Multilingual LLMs for China's Minority Languages
von: Zhang, Chen, et al.
Veröffentlicht: (2025)
von: Zhang, Chen, et al.
Veröffentlicht: (2025)
Benchmarking the Detection of LLMs-Generated Modern Chinese Poetry
von: Wang, Shanshan, et al.
Veröffentlicht: (2025)
von: Wang, Shanshan, et al.
Veröffentlicht: (2025)
PertEval: Unveiling Real Knowledge Capacity of LLMs with Knowledge-Invariant Perturbations
von: Li, Jiatong, et al.
Veröffentlicht: (2024)
von: Li, Jiatong, et al.
Veröffentlicht: (2024)
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
von: Lu, Yuchen, et al.
Veröffentlicht: (2025)
von: Lu, Yuchen, et al.
Veröffentlicht: (2025)
LLMs for Explainable AI: A Comprehensive Survey
von: Bilal, Ahsan, et al.
Veröffentlicht: (2025)
von: Bilal, Ahsan, et al.
Veröffentlicht: (2025)
R2-Router: A New Paradigm for LLM Routing with Reasoning
von: Xue, Jiaqi, et al.
Veröffentlicht: (2026)
von: Xue, Jiaqi, et al.
Veröffentlicht: (2026)
LogEval: A Comprehensive Benchmark Suite for Large Language Models In Log Analysis
von: Cui, Tianyu, et al.
Veröffentlicht: (2024)
von: Cui, Tianyu, et al.
Veröffentlicht: (2024)
OPT-Engine: Benchmarking the Limits of LLMs in Optimization Modeling via Complexity Scaling
von: Chen, Yitian, et al.
Veröffentlicht: (2026)
von: Chen, Yitian, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2025) -
Neural Chain-of-Thought Search: Searching the Optimal Reasoning Path to Enhance Large Language Models
von: Ling, Guoming, et al.
Veröffentlicht: (2026) -
Let's Think Outside the Box: Exploring Leap-of-Thought in Large Language Models with Creative Humor Generation
von: Zhong, Shanshan, et al.
Veröffentlicht: (2023) -
AssoCiAm: A Benchmark for Evaluating Association Thinking while Circumventing Ambiguity
von: Liu, Yifan, et al.
Veröffentlicht: (2025) -
VL-RouterBench: A Benchmark for Vision-Language Model Routing
von: Huang, Zhehao, et al.
Veröffentlicht: (2025)