Confident or Seek Stronger: Exploring Uncertainty-Based On-device LLM Routing From Benchmarking to Generalization
Fuente:
arXiv
Guardado en:
| Autores principales: | Chuang, Yu-Neng, Yu, Leisheng, Wang, Guanchu, Zhang, Lizhe, Liu, Zirui, Cai, Xuanting, Sui, Yang, Braverman, Vladimir, Hu, Xia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Self-ensemble: Mitigating Confidence Mis-calibration for Large Language Models
por: Xu, Zicheng, et al.
Publicado: (2025)
por: Xu, Zicheng, et al.
Publicado: (2025)
FaithLM: Towards Faithful Explanations for Large Language Models
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
DTS: Enhancing Large Reasoning Models via Decoding Tree Sketching
por: Xu, Zicheng, et al.
Publicado: (2025)
por: Xu, Zicheng, et al.
Publicado: (2025)
Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
por: Luo, Feng, et al.
Publicado: (2026)
por: Luo, Feng, et al.
Publicado: (2026)
Assessing and Enhancing Large Language Models in Rare Disease Question-answering
por: Wang, Guanchu, et al.
Publicado: (2024)
por: Wang, Guanchu, et al.
Publicado: (2024)
TVE: Learning Meta-attribution for Transferable Vision Explainer
por: Wang, Guanchu, et al.
Publicado: (2023)
por: Wang, Guanchu, et al.
Publicado: (2023)
Learning to Route LLMs with Confidence Tokens
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
LTSM-Bundle: A Toolbox and Benchmark on Large Language Models for Time Series Forecasting
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
AutoL2S: Auto Long-Short Reasoning for Efficient Large Language Models
por: Luo, Feng, et al.
Publicado: (2025)
por: Luo, Feng, et al.
Publicado: (2025)
Self-Explaining Hypergraph Neural Networks for Diagnosis Prediction
por: Yu, Leisheng, et al.
Publicado: (2025)
por: Yu, Leisheng, et al.
Publicado: (2025)
Breaking the Frozen Subspace: Importance Sampling for Low-Rank Optimization in LLM Pretraining
por: Zhang, Haochen, et al.
Publicado: (2025)
por: Zhang, Haochen, et al.
Publicado: (2025)
KV Cache Compression, But What Must We Give in Return? A Comprehensive Benchmark of Long Context Capable Approaches
por: Yuan, Jiayi, et al.
Publicado: (2024)
por: Yuan, Jiayi, et al.
Publicado: (2024)
Taylor Unswift: Secured Weight Release for Large Language Models via Taylor Expansion
por: Wang, Guanchu, et al.
Publicado: (2024)
por: Wang, Guanchu, et al.
Publicado: (2024)
Learning to Compress Prompt in Natural Language Formats
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
Stronger core results with multidimensional prices
por: Braverman, Mark, et al.
Publicado: (2026)
por: Braverman, Mark, et al.
Publicado: (2026)
Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models
por: Sui, Yang, et al.
Publicado: (2025)
por: Sui, Yang, et al.
Publicado: (2025)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
por: Liu, Zirui, et al.
Publicado: (2024)
por: Liu, Zirui, et al.
Publicado: (2024)
SoulSeek: Exploring the Use of Social Cues in LLM-based Information Seeking
por: Shu, Yubo, et al.
Publicado: (2026)
por: Shu, Yubo, et al.
Publicado: (2026)
DHP Benchmark: Are LLMs Good NLG Evaluators?
por: Wang, Yicheng, et al.
Publicado: (2024)
por: Wang, Yicheng, et al.
Publicado: (2024)
Can Dual Unlocking Occur? The Impact of Generative AI on Firms' Demand‐ and Supply‐Related Innovation
por: Yu Wang, et al.
Publicado: (2026)
por: Yu Wang, et al.
Publicado: (2026)
The LLM Data Auditor: A Metric-oriented Survey on Quality and Trustworthiness in Evaluating Synthetic Data
por: Zhang, Kaituo, et al.
Publicado: (2026)
por: Zhang, Kaituo, et al.
Publicado: (2026)
On the Weak Point of the Stronger Uncertainty Relation
por: Urbanowski, K.
Publicado: (2025)
por: Urbanowski, K.
Publicado: (2025)
Label-Confidence-Aware Uncertainty Estimation in Natural Language Generation
por: Lin, Qinhong, et al.
Publicado: (2024)
por: Lin, Qinhong, et al.
Publicado: (2024)
Heaven-Sent or Hell-Bent? Benchmarking the Intelligence and Defectiveness of LLM Hallucinations
por: Yang, Chengxu, et al.
Publicado: (2025)
por: Yang, Chengxu, et al.
Publicado: (2025)
From Adam Smith to Ronald Reagan: Public Libraries as a Public Good.
por: Braverman, Miriam
Publicado: (1982)
por: Braverman, Miriam
Publicado: (1982)
InfoDeepSeek: Benchmarking Agentic Information Seeking for Retrieval-Augmented Generation
por: Xi, Yunjia, et al.
Publicado: (2025)
por: Xi, Yunjia, et al.
Publicado: (2025)
When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger
por: Afzali, Amirabbas, et al.
Publicado: (2026)
por: Afzali, Amirabbas, et al.
Publicado: (2026)
GraphFM: A Comprehensive Benchmark for Graph Foundation Model
por: Xu, Yuhao, et al.
Publicado: (2024)
por: Xu, Yuhao, et al.
Publicado: (2024)
Training-Free Time Series Classification via In-Context Reasoning with LLM Agents
por: Sui, Songyuan, et al.
Publicado: (2025)
por: Sui, Songyuan, et al.
Publicado: (2025)
Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment
por: Kwon, Jea, et al.
Publicado: (2025)
por: Kwon, Jea, et al.
Publicado: (2025)
Stronger Than You Think: Benchmarking Weak Supervision on Realistic Tasks
por: Zhang, Tianyi, et al.
Publicado: (2025)
por: Zhang, Tianyi, et al.
Publicado: (2025)
Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning
por: Xu, Yuanda, et al.
Publicado: (2026)
por: Xu, Yuanda, et al.
Publicado: (2026)
A Stronger Benchmark for Online Bilateral Trade: From Fixed Prices to Distributions
por: Lunghi, Anna, et al.
Publicado: (2026)
por: Lunghi, Anna, et al.
Publicado: (2026)
LLM Unlearning Reveals a Stronger-Than-Expected Coreset Effect in Current Benchmarks
por: Pal, Soumyadeep, et al.
Publicado: (2025)
por: Pal, Soumyadeep, et al.
Publicado: (2025)
Infernux: A Python-Native Game Engine with JIT-Accelerated Scripting
por: Chen, Lizhe
Publicado: (2026)
por: Chen, Lizhe
Publicado: (2026)
Low regularity well-posedness for two-dimensional deep water waves
por: Wan, Lizhe
Publicado: (2024)
por: Wan, Lizhe
Publicado: (2024)
Graphene Growth on Copper Substrate by LAMMPS Simulation
por: Hong, Lizhe
Publicado: (2025)
por: Hong, Lizhe
Publicado: (2025)
On the gravity-capillary water waves with point vortices
por: Wan, Lizhe
Publicado: (2025)
por: Wan, Lizhe
Publicado: (2025)
Low regularity well-posedness for two-dimensional deep gravity water waves with constant vorticity
por: Wan, Lizhe
Publicado: (2023)
por: Wan, Lizhe
Publicado: (2023)
On the capillary water waves with constant vorticity
por: Wan, Lizhe
Publicado: (2024)
por: Wan, Lizhe
Publicado: (2024)
Ejemplares similares
-
Self-ensemble: Mitigating Confidence Mis-calibration for Large Language Models
por: Xu, Zicheng, et al.
Publicado: (2025) -
FaithLM: Towards Faithful Explanations for Large Language Models
por: Chuang, Yu-Neng, et al.
Publicado: (2024) -
DTS: Enhancing Large Reasoning Models via Decoding Tree Sketching
por: Xu, Zicheng, et al.
Publicado: (2025) -
Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
por: Luo, Feng, et al.
Publicado: (2026) -
Assessing and Enhancing Large Language Models in Rare Disease Question-answering
por: Wang, Guanchu, et al.
Publicado: (2024)