Inference Time Optimization with Confidence Dynamics
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yu, Liu, Minghao, Wang, Jiayun, Huang, Jinrui, Shah, Ankit, Wei, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
di: Wang, Zhenting, et al.
Pubblicazione: (2026)
di: Wang, Zhenting, et al.
Pubblicazione: (2026)
ProRefine: Inference-Time Prompt Refinement with Textual Feedback
di: Pandita, Deepak, et al.
Pubblicazione: (2025)
di: Pandita, Deepak, et al.
Pubblicazione: (2025)
Bridging the Language Gaps in Large Language Models with Inference-Time Cross-Lingual Intervention
di: Wang, Weixuan, et al.
Pubblicazione: (2024)
di: Wang, Weixuan, et al.
Pubblicazione: (2024)
Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference
di: Chen, Bo-Wei, et al.
Pubblicazione: (2026)
di: Chen, Bo-Wei, et al.
Pubblicazione: (2026)
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
di: Beetham, James, et al.
Pubblicazione: (2024)
di: Beetham, James, et al.
Pubblicazione: (2024)
Enhancing Retrieval Systems with Inference-Time Logical Reasoning
di: Faltings, Felix, et al.
Pubblicazione: (2025)
di: Faltings, Felix, et al.
Pubblicazione: (2025)
Momentum Streams for Optimizer-Inspired Transformers
di: Gai, Jingchu, et al.
Pubblicazione: (2026)
di: Gai, Jingchu, et al.
Pubblicazione: (2026)
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
di: Yao, Dingyu, et al.
Pubblicazione: (2025)
di: Yao, Dingyu, et al.
Pubblicazione: (2025)
Improving Data Efficiency via Curating LLM-Driven Rating Systems
di: Pang, Jinlong, et al.
Pubblicazione: (2024)
di: Pang, Jinlong, et al.
Pubblicazione: (2024)
Knowledge Graph Error Detection with Contrastive Confidence Adaption
di: Liu, Xiangyu, et al.
Pubblicazione: (2023)
di: Liu, Xiangyu, et al.
Pubblicazione: (2023)
Preference Ranking Optimization for Human Alignment
di: Song, Feifan, et al.
Pubblicazione: (2023)
di: Song, Feifan, et al.
Pubblicazione: (2023)
From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models
di: Tong, Junlong, et al.
Pubblicazione: (2026)
di: Tong, Junlong, et al.
Pubblicazione: (2026)
Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents
di: Zhou, Heng, et al.
Pubblicazione: (2026)
di: Zhou, Heng, et al.
Pubblicazione: (2026)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models
di: Fang, Liancheng, et al.
Pubblicazione: (2026)
di: Fang, Liancheng, et al.
Pubblicazione: (2026)
LLM Unlearning via Loss Adjustment with Only Forget Data
di: Wang, Yaxuan, et al.
Pubblicazione: (2024)
di: Wang, Yaxuan, et al.
Pubblicazione: (2024)
Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning
di: Zhang, Chuang, et al.
Pubblicazione: (2026)
di: Zhang, Chuang, et al.
Pubblicazione: (2026)
CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation
di: Cui, Guofeng, et al.
Pubblicazione: (2025)
di: Cui, Guofeng, et al.
Pubblicazione: (2025)
GradPruner: Gradient-Guided Layer Pruning Enabling Efficient Fine-Tuning and Inference for LLMs
di: Huang, Wei, et al.
Pubblicazione: (2026)
di: Huang, Wei, et al.
Pubblicazione: (2026)
Enhancing Retrieval for ESGLLM via ESG-CID -- A Disclosure Content Index Finetuning Dataset for Mapping GRI and ESRS
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2025)
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2025)
HBO: Hierarchical Balancing Optimization for Fine-Tuning Large Language Models
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
$C^3$: Confidence Calibration Model Cascade for Inference-Efficient Cross-Lingual Natural Language Understanding
di: Lu, Taixi, et al.
Pubblicazione: (2024)
di: Lu, Taixi, et al.
Pubblicazione: (2024)
Inference-Time Alignment of Diffusion Models via Trust-Region Iterative Twisted Sequential Monte Carlo
di: Wang, Weixin, et al.
Pubblicazione: (2026)
di: Wang, Weixin, et al.
Pubblicazione: (2026)
Training-Free Agentic AI: Probabilistic Control and Coordination in Multi-Agent LLM Systems
di: Hosseini, Mohammad Parsa, et al.
Pubblicazione: (2026)
di: Hosseini, Mohammad Parsa, et al.
Pubblicazione: (2026)
SR-KI: Scalable and Real-Time Knowledge Integration into LLMs via Supervised Attention
di: Yu, Bohan, et al.
Pubblicazione: (2025)
di: Yu, Bohan, et al.
Pubblicazione: (2025)
Sharing Matters: Analysing Neurons Across Languages and Tasks in LLMs
di: Wang, Weixuan, et al.
Pubblicazione: (2024)
di: Wang, Weixuan, et al.
Pubblicazione: (2024)
How Confident Is the First Token? An Uncertainty-Calibrated Prompt Optimization Framework for Large Language Model Classification and Understanding
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time
di: Chen, Yilong, et al.
Pubblicazione: (2024)
di: Chen, Yilong, et al.
Pubblicazione: (2024)
Examining False Positives under Inference Scaling for Mathematical Reasoning
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
Confident in a Confidence Score: Investigating the Sensitivity of Confidence Scores to Supervised Fine-Tuning
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2026)
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2026)
Earley-Driven Dynamic Pruning for Efficient Structured Decoding
di: Sun, Xintong, et al.
Pubblicazione: (2025)
di: Sun, Xintong, et al.
Pubblicazione: (2025)
Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey
di: Liu, Xiaoou, et al.
Pubblicazione: (2025)
di: Liu, Xiaoou, et al.
Pubblicazione: (2025)
MarkovScale: Towards Optimal Sequential Scaling at Inference Time
di: Wang, Youkang, et al.
Pubblicazione: (2026)
di: Wang, Youkang, et al.
Pubblicazione: (2026)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
di: Li, Yichen, et al.
Pubblicazione: (2025)
di: Li, Yichen, et al.
Pubblicazione: (2025)
Profile-LLM: Dynamic Profile Optimization for Realistic Personality Expression in LLMs
di: Dai, Shi-Wei, et al.
Pubblicazione: (2025)
di: Dai, Shi-Wei, et al.
Pubblicazione: (2025)
UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling
di: Huang, Kaiyu, et al.
Pubblicazione: (2026)
di: Huang, Kaiyu, et al.
Pubblicazione: (2026)
Inference-Time Language Model Alignment via Integrated Value Guidance
di: Liu, Zhixuan, et al.
Pubblicazione: (2024)
di: Liu, Zhixuan, et al.
Pubblicazione: (2024)
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
di: Long, Lingkun, et al.
Pubblicazione: (2026)
di: Long, Lingkun, et al.
Pubblicazione: (2026)
DKE-Research at SemEval-2024 Task 2: Incorporating Data Augmentation with Generative Models and Biomedical Knowledge to Enhance Inference Robustness
di: Wang, Yuqi, et al.
Pubblicazione: (2024)
di: Wang, Yuqi, et al.
Pubblicazione: (2024)
Detecting Anti-Semitic Hate Speech using Transformer-based Large Language Models
di: Liu, Dengyi, et al.
Pubblicazione: (2024)
di: Liu, Dengyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
di: Wang, Zhenting, et al.
Pubblicazione: (2026) -
ProRefine: Inference-Time Prompt Refinement with Textual Feedback
di: Pandita, Deepak, et al.
Pubblicazione: (2025) -
Bridging the Language Gaps in Large Language Models with Inference-Time Cross-Lingual Intervention
di: Wang, Weixuan, et al.
Pubblicazione: (2024) -
Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference
di: Chen, Bo-Wei, et al.
Pubblicazione: (2026) -
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
di: Beetham, James, et al.
Pubblicazione: (2024)