Inference Time Optimization with Confidence Dynamics
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Yu, Liu, Minghao, Wang, Jiayun, Huang, Jinrui, Shah, Ankit, Wei, Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
von: Wang, Zhenting, et al.
Veröffentlicht: (2026)
von: Wang, Zhenting, et al.
Veröffentlicht: (2026)
ProRefine: Inference-Time Prompt Refinement with Textual Feedback
von: Pandita, Deepak, et al.
Veröffentlicht: (2025)
von: Pandita, Deepak, et al.
Veröffentlicht: (2025)
Bridging the Language Gaps in Large Language Models with Inference-Time Cross-Lingual Intervention
von: Wang, Weixuan, et al.
Veröffentlicht: (2024)
von: Wang, Weixuan, et al.
Veröffentlicht: (2024)
Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference
von: Chen, Bo-Wei, et al.
Veröffentlicht: (2026)
von: Chen, Bo-Wei, et al.
Veröffentlicht: (2026)
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
von: Beetham, James, et al.
Veröffentlicht: (2024)
von: Beetham, James, et al.
Veröffentlicht: (2024)
Enhancing Retrieval Systems with Inference-Time Logical Reasoning
von: Faltings, Felix, et al.
Veröffentlicht: (2025)
von: Faltings, Felix, et al.
Veröffentlicht: (2025)
Momentum Streams for Optimizer-Inspired Transformers
von: Gai, Jingchu, et al.
Veröffentlicht: (2026)
von: Gai, Jingchu, et al.
Veröffentlicht: (2026)
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
von: Yao, Dingyu, et al.
Veröffentlicht: (2025)
von: Yao, Dingyu, et al.
Veröffentlicht: (2025)
Improving Data Efficiency via Curating LLM-Driven Rating Systems
von: Pang, Jinlong, et al.
Veröffentlicht: (2024)
von: Pang, Jinlong, et al.
Veröffentlicht: (2024)
Knowledge Graph Error Detection with Contrastive Confidence Adaption
von: Liu, Xiangyu, et al.
Veröffentlicht: (2023)
von: Liu, Xiangyu, et al.
Veröffentlicht: (2023)
Preference Ranking Optimization for Human Alignment
von: Song, Feifan, et al.
Veröffentlicht: (2023)
von: Song, Feifan, et al.
Veröffentlicht: (2023)
From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models
von: Tong, Junlong, et al.
Veröffentlicht: (2026)
von: Tong, Junlong, et al.
Veröffentlicht: (2026)
Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents
von: Zhou, Heng, et al.
Veröffentlicht: (2026)
von: Zhou, Heng, et al.
Veröffentlicht: (2026)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
von: Hu, Jinwu, et al.
Veröffentlicht: (2025)
von: Hu, Jinwu, et al.
Veröffentlicht: (2025)
Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models
von: Fang, Liancheng, et al.
Veröffentlicht: (2026)
von: Fang, Liancheng, et al.
Veröffentlicht: (2026)
LLM Unlearning via Loss Adjustment with Only Forget Data
von: Wang, Yaxuan, et al.
Veröffentlicht: (2024)
von: Wang, Yaxuan, et al.
Veröffentlicht: (2024)
Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning
von: Zhang, Chuang, et al.
Veröffentlicht: (2026)
von: Zhang, Chuang, et al.
Veröffentlicht: (2026)
CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation
von: Cui, Guofeng, et al.
Veröffentlicht: (2025)
von: Cui, Guofeng, et al.
Veröffentlicht: (2025)
GradPruner: Gradient-Guided Layer Pruning Enabling Efficient Fine-Tuning and Inference for LLMs
von: Huang, Wei, et al.
Veröffentlicht: (2026)
von: Huang, Wei, et al.
Veröffentlicht: (2026)
Enhancing Retrieval for ESGLLM via ESG-CID -- A Disclosure Content Index Finetuning Dataset for Mapping GRI and ESRS
von: Ahmed, Shafiuddin Rehan, et al.
Veröffentlicht: (2025)
von: Ahmed, Shafiuddin Rehan, et al.
Veröffentlicht: (2025)
HBO: Hierarchical Balancing Optimization for Fine-Tuning Large Language Models
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
$C^3$: Confidence Calibration Model Cascade for Inference-Efficient Cross-Lingual Natural Language Understanding
von: Lu, Taixi, et al.
Veröffentlicht: (2024)
von: Lu, Taixi, et al.
Veröffentlicht: (2024)
Inference-Time Alignment of Diffusion Models via Trust-Region Iterative Twisted Sequential Monte Carlo
von: Wang, Weixin, et al.
Veröffentlicht: (2026)
von: Wang, Weixin, et al.
Veröffentlicht: (2026)
Training-Free Agentic AI: Probabilistic Control and Coordination in Multi-Agent LLM Systems
von: Hosseini, Mohammad Parsa, et al.
Veröffentlicht: (2026)
von: Hosseini, Mohammad Parsa, et al.
Veröffentlicht: (2026)
SR-KI: Scalable and Real-Time Knowledge Integration into LLMs via Supervised Attention
von: Yu, Bohan, et al.
Veröffentlicht: (2025)
von: Yu, Bohan, et al.
Veröffentlicht: (2025)
Sharing Matters: Analysing Neurons Across Languages and Tasks in LLMs
von: Wang, Weixuan, et al.
Veröffentlicht: (2024)
von: Wang, Weixuan, et al.
Veröffentlicht: (2024)
How Confident Is the First Token? An Uncertainty-Calibrated Prompt Optimization Framework for Large Language Model Classification and Understanding
von: Chen, Wei, et al.
Veröffentlicht: (2026)
von: Chen, Wei, et al.
Veröffentlicht: (2026)
NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time
von: Chen, Yilong, et al.
Veröffentlicht: (2024)
von: Chen, Yilong, et al.
Veröffentlicht: (2024)
Examining False Positives under Inference Scaling for Mathematical Reasoning
von: Wang, Yu, et al.
Veröffentlicht: (2025)
von: Wang, Yu, et al.
Veröffentlicht: (2025)
Confident in a Confidence Score: Investigating the Sensitivity of Confidence Scores to Supervised Fine-Tuning
von: Flores, Lorenzo Jaime Yu, et al.
Veröffentlicht: (2026)
von: Flores, Lorenzo Jaime Yu, et al.
Veröffentlicht: (2026)
Earley-Driven Dynamic Pruning for Efficient Structured Decoding
von: Sun, Xintong, et al.
Veröffentlicht: (2025)
von: Sun, Xintong, et al.
Veröffentlicht: (2025)
Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey
von: Liu, Xiaoou, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoou, et al.
Veröffentlicht: (2025)
MarkovScale: Towards Optimal Sequential Scaling at Inference Time
von: Wang, Youkang, et al.
Veröffentlicht: (2026)
von: Wang, Youkang, et al.
Veröffentlicht: (2026)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
von: Li, Yichen, et al.
Veröffentlicht: (2025)
von: Li, Yichen, et al.
Veröffentlicht: (2025)
Profile-LLM: Dynamic Profile Optimization for Realistic Personality Expression in LLMs
von: Dai, Shi-Wei, et al.
Veröffentlicht: (2025)
von: Dai, Shi-Wei, et al.
Veröffentlicht: (2025)
UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling
von: Huang, Kaiyu, et al.
Veröffentlicht: (2026)
von: Huang, Kaiyu, et al.
Veröffentlicht: (2026)
Inference-Time Language Model Alignment via Integrated Value Guidance
von: Liu, Zhixuan, et al.
Veröffentlicht: (2024)
von: Liu, Zhixuan, et al.
Veröffentlicht: (2024)
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
von: Long, Lingkun, et al.
Veröffentlicht: (2026)
von: Long, Lingkun, et al.
Veröffentlicht: (2026)
DKE-Research at SemEval-2024 Task 2: Incorporating Data Augmentation with Generative Models and Biomedical Knowledge to Enhance Inference Robustness
von: Wang, Yuqi, et al.
Veröffentlicht: (2024)
von: Wang, Yuqi, et al.
Veröffentlicht: (2024)
Detecting Anti-Semitic Hate Speech using Transformer-based Large Language Models
von: Liu, Dengyi, et al.
Veröffentlicht: (2024)
von: Liu, Dengyi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
von: Wang, Zhenting, et al.
Veröffentlicht: (2026) -
ProRefine: Inference-Time Prompt Refinement with Textual Feedback
von: Pandita, Deepak, et al.
Veröffentlicht: (2025) -
Bridging the Language Gaps in Large Language Models with Inference-Time Cross-Lingual Intervention
von: Wang, Weixuan, et al.
Veröffentlicht: (2024) -
Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference
von: Chen, Bo-Wei, et al.
Veröffentlicht: (2026) -
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
von: Beetham, James, et al.
Veröffentlicht: (2024)