Optimizing Temperature for Language Models with Multi-Sample Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Du, Weihua, Yang, Yiming, Welleck, Sean |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Agentic-R1: Distilled Dual-Strategy Reasoning
di: Du, Weihua, et al.
Pubblicazione: (2025)
di: Du, Weihua, et al.
Pubblicazione: (2025)
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
Training Proactive and Personalized LLM Agents
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025)
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025)
miniCTX: Neural Theorem Proving with (Long-)Contexts
di: Hu, Jiewen, et al.
Pubblicazione: (2024)
di: Hu, Jiewen, et al.
Pubblicazione: (2024)
Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision
di: Sun, Zhiqing, et al.
Pubblicazione: (2024)
di: Sun, Zhiqing, et al.
Pubblicazione: (2024)
AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation
di: Du, Weihua, et al.
Pubblicazione: (2026)
di: Du, Weihua, et al.
Pubblicazione: (2026)
ImProver 2: Iteratively Self-Improving LMs for Neurosymbolic Proof Optimization
di: Ahuja, Riyaz, et al.
Pubblicazione: (2026)
di: Ahuja, Riyaz, et al.
Pubblicazione: (2026)
Self-Play Preference Optimization for Language Model Alignment
di: Wu, Yue, et al.
Pubblicazione: (2024)
di: Wu, Yue, et al.
Pubblicazione: (2024)
SLOT: Sample-specific Language Model Optimization at Test-time
di: Hu, Yang, et al.
Pubblicazione: (2025)
di: Hu, Yang, et al.
Pubblicazione: (2025)
Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
di: Chow, Yinlam, et al.
Pubblicazione: (2024)
di: Chow, Yinlam, et al.
Pubblicazione: (2024)
Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees
di: Chen, Sijia, et al.
Pubblicazione: (2024)
di: Chen, Sijia, et al.
Pubblicazione: (2024)
CORM: Cache Optimization with Recent Message for Large Language Model Inference
di: Dai, Jincheng, et al.
Pubblicazione: (2024)
di: Dai, Jincheng, et al.
Pubblicazione: (2024)
$T^2$ of Thoughts: Temperature Tree Elicits Reasoning in Large Language Models
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
Building Decision Making Models Through Language Model Regime
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
di: Li, Kenneth, et al.
Pubblicazione: (2024)
di: Li, Kenneth, et al.
Pubblicazione: (2024)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
di: Wang, Xuliang, et al.
Pubblicazione: (2026)
di: Wang, Xuliang, et al.
Pubblicazione: (2026)
An Efficient Inference Framework for Early-exit Large Language Models
di: Miao, Ruijie, et al.
Pubblicazione: (2024)
di: Miao, Ruijie, et al.
Pubblicazione: (2024)
HMI: Hierarchical Knowledge Management for Efficient Multi-Tenant Inference in Pretrained Language Models
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs
di: Opsahl-Ong, Krista, et al.
Pubblicazione: (2024)
di: Opsahl-Ong, Krista, et al.
Pubblicazione: (2024)
Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
di: Du, Weihua, et al.
Pubblicazione: (2025)
di: Du, Weihua, et al.
Pubblicazione: (2025)
Scaling Inference-Efficient Language Models
di: Bian, Song, et al.
Pubblicazione: (2025)
di: Bian, Song, et al.
Pubblicazione: (2025)
Scaling LLM Multi-turn RL with End-to-end Summarization-based Context Management
di: Lu, Miao, et al.
Pubblicazione: (2025)
di: Lu, Miao, et al.
Pubblicazione: (2025)
Large Language Models as Optimizers
di: Yang, Chengrun, et al.
Pubblicazione: (2023)
di: Yang, Chengrun, et al.
Pubblicazione: (2023)
Manifold-based Sampling for In-Context Hallucination Detection in Large Language Models
di: Vamshi, Bodla Krishna, et al.
Pubblicazione: (2026)
di: Vamshi, Bodla Krishna, et al.
Pubblicazione: (2026)
Reasoning with Sampling: Your Base Model is Smarter Than You Think
di: Karan, Aayush, et al.
Pubblicazione: (2025)
di: Karan, Aayush, et al.
Pubblicazione: (2025)
Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization
di: Ji, Kaixuan, et al.
Pubblicazione: (2024)
di: Ji, Kaixuan, et al.
Pubblicazione: (2024)
On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency
di: Wang, Yiming, et al.
Pubblicazione: (2026)
di: Wang, Yiming, et al.
Pubblicazione: (2026)
Syntactic Control of Language Models by Posterior Inference
di: Xefteri, Vicky, et al.
Pubblicazione: (2025)
di: Xefteri, Vicky, et al.
Pubblicazione: (2025)
Causal Inference for Human-Language Model Collaboration
di: Zhang, Bohan, et al.
Pubblicazione: (2024)
di: Zhang, Bohan, et al.
Pubblicazione: (2024)
Memory Injections: Correcting Multi-Hop Reasoning Failures during Inference in Transformer-Based Language Models
di: Sakarvadia, Mansi, et al.
Pubblicazione: (2023)
di: Sakarvadia, Mansi, et al.
Pubblicazione: (2023)
Calibrating Language Models with Adaptive Temperature Scaling
di: Xie, Johnathan, et al.
Pubblicazione: (2024)
di: Xie, Johnathan, et al.
Pubblicazione: (2024)
Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers
di: Du, Yixuan, et al.
Pubblicazione: (2026)
di: Du, Yixuan, et al.
Pubblicazione: (2026)
On the Role of Temperature Sampling in Test-Time Scaling
di: Wu, Yuheng, et al.
Pubblicazione: (2025)
di: Wu, Yuheng, et al.
Pubblicazione: (2025)
Fast Controlled Generation from Language Models with Adaptive Weighted Rejection Sampling
di: Lipkin, Benjamin, et al.
Pubblicazione: (2025)
di: Lipkin, Benjamin, et al.
Pubblicazione: (2025)
PAT: Pruning-Aware Tuning for Large Language Models
di: Liu, Yijiang, et al.
Pubblicazione: (2024)
di: Liu, Yijiang, et al.
Pubblicazione: (2024)
MPPO: Multi Pair-wise Preference Optimization for LLMs with Arbitrary Negative Samples
di: Xie, Shuo, et al.
Pubblicazione: (2024)
di: Xie, Shuo, et al.
Pubblicazione: (2024)
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
di: Tyukin, Georgy
Pubblicazione: (2024)
di: Tyukin, Georgy
Pubblicazione: (2024)
Hypothesis Generation and Inductive Inference in Children and Language Models
di: Qin, Jeffrey, et al.
Pubblicazione: (2026)
di: Qin, Jeffrey, et al.
Pubblicazione: (2026)
Fine-Grained Interpretation of Political Opinions in Large Language Models
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Agentic-R1: Distilled Dual-Strategy Reasoning
di: Du, Weihua, et al.
Pubblicazione: (2025) -
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
di: Yang, Ningyuan, et al.
Pubblicazione: (2026) -
Training Proactive and Personalized LLM Agents
di: Sun, Weiwei, et al.
Pubblicazione: (2025) -
L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025) -
miniCTX: Neural Theorem Proving with (Long-)Contexts
di: Hu, Jiewen, et al.
Pubblicazione: (2024)