Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
Fuente:
arXiv
Salvato in:
| Autori principali: | Karlekar, Sweta, Zheng, Carolina, Saebo, Magnus, Beltran-Velez, Nicolas, Yu, Shuyang, Bowlan, John, Kucer, Michal, Blei, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders
di: Zheng, Carolina, et al.
Pubblicazione: (2025)
di: Zheng, Carolina, et al.
Pubblicazione: (2025)
Estimating the Hallucination Rate of Generative AI
di: Jesson, Andrew, et al.
Pubblicazione: (2024)
di: Jesson, Andrew, et al.
Pubblicazione: (2024)
Posterior Mean Matching: Generative Modeling through Online Bayesian Inference
di: Salazar, Sebastian, et al.
Pubblicazione: (2024)
di: Salazar, Sebastian, et al.
Pubblicazione: (2024)
Can Generative AI Solve Your In-Context Learning Problem? A Martingale Perspective
di: Jesson, Andrew, et al.
Pubblicazione: (2024)
di: Jesson, Andrew, et al.
Pubblicazione: (2024)
Hypothesis Testing the Circuit Hypothesis in LLMs
di: Shi, Claudia, et al.
Pubblicazione: (2024)
di: Shi, Claudia, et al.
Pubblicazione: (2024)
Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
di: Xia, Fanzeng, et al.
Pubblicazione: (2024)
di: Xia, Fanzeng, et al.
Pubblicazione: (2024)
Fusing Reward and Dueling Feedback in Stochastic Bandits
di: Wang, Xuchuang, et al.
Pubblicazione: (2025)
di: Wang, Xuchuang, et al.
Pubblicazione: (2025)
LatentEvolve: Self-Evolving Test-Time Scaling in Latent Space
di: Zhang, Guibin, et al.
Pubblicazione: (2025)
di: Zhang, Guibin, et al.
Pubblicazione: (2025)
Treeffuser: Probabilistic Predictions via Conditional Diffusions with Gradient-Boosted Trees
di: Beltran-Velez, Nicolas, et al.
Pubblicazione: (2024)
di: Beltran-Velez, Nicolas, et al.
Pubblicazione: (2024)
LLM Routing with Dueling Feedback
di: Chiang, Chao-Kai, et al.
Pubblicazione: (2025)
di: Chiang, Chao-Kai, et al.
Pubblicazione: (2025)
LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization
di: Wu, Yuanchen, et al.
Pubblicazione: (2025)
di: Wu, Yuanchen, et al.
Pubblicazione: (2025)
ACE: Self-Evolving LLM Coding Framework via Adversarial Unit Test Generation and Preference Optimization
di: Huang, Yixu, et al.
Pubblicazione: (2026)
di: Huang, Yixu, et al.
Pubblicazione: (2026)
BlindFL: Segmented Federated Learning with Fully Homomorphic Encryption
di: Gronberg, Evan, et al.
Pubblicazione: (2025)
di: Gronberg, Evan, et al.
Pubblicazione: (2025)
SELAUR: Self Evolving LLM Agent via Uncertainty-aware Rewards
di: Zhang, Dengjia, et al.
Pubblicazione: (2026)
di: Zhang, Dengjia, et al.
Pubblicazione: (2026)
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
di: Verma, Arun, et al.
Pubblicazione: (2024)
di: Verma, Arun, et al.
Pubblicazione: (2024)
Bayesian Preference Learning for Test-Time Steerable Reward Models
di: Hong, Jiwoo, et al.
Pubblicazione: (2026)
di: Hong, Jiwoo, et al.
Pubblicazione: (2026)
MetaScale: Test-Time Scaling with Evolving Meta-Thoughts
di: Liu, Qin, et al.
Pubblicazione: (2025)
di: Liu, Qin, et al.
Pubblicazione: (2025)
Self-Evolved Reward Learning for LLMs
di: Huang, Chenghua, et al.
Pubblicazione: (2024)
di: Huang, Chenghua, et al.
Pubblicazione: (2024)
How Robust Are Energy-Based Models Trained With Equilibrium Propagation?
di: Mansingh, Siddharth, et al.
Pubblicazione: (2024)
di: Mansingh, Siddharth, et al.
Pubblicazione: (2024)
When Can We Track Significant Preference Shifts in Dueling Bandits?
di: Suk, Joe, et al.
Pubblicazione: (2023)
di: Suk, Joe, et al.
Pubblicazione: (2023)
Direct Preference-Based Evolutionary Multi-Objective Optimization with Dueling Bandit
di: Huang, Tian, et al.
Pubblicazione: (2023)
di: Huang, Tian, et al.
Pubblicazione: (2023)
TTCS: Test-Time Curriculum Synthesis for Self-Evolving
di: Yang, Chengyi, et al.
Pubblicazione: (2026)
di: Yang, Chengyi, et al.
Pubblicazione: (2026)
On the stochastics of human and artificial creativity
di: Sæbø, Solve, et al.
Pubblicazione: (2024)
di: Sæbø, Solve, et al.
Pubblicazione: (2024)
Self-Evolving Curriculum for LLM Reasoning
di: Chen, Xiaoyin, et al.
Pubblicazione: (2025)
di: Chen, Xiaoyin, et al.
Pubblicazione: (2025)
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
di: Chen, Tianlang, et al.
Pubblicazione: (2025)
di: Chen, Tianlang, et al.
Pubblicazione: (2025)
SPUS: A Lightweight and Parameter-Efficient Foundation Model for PDEs
di: Siddik, Abu Bucker, et al.
Pubblicazione: (2025)
di: Siddik, Abu Bucker, et al.
Pubblicazione: (2025)
The Phase Transition of the Voter Model on Evolving Scale-Free Networks
di: Fernley, John
Pubblicazione: (2024)
di: Fernley, John
Pubblicazione: (2024)
CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models
di: Zhu, Xiao, et al.
Pubblicazione: (2026)
di: Zhu, Xiao, et al.
Pubblicazione: (2026)
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
di: Zhao, Wenshuo, et al.
Pubblicazione: (2026)
di: Zhao, Wenshuo, et al.
Pubblicazione: (2026)
DP-Dueling: Learning from Preference Feedback without Compromising User Privacy
di: Saha, Aadirupa, et al.
Pubblicazione: (2024)
di: Saha, Aadirupa, et al.
Pubblicazione: (2024)
Preference is More Than Comparisons: Rethinking Dueling Bandits with Augmented Human Feedback
di: Wang, Shengbo, et al.
Pubblicazione: (2025)
di: Wang, Shengbo, et al.
Pubblicazione: (2025)
Test-Time Reasoning Through Visual Human Preferences with VLMs and Soft Rewards
di: Gambashidze, Alexander, et al.
Pubblicazione: (2025)
di: Gambashidze, Alexander, et al.
Pubblicazione: (2025)
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification
di: Wan, Yuxuan, et al.
Pubblicazione: (2026)
di: Wan, Yuxuan, et al.
Pubblicazione: (2026)
Online Clustering of Dueling Bandits
di: Wang, Zhiyong, et al.
Pubblicazione: (2025)
di: Wang, Zhiyong, et al.
Pubblicazione: (2025)
Improving the Physics of Video Generation with VJEPA-2 Reward Signal
di: Yuan, Jianhao, et al.
Pubblicazione: (2025)
di: Yuan, Jianhao, et al.
Pubblicazione: (2025)
SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking
di: Li, Jindong, et al.
Pubblicazione: (2026)
di: Li, Jindong, et al.
Pubblicazione: (2026)
The Sampling Complexity of Condorcet Winner Identification in Dueling Bandits
di: Saad, El Mehdi, et al.
Pubblicazione: (2026)
di: Saad, El Mehdi, et al.
Pubblicazione: (2026)
RewardHarness: Self-Evolving Agentic Post-Training
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
Dueling Deep Reinforcement Learning for Financial Time Series
di: Giorgio, Bruno
Pubblicazione: (2025)
di: Giorgio, Bruno
Pubblicazione: (2025)
Documenti analoghi
-
Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders
di: Zheng, Carolina, et al.
Pubblicazione: (2025) -
Estimating the Hallucination Rate of Generative AI
di: Jesson, Andrew, et al.
Pubblicazione: (2024) -
Posterior Mean Matching: Generative Modeling through Online Bayesian Inference
di: Salazar, Sebastian, et al.
Pubblicazione: (2024) -
Can Generative AI Solve Your In-Context Learning Problem? A Martingale Perspective
di: Jesson, Andrew, et al.
Pubblicazione: (2024) -
Hypothesis Testing the Circuit Hypothesis in LLMs
di: Shi, Claudia, et al.
Pubblicazione: (2024)