RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Tianlang, Xu, Minkai, Leskovec, Jure, Ermon, Stefano |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Energy-Based Diffusion Language Models for Text Generation
by: Xu, Minkai, et al.
Published: (2024)
by: Xu, Minkai, et al.
Published: (2024)
Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space
by: Shen, Yangyi, et al.
Published: (2026)
by: Shen, Yangyi, et al.
Published: (2026)
TabDiff: a Mixed-type Diffusion Model for Tabular Data Generation
by: Shi, Juntong, et al.
Published: (2024)
by: Shi, Juntong, et al.
Published: (2024)
RelDiff: Relational Data Generative Modeling with Graph-Based Diffusion Models
by: Hudovernik, Valter, et al.
Published: (2025)
by: Hudovernik, Valter, et al.
Published: (2025)
Large Language Models are Good Relational Learners
by: Wu, Fang, et al.
Published: (2025)
by: Wu, Fang, et al.
Published: (2025)
Found in Conversation: LLMs Teach Themselves to Close the Multi-Turn Gap
by: Chen, Tianlang, et al.
Published: (2026)
by: Chen, Tianlang, et al.
Published: (2026)
$f$-PO: Generalizing Preference Optimization with $f$-divergence Minimization
by: Han, Jiaqi, et al.
Published: (2024)
by: Han, Jiaqi, et al.
Published: (2024)
Inference-Time Scaling of Diffusion Language Models via Trajectory Refinement
by: Dang, Meihua, et al.
Published: (2025)
by: Dang, Meihua, et al.
Published: (2025)
RelGNN: Composite Message Passing for Relational Deep Learning
by: Chen, Tianlang, et al.
Published: (2025)
by: Chen, Tianlang, et al.
Published: (2025)
Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective
by: Ou, Jingyang, et al.
Published: (2025)
by: Ou, Jingyang, et al.
Published: (2025)
Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution
by: Lou, Aaron, et al.
Published: (2023)
by: Lou, Aaron, et al.
Published: (2023)
Aligning Target-Aware Molecule Diffusion Models with Exact Energy Optimization
by: Gu, Siyi, et al.
Published: (2024)
by: Gu, Siyi, et al.
Published: (2024)
Geometric Trajectory Diffusion Models
by: Han, Jiaqi, et al.
Published: (2024)
by: Han, Jiaqi, et al.
Published: (2024)
TFG: Unified Training-Free Guidance for Diffusion Models
by: Ye, Haotian, et al.
Published: (2024)
by: Ye, Haotian, et al.
Published: (2024)
Divergence Minimization Preference Optimization for Diffusion Model Alignment
by: Li, Binxu, et al.
Published: (2025)
by: Li, Binxu, et al.
Published: (2025)
Reviving Any-Subset Autoregressive Models with Principled Parallel Sampling and Speculative Decoding
by: Guo, Gabe, et al.
Published: (2025)
by: Guo, Gabe, et al.
Published: (2025)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
by: Rafailov, Rafael, et al.
Published: (2023)
by: Rafailov, Rafael, et al.
Published: (2023)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
by: Tejaswi, Atula, et al.
Published: (2026)
by: Tejaswi, Atula, et al.
Published: (2026)
GeoLLM: Extracting Geospatial Knowledge from Large Language Models
by: Manvi, Rohin, et al.
Published: (2023)
by: Manvi, Rohin, et al.
Published: (2023)
Large Language Models are Geographically Biased
by: Manvi, Rohin, et al.
Published: (2024)
by: Manvi, Rohin, et al.
Published: (2024)
Equivariant Graph Neural Operator for Modeling 3D Dynamics
by: Xu, Minkai, et al.
Published: (2024)
by: Xu, Minkai, et al.
Published: (2024)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
by: Wang, Jian, et al.
Published: (2025)
by: Wang, Jian, et al.
Published: (2025)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
by: Karlekar, Sweta, et al.
Published: (2026)
by: Karlekar, Sweta, et al.
Published: (2026)
Provable Scaling Laws for the Test-Time Compute of Large Language Models
by: Chen, Yanxi, et al.
Published: (2024)
by: Chen, Yanxi, et al.
Published: (2024)
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
by: Zhao, Siyan, et al.
Published: (2025)
by: Zhao, Siyan, et al.
Published: (2025)
Adaptive Inference-Time Compute: LLMs Can Predict if They Can Do Better, Even Mid-Generation
by: Manvi, Rohin, et al.
Published: (2024)
by: Manvi, Rohin, et al.
Published: (2024)
Uncertainty Quantification for Forward and Inverse Problems of PDEs via Latent Global Evolution
by: Wu, Tailin, et al.
Published: (2024)
by: Wu, Tailin, et al.
Published: (2024)
AvaTaR: Optimizing LLM Agents for Tool Usage via Contrastive Reasoning
by: Wu, Shirley, et al.
Published: (2024)
by: Wu, Shirley, et al.
Published: (2024)
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
by: Zhao, Wenshuo, et al.
Published: (2026)
by: Zhao, Wenshuo, et al.
Published: (2026)
Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning
by: Reganova, Elizaveta, et al.
Published: (2024)
by: Reganova, Elizaveta, et al.
Published: (2024)
On the Power of (Approximate) Reward Models for Inference-Time Scaling
by: Zhu, Youheng, et al.
Published: (2026)
by: Zhu, Youheng, et al.
Published: (2026)
Inference-Time Scaling for Generalist Reward Modeling
by: Liu, Zijun, et al.
Published: (2025)
by: Liu, Zijun, et al.
Published: (2025)
Parallel Test-Time Scaling for Latent Reasoning Models
by: You, Runyang, et al.
Published: (2025)
by: You, Runyang, et al.
Published: (2025)
Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes
by: Bereket, Michael, et al.
Published: (2025)
by: Bereket, Michael, et al.
Published: (2025)
HEART: Emotionally-Driven Test-Time Scaling of Language Models
by: Pinto, Gabriela, et al.
Published: (2025)
by: Pinto, Gabriela, et al.
Published: (2025)
On the Emergence and Test-Time Use of Structural Information in Large Language Models
by: Chen, Michelle Chao, et al.
Published: (2026)
by: Chen, Michelle Chao, et al.
Published: (2026)
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
by: Zhao, James Xu, et al.
Published: (2025)
by: Zhao, James Xu, et al.
Published: (2025)
Bayesian Preference Learning for Test-Time Steerable Reward Models
by: Hong, Jiwoo, et al.
Published: (2026)
by: Hong, Jiwoo, et al.
Published: (2026)
Test-Time Scaling with Reflective Generative Model
by: Wang, Zixiao, et al.
Published: (2025)
by: Wang, Zixiao, et al.
Published: (2025)
Test-Time Learning for Large Language Models
by: Hu, Jinwu, et al.
Published: (2025)
by: Hu, Jinwu, et al.
Published: (2025)
Similar Items
-
Energy-Based Diffusion Language Models for Text Generation
by: Xu, Minkai, et al.
Published: (2024) -
Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space
by: Shen, Yangyi, et al.
Published: (2026) -
TabDiff: a Mixed-type Diffusion Model for Tabular Data Generation
by: Shi, Juntong, et al.
Published: (2024) -
RelDiff: Relational Data Generative Modeling with Graph-Based Diffusion Models
by: Hudovernik, Valter, et al.
Published: (2025) -
Large Language Models are Good Relational Learners
by: Wu, Fang, et al.
Published: (2025)