Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Miles, Roy, Toker, Aysim, Oncescu, Andreea-Maria, Xu, Songcen, Deng, Jiankang, Elezi, Ismail |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing
par: Toker, Aysim, et autres
Publié: (2025)
par: Toker, Aysim, et autres
Publié: (2025)
$V_kD:$ Improving Knowledge Distillation using Orthogonal Projections
par: Miles, Roy, et autres
Publié: (2024)
par: Miles, Roy, et autres
Publié: (2024)
VeLoRA: Memory Efficient Training using Rank-1 Sub-Token Projections
par: Miles, Roy, et autres
Publié: (2024)
par: Miles, Roy, et autres
Publié: (2024)
A Benchmark for Deep Information Synthesis
par: Paul, Debjit, et autres
Publié: (2026)
par: Paul, Debjit, et autres
Publié: (2026)
From Attention to Activation: Unravelling the Enigmas of Large Language Models
par: Kaul, Prannay, et autres
Publié: (2024)
par: Kaul, Prannay, et autres
Publié: (2024)
Top 10 Open Challenges Steering the Future of Diffusion Language Model and Its Variants
par: Wang, Yunhe, et autres
Publié: (2026)
par: Wang, Yunhe, et autres
Publié: (2026)
Deep Active Learning: A Reality Check
par: Gashi, Edrina, et autres
Publié: (2024)
par: Gashi, Edrina, et autres
Publié: (2024)
RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models
par: Ye-Bin, Moon, et autres
Publié: (2025)
par: Ye-Bin, Moon, et autres
Publié: (2025)
CASteer: Cross-Attention Steering for Controllable Concept Erasure
par: Gaintseva, Tatiana, et autres
Publié: (2025)
par: Gaintseva, Tatiana, et autres
Publié: (2025)
Logical Reasoning with Outcome Reward Models for Test-Time Scaling
par: Thatikonda, Ramya Keerthy, et autres
Publié: (2025)
par: Thatikonda, Ramya Keerthy, et autres
Publié: (2025)
A Stitch in Time Saves Nine: Proactive Self-Refinement for Language Models
par: Han, Jinyi, et autres
Publié: (2025)
par: Han, Jinyi, et autres
Publié: (2025)
G3DR: Generative 3D Reconstruction in ImageNet
par: Reddy, Pradyumna, et autres
Publié: (2024)
par: Reddy, Pradyumna, et autres
Publié: (2024)
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
par: Cui, Yingqian, et autres
Publié: (2025)
par: Cui, Yingqian, et autres
Publié: (2025)
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
par: Zhao, Wenshuo, et autres
Publié: (2026)
par: Zhao, Wenshuo, et autres
Publié: (2026)
Inference-Time Scaling for Generalist Reward Modeling
par: Liu, Zijun, et autres
Publié: (2025)
par: Liu, Zijun, et autres
Publié: (2025)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
par: Karlekar, Sweta, et autres
Publié: (2026)
par: Karlekar, Sweta, et autres
Publié: (2026)
Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling
par: Trung, Bui The, et autres
Publié: (2026)
par: Trung, Bui The, et autres
Publié: (2026)
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
par: Chen, Tianlang, et autres
Publié: (2025)
par: Chen, Tianlang, et autres
Publié: (2025)
MidSteer: Optimal Affine Framework for Steering Generative Models
par: Gaintseva, Tatiana, et autres
Publié: (2026)
par: Gaintseva, Tatiana, et autres
Publié: (2026)
RTTC: Reward-Guided Collaborative Test-Time Compute
par: Muñoz, J. Pablo, et autres
Publié: (2025)
par: Muñoz, J. Pablo, et autres
Publié: (2025)
Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering
par: Choi, Yura, et autres
Publié: (2026)
par: Choi, Yura, et autres
Publié: (2026)
Leveraging Large Language Models for Rare Disease Named Entity Recognition
par: Xi, Nan Miles, et autres
Publié: (2025)
par: Xi, Nan Miles, et autres
Publié: (2025)
UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling
par: Huang, Kaiyu, et autres
Publié: (2026)
par: Huang, Kaiyu, et autres
Publié: (2026)
Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence
par: Ghasemabadi, Amirhosein, et autres
Publié: (2025)
par: Ghasemabadi, Amirhosein, et autres
Publié: (2025)
BrowseConf: Confidence-Guided Test-Time Scaling for Web Agents
par: Ou, Litu, et autres
Publié: (2025)
par: Ou, Litu, et autres
Publié: (2025)
Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning
par: Turpin, Miles, et autres
Publié: (2025)
par: Turpin, Miles, et autres
Publié: (2025)
SatSynth: Augmenting Image-Mask Pairs through Diffusion Models for Aerial Semantic Segmentation
par: Toker, Aysim, et autres
Publié: (2024)
par: Toker, Aysim, et autres
Publié: (2024)
Self-Rewarding Language Models
par: Yuan, Weizhe, et autres
Publié: (2024)
par: Yuan, Weizhe, et autres
Publié: (2024)
DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces
par: Khan, Mohammad Sadil, et autres
Publié: (2026)
par: Khan, Mohammad Sadil, et autres
Publié: (2026)
Finish First, Perfect Later: Test-Time Token-Level Cross-Validation for Diffusion Large Language Models
par: Tian, Runchu, et autres
Publié: (2025)
par: Tian, Runchu, et autres
Publié: (2025)
R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning
par: Chen, Zhuokun, et autres
Publié: (2025)
par: Chen, Zhuokun, et autres
Publié: (2025)
GradeSQL: Test-Time Inference with Outcome Reward Models for Text-to-SQL Generation from Large Language Models
par: Tritto, Mattia, et autres
Publié: (2025)
par: Tritto, Mattia, et autres
Publié: (2025)
Provable Scaling Laws for the Test-Time Compute of Large Language Models
par: Chen, Yanxi, et autres
Publié: (2024)
par: Chen, Yanxi, et autres
Publié: (2024)
"Principal Components" Enable A New Language of Images
par: Wen, Xin, et autres
Publié: (2025)
par: Wen, Xin, et autres
Publié: (2025)
m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models
par: Huang, Xiaoke, et autres
Publié: (2025)
par: Huang, Xiaoke, et autres
Publié: (2025)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
par: Tejaswi, Atula, et autres
Publié: (2026)
par: Tejaswi, Atula, et autres
Publié: (2026)
DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models
par: Ventura, Mor, et autres
Publié: (2025)
par: Ventura, Mor, et autres
Publié: (2025)
Debiasing Reward Models via Causally Motivated Inference-Time Intervention
par: Shinoda, Kazutoshi, et autres
Publié: (2026)
par: Shinoda, Kazutoshi, et autres
Publié: (2026)
A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?
par: Zhang, Qiyuan, et autres
Publié: (2025)
par: Zhang, Qiyuan, et autres
Publié: (2025)
Value-Aware Numerical Representations for Transformer Language Models
par: Dutulescu, Andreea, et autres
Publié: (2026)
par: Dutulescu, Andreea, et autres
Publié: (2026)
Documents similaires
-
SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing
par: Toker, Aysim, et autres
Publié: (2025) -
$V_kD:$ Improving Knowledge Distillation using Orthogonal Projections
par: Miles, Roy, et autres
Publié: (2024) -
VeLoRA: Memory Efficient Training using Rank-1 Sub-Token Projections
par: Miles, Roy, et autres
Publié: (2024) -
A Benchmark for Deep Information Synthesis
par: Paul, Debjit, et autres
Publié: (2026) -
From Attention to Activation: Unravelling the Enigmas of Large Language Models
par: Kaul, Prannay, et autres
Publié: (2024)