ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Xiuyu, Zhang, Jinkai, Yi, Mingyang, Li, Yu, Wang, Longqiang, Wang, Yue, Fan, Ju |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers
por: Yang, Zhicheng, et al.
Publicado: (2025)
por: Yang, Zhicheng, et al.
Publicado: (2025)
Echo: Decoupling Inference and Training for Large-Scale RL Alignment on Heterogeneous Swarms
por: Xiao, Jie, et al.
Publicado: (2025)
por: Xiao, Jie, et al.
Publicado: (2025)
S*: Test Time Scaling for Code Generation
por: Li, Dacheng, et al.
Publicado: (2025)
por: Li, Dacheng, et al.
Publicado: (2025)
ETS: Efficient Tree Search for Inference-Time Scaling
por: Hooper, Coleman, et al.
Publicado: (2025)
por: Hooper, Coleman, et al.
Publicado: (2025)
SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
por: Wang, Chen, et al.
Publicado: (2025)
por: Wang, Chen, et al.
Publicado: (2025)
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
por: Lin, Weizhe, et al.
Publicado: (2025)
por: Lin, Weizhe, et al.
Publicado: (2025)
Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms
por: Su, Xuerui, et al.
Publicado: (2025)
por: Su, Xuerui, et al.
Publicado: (2025)
JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training
por: Hu, Zhengding, et al.
Publicado: (2026)
por: Hu, Zhengding, et al.
Publicado: (2026)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
por: Li, Haozhan, et al.
Publicado: (2025)
por: Li, Haozhan, et al.
Publicado: (2025)
AdamO: A Collapse-Suppressed Optimizer for Offline RL
por: Qiao, Nan, et al.
Publicado: (2026)
por: Qiao, Nan, et al.
Publicado: (2026)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
por: Setlur, Amrith, et al.
Publicado: (2025)
por: Setlur, Amrith, et al.
Publicado: (2025)
LogoRA: Local-Global Representation Alignment for Robust Time Series Classification
por: Zhang, Huanyu, et al.
Publicado: (2024)
por: Zhang, Huanyu, et al.
Publicado: (2024)
Open-World Test-Time Training: Self-Training with Contrast Learning
por: Su, Houcheng, et al.
Publicado: (2024)
por: Su, Houcheng, et al.
Publicado: (2024)
Central Limit Theorem for Two-Time-Scale Approximate Distributionally Robust RL
por: Wang, Shengbo, et al.
Publicado: (2026)
por: Wang, Shengbo, et al.
Publicado: (2026)
Less is More: Clustered Cross-Covariance Control for Offline RL
por: Qiao, Nan, et al.
Publicado: (2026)
por: Qiao, Nan, et al.
Publicado: (2026)
RollArt: Scaling Agentic RL Training via Disaggregated Infrastructure
por: Gao, Wei, et al.
Publicado: (2025)
por: Gao, Wei, et al.
Publicado: (2025)
Dual Alignment Maximin Optimization for Offline Model-based RL
por: Zhou, Chi, et al.
Publicado: (2025)
por: Zhou, Chi, et al.
Publicado: (2025)
SolverLLM: Leveraging Test-Time Scaling for Optimization Problem via LLM-Guided Search
por: Li, Dong, et al.
Publicado: (2025)
por: Li, Dong, et al.
Publicado: (2025)
Towards a Theoretical Understanding to the Generalization of RLHF
por: Li, Zhaochun, et al.
Publicado: (2026)
por: Li, Zhaochun, et al.
Publicado: (2026)
Fuz-RL: A Fuzzy-Guided Robust Framework for Safe Reinforcement Learning under Uncertainty
por: Wan, Xu, et al.
Publicado: (2026)
por: Wan, Xu, et al.
Publicado: (2026)
Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models
por: Wang, Liangyu, et al.
Publicado: (2025)
por: Wang, Liangyu, et al.
Publicado: (2025)
Reward-SQL: Boosting Text-to-SQL via Stepwise Reasoning and Process-Supervised Rewards
por: Zhang, Yuxin, et al.
Publicado: (2025)
por: Zhang, Yuxin, et al.
Publicado: (2025)
ReAugment: Model Zoo-Guided RL for Few-Shot Time Series Augmentation and Forecasting
por: Yuan, Haochen, et al.
Publicado: (2024)
por: Yuan, Haochen, et al.
Publicado: (2024)
Structural Alignment Improves Graph Test-Time Adaptation
por: Hsu, Hans Hao-Hsun, et al.
Publicado: (2025)
por: Hsu, Hans Hao-Hsun, et al.
Publicado: (2025)
Test-Time Training on Graphs with Large Language Models (LLMs)
por: Zhang, Jiaxin, et al.
Publicado: (2024)
por: Zhang, Jiaxin, et al.
Publicado: (2024)
On Designing Effective RL Reward at Training Time for LLM Reasoning
por: Gao, Jiaxuan, et al.
Publicado: (2024)
por: Gao, Jiaxuan, et al.
Publicado: (2024)
Training-Free Test-Time Adaptation with Brownian Distance Covariance in Vision-Language Models
por: Zhang, Yi, et al.
Publicado: (2026)
por: Zhang, Yi, et al.
Publicado: (2026)
Variational Continual Test-Time Adaptation
por: Lyu, Fan, et al.
Publicado: (2024)
por: Lyu, Fan, et al.
Publicado: (2024)
Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
por: Geuter, Jonathan, et al.
Publicado: (2025)
por: Geuter, Jonathan, et al.
Publicado: (2025)
End-to-End Test-Time Training for Long Context
por: Tandon, Arnuv, et al.
Publicado: (2025)
por: Tandon, Arnuv, et al.
Publicado: (2025)
Continuous-time Riemannian SGD and SVRG Flows on Wasserstein Probabilistic Space
por: Yi, Mingyang, et al.
Publicado: (2024)
por: Yi, Mingyang, et al.
Publicado: (2024)
Backpropagation-Free Test-Time Adaptation via Probabilistic Gaussian Alignment
por: Zhang, Youjia, et al.
Publicado: (2025)
por: Zhang, Youjia, et al.
Publicado: (2025)
TimeSAF: Towards LLM-Guided Semantic Asynchronous Fusion for Time Series Forecasting
por: Zhang, Fan, et al.
Publicado: (2026)
por: Zhang, Fan, et al.
Publicado: (2026)
Test-Time Scaling with Reflective Generative Model
por: Wang, Zixiao, et al.
Publicado: (2025)
por: Wang, Zixiao, et al.
Publicado: (2025)
Test-Time Training on Video Streams
por: Wang, Renhao, et al.
Publicado: (2023)
por: Wang, Renhao, et al.
Publicado: (2023)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
Understanding the Role of Training Data in Test-Time Scaling
por: Javanmard, Adel, et al.
Publicado: (2025)
por: Javanmard, Adel, et al.
Publicado: (2025)
Reasoning-as-Logic-Units: Scaling Test-Time Reasoning in Large Language Models Through Logic Unit Alignment
por: Li, Cheryl, et al.
Publicado: (2025)
por: Li, Cheryl, et al.
Publicado: (2025)
QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
por: Gu, Hao, et al.
Publicado: (2026)
por: Gu, Hao, et al.
Publicado: (2026)
Test-Time Training Scaling Laws for Chemical Exploration in Drug Design
por: Thomas, Morgan, et al.
Publicado: (2025)
por: Thomas, Morgan, et al.
Publicado: (2025)
Ejemplares similares
-
Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers
por: Yang, Zhicheng, et al.
Publicado: (2025) -
Echo: Decoupling Inference and Training for Large-Scale RL Alignment on Heterogeneous Swarms
por: Xiao, Jie, et al.
Publicado: (2025) -
S*: Test Time Scaling for Code Generation
por: Li, Dacheng, et al.
Publicado: (2025) -
ETS: Efficient Tree Search for Inference-Time Scaling
por: Hooper, Coleman, et al.
Publicado: (2025) -
SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
por: Wang, Chen, et al.
Publicado: (2025)