A Theoretical Lens for RL-Tuned Language Models via Energy-Based Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Tan, Zhiquan, Hong, Yinrong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Self-Supervised On-Policy Distillation for Reasoning Language Models
por: Tan, Zhiquan, et al.
Publicado: (2026)
por: Tan, Zhiquan, et al.
Publicado: (2026)
PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners
por: Tan, Zhiquan, et al.
Publicado: (2026)
por: Tan, Zhiquan, et al.
Publicado: (2026)
Inference-Cost-Aware Dynamic Tree Construction for Efficient Inference in Large Language Models
por: Hong, Yinrong, et al.
Publicado: (2025)
por: Hong, Yinrong, et al.
Publicado: (2025)
Information-Theoretic Perspectives on Optimizers
por: Tan, Zhiquan, et al.
Publicado: (2025)
por: Tan, Zhiquan, et al.
Publicado: (2025)
Accurate and Efficient Fine-Tuning of Quantized Large Language Models Through Optimal Balance
por: Shen, Ao, et al.
Publicado: (2024)
por: Shen, Ao, et al.
Publicado: (2024)
The Information of Large Language Model Geometry
por: Tan, Zhiquan, et al.
Publicado: (2024)
por: Tan, Zhiquan, et al.
Publicado: (2024)
Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models
por: Jelassi, Samy, et al.
Publicado: (2026)
por: Jelassi, Samy, et al.
Publicado: (2026)
Diff-eRank: A Novel Rank-Based Metric for Evaluating Large Language Models
por: Wei, Lai, et al.
Publicado: (2024)
por: Wei, Lai, et al.
Publicado: (2024)
Understanding Grokking Through A Robustness Viewpoint
por: Tan, Zhiquan, et al.
Publicado: (2023)
por: Tan, Zhiquan, et al.
Publicado: (2023)
Exploring Information-Theoretic Metrics Associated with Neural Collapse in Supervised Training
por: Song, Kun, et al.
Publicado: (2024)
por: Song, Kun, et al.
Publicado: (2024)
Can I understand what I create? Self-Knowledge Evaluation of Large Language Models
por: Tan, Zhiquan, et al.
Publicado: (2024)
por: Tan, Zhiquan, et al.
Publicado: (2024)
Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models
por: Li, Pengyi, et al.
Publicado: (2025)
por: Li, Pengyi, et al.
Publicado: (2025)
ATLAS: Adapter-Based Multi-Modal Continual Learning with a Two-Stage Learning Strategy
por: Li, Hong, et al.
Publicado: (2024)
por: Li, Hong, et al.
Publicado: (2024)
Model Explanations via the Axiomatic Causal Lens
por: Biradar, Gagan, et al.
Publicado: (2021)
por: Biradar, Gagan, et al.
Publicado: (2021)
Enhancing Offline Model-Based RL via Active Model Selection: A Bayesian Optimization Perspective
por: Yang, Yu-Wei, et al.
Publicado: (2025)
por: Yang, Yu-Wei, et al.
Publicado: (2025)
RL Token: Bootstrapping Online RL with Vision-Language-Action Models
por: Xu, Charles, et al.
Publicado: (2026)
por: Xu, Charles, et al.
Publicado: (2026)
SOMBRL: Scalable and Optimistic Model-Based RL
por: Sukhija, Bhavya, et al.
Publicado: (2025)
por: Sukhija, Bhavya, et al.
Publicado: (2025)
RL-Guided Data Selection for Language Model Finetuning
por: Jha, Animesh, et al.
Publicado: (2025)
por: Jha, Animesh, et al.
Publicado: (2025)
Learning Dynamics in RL Post-Training for Language Models
por: Tomihari, Akiyoshi
Publicado: (2026)
por: Tomihari, Akiyoshi
Publicado: (2026)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
por: Hong, Joey, et al.
Publicado: (2024)
por: Hong, Joey, et al.
Publicado: (2024)
An Analysis of Attention via the Lens of Exchangeability and Latent Variable Models
por: Zhang, Yufeng, et al.
Publicado: (2022)
por: Zhang, Yufeng, et al.
Publicado: (2022)
$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
por: Chen, Kang, et al.
Publicado: (2025)
por: Chen, Kang, et al.
Publicado: (2025)
Analyzing Memorization in Large Language Models through the Lens of Model Attribution
por: Menta, Tarun Ram, et al.
Publicado: (2025)
por: Menta, Tarun Ram, et al.
Publicado: (2025)
Continual Fine-Tuning of Large Language Models via Program Memory
por: Le, Hung, et al.
Publicado: (2026)
por: Le, Hung, et al.
Publicado: (2026)
EvoLen: Evolution-Guided Tokenization for DNA Language Model
por: Huang, Nan, et al.
Publicado: (2026)
por: Huang, Nan, et al.
Publicado: (2026)
Eliciting Latent Predictions from Transformers with the Tuned Lens
por: Belrose, Nora, et al.
Publicado: (2023)
por: Belrose, Nora, et al.
Publicado: (2023)
Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining
por: Cheng, Jie, et al.
Publicado: (2024)
por: Cheng, Jie, et al.
Publicado: (2024)
Dissecting Fine-Tuning Unlearning in Large Language Models
por: Hong, Yihuai, et al.
Publicado: (2024)
por: Hong, Yihuai, et al.
Publicado: (2024)
SecP-Tuning: Efficient Privacy-Preserving Prompt Tuning for Large Language Models via MPC
por: Luo, Jinglong, et al.
Publicado: (2025)
por: Luo, Jinglong, et al.
Publicado: (2025)
Informed POMDP: Leveraging Additional Information in Model-Based RL
por: Lambrechts, Gaspard, et al.
Publicado: (2023)
por: Lambrechts, Gaspard, et al.
Publicado: (2023)
Discovery of Sustainable Refrigerants through Physics-Informed RL Fine-Tuning of Sequence Models
por: Goldszal, Adrien, et al.
Publicado: (2025)
por: Goldszal, Adrien, et al.
Publicado: (2025)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
por: Mark, Max Sobol, et al.
Publicado: (2024)
por: Mark, Max Sobol, et al.
Publicado: (2024)
Adaptive Methods through the Lens of SDEs: Theoretical Insights on the Role of Noise
por: Compagnoni, Enea Monzio, et al.
Publicado: (2024)
por: Compagnoni, Enea Monzio, et al.
Publicado: (2024)
Reflect-RL: Two-Player Online RL Fine-Tuning for LMs
por: Zhou, Runlong, et al.
Publicado: (2024)
por: Zhou, Runlong, et al.
Publicado: (2024)
Improving Fairness of Large Language Model-Based ICU Mortality Prediction via Case-Based Prompting
por: Zhang, Gangxiong, et al.
Publicado: (2025)
por: Zhang, Gangxiong, et al.
Publicado: (2025)
GAST: Gradient-aligned Sparse Tuning of Large Language Models with Data-layer Selection
por: Yao, Kai, et al.
Publicado: (2026)
por: Yao, Kai, et al.
Publicado: (2026)
AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models
por: Lu, Chengxuan, et al.
Publicado: (2026)
por: Lu, Chengxuan, et al.
Publicado: (2026)
Energy-Based Reward Models for Robust Language Model Alignment
por: Lochab, Anamika, et al.
Publicado: (2025)
por: Lochab, Anamika, et al.
Publicado: (2025)
EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving
por: Palladino, Vittorio, et al.
Publicado: (2026)
por: Palladino, Vittorio, et al.
Publicado: (2026)
Embedding Enhancement via Fine-Tuned Language Models for Learner-Item Cognitive Modeling
por: Liu, Yuanhao, et al.
Publicado: (2026)
por: Liu, Yuanhao, et al.
Publicado: (2026)
Ejemplares similares
-
Self-Supervised On-Policy Distillation for Reasoning Language Models
por: Tan, Zhiquan, et al.
Publicado: (2026) -
PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners
por: Tan, Zhiquan, et al.
Publicado: (2026) -
Inference-Cost-Aware Dynamic Tree Construction for Efficient Inference in Large Language Models
por: Hong, Yinrong, et al.
Publicado: (2025) -
Information-Theoretic Perspectives on Optimizers
por: Tan, Zhiquan, et al.
Publicado: (2025) -
Accurate and Efficient Fine-Tuning of Quantized Large Language Models Through Optimal Balance
por: Shen, Ao, et al.
Publicado: (2024)