Salvato in:
| Autori principali: | Wang, Siqi, Yang, Hailong, Zhu, Junjie, Wang, Xuezhu, Xu, Yufan, Qian, Depei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2512.04752 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation
di: Cheng, Zelei, et al.
Pubblicazione: (2024)
di: Cheng, Zelei, et al.
Pubblicazione: (2024)
SplaXBERT: Leveraging Mixed Precision Training and Context Splitting for Question Answering
di: Yufan, Zhu, et al.
Pubblicazione: (2024)
di: Yufan, Zhu, et al.
Pubblicazione: (2024)
Beyond Window-Based Detection: A Graph-Centric Framework for Discrete Log Anomaly Detection
di: Qi, Jiaxing, et al.
Pubblicazione: (2025)
di: Qi, Jiaxing, et al.
Pubblicazione: (2025)
AuroRA: Breaking Low-Rank Bottleneck of LoRA with Nonlinear Mapping
di: Dong, Haonan, et al.
Pubblicazione: (2025)
di: Dong, Haonan, et al.
Pubblicazione: (2025)
An Adaptive Placement and Parallelism Framework for Accelerating RLHF Training
di: Xiao, Youshao, et al.
Pubblicazione: (2023)
di: Xiao, Youshao, et al.
Pubblicazione: (2023)
Breaking the Attention Bottleneck
di: Hilsenbek, Kalle
Pubblicazione: (2024)
di: Hilsenbek, Kalle
Pubblicazione: (2024)
Quantum Machine Learning in Log-based Anomaly Detection: Challenges and Opportunities
di: Qi, Jiaxing, et al.
Pubblicazione: (2024)
di: Qi, Jiaxing, et al.
Pubblicazione: (2024)
Breaking Symmetry Bottlenecks in GNN Readouts
di: Talhi, Mouad, et al.
Pubblicazione: (2026)
di: Talhi, Mouad, et al.
Pubblicazione: (2026)
BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training
di: Zhang, Zili, et al.
Pubblicazione: (2026)
di: Zhang, Zili, et al.
Pubblicazione: (2026)
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
di: Dai, Juntao, et al.
Pubblicazione: (2025)
di: Dai, Juntao, et al.
Pubblicazione: (2025)
Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models
di: Li, Zongqian, et al.
Pubblicazione: (2026)
di: Li, Zongqian, et al.
Pubblicazione: (2026)
OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework
di: Hu, Jian, et al.
Pubblicazione: (2024)
di: Hu, Jian, et al.
Pubblicazione: (2024)
Accelerating RLHF Training with Reward Variance Increase
di: Yang, Zonglin, et al.
Pubblicazione: (2025)
di: Yang, Zonglin, et al.
Pubblicazione: (2025)
Adaptive Margin RLHF via Preference over Preferences
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
Refining the Information Bottleneck via Adversarial Information Separation
di: Ning, Shuai, et al.
Pubblicazione: (2026)
di: Ning, Shuai, et al.
Pubblicazione: (2026)
Breaking Memorization Barriers in LLM Code Fine-Tuning via Information Bottleneck for Improved Generalization
di: Wang, Changsheng, et al.
Pubblicazione: (2025)
di: Wang, Changsheng, et al.
Pubblicazione: (2025)
Mjolnir: Breaking the Shield of Perturbation-Protected Gradients via Adaptive Diffusion
di: Liu, Xuan, et al.
Pubblicazione: (2024)
di: Liu, Xuan, et al.
Pubblicazione: (2024)
Graph-KV: Breaking Sequence via Injecting Structural Biases into Large Language Models
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Efficient Federated RLHF via Zeroth-Order Policy Optimization
di: Wang, Deyi, et al.
Pubblicazione: (2026)
di: Wang, Deyi, et al.
Pubblicazione: (2026)
Exploring Dynamic Properties of Backdoor Training Through Information Bottleneck
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
Breaking the Bottlenecks: Scalable Diffusion Models for 3D Molecular Generation
di: Das, Adrita, et al.
Pubblicazione: (2026)
di: Das, Adrita, et al.
Pubblicazione: (2026)
Provably Efficient Online RLHF with One-Pass Reward Modeling
di: Li, Long-Fei, et al.
Pubblicazione: (2025)
di: Li, Long-Fei, et al.
Pubblicazione: (2025)
Policy Optimization in RLHF: The Impact of Out-of-preference Data
di: Li, Ziniu, et al.
Pubblicazione: (2023)
di: Li, Ziniu, et al.
Pubblicazione: (2023)
RLHF Workflow: From Reward Modeling to Online RLHF
di: Dong, Hanze, et al.
Pubblicazione: (2024)
di: Dong, Hanze, et al.
Pubblicazione: (2024)
Breaking the Context Bottleneck on Long Time Series Forecasting
di: Ma, Chao, et al.
Pubblicazione: (2024)
di: Ma, Chao, et al.
Pubblicazione: (2024)
Robust Post-Training for Generative Recommenders: Why Exponential Reward-Weighted SFT Outperforms RLHF
di: Chidambaram, Keertana, et al.
Pubblicazione: (2026)
di: Chidambaram, Keertana, et al.
Pubblicazione: (2026)
Mitigating the Alignment Tax of RLHF
di: Lin, Yong, et al.
Pubblicazione: (2023)
di: Lin, Yong, et al.
Pubblicazione: (2023)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
di: Zhou, Yang, et al.
Pubblicazione: (2025)
di: Zhou, Yang, et al.
Pubblicazione: (2025)
Draft, Verify, and Improve: Toward Training-Aware Speculative Decoding
di: Bhansali, Shrenik, et al.
Pubblicazione: (2025)
di: Bhansali, Shrenik, et al.
Pubblicazione: (2025)
Breaking AR's Sampling Bottleneck: Provable Acceleration via Diffusion Language Models
di: Li, Gen, et al.
Pubblicazione: (2025)
di: Li, Gen, et al.
Pubblicazione: (2025)
MUDDFormer: Breaking Residual Bottlenecks in Transformers via Multiway Dynamic Dense Connections
di: Xiao, Da, et al.
Pubblicazione: (2025)
di: Xiao, Da, et al.
Pubblicazione: (2025)
Factored Causal Representation Learning for Robust Reward Modeling in RLHF
di: Yang, Yupei, et al.
Pubblicazione: (2026)
di: Yang, Yupei, et al.
Pubblicazione: (2026)
Towards a Theoretical Understanding to the Generalization of RLHF
di: Li, Zhaochun, et al.
Pubblicazione: (2026)
di: Li, Zhaochun, et al.
Pubblicazione: (2026)
Optimizing RLHF Training for Large Language Models with Stage Fusion
di: Zhong, Yinmin, et al.
Pubblicazione: (2024)
di: Zhong, Yinmin, et al.
Pubblicazione: (2024)
Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
di: Sheng, Jiayuan, et al.
Pubblicazione: (2025)
di: Sheng, Jiayuan, et al.
Pubblicazione: (2025)
P-EAGLE: Parallel-Drafting EAGLE with Scalable Training
di: Hui, Mude, et al.
Pubblicazione: (2026)
di: Hui, Mude, et al.
Pubblicazione: (2026)
Breaking the Simplification Bottleneck in Amortized Neural Symbolic Regression
di: Saegert, Paul, et al.
Pubblicazione: (2026)
di: Saegert, Paul, et al.
Pubblicazione: (2026)
SharedRep-RLHF: A Shared Representation Approach to RLHF with Diverse Preferences
di: Mukherjee, Arpan, et al.
Pubblicazione: (2025)
di: Mukherjee, Arpan, et al.
Pubblicazione: (2025)
Unifying Stable Optimization and Reference Regularization in RLHF
di: He, Li, et al.
Pubblicazione: (2026)
di: He, Li, et al.
Pubblicazione: (2026)
Learning a Pessimistic Reward Model in RLHF
di: Xu, Yinglun, et al.
Pubblicazione: (2025)
di: Xu, Yinglun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation
di: Cheng, Zelei, et al.
Pubblicazione: (2024) -
SplaXBERT: Leveraging Mixed Precision Training and Context Splitting for Question Answering
di: Yufan, Zhu, et al.
Pubblicazione: (2024) -
Beyond Window-Based Detection: A Graph-Centric Framework for Discrete Log Anomaly Detection
di: Qi, Jiaxing, et al.
Pubblicazione: (2025) -
AuroRA: Breaking Low-Rank Bottleneck of LoRA with Nonlinear Mapping
di: Dong, Haonan, et al.
Pubblicazione: (2025) -
An Adaptive Placement and Parallelism Framework for Accelerating RLHF Training
di: Xiao, Youshao, et al.
Pubblicazione: (2023)