Salvato in:
| Autori principali: | Jiang, Yuxuan, Zhou, Ziming, Xu, Boyu, Liu, Beijie, Xu, Runhui, Huang, Peng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2506.14813 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning
di: Xu, Yuanda, et al.
Pubblicazione: (2026)
di: Xu, Yuanda, et al.
Pubblicazione: (2026)
A Triple-Inertial Accelerated Alternating Optimization Method for Deep Learning Training
di: Yan, Chengcheng, et al.
Pubblicazione: (2025)
di: Yan, Chengcheng, et al.
Pubblicazione: (2025)
Training Proactive and Personalized LLM Agents
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning
di: Luo, Haohao, et al.
Pubblicazione: (2026)
di: Luo, Haohao, et al.
Pubblicazione: (2026)
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
di: Lou, Yuxuan, et al.
Pubblicazione: (2026)
di: Lou, Yuxuan, et al.
Pubblicazione: (2026)
Learning from Complexity: Exploring Dynamic Sample Pruning of Spatio-Temporal Training
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
Silent Neuron Theory and Plasticity Preservation for Deep Reinforcement Learning in Adaptive Video Streaming
di: He, Zhiqiang, et al.
Pubblicazione: (2025)
di: He, Zhiqiang, et al.
Pubblicazione: (2025)
Approximated Likelihood Ratio: A Forward-Only and Parallel Framework for Boosting Neural Network Training
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training
di: Gong, Xue, et al.
Pubblicazione: (2026)
di: Gong, Xue, et al.
Pubblicazione: (2026)
Efficient Deep Learning Board: Training Feedback Is Not All You Need
di: Gong, Lina, et al.
Pubblicazione: (2024)
di: Gong, Lina, et al.
Pubblicazione: (2024)
Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple Actions
di: Gan, Guo, et al.
Pubblicazione: (2026)
di: Gan, Guo, et al.
Pubblicazione: (2026)
Reinforcement Learning on Pre-Training Data
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
Neural Thermodynamic Laws for Large Language Model Training
di: Liu, Ziming, et al.
Pubblicazione: (2025)
di: Liu, Ziming, et al.
Pubblicazione: (2025)
CAdam: Confidence-Based Optimization for Online Learning
di: Wang, Shaowen, et al.
Pubblicazione: (2024)
di: Wang, Shaowen, et al.
Pubblicazione: (2024)
Proactive Gradient Conflict Mitigation in Multi-Task Learning: A Sparse Training Perspective
di: Zhang, Zhi, et al.
Pubblicazione: (2024)
di: Zhang, Zhi, et al.
Pubblicazione: (2024)
Low-redundancy Distillation for Continual Learning
di: Liu, RuiQi, et al.
Pubblicazione: (2023)
di: Liu, RuiQi, et al.
Pubblicazione: (2023)
Tools Fail: Detecting Silent Errors in Faulty Tools
di: Sun, Jimin, et al.
Pubblicazione: (2024)
di: Sun, Jimin, et al.
Pubblicazione: (2024)
Z-Error Loss for Training Neural Networks
di: Godin, Guillaume
Pubblicazione: (2025)
di: Godin, Guillaume
Pubblicazione: (2025)
A Sensitivity-Driven Expert Allocation Method in LoRA-MoE for Efficient Fine-Tuning
di: Xu, Junzhou, et al.
Pubblicazione: (2025)
di: Xu, Junzhou, et al.
Pubblicazione: (2025)
Native Fortran Implementation of TensorFlow-Trained Deep and Bayesian Neural Networks
di: Furlong, Aidan, et al.
Pubblicazione: (2025)
di: Furlong, Aidan, et al.
Pubblicazione: (2025)
Towards Faster Training of Diffusion Models: An Inspiration of A Consistency Phenomenon
di: Xu, Tianshuo, et al.
Pubblicazione: (2024)
di: Xu, Tianshuo, et al.
Pubblicazione: (2024)
Beyond Squared Error: Exploring Loss Design for Enhanced Training of Generative Flow Networks
di: Hu, Rui, et al.
Pubblicazione: (2024)
di: Hu, Rui, et al.
Pubblicazione: (2024)
On the Interplay Between Sparsity and Training in Deep Reinforcement Learning
di: Davelouis, Fatima, et al.
Pubblicazione: (2025)
di: Davelouis, Fatima, et al.
Pubblicazione: (2025)
Efficient Multi-Task Modeling through Automated Fusion of Trained Models
di: Zhou, Jingxuan, et al.
Pubblicazione: (2025)
di: Zhou, Jingxuan, et al.
Pubblicazione: (2025)
To Train or Not to Train: Balancing Efficiency and Training Cost in Deep Reinforcement Learning for Mobile Edge Computing
di: Boscaro, Maddalena, et al.
Pubblicazione: (2024)
di: Boscaro, Maddalena, et al.
Pubblicazione: (2024)
CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models
di: Zhu, Xiao, et al.
Pubblicazione: (2026)
di: Zhu, Xiao, et al.
Pubblicazione: (2026)
Preparing Lessons for Progressive Training on Language Models
di: Pan, Yu, et al.
Pubblicazione: (2024)
di: Pan, Yu, et al.
Pubblicazione: (2024)
Symmetry-Aware Transformer Training for Automated Planning
di: Fritzsche, Markus, et al.
Pubblicazione: (2025)
di: Fritzsche, Markus, et al.
Pubblicazione: (2025)
ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
TimeMaster: Training Time-Series Multimodal LLMs to Reason via Reinforcement Learning
di: Zhang, Junru, et al.
Pubblicazione: (2025)
di: Zhang, Junru, et al.
Pubblicazione: (2025)
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
di: Hou, Hongru, et al.
Pubblicazione: (2026)
di: Hou, Hongru, et al.
Pubblicazione: (2026)
Open-World Test-Time Training: Self-Training with Contrast Learning
di: Su, Houcheng, et al.
Pubblicazione: (2024)
di: Su, Houcheng, et al.
Pubblicazione: (2024)
POINT$^{2}$: A Polymer Informatics Training and Testing Database
di: Xu, Jiaxin, et al.
Pubblicazione: (2025)
di: Xu, Jiaxin, et al.
Pubblicazione: (2025)
The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low Regret
di: Fluri, Lukas, et al.
Pubblicazione: (2024)
di: Fluri, Lukas, et al.
Pubblicazione: (2024)
Enhancing Deep Learning with Optimized Gradient Descent: Bridging Numerical Methods and Neural Network Training
di: Ma, Yuhan, et al.
Pubblicazione: (2024)
di: Ma, Yuhan, et al.
Pubblicazione: (2024)
Outlier Gradient Analysis: Efficiently Identifying Detrimental Training Samples for Deep Learning Models
di: Chhabra, Anshuman, et al.
Pubblicazione: (2024)
di: Chhabra, Anshuman, et al.
Pubblicazione: (2024)
Online Training and Pruning of Deep Reinforcement Learning Networks
di: Guenter, Valentin Frank Ingmar, et al.
Pubblicazione: (2025)
di: Guenter, Valentin Frank Ingmar, et al.
Pubblicazione: (2025)
Exploring Dynamic Properties of Backdoor Training Through Information Bottleneck
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
Sparse Training for Federated Learning with Regularized Error Correction
di: Greidi, Ran, et al.
Pubblicazione: (2023)
di: Greidi, Ran, et al.
Pubblicazione: (2023)
Training Large Language Models to Reason via EM Policy Gradient
di: Xu, Tianbing
Pubblicazione: (2025)
di: Xu, Tianbing
Pubblicazione: (2025)
Documenti analoghi
-
Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning
di: Xu, Yuanda, et al.
Pubblicazione: (2026) -
A Triple-Inertial Accelerated Alternating Optimization Method for Deep Learning Training
di: Yan, Chengcheng, et al.
Pubblicazione: (2025) -
Training Proactive and Personalized LLM Agents
di: Sun, Weiwei, et al.
Pubblicazione: (2025) -
IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning
di: Luo, Haohao, et al.
Pubblicazione: (2026) -
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
di: Lou, Yuxuan, et al.
Pubblicazione: (2026)