Actor-Critic based Online Data Mixing For Language Model Pre-Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Jing, Dang, Chenhao, Liao, Mingjie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bridging the Gap: Enabling Soft Actor Critic for High Performance Legged Locomotion
par: Sabatini, Gianluca, et autres
Publié: (2026)
par: Sabatini, Gianluca, et autres
Publié: (2026)
SMAC: Score-Matched Actor-Critics for Robust Offline-to-Online Transfer
par: de Lara, Nathan Samuel, et autres
Publié: (2026)
par: de Lara, Nathan Samuel, et autres
Publié: (2026)
Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic
par: Wang, Leo Muxing, et autres
Publié: (2026)
par: Wang, Leo Muxing, et autres
Publié: (2026)
SAC-GLAM: Improving Online RL for LLM agents with Soft Actor-Critic and Hindsight Relabeling
par: Gaven, Loris, et autres
Publié: (2024)
par: Gaven, Loris, et autres
Publié: (2024)
Average-Reward Soft Actor-Critic
par: Adamczyk, Jacob, et autres
Publié: (2025)
par: Adamczyk, Jacob, et autres
Publié: (2025)
Value Improved Actor Critic Algorithms
par: Oren, Yaniv, et autres
Publié: (2024)
par: Oren, Yaniv, et autres
Publié: (2024)
Diffusion Actor-Critic with Entropy Regulator
par: Wang, Yinuo, et autres
Publié: (2024)
par: Wang, Yinuo, et autres
Publié: (2024)
Revisiting Discrete Soft Actor-Critic
par: Zhou, Haibin, et autres
Publié: (2022)
par: Zhou, Haibin, et autres
Publié: (2022)
DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning
par: Ma, Xiaoteng, et autres
Publié: (2020)
par: Ma, Xiaoteng, et autres
Publié: (2020)
Distributional Soft Actor-Critic with Diffusion Policy
par: Liu, Tong, et autres
Publié: (2025)
par: Liu, Tong, et autres
Publié: (2025)
Flow Actor-Critic for Offline Reinforcement Learning
par: Chae, Jongseong, et autres
Publié: (2026)
par: Chae, Jongseong, et autres
Publié: (2026)
FM-EAC: Feature Model-based Enhanced Actor-Critic for Multi-Task Control in Dynamic Environments
par: Zhou, Quanxi, et autres
Publié: (2025)
par: Zhou, Quanxi, et autres
Publié: (2025)
Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic
par: Vo, Thanh Vinh, et autres
Publié: (2025)
par: Vo, Thanh Vinh, et autres
Publié: (2025)
Contrastive Language-Image Pre-Training Model based Semantic Communication Performance Optimization
par: Yang, Shaoran, et autres
Publié: (2025)
par: Yang, Shaoran, et autres
Publié: (2025)
Lightweight Geometric Adaptation for Training Physics-Informed Neural Networks
par: An, Kang, et autres
Publié: (2026)
par: An, Kang, et autres
Publié: (2026)
AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
par: Kang, Feiyang, et autres
Publié: (2024)
par: Kang, Feiyang, et autres
Publié: (2024)
Relational Object-Centric Actor-Critic
par: Ugadiarov, Leonid, et autres
Publié: (2023)
par: Ugadiarov, Leonid, et autres
Publié: (2023)
Offline Actor-Critic Reinforcement Learning Scales to Large Models
par: Springenberg, Jost Tobias, et autres
Publié: (2024)
par: Springenberg, Jost Tobias, et autres
Publié: (2024)
SACn: Soft Actor-Critic with n-step Returns
par: Łyskawa, Jakub, et autres
Publié: (2025)
par: Łyskawa, Jakub, et autres
Publié: (2025)
Actor-Critics Can Achieve Optimal Sample Efficiency
par: Tan, Kevin, et autres
Publié: (2025)
par: Tan, Kevin, et autres
Publié: (2025)
Scalable Neighborhood-Based Multi-Agent Actor-Critic
par: Goppelsroeder, Tim, et autres
Publié: (2026)
par: Goppelsroeder, Tim, et autres
Publié: (2026)
Revisiting Mixture Policies in Entropy-Regularized Actor-Critic
par: He, Jiamin, et autres
Publié: (2026)
par: He, Jiamin, et autres
Publié: (2026)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
par: Nakamoto, Mitsuhiko, et autres
Publié: (2023)
par: Nakamoto, Mitsuhiko, et autres
Publié: (2023)
Functional Critics Are Essential for Actor-Critic: From Off-Policy Stability to Efficient Exploration
par: Bai, Qinxun, et autres
Publié: (2025)
par: Bai, Qinxun, et autres
Publié: (2025)
Dissecting Discrete Soft Actor-Critic: Limitations and Principled Alternatives
par: Asad, Reza, et autres
Publié: (2025)
par: Asad, Reza, et autres
Publié: (2025)
Finite-time Convergence Analysis of Actor-Critic with Evolving Reward
par: Hu, Rui, et autres
Publié: (2025)
par: Hu, Rui, et autres
Publié: (2025)
Studying the Interplay Between the Actor and Critic Representations in Reinforcement Learning
par: Garcin, Samuel, et autres
Publié: (2025)
par: Garcin, Samuel, et autres
Publié: (2025)
Decorrelated Soft Actor-Critic for Efficient Deep Reinforcement Learning
par: Küçükoğlu, Burcu, et autres
Publié: (2025)
par: Küçükoğlu, Burcu, et autres
Publié: (2025)
Broad Critic Deep Actor Reinforcement Learning for Continuous Control
par: Thalagala, Shiron, et autres
Publié: (2024)
par: Thalagala, Shiron, et autres
Publié: (2024)
Ask-AC: An Initiative Advisor-in-the-Loop Actor-Critic Framework
par: Liu, Shunyu, et autres
Publié: (2022)
par: Liu, Shunyu, et autres
Publié: (2022)
Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic
par: Lee, Jeong Woon, et autres
Publié: (2026)
par: Lee, Jeong Woon, et autres
Publié: (2026)
Heavy-Ball Momentum Accelerated Actor-Critic With Function Approximation
par: Dong, Yanjie, et autres
Publié: (2024)
par: Dong, Yanjie, et autres
Publié: (2024)
A Survey on Time-Series Pre-Trained Models
par: Ma, Qianli, et autres
Publié: (2023)
par: Ma, Qianli, et autres
Publié: (2023)
MDGMIX: Boundary-Aware Subgraph Mixing for Multi-Domain Graph Pre-Training
par: Zheng, Ziyu, et autres
Publié: (2026)
par: Zheng, Ziyu, et autres
Publié: (2026)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
par: Nguyen, Dang, et autres
Publié: (2024)
par: Nguyen, Dang, et autres
Publié: (2024)
BiMix: A Bivariate Data Mixing Law for Language Model Pretraining
par: Ge, Ce, et autres
Publié: (2024)
par: Ge, Ce, et autres
Publié: (2024)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
par: Sen, Sayambhu, et autres
Publié: (2025)
par: Sen, Sayambhu, et autres
Publié: (2025)
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation
par: Nakanishi, Kosuke, et autres
Publié: (2025)
par: Nakanishi, Kosuke, et autres
Publié: (2025)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
par: Kohler, Hector, et autres
Publié: (2023)
par: Kohler, Hector, et autres
Publié: (2023)
Maximum Entropy On-Policy Actor-Critic via Entropy Advantage Estimation
par: Choe, Jean Seong Bjorn, et autres
Publié: (2024)
par: Choe, Jean Seong Bjorn, et autres
Publié: (2024)
Documents similaires
-
Bridging the Gap: Enabling Soft Actor Critic for High Performance Legged Locomotion
par: Sabatini, Gianluca, et autres
Publié: (2026) -
SMAC: Score-Matched Actor-Critics for Robust Offline-to-Online Transfer
par: de Lara, Nathan Samuel, et autres
Publié: (2026) -
Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic
par: Wang, Leo Muxing, et autres
Publié: (2026) -
SAC-GLAM: Improving Online RL for LLM agents with Soft Actor-Critic and Hindsight Relabeling
par: Gaven, Loris, et autres
Publié: (2024) -
Average-Reward Soft Actor-Critic
par: Adamczyk, Jacob, et autres
Publié: (2025)