Actor-Critic based Online Data Mixing For Language Model Pre-Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Jing, Dang, Chenhao, Liao, Mingjie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Bridging the Gap: Enabling Soft Actor Critic for High Performance Legged Locomotion
di: Sabatini, Gianluca, et al.
Pubblicazione: (2026)
di: Sabatini, Gianluca, et al.
Pubblicazione: (2026)
SMAC: Score-Matched Actor-Critics for Robust Offline-to-Online Transfer
di: de Lara, Nathan Samuel, et al.
Pubblicazione: (2026)
di: de Lara, Nathan Samuel, et al.
Pubblicazione: (2026)
Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic
di: Wang, Leo Muxing, et al.
Pubblicazione: (2026)
di: Wang, Leo Muxing, et al.
Pubblicazione: (2026)
SAC-GLAM: Improving Online RL for LLM agents with Soft Actor-Critic and Hindsight Relabeling
di: Gaven, Loris, et al.
Pubblicazione: (2024)
di: Gaven, Loris, et al.
Pubblicazione: (2024)
Average-Reward Soft Actor-Critic
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
Value Improved Actor Critic Algorithms
di: Oren, Yaniv, et al.
Pubblicazione: (2024)
di: Oren, Yaniv, et al.
Pubblicazione: (2024)
Diffusion Actor-Critic with Entropy Regulator
di: Wang, Yinuo, et al.
Pubblicazione: (2024)
di: Wang, Yinuo, et al.
Pubblicazione: (2024)
Revisiting Discrete Soft Actor-Critic
di: Zhou, Haibin, et al.
Pubblicazione: (2022)
di: Zhou, Haibin, et al.
Pubblicazione: (2022)
DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning
di: Ma, Xiaoteng, et al.
Pubblicazione: (2020)
di: Ma, Xiaoteng, et al.
Pubblicazione: (2020)
Distributional Soft Actor-Critic with Diffusion Policy
di: Liu, Tong, et al.
Pubblicazione: (2025)
di: Liu, Tong, et al.
Pubblicazione: (2025)
Flow Actor-Critic for Offline Reinforcement Learning
di: Chae, Jongseong, et al.
Pubblicazione: (2026)
di: Chae, Jongseong, et al.
Pubblicazione: (2026)
FM-EAC: Feature Model-based Enhanced Actor-Critic for Multi-Task Control in Dynamic Environments
di: Zhou, Quanxi, et al.
Pubblicazione: (2025)
di: Zhou, Quanxi, et al.
Pubblicazione: (2025)
Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic
di: Vo, Thanh Vinh, et al.
Pubblicazione: (2025)
di: Vo, Thanh Vinh, et al.
Pubblicazione: (2025)
Contrastive Language-Image Pre-Training Model based Semantic Communication Performance Optimization
di: Yang, Shaoran, et al.
Pubblicazione: (2025)
di: Yang, Shaoran, et al.
Pubblicazione: (2025)
Lightweight Geometric Adaptation for Training Physics-Informed Neural Networks
di: An, Kang, et al.
Pubblicazione: (2026)
di: An, Kang, et al.
Pubblicazione: (2026)
AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
di: Kang, Feiyang, et al.
Pubblicazione: (2024)
di: Kang, Feiyang, et al.
Pubblicazione: (2024)
Relational Object-Centric Actor-Critic
di: Ugadiarov, Leonid, et al.
Pubblicazione: (2023)
di: Ugadiarov, Leonid, et al.
Pubblicazione: (2023)
Offline Actor-Critic Reinforcement Learning Scales to Large Models
di: Springenberg, Jost Tobias, et al.
Pubblicazione: (2024)
di: Springenberg, Jost Tobias, et al.
Pubblicazione: (2024)
SACn: Soft Actor-Critic with n-step Returns
di: Łyskawa, Jakub, et al.
Pubblicazione: (2025)
di: Łyskawa, Jakub, et al.
Pubblicazione: (2025)
Actor-Critics Can Achieve Optimal Sample Efficiency
di: Tan, Kevin, et al.
Pubblicazione: (2025)
di: Tan, Kevin, et al.
Pubblicazione: (2025)
Scalable Neighborhood-Based Multi-Agent Actor-Critic
di: Goppelsroeder, Tim, et al.
Pubblicazione: (2026)
di: Goppelsroeder, Tim, et al.
Pubblicazione: (2026)
Revisiting Mixture Policies in Entropy-Regularized Actor-Critic
di: He, Jiamin, et al.
Pubblicazione: (2026)
di: He, Jiamin, et al.
Pubblicazione: (2026)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2023)
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2023)
Functional Critics Are Essential for Actor-Critic: From Off-Policy Stability to Efficient Exploration
di: Bai, Qinxun, et al.
Pubblicazione: (2025)
di: Bai, Qinxun, et al.
Pubblicazione: (2025)
Dissecting Discrete Soft Actor-Critic: Limitations and Principled Alternatives
di: Asad, Reza, et al.
Pubblicazione: (2025)
di: Asad, Reza, et al.
Pubblicazione: (2025)
Finite-time Convergence Analysis of Actor-Critic with Evolving Reward
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
Studying the Interplay Between the Actor and Critic Representations in Reinforcement Learning
di: Garcin, Samuel, et al.
Pubblicazione: (2025)
di: Garcin, Samuel, et al.
Pubblicazione: (2025)
Decorrelated Soft Actor-Critic for Efficient Deep Reinforcement Learning
di: Küçükoğlu, Burcu, et al.
Pubblicazione: (2025)
di: Küçükoğlu, Burcu, et al.
Pubblicazione: (2025)
Broad Critic Deep Actor Reinforcement Learning for Continuous Control
di: Thalagala, Shiron, et al.
Pubblicazione: (2024)
di: Thalagala, Shiron, et al.
Pubblicazione: (2024)
Ask-AC: An Initiative Advisor-in-the-Loop Actor-Critic Framework
di: Liu, Shunyu, et al.
Pubblicazione: (2022)
di: Liu, Shunyu, et al.
Pubblicazione: (2022)
Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic
di: Lee, Jeong Woon, et al.
Pubblicazione: (2026)
di: Lee, Jeong Woon, et al.
Pubblicazione: (2026)
Heavy-Ball Momentum Accelerated Actor-Critic With Function Approximation
di: Dong, Yanjie, et al.
Pubblicazione: (2024)
di: Dong, Yanjie, et al.
Pubblicazione: (2024)
A Survey on Time-Series Pre-Trained Models
di: Ma, Qianli, et al.
Pubblicazione: (2023)
di: Ma, Qianli, et al.
Pubblicazione: (2023)
MDGMIX: Boundary-Aware Subgraph Mixing for Multi-Domain Graph Pre-Training
di: Zheng, Ziyu, et al.
Pubblicazione: (2026)
di: Zheng, Ziyu, et al.
Pubblicazione: (2026)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
BiMix: A Bivariate Data Mixing Law for Language Model Pretraining
di: Ge, Ce, et al.
Pubblicazione: (2024)
di: Ge, Ce, et al.
Pubblicazione: (2024)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation
di: Nakanishi, Kosuke, et al.
Pubblicazione: (2025)
di: Nakanishi, Kosuke, et al.
Pubblicazione: (2025)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
di: Kohler, Hector, et al.
Pubblicazione: (2023)
di: Kohler, Hector, et al.
Pubblicazione: (2023)
Maximum Entropy On-Policy Actor-Critic via Entropy Advantage Estimation
di: Choe, Jean Seong Bjorn, et al.
Pubblicazione: (2024)
di: Choe, Jean Seong Bjorn, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Bridging the Gap: Enabling Soft Actor Critic for High Performance Legged Locomotion
di: Sabatini, Gianluca, et al.
Pubblicazione: (2026) -
SMAC: Score-Matched Actor-Critics for Robust Offline-to-Online Transfer
di: de Lara, Nathan Samuel, et al.
Pubblicazione: (2026) -
Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic
di: Wang, Leo Muxing, et al.
Pubblicazione: (2026) -
SAC-GLAM: Improving Online RL for LLM agents with Soft Actor-Critic and Hindsight Relabeling
di: Gaven, Loris, et al.
Pubblicazione: (2024) -
Average-Reward Soft Actor-Critic
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)