Safe Reinforcement Learning with Free-form Natural Language Constraints and Pre-Trained Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lou, Xingzhou, Zhang, Junge, Wang, Ziyan, Huang, Kaiqi, Du, Yali |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Safe Multi-agent Reinforcement Learning with Natural Language Constraints
di: Wang, Ziyan, et al.
Pubblicazione: (2024)
di: Wang, Ziyan, et al.
Pubblicazione: (2024)
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024)
di: Feng, Xidong, et al.
Pubblicazione: (2024)
Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
di: Liu, Wei, et al.
Pubblicazione: (2025)
di: Liu, Wei, et al.
Pubblicazione: (2025)
SPO: Multi-Dimensional Preference Sequential Alignment With Implicit Reward Modeling
di: Lou, Xingzhou, et al.
Pubblicazione: (2024)
di: Lou, Xingzhou, et al.
Pubblicazione: (2024)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
di: Park, Jungwoo, et al.
Pubblicazione: (2025)
di: Park, Jungwoo, et al.
Pubblicazione: (2025)
All Language Models Large and Small
di: Chen, Zhixun, et al.
Pubblicazione: (2024)
di: Chen, Zhixun, et al.
Pubblicazione: (2024)
Learning Dynamics in Continual Pre-Training for Large Language Models
di: Wang, Xingjin, et al.
Pubblicazione: (2025)
di: Wang, Xingjin, et al.
Pubblicazione: (2025)
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024)
di: Feng, Xidong, et al.
Pubblicazione: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
di: Wang, Yiping, et al.
Pubblicazione: (2025)
di: Wang, Yiping, et al.
Pubblicazione: (2025)
First Activations Matter: Training-Free Methods for Dynamic Activation in Large Language Models
di: Ma, Chi, et al.
Pubblicazione: (2024)
di: Ma, Chi, et al.
Pubblicazione: (2024)
Reinforcement Learning on Pre-Training Data
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
Building Safe and Deployable Clinical Natural Language Processing under Temporal Leakage Constraints
di: Cho, Ha Na, et al.
Pubblicazione: (2026)
di: Cho, Ha Na, et al.
Pubblicazione: (2026)
Hadamard Adapter: An Extreme Parameter-Efficient Adapter Tuning Method for Pre-trained Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars
di: Higuchi, Rei, et al.
Pubblicazione: (2025)
di: Higuchi, Rei, et al.
Pubblicazione: (2025)
Domain-Adaptive Continued Pre-Training of Small Language Models
di: Faroz, Salman
Pubblicazione: (2025)
di: Faroz, Salman
Pubblicazione: (2025)
Development of Pre-Trained Transformer-based Models for the Nepali Language
di: Thapa, Prajwal, et al.
Pubblicazione: (2024)
di: Thapa, Prajwal, et al.
Pubblicazione: (2024)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
Training-Free Dynamic Upcycling of Expert Language Models
di: Fanì, Eros, et al.
Pubblicazione: (2026)
di: Fanì, Eros, et al.
Pubblicazione: (2026)
SeMe: Training-Free Language Model Merging via Semantic Alignment
di: Gu, Jian, et al.
Pubblicazione: (2025)
di: Gu, Jian, et al.
Pubblicazione: (2025)
Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models
di: Zhang, Jingyang, et al.
Pubblicazione: (2024)
di: Zhang, Jingyang, et al.
Pubblicazione: (2024)
Training-Free Bayesianization for Low-Rank Adapters of Large Language Models
di: Shi, Haizhou, et al.
Pubblicazione: (2024)
di: Shi, Haizhou, et al.
Pubblicazione: (2024)
Training Bilingual LMs with Data Constraints in the Targeted Language
di: Seto, Skyler, et al.
Pubblicazione: (2024)
di: Seto, Skyler, et al.
Pubblicazione: (2024)
UltraEdit: Training-, Subject-, and Memory-Free Lifelong Editing in Language Models
di: Gu, Xiaojie, et al.
Pubblicazione: (2025)
di: Gu, Xiaojie, et al.
Pubblicazione: (2025)
CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment
di: Guo, Siyuan, et al.
Pubblicazione: (2026)
di: Guo, Siyuan, et al.
Pubblicazione: (2026)
Self-Training for Sample-Efficient Active Learning for Text Classification with Pre-Trained Language Models
di: Schröder, Christopher, et al.
Pubblicazione: (2024)
di: Schröder, Christopher, et al.
Pubblicazione: (2024)
DBR: Divergence-Based Regularization for Debiasing Natural Language Understanding Models
di: Li, Zihao, et al.
Pubblicazione: (2025)
di: Li, Zihao, et al.
Pubblicazione: (2025)
PolyPythias: Stability and Outliers across Fifty Language Model Pre-Training Runs
di: van der Wal, Oskar, et al.
Pubblicazione: (2025)
di: van der Wal, Oskar, et al.
Pubblicazione: (2025)
Empirical Analysis of Efficient Fine-Tuning Methods for Large Pre-Trained Language Models
di: Doering, Nigel, et al.
Pubblicazione: (2024)
di: Doering, Nigel, et al.
Pubblicazione: (2024)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
di: Zheng, Junhao, et al.
Pubblicazione: (2023)
di: Zheng, Junhao, et al.
Pubblicazione: (2023)
VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models
di: Jiang, Guochao, et al.
Pubblicazione: (2025)
di: Jiang, Guochao, et al.
Pubblicazione: (2025)
Heterogeneous Self-Supervised Acoustic Pre-Training with Local Constraints
di: Cui, Xiaodong, et al.
Pubblicazione: (2025)
di: Cui, Xiaodong, et al.
Pubblicazione: (2025)
Rehearsal-Free Modular and Compositional Continual Learning for Language Models
di: Wang, Mingyang, et al.
Pubblicazione: (2024)
di: Wang, Mingyang, et al.
Pubblicazione: (2024)
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
di: Zhuang, Yuchen, et al.
Pubblicazione: (2025)
di: Zhuang, Yuchen, et al.
Pubblicazione: (2025)
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
di: Deng, Wenlong, et al.
Pubblicazione: (2026)
di: Deng, Wenlong, et al.
Pubblicazione: (2026)
Model Merging in Pre-training of Large Language Models
di: Li, Yunshui, et al.
Pubblicazione: (2025)
di: Li, Yunshui, et al.
Pubblicazione: (2025)
The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models
di: Gu, Xiaojie, et al.
Pubblicazione: (2026)
di: Gu, Xiaojie, et al.
Pubblicazione: (2026)
PEARL: Training Socratic Tutors with Pedagogically Aligned Reinforcement Learning
di: Chang, Qikai, et al.
Pubblicazione: (2026)
di: Chang, Qikai, et al.
Pubblicazione: (2026)
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
RuAG: Learned-rule-augmented Generation for Large Language Models
di: Zhang, Yudi, et al.
Pubblicazione: (2024)
di: Zhang, Yudi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Safe Multi-agent Reinforcement Learning with Natural Language Constraints
di: Wang, Ziyan, et al.
Pubblicazione: (2024) -
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024) -
Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025) -
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
di: Liu, Wei, et al.
Pubblicazione: (2025) -
SPO: Multi-Dimensional Preference Sequential Alignment With Implicit Reward Modeling
di: Lou, Xingzhou, et al.
Pubblicazione: (2024)