Safe Reinforcement Learning with Free-form Natural Language Constraints and Pre-Trained Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lou, Xingzhou, Zhang, Junge, Wang, Ziyan, Huang, Kaiqi, Du, Yali |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Safe Multi-agent Reinforcement Learning with Natural Language Constraints
von: Wang, Ziyan, et al.
Veröffentlicht: (2024)
von: Wang, Ziyan, et al.
Veröffentlicht: (2024)
Natural Language Reinforcement Learning
von: Feng, Xidong, et al.
Veröffentlicht: (2024)
von: Feng, Xidong, et al.
Veröffentlicht: (2024)
Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2025)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
von: Liu, Wei, et al.
Veröffentlicht: (2025)
von: Liu, Wei, et al.
Veröffentlicht: (2025)
SPO: Multi-Dimensional Preference Sequential Alignment With Implicit Reward Modeling
von: Lou, Xingzhou, et al.
Veröffentlicht: (2024)
von: Lou, Xingzhou, et al.
Veröffentlicht: (2024)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
von: Park, Jungwoo, et al.
Veröffentlicht: (2025)
von: Park, Jungwoo, et al.
Veröffentlicht: (2025)
All Language Models Large and Small
von: Chen, Zhixun, et al.
Veröffentlicht: (2024)
von: Chen, Zhixun, et al.
Veröffentlicht: (2024)
Learning Dynamics in Continual Pre-Training for Large Language Models
von: Wang, Xingjin, et al.
Veröffentlicht: (2025)
von: Wang, Xingjin, et al.
Veröffentlicht: (2025)
Natural Language Reinforcement Learning
von: Feng, Xidong, et al.
Veröffentlicht: (2024)
von: Feng, Xidong, et al.
Veröffentlicht: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
von: Wang, Yiping, et al.
Veröffentlicht: (2025)
von: Wang, Yiping, et al.
Veröffentlicht: (2025)
First Activations Matter: Training-Free Methods for Dynamic Activation in Large Language Models
von: Ma, Chi, et al.
Veröffentlicht: (2024)
von: Ma, Chi, et al.
Veröffentlicht: (2024)
Reinforcement Learning on Pre-Training Data
von: Li, Siheng, et al.
Veröffentlicht: (2025)
von: Li, Siheng, et al.
Veröffentlicht: (2025)
Building Safe and Deployable Clinical Natural Language Processing under Temporal Leakage Constraints
von: Cho, Ha Na, et al.
Veröffentlicht: (2026)
von: Cho, Ha Na, et al.
Veröffentlicht: (2026)
Hadamard Adapter: An Extreme Parameter-Efficient Adapter Tuning Method for Pre-trained Language Models
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars
von: Higuchi, Rei, et al.
Veröffentlicht: (2025)
von: Higuchi, Rei, et al.
Veröffentlicht: (2025)
Domain-Adaptive Continued Pre-Training of Small Language Models
von: Faroz, Salman
Veröffentlicht: (2025)
von: Faroz, Salman
Veröffentlicht: (2025)
Development of Pre-Trained Transformer-based Models for the Nepali Language
von: Thapa, Prajwal, et al.
Veröffentlicht: (2024)
von: Thapa, Prajwal, et al.
Veröffentlicht: (2024)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
Training-Free Dynamic Upcycling of Expert Language Models
von: Fanì, Eros, et al.
Veröffentlicht: (2026)
von: Fanì, Eros, et al.
Veröffentlicht: (2026)
SeMe: Training-Free Language Model Merging via Semantic Alignment
von: Gu, Jian, et al.
Veröffentlicht: (2025)
von: Gu, Jian, et al.
Veröffentlicht: (2025)
Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models
von: Zhang, Jingyang, et al.
Veröffentlicht: (2024)
von: Zhang, Jingyang, et al.
Veröffentlicht: (2024)
Training-Free Bayesianization for Low-Rank Adapters of Large Language Models
von: Shi, Haizhou, et al.
Veröffentlicht: (2024)
von: Shi, Haizhou, et al.
Veröffentlicht: (2024)
Training Bilingual LMs with Data Constraints in the Targeted Language
von: Seto, Skyler, et al.
Veröffentlicht: (2024)
von: Seto, Skyler, et al.
Veröffentlicht: (2024)
UltraEdit: Training-, Subject-, and Memory-Free Lifelong Editing in Language Models
von: Gu, Xiaojie, et al.
Veröffentlicht: (2025)
von: Gu, Xiaojie, et al.
Veröffentlicht: (2025)
CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment
von: Guo, Siyuan, et al.
Veröffentlicht: (2026)
von: Guo, Siyuan, et al.
Veröffentlicht: (2026)
Self-Training for Sample-Efficient Active Learning for Text Classification with Pre-Trained Language Models
von: Schröder, Christopher, et al.
Veröffentlicht: (2024)
von: Schröder, Christopher, et al.
Veröffentlicht: (2024)
DBR: Divergence-Based Regularization for Debiasing Natural Language Understanding Models
von: Li, Zihao, et al.
Veröffentlicht: (2025)
von: Li, Zihao, et al.
Veröffentlicht: (2025)
PolyPythias: Stability and Outliers across Fifty Language Model Pre-Training Runs
von: van der Wal, Oskar, et al.
Veröffentlicht: (2025)
von: van der Wal, Oskar, et al.
Veröffentlicht: (2025)
Empirical Analysis of Efficient Fine-Tuning Methods for Large Pre-Trained Language Models
von: Doering, Nigel, et al.
Veröffentlicht: (2024)
von: Doering, Nigel, et al.
Veröffentlicht: (2024)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
von: Zheng, Junhao, et al.
Veröffentlicht: (2023)
von: Zheng, Junhao, et al.
Veröffentlicht: (2023)
VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models
von: Jiang, Guochao, et al.
Veröffentlicht: (2025)
von: Jiang, Guochao, et al.
Veröffentlicht: (2025)
Heterogeneous Self-Supervised Acoustic Pre-Training with Local Constraints
von: Cui, Xiaodong, et al.
Veröffentlicht: (2025)
von: Cui, Xiaodong, et al.
Veröffentlicht: (2025)
Rehearsal-Free Modular and Compositional Continual Learning for Language Models
von: Wang, Mingyang, et al.
Veröffentlicht: (2024)
von: Wang, Mingyang, et al.
Veröffentlicht: (2024)
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
von: Zhuang, Yuchen, et al.
Veröffentlicht: (2025)
von: Zhuang, Yuchen, et al.
Veröffentlicht: (2025)
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
von: Deng, Wenlong, et al.
Veröffentlicht: (2026)
von: Deng, Wenlong, et al.
Veröffentlicht: (2026)
Model Merging in Pre-training of Large Language Models
von: Li, Yunshui, et al.
Veröffentlicht: (2025)
von: Li, Yunshui, et al.
Veröffentlicht: (2025)
The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models
von: Gu, Xiaojie, et al.
Veröffentlicht: (2026)
von: Gu, Xiaojie, et al.
Veröffentlicht: (2026)
PEARL: Training Socratic Tutors with Pedagogically Aligned Reinforcement Learning
von: Chang, Qikai, et al.
Veröffentlicht: (2026)
von: Chang, Qikai, et al.
Veröffentlicht: (2026)
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
RuAG: Learned-rule-augmented Generation for Large Language Models
von: Zhang, Yudi, et al.
Veröffentlicht: (2024)
von: Zhang, Yudi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Safe Multi-agent Reinforcement Learning with Natural Language Constraints
von: Wang, Ziyan, et al.
Veröffentlicht: (2024) -
Natural Language Reinforcement Learning
von: Feng, Xidong, et al.
Veröffentlicht: (2024) -
Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2025) -
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
von: Liu, Wei, et al.
Veröffentlicht: (2025) -
SPO: Multi-Dimensional Preference Sequential Alignment With Implicit Reward Modeling
von: Lou, Xingzhou, et al.
Veröffentlicht: (2024)