Reinforcement Learning with Backtracking Feedback
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sel, Bilgehan, Keshava, Vaishakh, Wallis, Phillip, Rutishauser, Lukas, Jin, Ming, Li, Dingcheng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Backtracking for Safety
von: Sel, Bilgehan, et al.
Veröffentlicht: (2025)
von: Sel, Bilgehan, et al.
Veröffentlicht: (2025)
Adversarial Reinforcement Learning for Large Language Model Agent Safety
von: Wang, Zizhao, et al.
Veröffentlicht: (2025)
von: Wang, Zizhao, et al.
Veröffentlicht: (2025)
Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks
von: Liu, Haoyu, et al.
Veröffentlicht: (2026)
von: Liu, Haoyu, et al.
Veröffentlicht: (2026)
Skin-in-the-Game: Decision Making via Multi-Stakeholder Alignment in LLMs
von: Sel, Bilgehan, et al.
Veröffentlicht: (2024)
von: Sel, Bilgehan, et al.
Veröffentlicht: (2024)
LLMs Can Plan Only If We Tell Them
von: Sel, Bilgehan, et al.
Veröffentlicht: (2025)
von: Sel, Bilgehan, et al.
Veröffentlicht: (2025)
Safe and Balanced: A Framework for Constrained Multi-Objective Reinforcement Learning
von: Gu, Shangding, et al.
Veröffentlicht: (2024)
von: Gu, Shangding, et al.
Veröffentlicht: (2024)
Balance Reward and Safety Optimization for Safe Reinforcement Learning: A Perspective of Gradient Manipulation
von: Gu, Shangding, et al.
Veröffentlicht: (2024)
von: Gu, Shangding, et al.
Veröffentlicht: (2024)
Backtracking Improves Generation Safety
von: Zhang, Yiming, et al.
Veröffentlicht: (2024)
von: Zhang, Yiming, et al.
Veröffentlicht: (2024)
Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language Models
von: Sel, Bilgehan, et al.
Veröffentlicht: (2023)
von: Sel, Bilgehan, et al.
Veröffentlicht: (2023)
LSEBMCL: A Latent Space Energy-Based Model for Continual Learning
von: Li, Xiaodi, et al.
Veröffentlicht: (2025)
von: Li, Xiaodi, et al.
Veröffentlicht: (2025)
Parameter Efficient Reinforcement Learning from Human Feedback
von: Sidahmed, Hakim, et al.
Veröffentlicht: (2024)
von: Sidahmed, Hakim, et al.
Veröffentlicht: (2024)
Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning
von: Sel, Bilgehan, et al.
Veröffentlicht: (2026)
von: Sel, Bilgehan, et al.
Veröffentlicht: (2026)
PPSEBM: An Energy-Based Model with Progressive Parameter Selection for Continual Learning
von: Li, Xiaodi, et al.
Veröffentlicht: (2025)
von: Li, Xiaodi, et al.
Veröffentlicht: (2025)
Distributionally Robust Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2025)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2025)
RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
von: Lee, Harrison, et al.
Veröffentlicht: (2023)
von: Lee, Harrison, et al.
Veröffentlicht: (2023)
Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model
von: Dong, Yihong, et al.
Veröffentlicht: (2025)
von: Dong, Yihong, et al.
Veröffentlicht: (2025)
RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMs
von: Wu, Jiaxing, et al.
Veröffentlicht: (2024)
von: Wu, Jiaxing, et al.
Veröffentlicht: (2024)
Dr Genre: Reinforcement Learning from Decoupled LLM Feedback for Generic Text Rewriting
von: Li, Yufei, et al.
Veröffentlicht: (2025)
von: Li, Yufei, et al.
Veröffentlicht: (2025)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
von: Ackermann, Johannes, et al.
Veröffentlicht: (2025)
von: Ackermann, Johannes, et al.
Veröffentlicht: (2025)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
von: Zhang, Shun, et al.
Veröffentlicht: (2024)
von: Zhang, Shun, et al.
Veröffentlicht: (2024)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
Towards Efficient Online Exploration for Reinforcement Learning with Human Feedback
von: Li, Gen, et al.
Veröffentlicht: (2025)
von: Li, Gen, et al.
Veröffentlicht: (2025)
RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2024)
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases
von: Hahm, Dongyoon, et al.
Veröffentlicht: (2026)
von: Hahm, Dongyoon, et al.
Veröffentlicht: (2026)
Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints
von: Chittepu, Yaswanth, et al.
Veröffentlicht: (2025)
von: Chittepu, Yaswanth, et al.
Veröffentlicht: (2025)
Learning to Reason from Feedback at Test-Time
von: Li, Yanyang, et al.
Veröffentlicht: (2025)
von: Li, Yanyang, et al.
Veröffentlicht: (2025)
Beyond Introspection: Reinforcing Thinking via Externalist Behavioral Feedback
von: Yang, Diji, et al.
Veröffentlicht: (2024)
von: Yang, Diji, et al.
Veröffentlicht: (2024)
Reinforcement Learning from Human Feedback with Active Queries
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
von: Zhang, Wenbo, et al.
Veröffentlicht: (2024)
von: Zhang, Wenbo, et al.
Veröffentlicht: (2024)
Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
von: Wu, Mingqi, et al.
Veröffentlicht: (2025)
von: Wu, Mingqi, et al.
Veröffentlicht: (2025)
ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
Learning Personalized Agents from Human Feedback
von: Liang, Kaiqu, et al.
Veröffentlicht: (2026)
von: Liang, Kaiqu, et al.
Veröffentlicht: (2026)
Provable Interactive Learning with Hindsight Instruction Feedback
von: Misra, Dipendra, et al.
Veröffentlicht: (2024)
von: Misra, Dipendra, et al.
Veröffentlicht: (2024)
DISCO Balances the Scales: Adaptive Domain- and Difficulty-Aware Reinforcement Learning on Imbalanced Data
von: Zhou, Yuhang, et al.
Veröffentlicht: (2025)
von: Zhou, Yuhang, et al.
Veröffentlicht: (2025)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
Joint Learning of Context and Feedback Embeddings in Spoken Dialogue
von: Qian, Livia, et al.
Veröffentlicht: (2024)
von: Qian, Livia, et al.
Veröffentlicht: (2024)
RLVF: Learning from Verbal Feedback without Overgeneralization
von: Stephan, Moritz, et al.
Veröffentlicht: (2024)
von: Stephan, Moritz, et al.
Veröffentlicht: (2024)
Reinforcement Learning on Pre-Training Data
von: Li, Siheng, et al.
Veröffentlicht: (2025)
von: Li, Siheng, et al.
Veröffentlicht: (2025)
HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning
von: Lu, Zhicong, et al.
Veröffentlicht: (2026)
von: Lu, Zhicong, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Backtracking for Safety
von: Sel, Bilgehan, et al.
Veröffentlicht: (2025) -
Adversarial Reinforcement Learning for Large Language Model Agent Safety
von: Wang, Zizhao, et al.
Veröffentlicht: (2025) -
Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks
von: Liu, Haoyu, et al.
Veröffentlicht: (2026) -
Skin-in-the-Game: Decision Making via Multi-Stakeholder Alignment in LLMs
von: Sel, Bilgehan, et al.
Veröffentlicht: (2024) -
LLMs Can Plan Only If We Tell Them
von: Sel, Bilgehan, et al.
Veröffentlicht: (2025)