SAIL: Self-Improving Efficient Online Alignment of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ding, Mucong, Chakraborty, Souradip, Agrawal, Vibhu, Che, Zora, Koppel, Alec, Wang, Mengdi, Bedi, Amrit, Huang, Furong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
di: Beetham, James, et al.
Pubblicazione: (2024)
di: Beetham, James, et al.
Pubblicazione: (2024)
PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
Transfer Q Star: Principled Decoding for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
EnsemW2S: Enhancing Weak-to-Strong Generalization with Large Language Model Ensembles
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2026)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2026)
Collab: Controlled Decoding using Mixture of Agents for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2025)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2025)
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2025)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2025)
EnsemW2S: Enhancing Weak-to-Strong Generalization with Large Language Model Ensembles
di: Agrawal, Aakriti, et al.
Pubblicazione: (2024)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2024)
Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time
di: Chehade, Mohamad, et al.
Pubblicazione: (2025)
di: Chehade, Mohamad, et al.
Pubblicazione: (2025)
PROPS: Progressively Private Self-alignment of Large Language Models
di: Teku, Noel, et al.
Pubblicazione: (2025)
di: Teku, Noel, et al.
Pubblicazione: (2025)
GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows
di: Chakraborty, Souradip, et al.
Pubblicazione: (2025)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2025)
Auction-Based Regulation for Artificial Intelligence
di: Bornstein, Marco, et al.
Pubblicazione: (2024)
di: Bornstein, Marco, et al.
Pubblicazione: (2024)
MIRA: Towards Mitigating Reward Hacking in Inference-Time Alignment of T2I Diffusion Models
di: Zhai, Kevin, et al.
Pubblicazione: (2025)
di: Zhai, Kevin, et al.
Pubblicazione: (2025)
Efficient Alignment of Large Language Models via Data Sampling
di: Khera, Amrit, et al.
Pubblicazione: (2024)
di: Khera, Amrit, et al.
Pubblicazione: (2024)
Beyond Text: Utilizing Vocal Cues to Improve Decision Making in LLMs for Robot Navigation Tasks
di: Sun, Xingpeng, et al.
Pubblicazione: (2024)
di: Sun, Xingpeng, et al.
Pubblicazione: (2024)
RL with Learnable Textual Feedback: A Bilevel Approach
di: Singh, Utsav, et al.
Pubblicazione: (2026)
di: Singh, Utsav, et al.
Pubblicazione: (2026)
Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training
di: Barakat, Anas, et al.
Pubblicazione: (2026)
di: Barakat, Anas, et al.
Pubblicazione: (2026)
Is poisoning a real threat to LLM alignment? Maybe more so than you think
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2024)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2024)
BalancedDPO: Adaptive Multi-Metric Alignment
di: Tamboli, Dipesh, et al.
Pubblicazione: (2025)
di: Tamboli, Dipesh, et al.
Pubblicazione: (2025)
Can Watermarking Large Language Models Prevent Copyrighted Text Generation and Hide Training Data?
di: Panaitescu-Liess, Michael-Andrei, et al.
Pubblicazione: (2024)
di: Panaitescu-Liess, Michael-Andrei, et al.
Pubblicazione: (2024)
Post-training Large Language Models for Diverse High-Quality Responses
di: Chen, Yilei, et al.
Pubblicazione: (2025)
di: Chen, Yilei, et al.
Pubblicazione: (2025)
Align-Pro: A Principled Approach to Prompt Optimization for LLM Alignment
di: Trivedi, Prashant, et al.
Pubblicazione: (2025)
di: Trivedi, Prashant, et al.
Pubblicazione: (2025)
VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences
di: Singh, Anukriti, et al.
Pubblicazione: (2025)
di: Singh, Anukriti, et al.
Pubblicazione: (2025)
On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning
di: Barakat, Anas, et al.
Pubblicazione: (2024)
di: Barakat, Anas, et al.
Pubblicazione: (2024)
Agentic Critical Training
di: Liu, Weize, et al.
Pubblicazione: (2026)
di: Liu, Weize, et al.
Pubblicazione: (2026)
SAFLEX: Self-Adaptive Augmentation via Feature Label Extrapolation
di: Ding, Mucong, et al.
Pubblicazione: (2024)
di: Ding, Mucong, et al.
Pubblicazione: (2024)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
di: Ji, Xiang, et al.
Pubblicazione: (2024)
di: Ji, Xiang, et al.
Pubblicazione: (2024)
Beyond Joint Demonstrations: Personalized Expert Guidance for Efficient Multi-Agent Reinforcement Learning
di: Yu, Peihong, et al.
Pubblicazione: (2024)
di: Yu, Peihong, et al.
Pubblicazione: (2024)
Improving and Assessing the Fidelity of Large Language Models Alignment to Online Communities
di: Chu, Minh Duc, et al.
Pubblicazione: (2024)
di: Chu, Minh Duc, et al.
Pubblicazione: (2024)
Easy2Hard-Bench: Standardized Difficulty Labels for Profiling LLM Performance and Generalization
di: Ding, Mucong, et al.
Pubblicazione: (2024)
di: Ding, Mucong, et al.
Pubblicazione: (2024)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Active Preference Optimization for Sample Efficient RLHF
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
FACT or Fiction: Can Truthful Mechanisms Eliminate Federated Free Riding?
di: Bornstein, Marco, et al.
Pubblicazione: (2024)
di: Bornstein, Marco, et al.
Pubblicazione: (2024)
Spectral Greedy Coresets for Graph Neural Networks
di: Ding, Mucong, et al.
Pubblicazione: (2024)
di: Ding, Mucong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024) -
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
di: Beetham, James, et al.
Pubblicazione: (2024) -
PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023) -
Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025) -
Transfer Q Star: Principled Decoding for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)