Collab: Controlled Decoding using Mixture of Agents for LLM Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Chakraborty, Souradip, Bhatt, Sujay, Sehwag, Udari Madhushani, Ghosal, Soumya Suvra, Qiu, Jiahao, Wang, Mengdi, Manocha, Dinesh, Huang, Furong, Koppel, Alec, Ganesh, Sumitra |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Transfer Q Star: Principled Decoding for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning
di: Zeng, Sihan, et al.
Pubblicazione: (2026)
di: Zeng, Sihan, et al.
Pubblicazione: (2026)
In-Context Learning with Topological Information for Knowledge Graph Completion
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2024)
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2024)
PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
Learning in Herding Mean Field Games: Single-Loop Algorithm with Finite-Time Convergence Analysis
di: Zeng, Sihan, et al.
Pubblicazione: (2024)
di: Zeng, Sihan, et al.
Pubblicazione: (2024)
Regularized Proportional Fairness Mechanism for Resource Allocation Without Money
di: Zeng, Sihan, et al.
Pubblicazione: (2025)
di: Zeng, Sihan, et al.
Pubblicazione: (2025)
Partially Observable Contextual Bandits with Linear Payoffs
di: Zeng, Sihan, et al.
Pubblicazione: (2024)
di: Zeng, Sihan, et al.
Pubblicazione: (2024)
Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2026)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2026)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
AdvBDGen: Adversarially Fortified Prompt-Specific Fuzzy Backdoor Generator Against LLM Alignment
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2024)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2024)
Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time
di: Chehade, Mohamad, et al.
Pubblicazione: (2025)
di: Chehade, Mohamad, et al.
Pubblicazione: (2025)
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2025)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2025)
Learning Payment-Free Resource Allocation Mechanisms
di: Zeng, Sihan, et al.
Pubblicazione: (2023)
di: Zeng, Sihan, et al.
Pubblicazione: (2023)
IntCoOp: Interpretability-Aware Vision-Language Prompt Tuning
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
PromptRefine: Enhancing Few-Shot Performance on Low-Resource Indic Languages with Example Selection from Related Example Banks
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
Learning in Stackelberg Mean Field Games: A Non-Asymptotic Analysis
di: Zeng, Sihan, et al.
Pubblicazione: (2025)
di: Zeng, Sihan, et al.
Pubblicazione: (2025)
Continual Learning of Domain Knowledge from Human Feedback in Text-to-SQL
di: Cook, Thomas, et al.
Pubblicazione: (2025)
di: Cook, Thomas, et al.
Pubblicazione: (2025)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
di: Ding, Mucong, et al.
Pubblicazione: (2024)
di: Ding, Mucong, et al.
Pubblicazione: (2024)
Rethinking Neural Network Learning Rates: A Stackelberg Perspective
di: Zeng, Sihan, et al.
Pubblicazione: (2026)
di: Zeng, Sihan, et al.
Pubblicazione: (2026)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
Engagement Undermines Safety: How Stereotypes and Toxicity Shape Humor in Language Models
di: Dogra, Atharvan, et al.
Pubblicazione: (2025)
di: Dogra, Atharvan, et al.
Pubblicazione: (2025)
PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2025)
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2025)
Decentralized Convergence to Equilibrium Prices in Trading Networks
di: Lock, Edwin, et al.
Pubblicazione: (2024)
di: Lock, Edwin, et al.
Pubblicazione: (2024)
Approximate Equivariance in Reinforcement Learning
di: Park, Jung Yeon, et al.
Pubblicazione: (2024)
di: Park, Jung Yeon, et al.
Pubblicazione: (2024)
AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration
di: Karthikeyan, Harish, et al.
Pubblicazione: (2025)
di: Karthikeyan, Harish, et al.
Pubblicazione: (2025)
ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2026)
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2026)
O3D: Offline Data-driven Discovery and Distillation for Sequential Decision-Making with Large Language Models
di: Xiao, Yuchen, et al.
Pubblicazione: (2023)
di: Xiao, Yuchen, et al.
Pubblicazione: (2023)
Can LLMs be Scammed? A Baseline Measurement Study
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2024)
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2024)
No One Size Fits All: QueryBandits for Hallucination Mitigation
di: Cho, Nicole, et al.
Pubblicazione: (2026)
di: Cho, Nicole, et al.
Pubblicazione: (2026)
QueryBandits for Hallucination Mitigation: Exploiting Semantic Features for No-Regret Rewriting
di: Cho, Nicole, et al.
Pubblicazione: (2025)
di: Cho, Nicole, et al.
Pubblicazione: (2025)
Efficient Inverse Multiagent Learning
di: Goktas, Denizalp, et al.
Pubblicazione: (2025)
di: Goktas, Denizalp, et al.
Pubblicazione: (2025)
Relic: Enhancing Reward Model Generalization for Low-Resource Indic Languages with Few-Shot Examples
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2025)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2025)
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
di: Beetham, James, et al.
Pubblicazione: (2024)
di: Beetham, James, et al.
Pubblicazione: (2024)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
di: Campbell, David, et al.
Pubblicazione: (2026)
di: Campbell, David, et al.
Pubblicazione: (2026)
A Heterogeneous Agent Model of Mortgage Servicing: An Income-based Relief Analysis
di: Garg, Deepeka, et al.
Pubblicazione: (2024)
di: Garg, Deepeka, et al.
Pubblicazione: (2024)
Enhancing Deep Neural Network Reliability with Refinement and Calibration
di: Hebbalaguppe, Ramya, et al.
Pubblicazione: (2026)
di: Hebbalaguppe, Ramya, et al.
Pubblicazione: (2026)
Is poisoning a real threat to LLM alignment? Maybe more so than you think
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2024)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2024)
LBAP: Improved Uncertainty Alignment of LLM Planners using Bayesian Inference
di: Mullen Jr., James F., et al.
Pubblicazione: (2024)
di: Mullen Jr., James F., et al.
Pubblicazione: (2024)
Documenti analoghi
-
Transfer Q Star: Principled Decoding for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024) -
GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment
di: Xu, Yuancheng, et al.
Pubblicazione: (2024) -
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024) -
A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning
di: Zeng, Sihan, et al.
Pubblicazione: (2026) -
In-Context Learning with Topological Information for Knowledge Graph Completion
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2024)