FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Nourzad, Fatemeh, Roknilamouki, Amirhossein, Ekici, Eylem, Liu, Jia, Shroff, Ness |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2025)
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2025)
Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2026)
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2026)
Online Learning for Optimizing AoI-Energy Tradeoff under Unknown Channel Statistics
di: Abd-Elmagid, Mohamed A., et al.
Pubblicazione: (2025)
di: Abd-Elmagid, Mohamed A., et al.
Pubblicazione: (2025)
Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual
di: Li, Yining, et al.
Pubblicazione: (2026)
di: Li, Yining, et al.
Pubblicazione: (2026)
Can We Theoretically Quantify the Impacts of Local Updates on the Generalization Performance of Federated Learning?
di: Ju, Peizhong, et al.
Pubblicazione: (2024)
di: Ju, Peizhong, et al.
Pubblicazione: (2024)
GPT-4o as the Gold Standard: A Scalable and General Purpose Approach to Filter Language Model Pretraining Data
di: Zhang, Jifan, et al.
Pubblicazione: (2024)
di: Zhang, Jifan, et al.
Pubblicazione: (2024)
From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models
di: Liang, Yuchen, et al.
Pubblicazione: (2026)
di: Liang, Yuchen, et al.
Pubblicazione: (2026)
How to Find the Exact Pareto Front for Multi-Objective MDPs?
di: Li, Yining, et al.
Pubblicazione: (2024)
di: Li, Yining, et al.
Pubblicazione: (2024)
Provably Efficient Multi-Objective Bandit Algorithms under Preference-Centric Customization
di: Cao, Linfeng, et al.
Pubblicazione: (2025)
di: Cao, Linfeng, et al.
Pubblicazione: (2025)
Sharp Convergence Rates for Masked Diffusion Models
di: Liang, Yuchen, et al.
Pubblicazione: (2026)
di: Liang, Yuchen, et al.
Pubblicazione: (2026)
Theory on Score-Mismatched Diffusion Models and Zero-Shot Conditional Samplers
di: Liang, Yuchen, et al.
Pubblicazione: (2024)
di: Liang, Yuchen, et al.
Pubblicazione: (2024)
Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences
di: Shi, Ming, et al.
Pubblicazione: (2026)
di: Shi, Ming, et al.
Pubblicazione: (2026)
Learnable Chernoff Baselines for Inference-Time Alignment
di: Madhow, Sunil, et al.
Pubblicazione: (2026)
di: Madhow, Sunil, et al.
Pubblicazione: (2026)
Prediction-Assisted Online Distributed Deep Learning Workload Scheduling in GPU Clusters
di: Luo, Ziyue, et al.
Pubblicazione: (2025)
di: Luo, Ziyue, et al.
Pubblicazione: (2025)
Discrete Diffusion Models: Novel Analysis and New Sampler Guarantees
di: Liang, Yuchen, et al.
Pubblicazione: (2025)
di: Liang, Yuchen, et al.
Pubblicazione: (2025)
Broadening Target Distributions for Accelerated Diffusion Models via a Novel Analysis Approach
di: Liang, Yuchen, et al.
Pubblicazione: (2024)
di: Liang, Yuchen, et al.
Pubblicazione: (2024)
An LP-based Sampling Policy for Multi-Armed Bandits with Side-Observations and Stochastic Availability
di: Soni, Ashutosh, et al.
Pubblicazione: (2026)
di: Soni, Ashutosh, et al.
Pubblicazione: (2026)
Monitoring State Transitions in Markovian Systems with Sampling Cost
di: Saurav, Kumar, et al.
Pubblicazione: (2025)
di: Saurav, Kumar, et al.
Pubblicazione: (2025)
Near-Optimal Partially Observable Reinforcement Learning with Partial Online State Information
di: Shi, Ming, et al.
Pubblicazione: (2023)
di: Shi, Ming, et al.
Pubblicazione: (2023)
BeST -- A Novel Source Selection Metric for Transfer Learning
di: Soni, Ashutosh, et al.
Pubblicazione: (2025)
di: Soni, Ashutosh, et al.
Pubblicazione: (2025)
Absorb and Converge: Provable Convergence Guarantee for Absorbing Discrete Diffusion Models
di: Liang, Yuchen, et al.
Pubblicazione: (2025)
di: Liang, Yuchen, et al.
Pubblicazione: (2025)
Mixture-of-Transformers Learn Faster: A Theoretical Study on Classification Problems
di: Li, Hongbo, et al.
Pubblicazione: (2025)
di: Li, Hongbo, et al.
Pubblicazione: (2025)
RSPO: Regularized Self-Play Alignment of Large Language Models
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
MIRA: Memory-Integrated Reinforcement Learning Agent with Limited LLM Guidance
di: Nourzad, Narjes, et al.
Pubblicazione: (2026)
di: Nourzad, Narjes, et al.
Pubblicazione: (2026)
Memory-Based Advantage Shaping for LLM-Guided Reinforcement Learning
di: Nourzad, Narjes, et al.
Pubblicazione: (2026)
di: Nourzad, Narjes, et al.
Pubblicazione: (2026)
Smart Routing with Precise Link Estimation: DSEE-Based Anypath Routing for Reliable Wireless Networking
di: Nourzad, Narjes, et al.
Pubblicazione: (2024)
di: Nourzad, Narjes, et al.
Pubblicazione: (2024)
Unlocking the Power of Rehearsal in Continual Learning: A Theoretical Perspective
di: Deng, Junze, et al.
Pubblicazione: (2025)
di: Deng, Junze, et al.
Pubblicazione: (2025)
Constraint-Rectified Training for Efficient Chain-of-Thought
di: Wu, Qinhang, et al.
Pubblicazione: (2026)
di: Wu, Qinhang, et al.
Pubblicazione: (2026)
Theory on Mixture-of-Experts in Continual Learning
di: Li, Hongbo, et al.
Pubblicazione: (2024)
di: Li, Hongbo, et al.
Pubblicazione: (2024)
Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment
di: Na, Byeonghu, et al.
Pubblicazione: (2026)
di: Na, Byeonghu, et al.
Pubblicazione: (2026)
Regularized Conditional Diffusion Model for Multi-Task Preference Alignment
di: Yu, Xudong, et al.
Pubblicazione: (2024)
di: Yu, Xudong, et al.
Pubblicazione: (2024)
DR. WELL: Dynamic Reasoning and Learning with Symbolic World Model for Embodied LLM-Based Multi-Agent Collaboration
di: Nourzad, Narjes, et al.
Pubblicazione: (2025)
di: Nourzad, Narjes, et al.
Pubblicazione: (2025)
RhythmBERT: A Self-Supervised Language Model Based on Latent Representations of ECG Waveforms for Heart Disease Detection
di: Wang, Xin, et al.
Pubblicazione: (2026)
di: Wang, Xin, et al.
Pubblicazione: (2026)
Multi-Objective Alignment of Large Language Models Through Hypervolume Maximization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
Beyond Activation Alignment: The Geometry of Neural Sensitivity
di: Yavari, Amirhossein, et al.
Pubblicazione: (2026)
di: Yavari, Amirhossein, et al.
Pubblicazione: (2026)
Walk the Talk? Measuring the Faithfulness of Large Language Model Explanations
di: Matton, Katie, et al.
Pubblicazione: (2025)
di: Matton, Katie, et al.
Pubblicazione: (2025)
FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment
di: Zhu, Kewen, et al.
Pubblicazione: (2026)
di: Zhu, Kewen, et al.
Pubblicazione: (2026)
Beyond Freshness and Semantics: A Coupon-Collector Framework for Effective Status Updates
di: Ahmed, Youssef, et al.
Pubblicazione: (2026)
di: Ahmed, Youssef, et al.
Pubblicazione: (2026)
ConceptSearch: Towards Efficient Program Search Using LLMs for Abstraction and Reasoning Corpus (ARC)
di: Singhal, Kartik, et al.
Pubblicazione: (2024)
di: Singhal, Kartik, et al.
Pubblicazione: (2024)
Context-Adaptive Multi-Prompt Embedding with Large Language Models for Vision-Language Alignment
di: Kim, Dahun, et al.
Pubblicazione: (2025)
di: Kim, Dahun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2025) -
Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2026) -
Online Learning for Optimizing AoI-Energy Tradeoff under Unknown Channel Statistics
di: Abd-Elmagid, Mohamed A., et al.
Pubblicazione: (2025) -
Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual
di: Li, Yining, et al.
Pubblicazione: (2026) -
Can We Theoretically Quantify the Impacts of Local Updates on the Generalization Performance of Federated Learning?
di: Ju, Peizhong, et al.
Pubblicazione: (2024)