Optimal Stability of KL Divergence under Gaussian Perturbations
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Jialu, Zhang, Yufeng, Hu, Nan, Chen, Zhenbang, Wang, Ji, Li, Keqin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generalized Munchausen Reinforcement Learning using Tsallis KL Divergence
di: Zhu, Lingwei, et al.
Pubblicazione: (2023)
di: Zhu, Lingwei, et al.
Pubblicazione: (2023)
On Flow Matching KL Divergence
di: Su, Maojiang, et al.
Pubblicazione: (2025)
di: Su, Maojiang, et al.
Pubblicazione: (2025)
Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint
di: Xiong, Wei, et al.
Pubblicazione: (2023)
di: Xiong, Wei, et al.
Pubblicazione: (2023)
Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning
di: Yuan, Rui, et al.
Pubblicazione: (2026)
di: Yuan, Rui, et al.
Pubblicazione: (2026)
KL Penalty Control via Perturbation for Direct Preference Optimization
di: Lee, Sangkyu, et al.
Pubblicazione: (2025)
di: Lee, Sangkyu, et al.
Pubblicazione: (2025)
Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning
di: Zhang, Yixian, et al.
Pubblicazione: (2025)
di: Zhang, Yixian, et al.
Pubblicazione: (2025)
AI-Driven Fronthaul Link Compression in Wireless Communication Systems: Review and Method Design
di: Zhang, Keqin
Pubblicazione: (2025)
di: Zhang, Keqin
Pubblicazione: (2025)
Generalisation of RLHF under Reward Shift and Clipped KL Regularisation
di: Tang, Kenton, et al.
Pubblicazione: (2026)
di: Tang, Kenton, et al.
Pubblicazione: (2026)
Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
di: Ji, Kaixuan, et al.
Pubblicazione: (2026)
di: Ji, Kaixuan, et al.
Pubblicazione: (2026)
On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
di: Ji, Kaixuan, et al.
Pubblicazione: (2026)
di: Ji, Kaixuan, et al.
Pubblicazione: (2026)
Every Node is Different: Dynamically Fusing Self-Supervised Tasks for Attributed Graph Clustering
di: Zhu, Pengfei, et al.
Pubblicazione: (2024)
di: Zhu, Pengfei, et al.
Pubblicazione: (2024)
Divergence-Augmented Policy Optimization
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Offline and Online KL-Regularized RLHF under Differential Privacy
di: Wu, Yulian, et al.
Pubblicazione: (2025)
di: Wu, Yulian, et al.
Pubblicazione: (2025)
Revisiting Weak-to-Strong Generalization in Theory and Practice: Reverse KL vs. Forward KL
di: Yao, Wei, et al.
Pubblicazione: (2025)
di: Yao, Wei, et al.
Pubblicazione: (2025)
The Unseen Threat: Residual Knowledge in Machine Unlearning under Perturbed Samples
di: Hsu, Hsiang, et al.
Pubblicazione: (2026)
di: Hsu, Hsiang, et al.
Pubblicazione: (2026)
Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness Guarantees
di: Queeney, James, et al.
Pubblicazione: (2023)
di: Queeney, James, et al.
Pubblicazione: (2023)
Relaxed Triangle Inequality for Kullback-Leibler Divergence Between Multivariate Gaussian Distributions
di: Xiao, Shiji, et al.
Pubblicazione: (2026)
di: Xiao, Shiji, et al.
Pubblicazione: (2026)
From Atoms to Chains: Divergence-Guided Reasoning Curriculum for Unlabeled LLM Domain Adaptation
di: Wang, Yongqi, et al.
Pubblicazione: (2026)
di: Wang, Yongqi, et al.
Pubblicazione: (2026)
FFT-MoE: Efficient Federated Fine-Tuning for Foundation Models via Large-scale Sparse MoE under Heterogeneous Edge
di: Hu, Gang, et al.
Pubblicazione: (2025)
di: Hu, Gang, et al.
Pubblicazione: (2025)
Expert Divergence Learning for MoE-based Language Models
di: Li, Jiaang, et al.
Pubblicazione: (2026)
di: Li, Jiaang, et al.
Pubblicazione: (2026)
Empirical Characterization of Rationale Stability Under Controlled Perturbations for Explainable Pattern Recognition
di: Sakib, Abu Noman Md, et al.
Pubblicazione: (2026)
di: Sakib, Abu Noman Md, et al.
Pubblicazione: (2026)
CLID-MU: Cross-Layer Information Divergence Based Meta Update Strategy for Learning with Noisy Labels
di: Hu, Ruofan, et al.
Pubblicazione: (2025)
di: Hu, Ruofan, et al.
Pubblicazione: (2025)
PerturbDiff: Functional Diffusion for Single-Cell Perturbation Modeling
di: Yuan, Xinyu, et al.
Pubblicazione: (2026)
di: Yuan, Xinyu, et al.
Pubblicazione: (2026)
Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling
di: Wang, Xinglin, et al.
Pubblicazione: (2025)
di: Wang, Xinglin, et al.
Pubblicazione: (2025)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
di: Huang, Kaixuan, et al.
Pubblicazione: (2025)
di: Huang, Kaixuan, et al.
Pubblicazione: (2025)
APO: Alpha-Divergence Preference Optimization
di: Zixian, Wang
Pubblicazione: (2025)
di: Zixian, Wang
Pubblicazione: (2025)
Backward-Friendly Optimization: Training Large Language Models with Approximate Gradients under Memory Constraints
di: Yang, Jing, et al.
Pubblicazione: (2025)
di: Yang, Jing, et al.
Pubblicazione: (2025)
Masked Graph Learning with Recurrent Alignment for Multimodal Emotion Recognition in Conversation
di: Meng, Tao, et al.
Pubblicazione: (2024)
di: Meng, Tao, et al.
Pubblicazione: (2024)
Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence
di: Yin, Wenzhe, et al.
Pubblicazione: (2025)
di: Yin, Wenzhe, et al.
Pubblicazione: (2025)
KL-regularization Itself is Differentially Private in Bandits and RLHF
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
Sim2Act: Robust Simulation-to-Decision Learning via Adversarial Calibration and Group-Relative Perturbation
di: Cao, Hongyu, et al.
Pubblicazione: (2026)
di: Cao, Hongyu, et al.
Pubblicazione: (2026)
Embeddings to Diagnosis: Latent Fragility under Agentic Perturbations in Clinical LLMs
di: Vijayaraj, Raj Krishnan
Pubblicazione: (2025)
di: Vijayaraj, Raj Krishnan
Pubblicazione: (2025)
Research and Design on Intelligent Recognition of Unordered Targets for Robots Based on Reinforcement Learning
di: Mao, Yiting, et al.
Pubblicazione: (2025)
di: Mao, Yiting, et al.
Pubblicazione: (2025)
TimeGNN-Augmented Hybrid-Action MARL for Fine-Grained Task Partitioning and Energy-Aware Offloading in MEC
di: Ai, Wei, et al.
Pubblicazione: (2026)
di: Ai, Wei, et al.
Pubblicazione: (2026)
\textsc{MasFACT}: Continual Multi-Agent Topology Learning via Geometry-Aware Posterior Transfer
di: Wang, Xuefei, et al.
Pubblicazione: (2026)
di: Wang, Xuefei, et al.
Pubblicazione: (2026)
Generalized Cauchy-Schwarz Divergence and Its Deep Learning Applications
di: Lu, Mingfei, et al.
Pubblicazione: (2024)
di: Lu, Mingfei, et al.
Pubblicazione: (2024)
Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability
di: Zhao, Qingyue, et al.
Pubblicazione: (2026)
di: Zhao, Qingyue, et al.
Pubblicazione: (2026)
Unifying Adversarial Perturbation for Graph Neural Networks
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
FedRD: Reducing Divergences for Generalized Federated Learning via Heterogeneity-aware Parameter Guidance
di: Wang, Kaile, et al.
Pubblicazione: (2026)
di: Wang, Kaile, et al.
Pubblicazione: (2026)
EVE: Efficient Verification of Data Erasure through Customized Perturbation in Approximate Unlearning
di: Wang, Weiqi, et al.
Pubblicazione: (2026)
di: Wang, Weiqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Generalized Munchausen Reinforcement Learning using Tsallis KL Divergence
di: Zhu, Lingwei, et al.
Pubblicazione: (2023) -
On Flow Matching KL Divergence
di: Su, Maojiang, et al.
Pubblicazione: (2025) -
Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint
di: Xiong, Wei, et al.
Pubblicazione: (2023) -
Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning
di: Yuan, Rui, et al.
Pubblicazione: (2026) -
KL Penalty Control via Perturbation for Direct Preference Optimization
di: Lee, Sangkyu, et al.
Pubblicazione: (2025)