The Cosine Schedule is Fisher-Rao-Optimal for Masked Discrete Diffusion Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Leo, Syed, Saifuddin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Score-Optimal Diffusion Schedules
par: Williams, Christopher, et autres
Publié: (2024)
par: Williams, Christopher, et autres
Publié: (2024)
Optimal Inference Schedules for Masked Diffusion Models
par: Chen, Sitan, et autres
Publié: (2025)
par: Chen, Sitan, et autres
Publié: (2025)
Why Masking Diffusion Works: Condition on the Jump Schedule for Improved Discrete Diffusion
par: Amin, Alan N., et autres
Publié: (2025)
par: Amin, Alan N., et autres
Publié: (2025)
PPO in the Fisher-Rao geometry
par: Lascu, Razvan-Andrei, et autres
Publié: (2025)
par: Lascu, Razvan-Andrei, et autres
Publié: (2025)
CREPE: Controlling Diffusion with Replica Exchange
par: He, Jiajun, et autres
Publié: (2025)
par: He, Jiajun, et autres
Publié: (2025)
Kernel Approximation of Fisher-Rao Gradient Flows
par: Zhu, Jia-Jie, et autres
Publié: (2024)
par: Zhu, Jia-Jie, et autres
Publié: (2024)
Sampling in Unit Time with Kernel Fisher-Rao Flow
par: Maurais, Aimee, et autres
Publié: (2024)
par: Maurais, Aimee, et autres
Publié: (2024)
Improved Sampling Schedules for Discrete Diffusion Models
par: Foresti, Alberto, et autres
Publié: (2026)
par: Foresti, Alberto, et autres
Publié: (2026)
Error Bounds and Optimal Schedules for Masked Diffusions with Factorized Approximations
par: Lavenant, Hugo, et autres
Publié: (2025)
par: Lavenant, Hugo, et autres
Publié: (2025)
Beyond Masked and Unmasked: Discrete Diffusion Models via Partial Masking
par: Chao, Chen-Hao, et autres
Publié: (2025)
par: Chao, Chen-Hao, et autres
Publié: (2025)
Functionality-Oriented LLM Merging on the Fisher--Rao Manifold
par: Wang, Jiayu, et autres
Publié: (2026)
par: Wang, Jiayu, et autres
Publié: (2026)
The Fisher-Rao Loss for Learning under Label Noise
par: Miyamoto, Henrique K., et autres
Publié: (2022)
par: Miyamoto, Henrique K., et autres
Publié: (2022)
FRInGe: Distribution-Space Integrated Gradients with Fisher--Rao Geometry
par: Martino, Gabriele, et autres
Publié: (2026)
par: Martino, Gabriele, et autres
Publié: (2026)
An approach to Fisher-Rao metric for infinite dimensional non-parametric information geometry
par: Cheng, Bing, et autres
Publié: (2025)
par: Cheng, Bing, et autres
Publié: (2025)
Efficient Neural Networks with Discrete Cosine Transform Activations
par: Martinez-Gost, Marc, et autres
Publié: (2025)
par: Martinez-Gost, Marc, et autres
Publié: (2025)
Simplified and Generalized Masked Diffusion for Discrete Data
par: Shi, Jiaxin, et autres
Publié: (2024)
par: Shi, Jiaxin, et autres
Publié: (2024)
Multi-Objective Optimization via Wasserstein-Fisher-Rao Gradient Flow
par: Ren, Yinuo, et autres
Publié: (2023)
par: Ren, Yinuo, et autres
Publié: (2023)
Steering Masked Discrete Diffusion Models via Discrete Denoising Posterior Prediction
par: Rector-Brooks, Jarrid, et autres
Publié: (2024)
par: Rector-Brooks, Jarrid, et autres
Publié: (2024)
What Exactly Does Guidance Do in Masked Discrete Diffusion Models
par: Ye, He, et autres
Publié: (2025)
par: Ye, He, et autres
Publié: (2025)
Fisher-Rao distance and pullback SPD cone distances between multivariate normal distributions
par: Nielsen, Frank
Publié: (2023)
par: Nielsen, Frank
Publié: (2023)
Adaptive function approximation based on the Discrete Cosine Transform (DCT)
par: Pérez-Neira, Ana I., et autres
Publié: (2023)
par: Pérez-Neira, Ana I., et autres
Publié: (2023)
Beyond Cosine Decay: On the effectiveness of Infinite Learning Rate Schedule for Continual Pre-training
par: Singh, Vaibhav, et autres
Publié: (2025)
par: Singh, Vaibhav, et autres
Publié: (2025)
Latent Shadows: The Gaussian-Discrete Duality in Masked Diffusion
par: Chen, Guinan, et autres
Publié: (2026)
par: Chen, Guinan, et autres
Publié: (2026)
Weighted Stochastic Differential Equation to Implement Wasserstein-Fisher-Rao Gradient Flow
par: Rahimi, Herlock
Publié: (2025)
par: Rahimi, Herlock
Publié: (2025)
Inclusive KL Minimization: A Wasserstein-Fisher-Rao Gradient Flow Perspective
par: Zhu, Jia-Jie
Publié: (2024)
par: Zhu, Jia-Jie
Publié: (2024)
Learning Generation Orders for Masked Discrete Diffusion Models via Variational Inference
par: Fox, David, et autres
Publié: (2026)
par: Fox, David, et autres
Publié: (2026)
Conditional Diffusion Sampling
par: Castro-Macías, Francisco M., et autres
Publié: (2026)
par: Castro-Macías, Francisco M., et autres
Publié: (2026)
Accelerated Parallel Tempering via Neural Transports
par: Zhang, Leo, et autres
Publié: (2025)
par: Zhang, Leo, et autres
Publié: (2025)
Noise Schedule Design for Diffusion Models: An Optimal Control Perspective
par: Kong, Seo Taek, et autres
Publié: (2026)
par: Kong, Seo Taek, et autres
Publié: (2026)
Boosting Adversarial Training via Fisher-Rao Norm-based Regularization
par: Yin, Xiangyu, et autres
Publié: (2024)
par: Yin, Xiangyu, et autres
Publié: (2024)
Fisher-Rao Gradient Flow: Geodesic Convexity and Functional Inequalities
par: Carrillo, José A., et autres
Publié: (2024)
par: Carrillo, José A., et autres
Publié: (2024)
On propagation of chaos for the Fisher-Rao gradient flow in entropic mean-field optimization
par: Lazić, Petra, et autres
Publié: (2026)
par: Lazić, Petra, et autres
Publié: (2026)
Neural Sampling from Boltzmann Densities: Fisher-Rao Curves in the Wasserstein Geometry
par: Chemseddine, Jannis, et autres
Publié: (2024)
par: Chemseddine, Jannis, et autres
Publié: (2024)
Fisher Mask Nodes for Language Model Merging
par: K, Thennal D, et autres
Publié: (2024)
par: K, Thennal D, et autres
Publié: (2024)
Not All Denoising Steps Are Equal: Model Scheduling for Faster Masked Diffusion Language Models
par: Sedykh, Ivan, et autres
Publié: (2026)
par: Sedykh, Ivan, et autres
Publié: (2026)
Efficient, Multimodal, and Derivative-Free Bayesian Inference With Fisher-Rao Gradient Flows
par: Chen, Yifan, et autres
Publié: (2024)
par: Chen, Yifan, et autres
Publié: (2024)
FGGM: Fisher-Guided Gradient Masking for Continual Learning
par: Tan, Chao-Hong, et autres
Publié: (2026)
par: Tan, Chao-Hong, et autres
Publié: (2026)
A Fisher-Rao gradient flow for entropic mean-field min-max games
par: Lascu, Razvan-Andrei, et autres
Publié: (2024)
par: Lascu, Razvan-Andrei, et autres
Publié: (2024)
Rao-Blackwell Gradient Estimators for Equivariant Denoising Diffusion
par: Tong, Vinh, et autres
Publié: (2025)
par: Tong, Vinh, et autres
Publié: (2025)
Discrete Cosine Transform Based Decorrelated Attention for Vision Transformers
par: Pan, Hongyi, et autres
Publié: (2024)
par: Pan, Hongyi, et autres
Publié: (2024)
Documents similaires
-
Score-Optimal Diffusion Schedules
par: Williams, Christopher, et autres
Publié: (2024) -
Optimal Inference Schedules for Masked Diffusion Models
par: Chen, Sitan, et autres
Publié: (2025) -
Why Masking Diffusion Works: Condition on the Jump Schedule for Improved Discrete Diffusion
par: Amin, Alan N., et autres
Publié: (2025) -
PPO in the Fisher-Rao geometry
par: Lascu, Razvan-Andrei, et autres
Publié: (2025) -
CREPE: Controlling Diffusion with Replica Exchange
par: He, Jiajun, et autres
Publié: (2025)