Scaling Behavior of Discrete Diffusion Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | von Rütte, Dimitri, Fluri, Janis, Pooladzandi, Omead, Schölkopf, Bernhard, Hofmann, Thomas, Orvieto, Antonio |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generalized Interpolating Discrete Diffusion
di: von Rütte, Dimitri, et al.
Pubblicazione: (2025)
di: von Rütte, Dimitri, et al.
Pubblicazione: (2025)
Deriving Hyperparameter Scaling Laws via Modern Optimization Theory
di: Shulgin, Egor, et al.
Pubblicazione: (2026)
di: Shulgin, Egor, et al.
Pubblicazione: (2026)
Curvature-Informed SGD via General Purpose Lie-Group Preconditioners
di: Pooladzandi, Omead, et al.
Pubblicazione: (2024)
di: Pooladzandi, Omead, et al.
Pubblicazione: (2024)
PureEBM: Universal Poison Purification via Mid-Run Dynamics of Energy-Based Models
di: Pooladzandi, Omead, et al.
Pubblicazione: (2024)
di: Pooladzandi, Omead, et al.
Pubblicazione: (2024)
Implicit Bias and Convergence of Matrix Stochastic Mirror Descent
di: Akhtiamov, Danil, et al.
Pubblicazione: (2026)
di: Akhtiamov, Danil, et al.
Pubblicazione: (2026)
PureGen: Universal Data Purification for Train-Time Poison Defense via Generative Model Dynamics
di: Bhat, Sunay, et al.
Pubblicazione: (2024)
di: Bhat, Sunay, et al.
Pubblicazione: (2024)
FIGARO: Generating Symbolic Music with Fine-Grained Artistic Control
di: von Rütte, Dimitri, et al.
Pubblicazione: (2022)
di: von Rütte, Dimitri, et al.
Pubblicazione: (2022)
Exploring Magnitude Preservation and Rotation Modulation in Diffusion Transformers
di: Bill, Eric Tillman, et al.
Pubblicazione: (2025)
di: Bill, Eric Tillman, et al.
Pubblicazione: (2025)
Causal Modeling with Stationary Diffusions
di: Lorch, Lars, et al.
Pubblicazione: (2023)
di: Lorch, Lars, et al.
Pubblicazione: (2023)
Super Consistency of Neural Network Landscapes and Learning Rate Transfer
di: Noci, Lorenzo, et al.
Pubblicazione: (2024)
di: Noci, Lorenzo, et al.
Pubblicazione: (2024)
Adam Simplified: Bias Correction Debunked
di: Laing, Sam, et al.
Pubblicazione: (2025)
di: Laing, Sam, et al.
Pubblicazione: (2025)
Revisiting associative recall in modern recurrent models
di: Okpekpe, Destiny, et al.
Pubblicazione: (2025)
di: Okpekpe, Destiny, et al.
Pubblicazione: (2025)
Robustness of Nonlinear Representation Learning
di: Buchholz, Simon, et al.
Pubblicazione: (2025)
di: Buchholz, Simon, et al.
Pubblicazione: (2025)
Geometry-Aware Instrumental Variable Regression
di: Kremer, Heiner, et al.
Pubblicazione: (2024)
di: Kremer, Heiner, et al.
Pubblicazione: (2024)
Targeted Reduction of Causal Models
di: Kekić, Armin, et al.
Pubblicazione: (2023)
di: Kekić, Armin, et al.
Pubblicazione: (2023)
A Language Model's Guide Through Latent Space
di: von Rütte, Dimitri, et al.
Pubblicazione: (2024)
di: von Rütte, Dimitri, et al.
Pubblicazione: (2024)
SPARTAN: A Sparse Transformer World Model Attending to What Matters
di: Lei, Anson, et al.
Pubblicazione: (2024)
di: Lei, Anson, et al.
Pubblicazione: (2024)
Recurrent Distance Filtering for Graph Representation Learning
di: Ding, Yuhui, et al.
Pubblicazione: (2023)
di: Ding, Yuhui, et al.
Pubblicazione: (2023)
Hallmarks of Optimization Trajectories in Neural Networks: Directional Exploration and Redundancy
di: Singh, Sidak Pal, et al.
Pubblicazione: (2024)
di: Singh, Sidak Pal, et al.
Pubblicazione: (2024)
In Search of Adam's Secret Sauce
di: Orvieto, Antonio, et al.
Pubblicazione: (2025)
di: Orvieto, Antonio, et al.
Pubblicazione: (2025)
An Adaptive Stochastic Gradient Method with Non-negative Gauss-Newton Stepsizes
di: Orvieto, Antonio, et al.
Pubblicazione: (2024)
di: Orvieto, Antonio, et al.
Pubblicazione: (2024)
Skill or Luck? Return Decomposition via Advantage Functions
di: Pan, Hsiao-Ru, et al.
Pubblicazione: (2024)
di: Pan, Hsiao-Ru, et al.
Pubblicazione: (2024)
Natural Building Blocks for Structured World Models: Theory, Evidence, and Scaling
di: Da Costa, Lancelot, et al.
Pubblicazione: (2025)
di: Da Costa, Lancelot, et al.
Pubblicazione: (2025)
Can you Finetune your Binoculars? Embedding Text Watermarks into the Weights of Large Language Models
di: Elhassan, Fay, et al.
Pubblicazione: (2025)
di: Elhassan, Fay, et al.
Pubblicazione: (2025)
Out-of-Variable Generalization for Discriminative Models
di: Guo, Siyuan, et al.
Pubblicazione: (2023)
di: Guo, Siyuan, et al.
Pubblicazione: (2023)
Computational Arbitrage in AI Model Markets
di: Olmedo, Ricardo, et al.
Pubblicazione: (2026)
di: Olmedo, Ricardo, et al.
Pubblicazione: (2026)
A Probabilistic Model Behind Self-Supervised Learning
di: Bizeul, Alice, et al.
Pubblicazione: (2024)
di: Bizeul, Alice, et al.
Pubblicazione: (2024)
On the Emergence and Test-Time Use of Structural Information in Large Language Models
di: Chen, Michelle Chao, et al.
Pubblicazione: (2026)
di: Chen, Michelle Chao, et al.
Pubblicazione: (2026)
Improving Large Language Model Safety with Contrastive Representation Learning
di: Simko, Samuel, et al.
Pubblicazione: (2025)
di: Simko, Samuel, et al.
Pubblicazione: (2025)
Physics of Learning: A Lagrangian perspective to different learning paradigms
di: Guo, Siyuan, et al.
Pubblicazione: (2025)
di: Guo, Siyuan, et al.
Pubblicazione: (2025)
Latent Causal Diffusions for Single-Cell Perturbation Modeling
di: Lorch, Lars, et al.
Pubblicazione: (2026)
di: Lorch, Lars, et al.
Pubblicazione: (2026)
Compete and Compose: Learning Independent Mechanisms for Modular World Models
di: Lei, Anson, et al.
Pubblicazione: (2024)
di: Lei, Anson, et al.
Pubblicazione: (2024)
Recurrent neural networks: vanishing and exploding gradients are not the end of the story
di: Zucchet, Nicolas, et al.
Pubblicazione: (2024)
di: Zucchet, Nicolas, et al.
Pubblicazione: (2024)
An Uncertainty Principle for Linear Recurrent Neural Networks
di: François, Alexandre, et al.
Pubblicazione: (2025)
di: François, Alexandre, et al.
Pubblicazione: (2025)
When, Where and Why to Average Weights?
di: Ajroldi, Niccolò, et al.
Pubblicazione: (2025)
di: Ajroldi, Niccolò, et al.
Pubblicazione: (2025)
Explaining Grokking in Transformers through the Lens of Inductive Bias
di: Singh, Jaisidh, et al.
Pubblicazione: (2026)
di: Singh, Jaisidh, et al.
Pubblicazione: (2026)
Universal Dynamics of Warmup Stable Decay: understanding WSD beyond Transformers
di: Belloni, Annalisa, et al.
Pubblicazione: (2026)
di: Belloni, Annalisa, et al.
Pubblicazione: (2026)
Improved state mixing in higher-order and block diagonal linear recurrent networks
di: Dubinin, Igor, et al.
Pubblicazione: (2026)
di: Dubinin, Igor, et al.
Pubblicazione: (2026)
Online Learning and Unlearning
di: Hu, Yaxi, et al.
Pubblicazione: (2025)
di: Hu, Yaxi, et al.
Pubblicazione: (2025)
Learning Joint Interventional Effects from Single-Variable Interventions in Additive Models
di: Kekić, Armin, et al.
Pubblicazione: (2025)
di: Kekić, Armin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Generalized Interpolating Discrete Diffusion
di: von Rütte, Dimitri, et al.
Pubblicazione: (2025) -
Deriving Hyperparameter Scaling Laws via Modern Optimization Theory
di: Shulgin, Egor, et al.
Pubblicazione: (2026) -
Curvature-Informed SGD via General Purpose Lie-Group Preconditioners
di: Pooladzandi, Omead, et al.
Pubblicazione: (2024) -
PureEBM: Universal Poison Purification via Mid-Run Dynamics of Energy-Based Models
di: Pooladzandi, Omead, et al.
Pubblicazione: (2024) -
Implicit Bias and Convergence of Matrix Stochastic Mirror Descent
di: Akhtiamov, Danil, et al.
Pubblicazione: (2026)