Salvato in:
| Autori principali: | Davis, Oscar, Filippova, Anastasiia, Ablin, Pierre, Turrisi, Victor, Shidani, Amitis, Cuturi, Marco, Béthune, Louis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.07820 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection
di: Bethune, Louis, et al.
Pubblicazione: (2025)
di: Bethune, Louis, et al.
Pubblicazione: (2025)
Learning Unmasking Policies for Diffusion Language Models
di: Jazbec, Metod, et al.
Pubblicazione: (2025)
di: Jazbec, Metod, et al.
Pubblicazione: (2025)
DynaMiCS: Fine-tuning LLMs with Performance Constraints using Dynamic Mixtures
di: Gualdoni, Eleonora, et al.
Pubblicazione: (2026)
di: Gualdoni, Eleonora, et al.
Pubblicazione: (2026)
Optimal Splitting of Language Models from Mixtures to Specialized Domains
di: Seto, Skyler, et al.
Pubblicazione: (2026)
di: Seto, Skyler, et al.
Pubblicazione: (2026)
Sample and Map from a Single Convex Potential: Generation using Conjugate Moment Measures
di: Vesseron, Nina, et al.
Pubblicazione: (2025)
di: Vesseron, Nina, et al.
Pubblicazione: (2025)
Shielded Diffusion: Generating Novel and Diverse Images using Sparse Repellency
di: Kirchhof, Michael, et al.
Pubblicazione: (2024)
di: Kirchhof, Michael, et al.
Pubblicazione: (2024)
The Data-Quality Illusion: Rethinking Classifier-Based Quality Filtering for LLM Pretraining
di: Saada, Thiziri Nait, et al.
Pubblicazione: (2025)
di: Saada, Thiziri Nait, et al.
Pubblicazione: (2025)
Completed Hyperparameter Transfer across Modules, Width, Depth, Batch and Duration
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025)
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025)
The Geometries of Truth Are Orthogonal Across Tasks
di: Azizian, Waiss, et al.
Pubblicazione: (2025)
di: Azizian, Waiss, et al.
Pubblicazione: (2025)
Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing
di: Filippova, Anastasiia, et al.
Pubblicazione: (2026)
di: Filippova, Anastasiia, et al.
Pubblicazione: (2026)
Multivariate Conformal Prediction using Optimal Transport
di: Klein, Michal, et al.
Pubblicazione: (2025)
di: Klein, Michal, et al.
Pubblicazione: (2025)
Locking Pretrained Weights via Deep Low-Rank Residual Distillation
di: Sakamoto, Keitaro, et al.
Pubblicazione: (2026)
di: Sakamoto, Keitaro, et al.
Pubblicazione: (2026)
Ranking In Generalized Linear Bandits
di: Shidani, Amitis, et al.
Pubblicazione: (2022)
di: Shidani, Amitis, et al.
Pubblicazione: (2022)
Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings
di: Jeha, Paul, et al.
Pubblicazione: (2026)
di: Jeha, Paul, et al.
Pubblicazione: (2026)
Nectar: Neural Estimation of Cached-Token Attention via Regression
di: Monteiro, João, et al.
Pubblicazione: (2026)
di: Monteiro, João, et al.
Pubblicazione: (2026)
The Design Space of Tri-Modal Masked Diffusion Models
di: Bethune, Louis, et al.
Pubblicazione: (2026)
di: Bethune, Louis, et al.
Pubblicazione: (2026)
Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training
di: Krajewski, Jakub, et al.
Pubblicazione: (2025)
di: Krajewski, Jakub, et al.
Pubblicazione: (2025)
Scaling Laws for Optimal Data Mixtures
di: Shukor, Mustafa, et al.
Pubblicazione: (2025)
di: Shukor, Mustafa, et al.
Pubblicazione: (2025)
Distillation Scaling Laws
di: Busbridge, Dan, et al.
Pubblicazione: (2025)
di: Busbridge, Dan, et al.
Pubblicazione: (2025)
Beyond Real Data: Synthetic Data through the Lens of Regularization
di: Shidani, Amitis, et al.
Pubblicazione: (2025)
di: Shidani, Amitis, et al.
Pubblicazione: (2025)
Theory, Analysis, and Best Practices for Sigmoid Self-Attention
di: Ramapuram, Jason, et al.
Pubblicazione: (2024)
di: Ramapuram, Jason, et al.
Pubblicazione: (2024)
Scaling Laws for Mixture Pretraining Under Data Constraints
di: Sedova, Anastasiia, et al.
Pubblicazione: (2026)
di: Sedova, Anastasiia, et al.
Pubblicazione: (2026)
Careful with that Scalpel: Improving Gradient Surgery with an EMA
di: Hsieh, Yu-Guan, et al.
Pubblicazione: (2024)
di: Hsieh, Yu-Guan, et al.
Pubblicazione: (2024)
Categorical Flow Maps
di: Roos, Daan, et al.
Pubblicazione: (2026)
di: Roos, Daan, et al.
Pubblicazione: (2026)
Learning Elastic Costs to Shape Monge Displacements
di: Klein, Michal, et al.
Pubblicazione: (2023)
di: Klein, Michal, et al.
Pubblicazione: (2023)
Scaling Properties of Continuous Diffusion Spoken Language Models
di: Ramapuram, Jason, et al.
Pubblicazione: (2026)
di: Ramapuram, Jason, et al.
Pubblicazione: (2026)
Poly-View Contrastive Learning
di: Shidani, Amitis, et al.
Pubblicazione: (2024)
di: Shidani, Amitis, et al.
Pubblicazione: (2024)
Deep Sturm--Liouville: From Sample-Based to 1D Regularization with Learnable Orthogonal Basis Functions
di: Vigouroux, David, et al.
Pubblicazione: (2025)
di: Vigouroux, David, et al.
Pubblicazione: (2025)
On a Neural Implementation of Brenier's Polar Factorization
di: Vesseron, Nina, et al.
Pubblicazione: (2024)
di: Vesseron, Nina, et al.
Pubblicazione: (2024)
Partial Parameter Updates for Efficient Distributed Training
di: Filippova, Anastasiia, et al.
Pubblicazione: (2025)
di: Filippova, Anastasiia, et al.
Pubblicazione: (2025)
No Need to Talk: Asynchronous Mixture of Language Models
di: Filippova, Anastasiia, et al.
Pubblicazione: (2024)
di: Filippova, Anastasiia, et al.
Pubblicazione: (2024)
GENOT: Entropic (Gromov) Wasserstein Flow Matching with Applications to Single-Cell Genomics
di: Klein, Dominik, et al.
Pubblicazione: (2023)
di: Klein, Dominik, et al.
Pubblicazione: (2023)
On Fitting Flow Models with Large Sinkhorn Couplings
di: Zhang, Stephen, et al.
Pubblicazione: (2025)
di: Zhang, Stephen, et al.
Pubblicazione: (2025)
Flow Matching with Semidiscrete Couplings
di: Mousavi-Hosseini, Alireza, et al.
Pubblicazione: (2025)
di: Mousavi-Hosseini, Alireza, et al.
Pubblicazione: (2025)
How Smooth Is Attention?
di: Castin, Valérie, et al.
Pubblicazione: (2023)
di: Castin, Valérie, et al.
Pubblicazione: (2023)
The AdEMAMix Optimizer: Better, Faster, Older
di: Pagliardini, Matteo, et al.
Pubblicazione: (2024)
di: Pagliardini, Matteo, et al.
Pubblicazione: (2024)
Dynamic Gradient Alignment for Online Data Mixing
di: Fan, Simin, et al.
Pubblicazione: (2024)
di: Fan, Simin, et al.
Pubblicazione: (2024)
Enhancing Hypergradients Estimation: A Study of Preconditioning and Reparameterization
di: Ye, Zhenzhang, et al.
Pubblicazione: (2024)
di: Ye, Zhenzhang, et al.
Pubblicazione: (2024)
MVICAD2: Multi-View Independent Component Analysis with Delays and Dilations
di: Heurtebise, Ambroise, et al.
Pubblicazione: (2025)
di: Heurtebise, Ambroise, et al.
Pubblicazione: (2025)
Simplex-to-Euclidean Bijections for Categorical Flow Matching
di: Williams, Bernardo, et al.
Pubblicazione: (2025)
di: Williams, Bernardo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection
di: Bethune, Louis, et al.
Pubblicazione: (2025) -
Learning Unmasking Policies for Diffusion Language Models
di: Jazbec, Metod, et al.
Pubblicazione: (2025) -
DynaMiCS: Fine-tuning LLMs with Performance Constraints using Dynamic Mixtures
di: Gualdoni, Eleonora, et al.
Pubblicazione: (2026) -
Optimal Splitting of Language Models from Mixtures to Specialized Domains
di: Seto, Skyler, et al.
Pubblicazione: (2026) -
Sample and Map from a Single Convex Potential: Generation using Conjugate Moment Measures
di: Vesseron, Nina, et al.
Pubblicazione: (2025)