Enregistré dans:
| Auteurs principaux: | Ronen, Omer, Humayun, Ahmed Imtiaz, Baraniuk, Richard, Balestriero, Randall, Yu, Bin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2406.09657 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Deep Networks Always Grok and Here is Why
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2024)
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2024)
On the Geometry of Deep Learning
par: Balestriero, Randall, et autres
Publié: (2024)
par: Balestriero, Randall, et autres
Publié: (2024)
The Linear Centroids Hypothesis: Features as Directions Learned by Local Experts
par: Walker, Thomas, et autres
Publié: (2026)
par: Walker, Thomas, et autres
Publié: (2026)
GrokAlign: Geometric Characterisation and Acceleration of Grokking
par: Walker, Thomas, et autres
Publié: (2025)
par: Walker, Thomas, et autres
Publié: (2025)
SplineCam: Exact Visualization and Characterization of Deep Network Geometry and Decision Boundaries
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2023)
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2023)
The Geometric Structure of Models Learning Sparse Data
par: Walker, Thomas, et autres
Publié: (2026)
par: Walker, Thomas, et autres
Publié: (2026)
Self-Improving Diffusion Models with Synthetic Data
par: Alemohammad, Sina, et autres
Publié: (2024)
par: Alemohammad, Sina, et autres
Publié: (2024)
ALLoRA: Adaptive Learning Rate Mitigates LoRA Fatal Flaws
par: Huang, Hai, et autres
Publié: (2024)
par: Huang, Hai, et autres
Publié: (2024)
SAFE: A Novel Approach to AI Weather Evaluation through Stratified Assessments of Forecasts over Earth
par: Masi, Nick, et autres
Publié: (2025)
par: Masi, Nick, et autres
Publié: (2025)
Eidetic Learning: an Efficient and Provable Solution to Catastrophic Forgetting
par: Dronen, Nicholas, et autres
Publié: (2025)
par: Dronen, Nicholas, et autres
Publié: (2025)
Task Priors: Enhancing Model Evaluation by Considering the Entire Space of Downstream Tasks
par: Patel, Niket, et autres
Publié: (2025)
par: Patel, Niket, et autres
Publié: (2025)
No Location Left Behind: Measuring and Improving the Fairness of Implicit Representations for Earth Data
par: Cai, Daniel, et autres
Publié: (2025)
par: Cai, Daniel, et autres
Publié: (2025)
Fast and Exact Enumeration of Deep Networks Partitions Regions
par: Balestriero, Randall, et autres
Publié: (2024)
par: Balestriero, Randall, et autres
Publié: (2024)
Max-Affine Spline Insights Into Deep Network Pruning
par: You, Haoran, et autres
Publié: (2021)
par: You, Haoran, et autres
Publié: (2021)
Curvature Tuning: Provable Training-free Model Steering From a Single Parameter
par: Hu, Leyang, et autres
Publié: (2025)
par: Hu, Leyang, et autres
Publié: (2025)
Post-Hoc Guidance for Consistency Models by Joint Flow Distribution Learning
par: Hsu, Chia-Hong, et autres
Publié: (2026)
par: Hsu, Chia-Hong, et autres
Publié: (2026)
Occam's Razor for Self Supervised Learning: What is Sufficient to Learn Good Representations?
par: Ibrahim, Mark, et autres
Publié: (2024)
par: Ibrahim, Mark, et autres
Publié: (2024)
Semantic Tube Prediction: Beating LLM Data Efficiency with JEPA
par: Huang, Hai, et autres
Publié: (2026)
par: Huang, Hai, et autres
Publié: (2026)
Variance Covariance Regularization Enforces Pairwise Independence in Self-Supervised Representations
par: Mialon, Grégoire, et autres
Publié: (2022)
par: Mialon, Grégoire, et autres
Publié: (2022)
Learning by Reconstruction Produces Uninformative Features For Perception
par: Balestriero, Randall, et autres
Publié: (2024)
par: Balestriero, Randall, et autres
Publié: (2024)
LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
par: Balestriero, Randall, et autres
Publié: (2025)
par: Balestriero, Randall, et autres
Publié: (2025)
The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws
par: Jin, Tian, et autres
Publié: (2025)
par: Jin, Tian, et autres
Publié: (2025)
The Fair Language Model Paradox
par: Pinto, Andrea, et autres
Publié: (2024)
par: Pinto, Andrea, et autres
Publié: (2024)
Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation
par: Balestriero, Randall, et autres
Publié: (2023)
par: Balestriero, Randall, et autres
Publié: (2023)
CBOL-Tuner: Classifier-pruned Bayesian optimization to explore temporally structured latent spaces for particle accelerator tuning
par: Rautela, Mahindra, et autres
Publié: (2024)
par: Rautela, Mahindra, et autres
Publié: (2024)
Self-Supervised Anomaly Detection in the Wild: Favor Joint Embeddings Methods
par: Otero, Daniel, et autres
Publié: (2024)
par: Otero, Daniel, et autres
Publié: (2024)
Position: An Empirically Grounded Identifiability Theory Will Accelerate Self-Supervised Learning Research
par: Reizinger, Patrik, et autres
Publié: (2025)
par: Reizinger, Patrik, et autres
Publié: (2025)
Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations
par: Tamayo-Rousseau, Camilo, et autres
Publié: (2025)
par: Tamayo-Rousseau, Camilo, et autres
Publié: (2025)
Is your algorithm unlearning or untraining?
par: Triantafillou, Eleni, et autres
Publié: (2026)
par: Triantafillou, Eleni, et autres
Publié: (2026)
Improving Fairness and Mitigating MADness in Generative Models
par: Mayer, Paul, et autres
Publié: (2024)
par: Mayer, Paul, et autres
Publié: (2024)
PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning
par: Lu, Wenquan, et autres
Publié: (2026)
par: Lu, Wenquan, et autres
Publié: (2026)
On the Computational Efficiency of Bayesian Additive Regression Trees: An Asymptotic Analysis
par: Tan, Yan Shuo, et autres
Publié: (2024)
par: Tan, Yan Shuo, et autres
Publié: (2024)
Approaching an unknown communication system by latent space exploration and causal inference
par: Beguš, Gašper, et autres
Publié: (2023)
par: Beguš, Gašper, et autres
Publié: (2023)
Double Descent and Other Interpolation Phenomena in GANs
par: Luzi, Lorenzo, et autres
Publié: (2021)
par: Luzi, Lorenzo, et autres
Publié: (2021)
PCS-UQ: Uncertainty Quantification via the Predictability-Computability-Stability Framework
par: Agarwal, Abhineet, et autres
Publié: (2025)
par: Agarwal, Abhineet, et autres
Publié: (2025)
stable-pretraining-v1: Foundation Model Research Made Simple
par: Balestriero, Randall, et autres
Publié: (2025)
par: Balestriero, Randall, et autres
Publié: (2025)
Synthetic Context Generation for Question Generation
par: Liu, Naiming, et autres
Publié: (2024)
par: Liu, Naiming, et autres
Publié: (2024)
Circuit Complexity of Hierarchical Knowledge Tracing and Implications for Log-Precision Transformers
par: Liu, Naiming, et autres
Publié: (2026)
par: Liu, Naiming, et autres
Publié: (2026)
Stabilizing autoregressive forecasts in chaotic systems via multi-rate latent recurrence
par: Dhingra, Mrigank, et autres
Publié: (2026)
par: Dhingra, Mrigank, et autres
Publié: (2026)
GPS-SSL: Guided Positive Sampling to Inject Prior Into Self-Supervised Learning
par: Feizi, Aarash, et autres
Publié: (2024)
par: Feizi, Aarash, et autres
Publié: (2024)
Documents similaires
-
Deep Networks Always Grok and Here is Why
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2024) -
On the Geometry of Deep Learning
par: Balestriero, Randall, et autres
Publié: (2024) -
The Linear Centroids Hypothesis: Features as Directions Learned by Local Experts
par: Walker, Thomas, et autres
Publié: (2026) -
GrokAlign: Geometric Characterisation and Acceleration of Grokking
par: Walker, Thomas, et autres
Publié: (2025) -
SplineCam: Exact Visualization and Characterization of Deep Network Geometry and Decision Boundaries
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2023)