Training Transformers with Enforced Lipschitz Constants
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Newhouse, Laker, Hess, R. Preston, Cesista, Franz, Zahorodnii, Andrii, Bernstein, Jeremy, Isola, Phillip |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Old Optimizer, New Norm: An Anthology
par: Bernstein, Jeremy, et autres
Publié: (2024)
par: Bernstein, Jeremy, et autres
Publié: (2024)
Modular Duality in Deep Learning
par: Bernstein, Jeremy, et autres
Publié: (2024)
par: Bernstein, Jeremy, et autres
Publié: (2024)
Improving World Models using Deep Supervision with Linear Probes
par: Zahorodnii, Andrii
Publié: (2025)
par: Zahorodnii, Andrii
Publié: (2025)
Training Neural Networks from Scratch with Parallel Low-Rank Adapters
par: Huh, Minyoung, et autres
Publié: (2024)
par: Huh, Minyoung, et autres
Publié: (2024)
Scalable Optimization in the Modular Norm
par: Large, Tim, et autres
Publié: (2024)
par: Large, Tim, et autres
Publié: (2024)
Improved Representation of Asymmetrical Distances with Interval Quasimetric Embeddings
par: Wang, Tongzhou, et autres
Publié: (2022)
par: Wang, Tongzhou, et autres
Publié: (2022)
ANTN: Bridging Autoregressive Neural Networks and Tensor Networks for Quantum Many-Body Simulation
par: Chen, Zhuo, et autres
Publié: (2023)
par: Chen, Zhuo, et autres
Publié: (2023)
Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights
par: Gan, Yulu, et autres
Publié: (2026)
par: Gan, Yulu, et autres
Publié: (2026)
Retrieval Augmented Structured Generation: Business Document Information Extraction As Tool Use
par: Cesista, Franz Louis, et autres
Publié: (2024)
par: Cesista, Franz Louis, et autres
Publié: (2024)
On the Lipschitz Constant of Deep Networks and Double Descent
par: Gamba, Matteo, et autres
Publié: (2023)
par: Gamba, Matteo, et autres
Publié: (2023)
The Truth Lies Somewhere in the Middle (of the Generated Tokens)
par: Wang, Sophie L., et autres
Publié: (2026)
par: Wang, Sophie L., et autres
Publié: (2026)
Multimodal Structured Generation: CVPR's 2nd MMFM Challenge Technical Report
par: Cesista, Franz Louis
Publié: (2024)
par: Cesista, Franz Louis
Publié: (2024)
Chordal Sparsity for Lipschitz Constant Estimation of Deep Neural Networks
par: Xue, Anton, et autres
Publié: (2022)
par: Xue, Anton, et autres
Publié: (2022)
Project Jenkins: Turning Monkey Neural Data into Robotic Arm Movement, and Back
par: Zahorodnii, Andrii, et autres
Publié: (2025)
par: Zahorodnii, Andrii, et autres
Publié: (2025)
Canonicalizing Multimodal Contrastive Representation Learning
par: Gupta, Sharut, et autres
Publié: (2026)
par: Gupta, Sharut, et autres
Publié: (2026)
Words That Make Language Models Perceive
par: Wang, Sophie L., et autres
Publié: (2025)
par: Wang, Sophie L., et autres
Publié: (2025)
Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences
par: Bahng, Hyojin, et autres
Publié: (2025)
par: Bahng, Hyojin, et autres
Publié: (2025)
Neuroprobe: Evaluating Intracranial Brain Responses to Naturalistic Stimuli
par: Zahorodnii, Andrii, et autres
Publié: (2025)
par: Zahorodnii, Andrii, et autres
Publié: (2025)
Softmax Attention with Constant Cost per Token
par: Heinsen, Franz A.
Publié: (2024)
par: Heinsen, Franz A.
Publié: (2024)
An Assessment of Model-On-Model Deception
par: Heitkoetter, Julius, et autres
Publié: (2024)
par: Heitkoetter, Julius, et autres
Publié: (2024)
Approximation Theory for Lipschitz Continuous Transformers
par: Furuya, Takashi, et autres
Publié: (2026)
par: Furuya, Takashi, et autres
Publié: (2026)
An Efficient Global Optimization Algorithm with Adaptive Estimates of the Local Lipschitz Constants
par: D'Agostino, Danny
Publié: (2022)
par: D'Agostino, Danny
Publié: (2022)
ExLipBaB: Exact Lipschitz Constant Computation for Piecewise Linear Neural Networks
par: Splittgerber, Tom A.
Publié: (2026)
par: Splittgerber, Tom A.
Publié: (2026)
Adaptive Length Image Tokenization via Recurrent Allocation
par: Duggal, Shivam, et autres
Publié: (2024)
par: Duggal, Shivam, et autres
Publié: (2024)
Fairness Aware Reward Optimization
par: Choi, Ching Lam, et autres
Publié: (2026)
par: Choi, Ching Lam, et autres
Publié: (2026)
Estimating Neural Network Robustness via Lipschitz Constant and Architecture Sensitivity
par: Abuduweili, Abulikemu, et autres
Publié: (2024)
par: Abuduweili, Abulikemu, et autres
Publié: (2024)
ECLipsE: Efficient Compositional Lipschitz Constant Estimation for Deep Neural Networks
par: Xu, Yuezhu, et autres
Publié: (2024)
par: Xu, Yuezhu, et autres
Publié: (2024)
Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models
par: Gupta, Sharut, et autres
Publié: (2025)
par: Gupta, Sharut, et autres
Publié: (2025)
Personalized Representation from Personalized Generation
par: Sundaram, Shobhita, et autres
Publié: (2024)
par: Sundaram, Shobhita, et autres
Publié: (2024)
A Spectral Condition for Feature Learning
par: Yang, Greg, et autres
Publié: (2023)
par: Yang, Greg, et autres
Publié: (2023)
The Platonic Representation Hypothesis
par: Huh, Minyoung, et autres
Publié: (2024)
par: Huh, Minyoung, et autres
Publié: (2024)
End-to-End Training for Unified Tokenization and Latent Denoising
par: Duggal, Shivam, et autres
Publié: (2026)
par: Duggal, Shivam, et autres
Publié: (2026)
Local Lipschitz Constant Computation of ReLU-FNNs: Upper Bound Computation with Exactness Verification
par: Ebihara, Yoshio, et autres
Publié: (2023)
par: Ebihara, Yoshio, et autres
Publié: (2023)
Single-pass Adaptive Image Tokenization for Minimum Program Search
par: Duggal, Shivam, et autres
Publié: (2025)
par: Duggal, Shivam, et autres
Publié: (2025)
Non-Uniform Memory Sampling in Experience Replay
par: Krutsylo, Andrii
Publié: (2025)
par: Krutsylo, Andrii
Publié: (2025)
Kolmogorov Complexity Bounds for LLM Steganography and a Perplexity-Based Detection Proxy
par: Shportko, Andrii
Publié: (2026)
par: Shportko, Andrii
Publié: (2026)
Enforcing convex constraints in Graph Neural Networks
par: Rashwan, Ahmed, et autres
Publié: (2025)
par: Rashwan, Ahmed, et autres
Publié: (2025)
Lipschitz Constant Meets Condition Number: Learning Robust and Compact Deep Neural Networks
par: Feng, Yangqi, et autres
Publié: (2025)
par: Feng, Yangqi, et autres
Publié: (2025)
Step by Step: Adaptive Gradient Descent for Training L-Lipschitz Neural Networks
par: Sung, Kyle, et autres
Publié: (2025)
par: Sung, Kyle, et autres
Publié: (2025)
Auditing and Enforcing Conditional Fairness via Optimal Transport
par: Ghassemi, Mohsen, et autres
Publié: (2024)
par: Ghassemi, Mohsen, et autres
Publié: (2024)
Documents similaires
-
Old Optimizer, New Norm: An Anthology
par: Bernstein, Jeremy, et autres
Publié: (2024) -
Modular Duality in Deep Learning
par: Bernstein, Jeremy, et autres
Publié: (2024) -
Improving World Models using Deep Supervision with Linear Probes
par: Zahorodnii, Andrii
Publié: (2025) -
Training Neural Networks from Scratch with Parallel Low-Rank Adapters
par: Huh, Minyoung, et autres
Publié: (2024) -
Scalable Optimization in the Modular Norm
par: Large, Tim, et autres
Publié: (2024)