Hessian of Perplexity for Large Language Models by PyTorch autograd (Open Source)
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Ilin, Ivan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A resource-efficient model for deep kernel learning
par: D'Amore, Luisa
Publié: (2024)
par: D'Amore, Luisa
Publié: (2024)
Hybrid Least Squares/Gradient Descent Methods for DeepONets
par: Choi, Jun, et autres
Publié: (2025)
par: Choi, Jun, et autres
Publié: (2025)
Bare-Metal Tensor Virtualization: Overcoming the Memory Wall in Edge-AI Inference on ARM64
par: Kilictas, Bugra, et autres
Publié: (2026)
par: Kilictas, Bugra, et autres
Publié: (2026)
Randomized Matrix Sketching for Neural Network Training and Gradient Monitoring
par: Antil, Harbir, et autres
Publié: (2025)
par: Antil, Harbir, et autres
Publié: (2025)
Layer-Parallel Training for Transformers
par: Jiang, Shuai, et autres
Publié: (2026)
par: Jiang, Shuai, et autres
Publié: (2026)
A Low-complexity Structured Neural Network to Realize States of Dynamical Systems
par: Aluvihare, Hansaka, et autres
Publié: (2025)
par: Aluvihare, Hansaka, et autres
Publié: (2025)
Deep Unfolding Network for Nonlinear Multi-Frequency Electrical Impedance Tomography
par: Alberti, Giovanni S., et autres
Publié: (2025)
par: Alberti, Giovanni S., et autres
Publié: (2025)
Multilevel Training for Kolmogorov Arnold Networks
par: Southworth, Ben S., et autres
Publié: (2026)
par: Southworth, Ben S., et autres
Publié: (2026)
Approximation of the Proximal Operator of the $\ell_\infty$ Norm Using a Neural Network
par: Linehan, Kathryn, et autres
Publié: (2024)
par: Linehan, Kathryn, et autres
Publié: (2024)
Recent Advances in Non-convex Smoothness Conditions and Applicability to Deep Linear Neural Networks
par: Patel, Vivak, et autres
Publié: (2024)
par: Patel, Vivak, et autres
Publié: (2024)
To be or not to be stable, that is the question: understanding neural networks for inverse problems
par: Evangelista, Davide, et autres
Publié: (2022)
par: Evangelista, Davide, et autres
Publié: (2022)
Space-time parallel scaling of Parareal with a physics-informed Fourier Neural Operator coarse propagator applied to the Black-Scholes equation
par: Ibrahim, Abdul Qadir, et autres
Publié: (2024)
par: Ibrahim, Abdul Qadir, et autres
Publié: (2024)
Randomized Forward Mode of Automatic Differentiation For Optimization Algorithms
par: Shukla, Khemraj, et autres
Publié: (2023)
par: Shukla, Khemraj, et autres
Publié: (2023)
Learning Nonlinear Finite Element Solution Operators using Multilayer Perceptrons and Energy Minimization
par: Larson, Mats G., et autres
Publié: (2024)
par: Larson, Mats G., et autres
Publié: (2024)
A network based approach for unbalanced optimal transport on surfaces
par: Pan, Jiangong, et autres
Publié: (2024)
par: Pan, Jiangong, et autres
Publié: (2024)
Approximation and Gradient Descent Training with Neural Networks
par: Welper, G.
Publié: (2024)
par: Welper, G.
Publié: (2024)
Neural-network methods for two-dimensional finite-source reflector design
par: Hacking, Roel, et autres
Publié: (2026)
par: Hacking, Roel, et autres
Publié: (2026)
RandNet-Parareal: a time-parallel PDE solver using Random Neural Networks
par: Gattiglio, Guglielmo, et autres
Publié: (2024)
par: Gattiglio, Guglielmo, et autres
Publié: (2024)
Objective Value Change and Shape-Based Accelerated Optimization for the Neural Network Approximation
par: Xie, Pengcheng, et autres
Publié: (2025)
par: Xie, Pengcheng, et autres
Publié: (2025)
Progressive Power Homotopy for Non-convex Optimization
par: Xu, Chen
Publié: (2026)
par: Xu, Chen
Publié: (2026)
Kourkoutas-Beta: A Sunspike-Driven Adam Optimizer with Desert Flair
par: Kassinos, Stavros C.
Publié: (2025)
par: Kassinos, Stavros C.
Publié: (2025)
Neural Preconditioning via Krylov Subspace Geometry
par: Dimola, Nunzio, et autres
Publié: (2025)
par: Dimola, Nunzio, et autres
Publié: (2025)
The Pontryagin Maximum Principle for Training Convolutional Neural Networks
par: Hofmann, Sebastian, et autres
Publié: (2025)
par: Hofmann, Sebastian, et autres
Publié: (2025)
Inter-Layer Hessian Analysis of Neural Networks with DAG Architectures
par: Bolshim, Maxim, et autres
Publié: (2026)
par: Bolshim, Maxim, et autres
Publié: (2026)
Local properties of neural networks through the lens of layer-wise Hessians
par: Bolshim, Maxim, et autres
Publié: (2025)
par: Bolshim, Maxim, et autres
Publié: (2025)
Stochastic Estimation of the Layer-wise Hessian Trace for Monitoring Neural-network Training
par: Bolshim, Maxim, et autres
Publié: (2026)
par: Bolshim, Maxim, et autres
Publié: (2026)
Derivative-Informed Fourier Neural Operator: Universal Approximation and Applications to PDE-Constrained Optimization
par: Yao, Boyuan, et autres
Publié: (2025)
par: Yao, Boyuan, et autres
Publié: (2025)
High-performance matrix-free unfitted finite element operator evaluation
par: Bergbauer, Maximilian, et autres
Publié: (2024)
par: Bergbauer, Maximilian, et autres
Publié: (2024)
Matrix-Free Evaluation of High-Order Shifted Boundary Finite Element Operators
par: Wichrowski, Michał
Publié: (2025)
par: Wichrowski, Michał
Publié: (2025)
Polyharmonic Cascade
par: Bakhvalov, Yuriy N.
Publié: (2025)
par: Bakhvalov, Yuriy N.
Publié: (2025)
SplInterp: Improving our Understanding and Training of Sparse Autoencoders
par: Budd, Jeremy, et autres
Publié: (2025)
par: Budd, Jeremy, et autres
Publié: (2025)
PETScML: Second-order solvers for training regression problems in Scientific Machine Learning
par: Zampini, Stefano, et autres
Publié: (2024)
par: Zampini, Stefano, et autres
Publié: (2024)
A Judge Agent Closes the Reliability Gap in AI-Generated Scientific Simulation
par: Yang, Chengshuai
Publié: (2026)
par: Yang, Chengshuai
Publié: (2026)
Sequential Least-Squares Estimators with Fast Randomized Sketching for Linear Statistical Models
par: Chen, Guan-Yu, et autres
Publié: (2025)
par: Chen, Guan-Yu, et autres
Publié: (2025)
Improving Matrix Exponential for Generative AI Flows: A Taylor-Based Approach Beyond Paterson--Stockmeyer
par: Sastre, Jorge, et autres
Publié: (2025)
par: Sastre, Jorge, et autres
Publié: (2025)
A Neumann-Neumann Acceleration with Coarse Space for Domain Decomposition of Extreme Learning Machines
par: Lee, Chang-Ock, et autres
Publié: (2025)
par: Lee, Chang-Ock, et autres
Publié: (2025)
Parallel-in-time Multilevel Krylov Methods: A Prototype
par: Erlangga, Yogi A.
Publié: (2023)
par: Erlangga, Yogi A.
Publié: (2023)
Self2Seg: Single-Image Self-Supervised Joint Segmentation and Denoising
par: Gruber, Nadja, et autres
Publié: (2023)
par: Gruber, Nadja, et autres
Publié: (2023)
Neural Network-Based Parameter Estimation for Non-Autonomous Differential Equations with Discontinuous Signals
par: Jo, Hyeontae, et autres
Publié: (2025)
par: Jo, Hyeontae, et autres
Publié: (2025)
SDFs from Unoriented Point Clouds using Neural Variational Heat Distances
par: Weidemaier, Samuel, et autres
Publié: (2025)
par: Weidemaier, Samuel, et autres
Publié: (2025)
Documents similaires
-
A resource-efficient model for deep kernel learning
par: D'Amore, Luisa
Publié: (2024) -
Hybrid Least Squares/Gradient Descent Methods for DeepONets
par: Choi, Jun, et autres
Publié: (2025) -
Bare-Metal Tensor Virtualization: Overcoming the Memory Wall in Edge-AI Inference on ARM64
par: Kilictas, Bugra, et autres
Publié: (2026) -
Randomized Matrix Sketching for Neural Network Training and Gradient Monitoring
par: Antil, Harbir, et autres
Publié: (2025) -
Layer-Parallel Training for Transformers
par: Jiang, Shuai, et autres
Publié: (2026)