Distributional Surgery for Language Model Activations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nguyen, Bao, Nguyen, Binh, Nguyen, Duy, Nguyen, Viet Anh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Task-driven Layerwise Additive Activation Intervention
par: Nguyen, Hieu Trung, et autres
Publié: (2025)
par: Nguyen, Hieu Trung, et autres
Publié: (2025)
Provably data-driven projection method for quadratic programming
par: Nguyen, Anh Tuan, et autres
Publié: (2025)
par: Nguyen, Anh Tuan, et autres
Publié: (2025)
Coverage-Validity-Aware Algorithmic Recourse
par: Bui, Ngoc, et autres
Publié: (2023)
par: Bui, Ngoc, et autres
Publié: (2023)
SCOPE: Spectral Concentration by Distributionally Robust Joint Covariance-Precision Estimation
par: Chen, Renjie, et autres
Publié: (2025)
par: Chen, Renjie, et autres
Publié: (2025)
A Geometric Unification of Distributionally Robust Covariance Estimators: Shrinking the Spectrum by Inflating the Ambiguity Set
par: Yue, Man-Chung, et autres
Publié: (2024)
par: Yue, Man-Chung, et autres
Publié: (2024)
Wasserstein Distributionally Robust Optimization: Theory and Applications in Machine Learning
par: Kuhn, Daniel, et autres
Publié: (2019)
par: Kuhn, Daniel, et autres
Publié: (2019)
Selective Ambulance Dispatch Under Contextual Travel-Time Uncertainty
par: Lin, Zikun, et autres
Publié: (2026)
par: Lin, Zikun, et autres
Publié: (2026)
Bellman Optimal Stepsize Straightening of Flow-Matching Models
par: Nguyen, Bao, et autres
Publié: (2023)
par: Nguyen, Bao, et autres
Publié: (2023)
Structured Pruning for Diverse Best-of-N Reasoning Optimization
par: Nguyen, Hieu Trung, et autres
Publié: (2025)
par: Nguyen, Hieu Trung, et autres
Publié: (2025)
A Hyper-Transformer model for Controllable Pareto Front Learning with Split Feasibility Constraints
par: Tuan, Tran Anh, et autres
Publié: (2024)
par: Tuan, Tran Anh, et autres
Publié: (2024)
HUANet: Hard-Constrained Unrolled ADMM for Constrained Convex Optimization
par: Tran, Trinh, et autres
Publié: (2026)
par: Tran, Trinh, et autres
Publié: (2026)
Reasoning Planning for Language Models
par: Nguyen, Bao, et autres
Publié: (2025)
par: Nguyen, Bao, et autres
Publié: (2025)
Tight Robustness Certificates and Wasserstein Distributional Attacks for Deep Neural Networks
par: Le, Bach C., et autres
Publié: (2025)
par: Le, Bach C., et autres
Publié: (2025)
Does Continued Pretraining on a Learner Corpus Improve Automated Essay Scoring on English Proficiency Tests? Evidence from EFCAMDAT
par: Nguyen, Duy Anh
Publié: (2026)
par: Nguyen, Duy Anh
Publié: (2026)
Lean and Mean Adaptive Optimization via Subset-Norm and Subspace-Momentum with Convergence Guarantees
par: Nguyen, Thien Hang, et autres
Publié: (2024)
par: Nguyen, Thien Hang, et autres
Publié: (2024)
Proactive DP: A Multple Target Optimization Framework for DP-SGD
par: van Dijk, Marten, et autres
Publié: (2021)
par: van Dijk, Marten, et autres
Publié: (2021)
How to Set $β_1, β_2$ in Adam: An Online Learning Perspective
par: Nguyen, Quan
Publié: (2025)
par: Nguyen, Quan
Publié: (2025)
On Unbalanced Optimal Transport: Gradient Methods, Sparsity and Approximation Error
par: Nguyen, Quang Minh, et autres
Publié: (2022)
par: Nguyen, Quang Minh, et autres
Publié: (2022)
Generative Conditional Distributions by Neural (Entropic) Optimal Transport
par: Nguyen, Bao, et autres
Publié: (2024)
par: Nguyen, Bao, et autres
Publié: (2024)
Semidefinite Relaxations of the Gromov-Wasserstein Distance
par: Chen, Junyu, et autres
Publié: (2023)
par: Chen, Junyu, et autres
Publié: (2023)
Decentralized Federated Learning with Gradient Tracking over Time-Varying Directed Networks
par: Nguyen, Duong Thuy Anh, et autres
Publié: (2024)
par: Nguyen, Duong Thuy Anh, et autres
Publié: (2024)
Cost-Adaptive Recourse Recommendation by Adaptive Preference Elicitation
par: Nguyen, Duy, et autres
Publié: (2024)
par: Nguyen, Duy, et autres
Publié: (2024)
Adjusted Shuffling SARAH: Advancing Complexity Analysis via Dynamic Gradient Weighting
par: Nguyen, Duc Toan, et autres
Publié: (2025)
par: Nguyen, Duc Toan, et autres
Publié: (2025)
Gap Safe Screening Rules for Fast Training of Robust Support Vector Machines under Feature Noise
par: Nguyen, Tan-Hau, et autres
Publié: (2026)
par: Nguyen, Tan-Hau, et autres
Publié: (2026)
A Novel Approach in Solving Stochastic Generalized Linear Regression via Nonconvex Programming
par: Anh, Vu Duc, et autres
Publié: (2024)
par: Anh, Vu Duc, et autres
Publié: (2024)
Adaptive multi-gradient methods for quasiconvex vector optimization and applications to multi-task learning
par: Minh, Nguyen Anh, et autres
Publié: (2024)
par: Minh, Nguyen Anh, et autres
Publié: (2024)
Efficient Online Large-Margin Classification via Dual Certificates
par: Ho-Nguyen, Nam, et autres
Publié: (2025)
par: Ho-Nguyen, Nam, et autres
Publié: (2025)
Robustifying Conditional Portfolio Decisions via Optimal Transport
par: Nguyen, Viet Anh, et autres
Publié: (2021)
par: Nguyen, Viet Anh, et autres
Publié: (2021)
Optimizing Stochastic Gradient Push under Broadcast Communications
par: Nguyen, Tuan, et autres
Publié: (2026)
par: Nguyen, Tuan, et autres
Publié: (2026)
Controllable Expensive Multi-objective Learning with Warm-starting Bayesian Optimization
par: Nguyen, Quang-Huy, et autres
Publié: (2023)
par: Nguyen, Quang-Huy, et autres
Publié: (2023)
Boolean Variation and Boolean Logic BackPropagation
par: Nguyen, Van Minh
Publié: (2023)
par: Nguyen, Van Minh
Publié: (2023)
FSNet: Feasibility-Seeking Neural Network for Constrained Optimization with Guarantees
par: Nguyen, Hoang T., et autres
Publié: (2025)
par: Nguyen, Hoang T., et autres
Publié: (2025)
Nash Equilibrium and Minimax Theorems via Variational Tools of Convex Analysis
par: Bao, Nguyen Xuan Duy, et autres
Publié: (2024)
par: Bao, Nguyen Xuan Duy, et autres
Publié: (2024)
When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift
par: Le, Khoi, et autres
Publié: (2026)
par: Le, Khoi, et autres
Publié: (2026)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
par: Nguyen, Hieu Trung, et autres
Publié: (2026)
par: Nguyen, Hieu Trung, et autres
Publié: (2026)
Don't Read Everything: A Curvature-Conditioned Query for Linear Attention
par: Le, Dong, et autres
Publié: (2026)
par: Le, Dong, et autres
Publié: (2026)
VFOG: Variance-Reduced Fast Optimistic Gradient Methods for a Class of Nonmonotone Generalized Equations
par: Tran-Dinh, Quoc, et autres
Publié: (2025)
par: Tran-Dinh, Quoc, et autres
Publié: (2025)
Fréchet Regression on the Bures-Wasserstein Manifold
par: Nguyen, Duc Toan, et autres
Publié: (2026)
par: Nguyen, Duc Toan, et autres
Publié: (2026)
Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models
par: Kunstner, Frederik, et autres
Publié: (2024)
par: Kunstner, Frederik, et autres
Publié: (2024)
Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training
par: Liu, Hong, et autres
Publié: (2023)
par: Liu, Hong, et autres
Publié: (2023)
Documents similaires
-
Task-driven Layerwise Additive Activation Intervention
par: Nguyen, Hieu Trung, et autres
Publié: (2025) -
Provably data-driven projection method for quadratic programming
par: Nguyen, Anh Tuan, et autres
Publié: (2025) -
Coverage-Validity-Aware Algorithmic Recourse
par: Bui, Ngoc, et autres
Publié: (2023) -
SCOPE: Spectral Concentration by Distributionally Robust Joint Covariance-Precision Estimation
par: Chen, Renjie, et autres
Publié: (2025) -
A Geometric Unification of Distributionally Robust Covariance Estimators: Shrinking the Spectrum by Inflating the Ambiguity Set
par: Yue, Man-Chung, et autres
Publié: (2024)