Memory-Efficient Gradient Unrolling for Large-Scale Bi-level Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Qianli, Wang, Yezhen, Yang, Zhouhao, Li, Xiang, Wang, Haonan, Zhang, Yang, Scarlett, Jonathan, Zhu, Zhanxing, Kawaguchi, Kenji |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LoReUn: Data Itself Implicitly Provides Cues to Improve Machine Unlearning
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
The Stronger the Diffusion Model, the Easier the Backdoor: Data Poisoning to Induce Copyright Breaches Without Adjusting Finetuning Pipeline
par: Wang, Haonan, et autres
Publié: (2024)
par: Wang, Haonan, et autres
Publié: (2024)
Memory-Efficient LLM Training by Various-Grained Low-Rank Projection of Gradients
par: Wang, Yezhen, et autres
Publié: (2025)
par: Wang, Yezhen, et autres
Publié: (2025)
VA3: Virtually Assured Amplification Attack on Probabilistic Copyright Protection for Text-to-Image Generative Models
par: Li, Xiang, et autres
Publié: (2023)
par: Li, Xiang, et autres
Publié: (2023)
FilDeep: Learning Large Deformations of Elastic-Plastic Solids with Multi-Fidelity Data
par: Tang, Jianheng, et autres
Publié: (2026)
par: Tang, Jianheng, et autres
Publié: (2026)
Efficient Linear Attention for Multivariate Time Series Modeling via Entropy Equality
par: Zhang, Mingtao, et autres
Publié: (2025)
par: Zhang, Mingtao, et autres
Publié: (2025)
SeedPrints: Fingerprints Can Even Tell Which Seed Your Large Language Model Was Trained From
par: Tong, Yao, et autres
Publié: (2025)
par: Tong, Yao, et autres
Publié: (2025)
Knowledge Distillation in Wide Neural Networks: Risk Bound, Data Efficiency and Imperfect Teacher
par: Ji, Guangda, et autres
Publié: (2020)
par: Ji, Guangda, et autres
Publié: (2020)
On Copyright Risks of Text-to-Image Diffusion Models
par: Zhang, Yang, et autres
Publié: (2023)
par: Zhang, Yang, et autres
Publié: (2023)
PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention
par: Wang, Haonan, et autres
Publié: (2025)
par: Wang, Haonan, et autres
Publié: (2025)
Backward-Friendly Optimization: Training Large Language Models with Approximate Gradients under Memory Constraints
par: Yang, Jing, et autres
Publié: (2025)
par: Yang, Jing, et autres
Publié: (2025)
MAVEN: A Mesh-Aware Volumetric Encoding Network for Simulating 3D Flexible Deformation
par: Feng, Zhe, et autres
Publié: (2026)
par: Feng, Zhe, et autres
Publié: (2026)
Auto-Unrolled Proximal Gradient Descent: An AutoML Approach to Interpretable Waveform Optimization
par: Kaplan, Ahmet
Publié: (2026)
par: Kaplan, Ahmet
Publié: (2026)
Advancing Multimodal Teacher Sentiment Analysis:The Large-Scale T-MED Dataset & The Effective AAM-TSA Model
par: Duan, Zhiyi, et autres
Publié: (2025)
par: Duan, Zhiyi, et autres
Publié: (2025)
BEAM: Bi-level Memory-adaptive Algorithmic Evolution for LLM-Powered Heuristic Design
par: Xiang, Chuyang, et autres
Publié: (2026)
par: Xiang, Chuyang, et autres
Publié: (2026)
Efficient Agent: Optimizing Planning Capability for Multimodal Retrieval Augmented Generation
par: Wang, Yuechen, et autres
Publié: (2025)
par: Wang, Yuechen, et autres
Publié: (2025)
Initialization is Half the Battle: Generating Diverse Images from a Guidance Potential Posterior
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
Clustering Inductive Biases with Unrolled Networks
par: Huml, Jonathan, et autres
Publié: (2023)
par: Huml, Jonathan, et autres
Publié: (2023)
Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
par: Wang, Yilong, et autres
Publié: (2026)
par: Wang, Yilong, et autres
Publié: (2026)
Bi-level Mean Field: Dynamic Grouping for Large-Scale MARL
par: Zheng, Yuxuan, et autres
Publié: (2025)
par: Zheng, Yuxuan, et autres
Publié: (2025)
AdaMergeX: Cross-Lingual Transfer with Large Language Models via Adaptive Adapter Merging
par: Zhao, Yiran, et autres
Publié: (2024)
par: Zhao, Yiran, et autres
Publié: (2024)
ViTE: Virtual Graph Trajectory Expert Router for Pedestrian Trajectory Prediction
par: Li, Ruochen, et autres
Publié: (2025)
par: Li, Ruochen, et autres
Publié: (2025)
LLM Data Selection and Utilization via Dynamic Bi-level Optimization
par: Yu, Yang, et autres
Publié: (2025)
par: Yu, Yang, et autres
Publié: (2025)
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
par: He, Yang, et autres
Publié: (2026)
par: He, Yang, et autres
Publié: (2026)
DISCO: Efficient Diffusion Solver for Large-Scale Combinatorial Optimization Problems
par: Zhao, Hang, et autres
Publié: (2024)
par: Zhao, Hang, et autres
Publié: (2024)
$δ$-mem: Efficient Online Memory for Large Language Models
par: Lei, Jingdi, et autres
Publié: (2026)
par: Lei, Jingdi, et autres
Publié: (2026)
FrontierOR: Benchmarking LLMs' Capacity for Efficient Algorithm Design in Large-Scale Optimization
par: Kong, Minwei, et autres
Publié: (2026)
par: Kong, Minwei, et autres
Publié: (2026)
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
par: Zhao, Yang, et autres
Publié: (2026)
par: Zhao, Yang, et autres
Publié: (2026)
Deep Learning-Enhanced Preconditioning for Efficient Conjugate Gradient Solvers in Large-Scale PDE Systems
par: Li, Rui, et autres
Publié: (2024)
par: Li, Rui, et autres
Publié: (2024)
iScheduler: Reinforcement Learning-Driven Continual Optimization for Large-Scale Resource Investment Problems
par: Hu, Yi-Xiang, et autres
Publié: (2026)
par: Hu, Yi-Xiang, et autres
Publié: (2026)
Fostering Video Reasoning via Next-Event Prediction
par: Wang, Haonan, et autres
Publié: (2025)
par: Wang, Haonan, et autres
Publié: (2025)
An Adaptive Differentially Private Federated Learning Framework with Bi-level Optimization
par: Wang, Jin, et autres
Publié: (2026)
par: Wang, Jin, et autres
Publié: (2026)
Unrolling Dynamic Programming via Graph Filters
par: Rozada, Sergio, et autres
Publié: (2025)
par: Rozada, Sergio, et autres
Publié: (2025)
How do Large Language Models Handle Multilingualism?
par: Zhao, Yiran, et autres
Publié: (2024)
par: Zhao, Yiran, et autres
Publié: (2024)
LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
par: He, Zifan, et autres
Publié: (2025)
par: He, Zifan, et autres
Publié: (2025)
Pruning General Large Language Models into Customized Expert Models
par: Zhao, Yirao, et autres
Publié: (2025)
par: Zhao, Yirao, et autres
Publié: (2025)
Efficient Diffusion as Low Light Enhancer
par: Lan, Guanzhou, et autres
Publié: (2024)
par: Lan, Guanzhou, et autres
Publié: (2024)
Variational Learning of Gaussian Process Latent Variable Models through Stochastic Gradient Annealed Importance Sampling
par: Xu, Jian, et autres
Publié: (2024)
par: Xu, Jian, et autres
Publié: (2024)
Statistical Mean Estimation with Coded Relayed Observations
par: Ling, Yan Hao, et autres
Publié: (2025)
par: Ling, Yan Hao, et autres
Publié: (2025)
Documents similaires
-
LoReUn: Data Itself Implicitly Provides Cues to Improve Machine Unlearning
par: Li, Xiang, et autres
Publié: (2025) -
The Stronger the Diffusion Model, the Easier the Backdoor: Data Poisoning to Induce Copyright Breaches Without Adjusting Finetuning Pipeline
par: Wang, Haonan, et autres
Publié: (2024) -
Memory-Efficient LLM Training by Various-Grained Low-Rank Projection of Gradients
par: Wang, Yezhen, et autres
Publié: (2025) -
VA3: Virtually Assured Amplification Attack on Probabilistic Copyright Protection for Text-to-Image Generative Models
par: Li, Xiang, et autres
Publié: (2023) -
FilDeep: Learning Large Deformations of Elastic-Plastic Solids with Multi-Fidelity Data
par: Tang, Jianheng, et autres
Publié: (2026)