Sparse Gradient Compression for Fine-Tuning Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, David H., Amiri, Mohammad Mohammadi, Pedapati, Tejaswini, Chaudhury, Subhajit, Chen, Pin-Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
di: Yang, David H., et al.
Pubblicazione: (2026)
di: Yang, David H., et al.
Pubblicazione: (2026)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
Large Language Models can be Strong Self-Detoxifiers
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024)
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024)
From PEFT to DEFT: Parameter Efficient Finetuning for Reducing Activation Density in Transformers
di: Runwal, Bharat, et al.
Pubblicazione: (2024)
di: Runwal, Bharat, et al.
Pubblicazione: (2024)
Differentiable Prompt Learning for Vision Language Models
di: Huang, Zhenhan, et al.
Pubblicazione: (2024)
di: Huang, Zhenhan, et al.
Pubblicazione: (2024)
Intermediate Representations are Strong AI-Generated Image Detectors
di: Huang, Zhenhan, et al.
Pubblicazione: (2026)
di: Huang, Zhenhan, et al.
Pubblicazione: (2026)
Graph is all you need? Lightweight data-agnostic neural architecture search without training
di: Huang, Zhenhan, et al.
Pubblicazione: (2024)
di: Huang, Zhenhan, et al.
Pubblicazione: (2024)
NeuroPrune: A Neuro-inspired Topological Sparse Training Algorithm for Large Language Models
di: Dhurandhar, Amit, et al.
Pubblicazione: (2024)
di: Dhurandhar, Amit, et al.
Pubblicazione: (2024)
Large Language Model Confidence Estimation via Black-Box Access
di: Pedapati, Tejaswini, et al.
Pubblicazione: (2024)
di: Pedapati, Tejaswini, et al.
Pubblicazione: (2024)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
di: Asif, Sadia, et al.
Pubblicazione: (2026)
di: Asif, Sadia, et al.
Pubblicazione: (2026)
Toward Efficient Influence Function: Dropout as a Compression Tool
di: Zhang, Yuchen, et al.
Pubblicazione: (2025)
di: Zhang, Yuchen, et al.
Pubblicazione: (2025)
TabSketchFM: Sketch-based Tabular Representation Learning for Data Discovery over Data Lakes
di: Khatiwada, Aamod, et al.
Pubblicazione: (2024)
di: Khatiwada, Aamod, et al.
Pubblicazione: (2024)
STAR: Spectral Truncation and Rescale for Model Merging
di: Lee, Yu-Ang, et al.
Pubblicazione: (2025)
di: Lee, Yu-Ang, et al.
Pubblicazione: (2025)
Needle in the Haystack for Memory Based Large Language Models
di: Nelson, Elliot, et al.
Pubblicazione: (2024)
di: Nelson, Elliot, et al.
Pubblicazione: (2024)
Larimar: Large Language Models with Episodic Memory Control
di: Das, Payel, et al.
Pubblicazione: (2024)
di: Das, Payel, et al.
Pubblicazione: (2024)
Scaling Sparse Fine-Tuning to Large Language Models
di: Ansell, Alan, et al.
Pubblicazione: (2024)
di: Ansell, Alan, et al.
Pubblicazione: (2024)
Modular Prompt Learning Improves Vision-Language Models
di: Huang, Zhenhan, et al.
Pubblicazione: (2025)
di: Huang, Zhenhan, et al.
Pubblicazione: (2025)
GAST: Gradient-aligned Sparse Tuning of Large Language Models with Data-layer Selection
di: Yao, Kai, et al.
Pubblicazione: (2026)
di: Yao, Kai, et al.
Pubblicazione: (2026)
Mitigating Gradient Bias in Multi-objective Learning: A Provably Convergent Stochastic Approach
di: Fernando, Heshan, et al.
Pubblicazione: (2022)
di: Fernando, Heshan, et al.
Pubblicazione: (2022)
Reinforcement Learning Fine-Tunes a Sparse Subnetwork in Large Language Models
di: Balashov, Andrii
Pubblicazione: (2025)
di: Balashov, Andrii
Pubblicazione: (2025)
TuneComp: Joint Fine-tuning and Compression for Large Foundation Models
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
di: Chen, Pin-Yu, et al.
Pubblicazione: (2025)
di: Chen, Pin-Yu, et al.
Pubblicazione: (2025)
Generation Constraint Scaling Can Mitigate Hallucination
di: Kollias, Georgios, et al.
Pubblicazione: (2024)
di: Kollias, Georgios, et al.
Pubblicazione: (2024)
Towards Reversible Model Merging For Low-rank Weights
di: Alipour, Mohammadsajad, et al.
Pubblicazione: (2025)
di: Alipour, Mohammadsajad, et al.
Pubblicazione: (2025)
Smooth Model Compression without Fine-Tuning
di: Runkel, Christina, et al.
Pubblicazione: (2025)
di: Runkel, Christina, et al.
Pubblicazione: (2025)
Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models
di: Zong, Yongshuo, et al.
Pubblicazione: (2024)
di: Zong, Yongshuo, et al.
Pubblicazione: (2024)
Optimal Singular Damage: Efficient LLM Inference in Low Storage Regimes
di: Alipour, Mohammadsajad, et al.
Pubblicazione: (2025)
di: Alipour, Mohammadsajad, et al.
Pubblicazione: (2025)
Information-Theoretic Privacy Control for Sequential Multi-Agent LLM Systems
di: Asif, Sadia, et al.
Pubblicazione: (2026)
di: Asif, Sadia, et al.
Pubblicazione: (2026)
Disentangled Structural and Featural Representation for Task-Agnostic Graph Valuation
di: Falahati, Ali, et al.
Pubblicazione: (2024)
di: Falahati, Ali, et al.
Pubblicazione: (2024)
Dissecting Fine-Tuning Unlearning in Large Language Models
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
Can Memory-Augmented Language Models Generalize on Reasoning-in-a-Haystack Tasks?
di: Das, Payel, et al.
Pubblicazione: (2025)
di: Das, Payel, et al.
Pubblicazione: (2025)
Model Reprogramming Outperforms Fine-tuning on Out-of-distribution Data in Text-Image Encoders
di: Geng, Andrew, et al.
Pubblicazione: (2024)
di: Geng, Andrew, et al.
Pubblicazione: (2024)
Sparse Layer Sharpness-Aware Minimization for Efficient Fine-Tuning
di: Cheng, Yifei, et al.
Pubblicazione: (2026)
di: Cheng, Yifei, et al.
Pubblicazione: (2026)
CoFrNets: Interpretable Neural Architecture Inspired by Continued Fractions
di: Puri, Isha, et al.
Pubblicazione: (2025)
di: Puri, Isha, et al.
Pubblicazione: (2025)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Resource-Efficient Federated Fine-Tuning Large Language Models for Heterogeneous Data
di: Liu, Jun, et al.
Pubblicazione: (2025)
di: Liu, Jun, et al.
Pubblicazione: (2025)
DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control
di: Yu, Chenbo
Pubblicazione: (2026)
di: Yu, Chenbo
Pubblicazione: (2026)
Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence
di: Nguyen, Quoc Minh, et al.
Pubblicazione: (2026)
di: Nguyen, Quoc Minh, et al.
Pubblicazione: (2026)
Differentially Private Subspace Fine-Tuning for Large Language Models
di: Zheng, Lele, et al.
Pubblicazione: (2026)
di: Zheng, Lele, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
di: Yang, David H., et al.
Pubblicazione: (2026) -
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025) -
Large Language Models can be Strong Self-Detoxifiers
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024) -
From PEFT to DEFT: Parameter Efficient Finetuning for Reducing Activation Density in Transformers
di: Runwal, Bharat, et al.
Pubblicazione: (2024) -
Differentiable Prompt Learning for Vision Language Models
di: Huang, Zhenhan, et al.
Pubblicazione: (2024)