FGGM: Fisher-Guided Gradient Masking for Continual Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tan, Chao-Hong, Chen, Qian, Wang, Wen, Ma, Yukun, Zhang, Chong, Deng, Chong, Zhang, Qinglin, Li, Xiangang, Ye, Jieping |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations
par: Tan, Chao-Hong, et autres
Publié: (2025)
par: Tan, Chao-Hong, et autres
Publié: (2025)
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
par: Chen, Qian, et autres
Publié: (2023)
par: Chen, Qian, et autres
Publié: (2023)
Exploring Gradient-Guided Masked Language Model to Detect Textual Adversarial Attacks
par: Zhang, Xiaomei, et autres
Publié: (2025)
par: Zhang, Xiaomei, et autres
Publié: (2025)
Fun-Audio-Chat Technical Report
par: Tongyi Fun Team, et autres
Publié: (2025)
par: Tongyi Fun Team, et autres
Publié: (2025)
Skip-Layer Attention: Bridging Abstract and Detailed Dependencies in Transformers
par: Chen, Qian, et autres
Publié: (2024)
par: Chen, Qian, et autres
Publié: (2024)
Fisher Mask Nodes for Language Model Merging
par: K, Thennal D, et autres
Publié: (2024)
par: K, Thennal D, et autres
Publié: (2024)
Learning to Evolve: Bayesian-Guided Continual Knowledge Graph Embedding
par: Li, Linyu, et autres
Publié: (2025)
par: Li, Linyu, et autres
Publié: (2025)
Unraveling Text Generation in LLMs: A Stochastic Differential Equation Approach
par: Zhang, Yukun
Publié: (2024)
par: Zhang, Yukun
Publié: (2024)
FisherMask: Enhancing Neural Network Labeling Efficiency in Image Classification Using Fisher Information
par: Gul, Shreen, et autres
Publié: (2024)
par: Gul, Shreen, et autres
Publié: (2024)
Knowledge Graph Large Language Model (KG-LLM) for Link Prediction
par: Shu, Dong, et autres
Publié: (2024)
par: Shu, Dong, et autres
Publié: (2024)
Functionality-Oriented LLM Merging on the Fisher--Rao Manifold
par: Wang, Jiayu, et autres
Publié: (2026)
par: Wang, Jiayu, et autres
Publié: (2026)
Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection
par: Sun, Guanglong, et autres
Publié: (2026)
par: Sun, Guanglong, et autres
Publié: (2026)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
par: Cheng, Yunfei, et autres
Publié: (2024)
par: Cheng, Yunfei, et autres
Publié: (2024)
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
par: Qin, Jiayu, et autres
Publié: (2025)
par: Qin, Jiayu, et autres
Publié: (2025)
Learning Granularity Representation for Temporal Knowledge Graph Completion
par: Zhang, Jinchuan, et autres
Publié: (2024)
par: Zhang, Jinchuan, et autres
Publié: (2024)
Joint Selection for Large-Scale Pre-Training Data via Policy Gradient-based Mask Learning
par: Fan, Ziqing, et autres
Publié: (2025)
par: Fan, Ziqing, et autres
Publié: (2025)
An Improved Empirical Fisher Approximation for Natural Gradient Descent
par: Wu, Xiaodong, et autres
Publié: (2024)
par: Wu, Xiaodong, et autres
Publié: (2024)
Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning
par: Yan, Shaotian, et autres
Publié: (2026)
par: Yan, Shaotian, et autres
Publié: (2026)
Attribution-Guided Masking for Robust Cross-Domain Sentiment Classification
par: Harkare, Shubham, et autres
Publié: (2026)
par: Harkare, Shubham, et autres
Publié: (2026)
Unveiling LLM Mechanisms Through Neural ODEs and Control Theory
par: Zhang, Yukun, et autres
Publié: (2024)
par: Zhang, Yukun, et autres
Publié: (2024)
Advancing vision-language models in front-end development via data synthesis
par: Ge, Tong, et autres
Publié: (2025)
par: Ge, Tong, et autres
Publié: (2025)
URRL-IMVC: Unified and Robust Representation Learning for Incomplete Multi-View Clustering
par: Teng, Ge, et autres
Publié: (2024)
par: Teng, Ge, et autres
Publié: (2024)
SAC-KG: Exploiting Large Language Models as Skilled Automatic Constructors for Domain Knowledge Graphs
par: Chen, Hanzhu, et autres
Publié: (2024)
par: Chen, Hanzhu, et autres
Publié: (2024)
Mask-Enhanced Autoregressive Prediction: Pay Less Attention to Learn More
par: Zhuang, Xialie, et autres
Publié: (2025)
par: Zhuang, Xialie, et autres
Publié: (2025)
Scaling up Masked Diffusion Models on Text
par: Nie, Shen, et autres
Publié: (2024)
par: Nie, Shen, et autres
Publié: (2024)
Masked Thought: Simply Masking Partial Reasoning Steps Can Improve Mathematical Reasoning Learning of Language Models
par: Chen, Changyu, et autres
Publié: (2024)
par: Chen, Changyu, et autres
Publié: (2024)
ReaGAN: Node-as-Agent-Reasoning Graph Agentic Network
par: Guo, Minghao, et autres
Publié: (2025)
par: Guo, Minghao, et autres
Publié: (2025)
ROPO: Robust Preference Optimization for Large Language Models
par: Liang, Xize, et autres
Publié: (2024)
par: Liang, Xize, et autres
Publié: (2024)
Continuous-Time Attention: PDE-Guided Mechanisms for Long-Sequence Transformers
par: Zhang, Yukun, et autres
Publié: (2025)
par: Zhang, Yukun, et autres
Publié: (2025)
Guided Sketch-Based Program Induction by Search Gradients
par: Amin, Ahmad Ayaz
Publié: (2024)
par: Amin, Ahmad Ayaz
Publié: (2024)
Recording for Eyes, Not Echoing to Ears: Contextualized Spoken-to-Written Conversion of ASR Transcripts
par: Liu, Jiaqing, et autres
Publié: (2024)
par: Liu, Jiaqing, et autres
Publié: (2024)
Fisher-Orthogonal Projected Natural Gradient Descent for Continual Learning
par: Garg, Ishir, et autres
Publié: (2026)
par: Garg, Ishir, et autres
Publié: (2026)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
par: Wu, Jinyang, et autres
Publié: (2025)
par: Wu, Jinyang, et autres
Publié: (2025)
Reconsidering Positional Supervision in Masked Diffusion Language Model Training
par: Ye, Mengyu, et autres
Publié: (2026)
par: Ye, Mengyu, et autres
Publié: (2026)
DPCL-Diff: The Temporal Knowledge Graph Reasoning Based on Graph Node Diffusion Model with Dual-Domain Periodic Contrastive Learning
par: Cao, Yukun, et autres
Publié: (2024)
par: Cao, Yukun, et autres
Publié: (2024)
Test-Time Learning for Large Language Models
par: Hu, Jinwu, et autres
Publié: (2025)
par: Hu, Jinwu, et autres
Publié: (2025)
FLoE: Fisher-Based Layer Selection for Efficient Sparse Adaptation of Low-Rank Experts
par: Wang, Xinyi, et autres
Publié: (2025)
par: Wang, Xinyi, et autres
Publié: (2025)
Understanding Structured Financial Data with LLMs: A Case Study on Fraud Detection
par: Tan, Xuwei, et autres
Publié: (2025)
par: Tan, Xuwei, et autres
Publié: (2025)
ToolFactory: Automating Tool Generation by Leveraging LLM to Understand REST API Documentations
par: Ni, Xinyi, et autres
Publié: (2025)
par: Ni, Xinyi, et autres
Publié: (2025)
Guess & Sketch: Language Model Guided Transpilation
par: Lee, Celine, et autres
Publié: (2023)
par: Lee, Celine, et autres
Publié: (2023)
Documents similaires
-
DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations
par: Tan, Chao-Hong, et autres
Publié: (2025) -
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
par: Chen, Qian, et autres
Publié: (2023) -
Exploring Gradient-Guided Masked Language Model to Detect Textual Adversarial Attacks
par: Zhang, Xiaomei, et autres
Publié: (2025) -
Fun-Audio-Chat Technical Report
par: Tongyi Fun Team, et autres
Publié: (2025) -
Skip-Layer Attention: Bridging Abstract and Detailed Dependencies in Transformers
par: Chen, Qian, et autres
Publié: (2024)