FGGM: Fisher-Guided Gradient Masking for Continual Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Tan, Chao-Hong, Chen, Qian, Wang, Wen, Ma, Yukun, Zhang, Chong, Deng, Chong, Zhang, Qinglin, Li, Xiangang, Ye, Jieping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations
di: Tan, Chao-Hong, et al.
Pubblicazione: (2025)
di: Tan, Chao-Hong, et al.
Pubblicazione: (2025)
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
di: Chen, Qian, et al.
Pubblicazione: (2023)
di: Chen, Qian, et al.
Pubblicazione: (2023)
Exploring Gradient-Guided Masked Language Model to Detect Textual Adversarial Attacks
di: Zhang, Xiaomei, et al.
Pubblicazione: (2025)
di: Zhang, Xiaomei, et al.
Pubblicazione: (2025)
Fun-Audio-Chat Technical Report
di: Tongyi Fun Team, et al.
Pubblicazione: (2025)
di: Tongyi Fun Team, et al.
Pubblicazione: (2025)
Skip-Layer Attention: Bridging Abstract and Detailed Dependencies in Transformers
di: Chen, Qian, et al.
Pubblicazione: (2024)
di: Chen, Qian, et al.
Pubblicazione: (2024)
Fisher Mask Nodes for Language Model Merging
di: K, Thennal D, et al.
Pubblicazione: (2024)
di: K, Thennal D, et al.
Pubblicazione: (2024)
Learning to Evolve: Bayesian-Guided Continual Knowledge Graph Embedding
di: Li, Linyu, et al.
Pubblicazione: (2025)
di: Li, Linyu, et al.
Pubblicazione: (2025)
Unraveling Text Generation in LLMs: A Stochastic Differential Equation Approach
di: Zhang, Yukun
Pubblicazione: (2024)
di: Zhang, Yukun
Pubblicazione: (2024)
FisherMask: Enhancing Neural Network Labeling Efficiency in Image Classification Using Fisher Information
di: Gul, Shreen, et al.
Pubblicazione: (2024)
di: Gul, Shreen, et al.
Pubblicazione: (2024)
Knowledge Graph Large Language Model (KG-LLM) for Link Prediction
di: Shu, Dong, et al.
Pubblicazione: (2024)
di: Shu, Dong, et al.
Pubblicazione: (2024)
Functionality-Oriented LLM Merging on the Fisher--Rao Manifold
di: Wang, Jiayu, et al.
Pubblicazione: (2026)
di: Wang, Jiayu, et al.
Pubblicazione: (2026)
Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection
di: Sun, Guanglong, et al.
Pubblicazione: (2026)
di: Sun, Guanglong, et al.
Pubblicazione: (2026)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
di: Qin, Jiayu, et al.
Pubblicazione: (2025)
di: Qin, Jiayu, et al.
Pubblicazione: (2025)
Learning Granularity Representation for Temporal Knowledge Graph Completion
di: Zhang, Jinchuan, et al.
Pubblicazione: (2024)
di: Zhang, Jinchuan, et al.
Pubblicazione: (2024)
Joint Selection for Large-Scale Pre-Training Data via Policy Gradient-based Mask Learning
di: Fan, Ziqing, et al.
Pubblicazione: (2025)
di: Fan, Ziqing, et al.
Pubblicazione: (2025)
An Improved Empirical Fisher Approximation for Natural Gradient Descent
di: Wu, Xiaodong, et al.
Pubblicazione: (2024)
di: Wu, Xiaodong, et al.
Pubblicazione: (2024)
Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning
di: Yan, Shaotian, et al.
Pubblicazione: (2026)
di: Yan, Shaotian, et al.
Pubblicazione: (2026)
Attribution-Guided Masking for Robust Cross-Domain Sentiment Classification
di: Harkare, Shubham, et al.
Pubblicazione: (2026)
di: Harkare, Shubham, et al.
Pubblicazione: (2026)
Unveiling LLM Mechanisms Through Neural ODEs and Control Theory
di: Zhang, Yukun, et al.
Pubblicazione: (2024)
di: Zhang, Yukun, et al.
Pubblicazione: (2024)
Advancing vision-language models in front-end development via data synthesis
di: Ge, Tong, et al.
Pubblicazione: (2025)
di: Ge, Tong, et al.
Pubblicazione: (2025)
URRL-IMVC: Unified and Robust Representation Learning for Incomplete Multi-View Clustering
di: Teng, Ge, et al.
Pubblicazione: (2024)
di: Teng, Ge, et al.
Pubblicazione: (2024)
SAC-KG: Exploiting Large Language Models as Skilled Automatic Constructors for Domain Knowledge Graphs
di: Chen, Hanzhu, et al.
Pubblicazione: (2024)
di: Chen, Hanzhu, et al.
Pubblicazione: (2024)
Mask-Enhanced Autoregressive Prediction: Pay Less Attention to Learn More
di: Zhuang, Xialie, et al.
Pubblicazione: (2025)
di: Zhuang, Xialie, et al.
Pubblicazione: (2025)
Scaling up Masked Diffusion Models on Text
di: Nie, Shen, et al.
Pubblicazione: (2024)
di: Nie, Shen, et al.
Pubblicazione: (2024)
Masked Thought: Simply Masking Partial Reasoning Steps Can Improve Mathematical Reasoning Learning of Language Models
di: Chen, Changyu, et al.
Pubblicazione: (2024)
di: Chen, Changyu, et al.
Pubblicazione: (2024)
ReaGAN: Node-as-Agent-Reasoning Graph Agentic Network
di: Guo, Minghao, et al.
Pubblicazione: (2025)
di: Guo, Minghao, et al.
Pubblicazione: (2025)
ROPO: Robust Preference Optimization for Large Language Models
di: Liang, Xize, et al.
Pubblicazione: (2024)
di: Liang, Xize, et al.
Pubblicazione: (2024)
Continuous-Time Attention: PDE-Guided Mechanisms for Long-Sequence Transformers
di: Zhang, Yukun, et al.
Pubblicazione: (2025)
di: Zhang, Yukun, et al.
Pubblicazione: (2025)
Guided Sketch-Based Program Induction by Search Gradients
di: Amin, Ahmad Ayaz
Pubblicazione: (2024)
di: Amin, Ahmad Ayaz
Pubblicazione: (2024)
Recording for Eyes, Not Echoing to Ears: Contextualized Spoken-to-Written Conversion of ASR Transcripts
di: Liu, Jiaqing, et al.
Pubblicazione: (2024)
di: Liu, Jiaqing, et al.
Pubblicazione: (2024)
Fisher-Orthogonal Projected Natural Gradient Descent for Continual Learning
di: Garg, Ishir, et al.
Pubblicazione: (2026)
di: Garg, Ishir, et al.
Pubblicazione: (2026)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
Reconsidering Positional Supervision in Masked Diffusion Language Model Training
di: Ye, Mengyu, et al.
Pubblicazione: (2026)
di: Ye, Mengyu, et al.
Pubblicazione: (2026)
DPCL-Diff: The Temporal Knowledge Graph Reasoning Based on Graph Node Diffusion Model with Dual-Domain Periodic Contrastive Learning
di: Cao, Yukun, et al.
Pubblicazione: (2024)
di: Cao, Yukun, et al.
Pubblicazione: (2024)
Test-Time Learning for Large Language Models
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
FLoE: Fisher-Based Layer Selection for Efficient Sparse Adaptation of Low-Rank Experts
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
Understanding Structured Financial Data with LLMs: A Case Study on Fraud Detection
di: Tan, Xuwei, et al.
Pubblicazione: (2025)
di: Tan, Xuwei, et al.
Pubblicazione: (2025)
ToolFactory: Automating Tool Generation by Leveraging LLM to Understand REST API Documentations
di: Ni, Xinyi, et al.
Pubblicazione: (2025)
di: Ni, Xinyi, et al.
Pubblicazione: (2025)
Guess & Sketch: Language Model Guided Transpilation
di: Lee, Celine, et al.
Pubblicazione: (2023)
di: Lee, Celine, et al.
Pubblicazione: (2023)
Documenti analoghi
-
DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations
di: Tan, Chao-Hong, et al.
Pubblicazione: (2025) -
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
di: Chen, Qian, et al.
Pubblicazione: (2023) -
Exploring Gradient-Guided Masked Language Model to Detect Textual Adversarial Attacks
di: Zhang, Xiaomei, et al.
Pubblicazione: (2025) -
Fun-Audio-Chat Technical Report
di: Tongyi Fun Team, et al.
Pubblicazione: (2025) -
Skip-Layer Attention: Bridging Abstract and Detailed Dependencies in Transformers
di: Chen, Qian, et al.
Pubblicazione: (2024)