Towards Understanding Fine-Tuning Mechanisms of LLMs via Circuit Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xu, Hu, Yan, Du, Wenyu, Cheng, Reynold, Wang, Benyou, Zou, Difan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
RAG-Instruct: Boosting LLMs with Diverse Retrieval-Augmented Instructions
par: Liu, Wanlong, et autres
Publié: (2024)
par: Liu, Wanlong, et autres
Publié: (2024)
Model Unlearning via Sparse Autoencoder Subspace Guided Projections
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks
par: Poppi, Samuele, et autres
Publié: (2024)
par: Poppi, Samuele, et autres
Publié: (2024)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
par: Tang, Zhengyang, et autres
Publié: (2024)
par: Tang, Zhengyang, et autres
Publié: (2024)
A Human-Like Reasoning Framework for Multi-Phases Planning Task with Large Language Models
par: Xie, Chengxing, et autres
Publié: (2024)
par: Xie, Chengxing, et autres
Publié: (2024)
HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
Unlocking Continual Learning Abilities in Language Models
par: Du, Wenyu, et autres
Publié: (2024)
par: Du, Wenyu, et autres
Publié: (2024)
ALKAFI-LLAMA3: Fine-Tuning LLMs for Precise Legal Understanding in Palestine
par: Qasem, Rabee, et autres
Publié: (2024)
par: Qasem, Rabee, et autres
Publié: (2024)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026)
par: Wang, Xu, et autres
Publié: (2026)
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
par: Meng, Haoming, et autres
Publié: (2026)
par: Meng, Haoming, et autres
Publié: (2026)
Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data
par: Rallapalli, Swati, et autres
Publié: (2025)
par: Rallapalli, Swati, et autres
Publié: (2025)
ClusterUCB: Efficient Gradient-Based Data Selection for Targeted Fine-Tuning of LLMs
par: Wang, Zige, et autres
Publié: (2025)
par: Wang, Zige, et autres
Publié: (2025)
Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning
par: Khadangi, Afshin, et autres
Publié: (2025)
par: Khadangi, Afshin, et autres
Publié: (2025)
Fine-Tuning Improves Information Conveyance in Language Models
par: Cheng, Yuwei, et autres
Publié: (2026)
par: Cheng, Yuwei, et autres
Publié: (2026)
Deconfounded Causality-aware Parameter-Efficient Fine-Tuning for Problem-Solving Improvement of LLMs
par: Wang, Ruoyu, et autres
Publié: (2024)
par: Wang, Ruoyu, et autres
Publié: (2024)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
par: Huang, Zeyu, et autres
Publié: (2025)
par: Huang, Zeyu, et autres
Publié: (2025)
Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
LLMem: Estimating GPU Memory Usage for Fine-Tuning Pre-Trained LLMs
par: Kim, Taeho, et autres
Publié: (2024)
par: Kim, Taeho, et autres
Publié: (2024)
Understanding the Performance and Estimating the Cost of LLM Fine-Tuning
par: Xia, Yuchen, et autres
Publié: (2024)
par: Xia, Yuchen, et autres
Publié: (2024)
Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs
par: Ovadia, Oded, et autres
Publié: (2023)
par: Ovadia, Oded, et autres
Publié: (2023)
Teaching LLMs How to Learn with Contextual Fine-Tuning
par: Choi, Younwoo, et autres
Publié: (2025)
par: Choi, Younwoo, et autres
Publié: (2025)
Get more for less: Principled Data Selection for Warming Up Fine-Tuning in LLMs
par: Kang, Feiyang, et autres
Publié: (2024)
par: Kang, Feiyang, et autres
Publié: (2024)
Proximal Supervised Fine-Tuning
par: Zhu, Wenhong, et autres
Publié: (2025)
par: Zhu, Wenhong, et autres
Publié: (2025)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
par: Shen, Zhanming, et autres
Publié: (2026)
par: Shen, Zhanming, et autres
Publié: (2026)
Filter-then-Weight: Online Data Selection and Reweighting for LLM Fine-Tuning
par: Wang, Fangxin, et autres
Publié: (2026)
par: Wang, Fangxin, et autres
Publié: (2026)
Understanding and Preserving Safety in Fine-Tuned LLMs
par: Zhang, Jiawen, et autres
Publié: (2026)
par: Zhang, Jiawen, et autres
Publié: (2026)
A Implies B: Circuit Analysis in LLMs for Propositional Logical Reasoning
par: Hong, Guan Zhe, et autres
Publié: (2024)
par: Hong, Guan Zhe, et autres
Publié: (2024)
Long Exposure: Accelerating Parameter-Efficient Fine-Tuning for LLMs under Shadowy Sparsity
par: Wang, Tuowei, et autres
Publié: (2025)
par: Wang, Tuowei, et autres
Publié: (2025)
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
par: Guo, Song, et autres
Publié: (2024)
par: Guo, Song, et autres
Publié: (2024)
Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection
par: Chen, Xingwu, et autres
Publié: (2025)
par: Chen, Xingwu, et autres
Publié: (2025)
SelectIT: Selective Instruction Tuning for LLMs via Uncertainty-Aware Self-Reflection
par: Liu, Liangxin, et autres
Publié: (2024)
par: Liu, Liangxin, et autres
Publié: (2024)
When More is Less: Understanding Chain-of-Thought Length in LLMs
par: Wu, Yuyang, et autres
Publié: (2025)
par: Wu, Yuyang, et autres
Publié: (2025)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
par: Pan, Birong, et autres
Publié: (2025)
par: Pan, Birong, et autres
Publié: (2025)
Understanding the Dynamics of Demonstration Conflict in In-Context Learning
par: Jiao, Difan, et autres
Publié: (2026)
par: Jiao, Difan, et autres
Publié: (2026)
CoD, Towards an Interpretable Medical Agent using Chain of Diagnosis
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
GSQ-Tuning: Group-Shared Exponents Integer in Fully Quantized Training for LLMs On-Device Fine-tuning
par: Zhou, Sifan, et autres
Publié: (2025)
par: Zhou, Sifan, et autres
Publié: (2025)
Hallucination Detection in LLMs: Fast and Memory-Efficient Fine-Tuned Models
par: Arteaga, Gabriel Y., et autres
Publié: (2024)
par: Arteaga, Gabriel Y., et autres
Publié: (2024)
Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression
par: Chen, Xingwu, et autres
Publié: (2025)
par: Chen, Xingwu, et autres
Publié: (2025)
From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning
par: Wu, Xuansheng, et autres
Publié: (2023)
par: Wu, Xuansheng, et autres
Publié: (2023)
Documents similaires
-
Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2025) -
RAG-Instruct: Boosting LLMs with Diverse Retrieval-Augmented Instructions
par: Liu, Wanlong, et autres
Publié: (2024) -
Model Unlearning via Sparse Autoencoder Subspace Guided Projections
par: Wang, Xu, et autres
Publié: (2025) -
Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks
par: Poppi, Samuele, et autres
Publié: (2024) -
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
par: Tang, Zhengyang, et autres
Publié: (2024)