Fine-Tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Prakash, Nikhil, Shaham, Tamar Rott, Haklay, Tal, Belinkov, Yonatan, Bau, David |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Position-aware Automatic Circuit Discovery
par: Haklay, Tal, et autres
Publié: (2025)
par: Haklay, Tal, et autres
Publié: (2025)
Language Models use Lookbacks to Track Beliefs
par: Prakash, Nikhil, et autres
Publié: (2025)
par: Prakash, Nikhil, et autres
Publié: (2025)
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
par: Cui, Kelly, et autres
Publié: (2026)
par: Cui, Kelly, et autres
Publié: (2026)
Planted in Pretraining, Swayed by Finetuning: A Case Study on the Origins of Cognitive Biases in LLMs
par: Itzhak, Itay, et autres
Publié: (2025)
par: Itzhak, Itay, et autres
Publié: (2025)
Pitfalls in Evaluating Interpretability Agents
par: Haklay, Tal, et autres
Publié: (2026)
par: Haklay, Tal, et autres
Publié: (2026)
Linearity of Relation Decoding in Transformer Language Models
par: Hernandez, Evan, et autres
Publié: (2023)
par: Hernandez, Evan, et autres
Publié: (2023)
Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms
par: Hanna, Michael, et autres
Publié: (2024)
par: Hanna, Michael, et autres
Publié: (2024)
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
par: Marks, Samuel, et autres
Publié: (2024)
par: Marks, Samuel, et autres
Publié: (2024)
PRISM: PRIor from corpus Statistics for topic Modeling
par: Ishon, Tal, et autres
Publié: (2026)
par: Ishon, Tal, et autres
Publié: (2026)
Leveraging Prototypical Representations for Mitigating Social Bias without Demographic Information
par: Iskander, Shadi, et autres
Publié: (2024)
par: Iskander, Shadi, et autres
Publié: (2024)
SAEs Are Good for Steering -- If You Select the Right Features
par: Arad, Dana, et autres
Publié: (2025)
par: Arad, Dana, et autres
Publié: (2025)
MIB: A Mechanistic Interpretability Benchmark
par: Mueller, Aaron, et autres
Publié: (2025)
par: Mueller, Aaron, et autres
Publié: (2025)
Fast Forwarding Low-Rank Training
par: Rahamim, Adir, et autres
Publié: (2024)
par: Rahamim, Adir, et autres
Publié: (2024)
Silent Tokens, Loud Effects: Padding in LLMs
par: Himelstein, Rom, et autres
Publié: (2025)
par: Himelstein, Rom, et autres
Publié: (2025)
A Vision Check-up for Language Models
par: Sharma, Pratyusha, et autres
Publié: (2024)
par: Sharma, Pratyusha, et autres
Publié: (2024)
Backward Lens: Projecting Language Model Gradients into the Vocabulary Space
par: Katz, Shahar, et autres
Publié: (2024)
par: Katz, Shahar, et autres
Publié: (2024)
From Feelings to Metrics: Understanding and Formalizing How Users Vibe-Test LLMs
par: Itzhak, Itay, et autres
Publié: (2026)
par: Itzhak, Itay, et autres
Publié: (2026)
Unified Concept Editing in Diffusion Models
par: Gandikota, Rohit, et autres
Publié: (2023)
par: Gandikota, Rohit, et autres
Publié: (2023)
Ranking Entities along Conceptual Space Dimensions with LLMs: An Analysis of Fine-Tuning Strategies
par: Kumar, Nitesh, et autres
Publié: (2024)
par: Kumar, Nitesh, et autres
Publié: (2024)
Tracking Universal Features Through Fine-Tuning and Model Merging
par: Horn, Niels, et autres
Publié: (2024)
par: Horn, Niels, et autres
Publié: (2024)
Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study
par: Ponkshe, Kaustubh, et autres
Publié: (2025)
par: Ponkshe, Kaustubh, et autres
Publié: (2025)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
par: Yanuka, Moran, et autres
Publié: (2024)
par: Yanuka, Moran, et autres
Publié: (2024)
Slot Machines: How LLMs Keep Track of Multiple Entities
par: Bogdan, Paul C., et autres
Publié: (2026)
par: Bogdan, Paul C., et autres
Publié: (2026)
Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism
par: Orgad, Hadas, et autres
Publié: (2026)
par: Orgad, Hadas, et autres
Publié: (2026)
Entity-Centric Reinforcement Learning for Object Manipulation from Pixels
par: Haramati, Dan, et autres
Publié: (2024)
par: Haramati, Dan, et autres
Publié: (2024)
Mechanisms of AI Protein Folding in ESMFold
par: Lu, Kevin, et autres
Publié: (2026)
par: Lu, Kevin, et autres
Publié: (2026)
Enhancing BERT Fine-Tuning for Sentiment Analysis in Lower-Resourced Languages
par: Kubík, Jozef, et autres
Publié: (2025)
par: Kubík, Jozef, et autres
Publié: (2025)
Confidence Regulation Neurons in Language Models
par: Stolfo, Alessandro, et autres
Publié: (2024)
par: Stolfo, Alessandro, et autres
Publié: (2024)
Multilingual Instruction Tuning With Just a Pinch of Multilinguality
par: Shaham, Uri, et autres
Publié: (2024)
par: Shaham, Uri, et autres
Publié: (2024)
Instructed to Bias: Instruction-Tuned Language Models Exhibit Emergent Cognitive Bias
par: Itzhak, Itay, et autres
Publié: (2023)
par: Itzhak, Itay, et autres
Publié: (2023)
Mafin: Enhancing Black-Box Embeddings with Model Augmented Fine-Tuning
par: Zhang, Mingtian, et autres
Publié: (2024)
par: Zhang, Mingtian, et autres
Publié: (2024)
Structured RAG for Answering Aggregative Questions
par: Koshorek, Omri, et autres
Publié: (2025)
par: Koshorek, Omri, et autres
Publié: (2025)
Anchored Supervised Fine-Tuning
par: Zhu, He, et autres
Publié: (2025)
par: Zhu, He, et autres
Publié: (2025)
Generating Fine Details of Entity Interactions
par: Gu, Xinyi, et autres
Publié: (2025)
par: Gu, Xinyi, et autres
Publié: (2025)
Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning
par: Yano, Kazuki, et autres
Publié: (2026)
par: Yano, Kazuki, et autres
Publié: (2026)
Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-Tuning
par: Vassoyan, Jean, et autres
Publié: (2025)
par: Vassoyan, Jean, et autres
Publié: (2025)
Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts
par: Chourasia, Shivam, et autres
Publié: (2026)
par: Chourasia, Shivam, et autres
Publié: (2026)
Erasing Conceptual Knowledge from Language Models
par: Gandikota, Rohit, et autres
Publié: (2024)
par: Gandikota, Rohit, et autres
Publié: (2024)
Towards Understanding Fine-Tuning Mechanisms of LLMs via Circuit Analysis
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
Prompt Tuning for Natural Language to SQL with Embedding Fine-Tuning and RAG
par: Jang, Jisoo, et autres
Publié: (2025)
par: Jang, Jisoo, et autres
Publié: (2025)
Documents similaires
-
Position-aware Automatic Circuit Discovery
par: Haklay, Tal, et autres
Publié: (2025) -
Language Models use Lookbacks to Track Beliefs
par: Prakash, Nikhil, et autres
Publié: (2025) -
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
par: Cui, Kelly, et autres
Publié: (2026) -
Planted in Pretraining, Swayed by Finetuning: A Case Study on the Origins of Cognitive Biases in LLMs
par: Itzhak, Itay, et autres
Publié: (2025) -
Pitfalls in Evaluating Interpretability Agents
par: Haklay, Tal, et autres
Publié: (2026)