SCALPEL: Selective Capability Ablation via Low-rank Parameter Editing for Large Language Model Interpretability Analysis
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fu, Zihao, Duan, Xufeng, Cai, Zhenguang G. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Large Language Models for Automated Literature Review: An Evaluation of Reference Generation, Abstract Writing, and Review Composition
von: Tang, Xuemei, et al.
Veröffentlicht: (2024)
von: Tang, Xuemei, et al.
Veröffentlicht: (2024)
CAST: Compositional Analysis via Spectral Tracking for Understanding Transformer Layer Functions
von: Fu, Zihao, et al.
Veröffentlicht: (2025)
von: Fu, Zihao, et al.
Veröffentlicht: (2025)
How Syntax Specialization Emerges in Language Models
von: Duan, Xufeng, et al.
Veröffentlicht: (2025)
von: Duan, Xufeng, et al.
Veröffentlicht: (2025)
MacBehaviour: An R package for behavioural experimentation on large language models
von: Duan, Xufeng, et al.
Veröffentlicht: (2024)
von: Duan, Xufeng, et al.
Veröffentlicht: (2024)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
von: Guo, Jiawei, et al.
Veröffentlicht: (2024)
von: Guo, Jiawei, et al.
Veröffentlicht: (2024)
RIPPLECOT: Amplifying Ripple Effect of Knowledge Editing in Language Models via Chain-of-Thought In-Context Learning
von: Zhao, Zihao, et al.
Veröffentlicht: (2024)
von: Zhao, Zihao, et al.
Veröffentlicht: (2024)
Do Large Language Models Plan Answer Positions? Position Bias in Multiple-Choice Question Generation
von: Tang, Xuemei, et al.
Veröffentlicht: (2026)
von: Tang, Xuemei, et al.
Veröffentlicht: (2026)
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
von: Lin, Haowei, et al.
Veröffentlicht: (2024)
von: Lin, Haowei, et al.
Veröffentlicht: (2024)
Unveiling Language Competence Neurons: A Psycholinguistic Approach to Model Interpretability
von: Duan, Xufeng, et al.
Veröffentlicht: (2024)
von: Duan, Xufeng, et al.
Veröffentlicht: (2024)
Low-rank Adaptation of Large Language Model Rescoring for Parameter-Efficient Speech Recognition
von: Yu, Yu, et al.
Veröffentlicht: (2023)
von: Yu, Yu, et al.
Veröffentlicht: (2023)
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
von: Marks, Samuel, et al.
Veröffentlicht: (2024)
von: Marks, Samuel, et al.
Veröffentlicht: (2024)
On Calibration of Large Language Models: From Response To Capability
von: Yang, Sin-Han, et al.
Veröffentlicht: (2026)
von: Yang, Sin-Han, et al.
Veröffentlicht: (2026)
Exploring and Benchmarking the Planning Capabilities of Large Language Models
von: Bohnet, Bernd, et al.
Veröffentlicht: (2024)
von: Bohnet, Bernd, et al.
Veröffentlicht: (2024)
Knowledge Editing on Black-box Large Language Models
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2024)
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2024)
Spectral Editing of Activations for Large Language Model Alignment
von: Qiu, Yifu, et al.
Veröffentlicht: (2024)
von: Qiu, Yifu, et al.
Veröffentlicht: (2024)
Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing
von: Zhang, Rongzhi, et al.
Veröffentlicht: (2025)
von: Zhang, Rongzhi, et al.
Veröffentlicht: (2025)
Rethinking Interpretability in the Era of Large Language Models
von: Singh, Chandan, et al.
Veröffentlicht: (2024)
von: Singh, Chandan, et al.
Veröffentlicht: (2024)
LoRETTA: Low-Rank Economic Tensor-Train Adaptation for Ultra-Low-Parameter Fine-Tuning of Large Language Models
von: Yang, Yifan, et al.
Veröffentlicht: (2024)
von: Yang, Yifan, et al.
Veröffentlicht: (2024)
ModelGPT: Unleashing LLM's Capabilities for Tailored Model Generation
von: Tang, Zihao, et al.
Veröffentlicht: (2024)
von: Tang, Zihao, et al.
Veröffentlicht: (2024)
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
von: Liu, Jing, et al.
Veröffentlicht: (2023)
von: Liu, Jing, et al.
Veröffentlicht: (2023)
Evaluating Interventional Reasoning Capabilities of Large Language Models
von: Kasetty, Tejas, et al.
Veröffentlicht: (2024)
von: Kasetty, Tejas, et al.
Veröffentlicht: (2024)
LLMCheckup: Conversational Examination of Large Language Models via Interpretability Tools and Self-Explanations
von: Wang, Qianli, et al.
Veröffentlicht: (2024)
von: Wang, Qianli, et al.
Veröffentlicht: (2024)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
von: Feng, Jie, et al.
Veröffentlicht: (2024)
von: Feng, Jie, et al.
Veröffentlicht: (2024)
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
von: Hua, Wenyue, et al.
Veröffentlicht: (2024)
von: Hua, Wenyue, et al.
Veröffentlicht: (2024)
LLM Surgery: Efficient Knowledge Unlearning and Editing in Large Language Models
von: Veldanda, Akshaj Kumar, et al.
Veröffentlicht: (2024)
von: Veldanda, Akshaj Kumar, et al.
Veröffentlicht: (2024)
LLM-Select: Feature Selection with Large Language Models
von: Jeong, Daniel P., et al.
Veröffentlicht: (2024)
von: Jeong, Daniel P., et al.
Veröffentlicht: (2024)
Enhancing the General Agent Capabilities of Low-Parameter LLMs through Tuning and Multi-Branch Reasoning
von: Zhou, Qinhao, et al.
Veröffentlicht: (2024)
von: Zhou, Qinhao, et al.
Veröffentlicht: (2024)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
von: Cho, Hakaze, et al.
Veröffentlicht: (2025)
von: Cho, Hakaze, et al.
Veröffentlicht: (2025)
MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series
von: Zhang, Ge, et al.
Veröffentlicht: (2024)
von: Zhang, Ge, et al.
Veröffentlicht: (2024)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
von: Chen, Pin-Yu, et al.
Veröffentlicht: (2025)
von: Chen, Pin-Yu, et al.
Veröffentlicht: (2025)
Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
von: Zheng, Jinquan, et al.
Veröffentlicht: (2026)
von: Zheng, Jinquan, et al.
Veröffentlicht: (2026)
DavIR: Data Selection via Implicit Reward for Large Language Models
von: Zhou, Haotian, et al.
Veröffentlicht: (2023)
von: Zhou, Haotian, et al.
Veröffentlicht: (2023)
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
von: Kang, Zhewei, et al.
Veröffentlicht: (2025)
von: Kang, Zhewei, et al.
Veröffentlicht: (2025)
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
von: Zhang, Shaolei, et al.
Veröffentlicht: (2024)
von: Zhang, Shaolei, et al.
Veröffentlicht: (2024)
Hierarchical Orthogonal Residual Spread for Precise Massive Editing in Large Language Models
von: Gu, Xiaojie, et al.
Veröffentlicht: (2026)
von: Gu, Xiaojie, et al.
Veröffentlicht: (2026)
Predicting Compact Phrasal Rewrites with Large Language Models for ASR Post Editing
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
SelfIE: Self-Interpretation of Large Language Model Embeddings
von: Chen, Haozhe, et al.
Veröffentlicht: (2024)
von: Chen, Haozhe, et al.
Veröffentlicht: (2024)
TracrBench: Generating Interpretability Testbeds with Large Language Models
von: Thurnherr, Hannes, et al.
Veröffentlicht: (2024)
von: Thurnherr, Hannes, et al.
Veröffentlicht: (2024)
Fine-Grained Interpretation of Political Opinions in Large Language Models
von: Hu, Jingyu, et al.
Veröffentlicht: (2025)
von: Hu, Jingyu, et al.
Veröffentlicht: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
von: Fu, Jiale, et al.
Veröffentlicht: (2025)
von: Fu, Jiale, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Large Language Models for Automated Literature Review: An Evaluation of Reference Generation, Abstract Writing, and Review Composition
von: Tang, Xuemei, et al.
Veröffentlicht: (2024) -
CAST: Compositional Analysis via Spectral Tracking for Understanding Transformer Layer Functions
von: Fu, Zihao, et al.
Veröffentlicht: (2025) -
How Syntax Specialization Emerges in Language Models
von: Duan, Xufeng, et al.
Veröffentlicht: (2025) -
MacBehaviour: An R package for behavioural experimentation on large language models
von: Duan, Xufeng, et al.
Veröffentlicht: (2024) -
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
von: Guo, Jiawei, et al.
Veröffentlicht: (2024)