Learning to Interpret Weight Differences in Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Goel, Avichal, Kim, Yoon, Shavit, Nir, Wang, Tony T. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Forbidden Facts: An Investigation of Competing Objectives in Llama-2
di: Wang, Tony T., et al.
Pubblicazione: (2023)
di: Wang, Tony T., et al.
Pubblicazione: (2023)
Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach
di: Wang, Tony T., et al.
Pubblicazione: (2024)
di: Wang, Tony T., et al.
Pubblicazione: (2024)
Variational Language Concepts for Interpreting Foundation Language Models
di: Wang, Hengyi, et al.
Pubblicazione: (2024)
di: Wang, Hengyi, et al.
Pubblicazione: (2024)
Scalable Energy-Based Models via Adversarial Training: Unifying Discrimination and Generation
di: Yin, Xuwang, et al.
Pubblicazione: (2025)
di: Yin, Xuwang, et al.
Pubblicazione: (2025)
Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference
di: Kim, Geonhee, et al.
Pubblicazione: (2024)
di: Kim, Geonhee, et al.
Pubblicazione: (2024)
The Birth of Knowledge: Emergent Features across Time, Space, and Scale in Large Language Models
di: Sawmya, Shashata, et al.
Pubblicazione: (2025)
di: Sawmya, Shashata, et al.
Pubblicazione: (2025)
On The Truthfulness of 'Surprisingly Likely' Responses of Large Language Models
di: Goel, Naman
Pubblicazione: (2023)
di: Goel, Naman
Pubblicazione: (2023)
Measuring Progress in Dictionary Learning for Language Model Interpretability with Board Game Models
di: Karvonen, Adam, et al.
Pubblicazione: (2024)
di: Karvonen, Adam, et al.
Pubblicazione: (2024)
Value Augmented Sampling for Language Model Alignment and Personalization
di: Han, Seungwook, et al.
Pubblicazione: (2024)
di: Han, Seungwook, et al.
Pubblicazione: (2024)
Why Larger Language Models Do In-context Learning Differently?
di: Shi, Zhenmei, et al.
Pubblicazione: (2024)
di: Shi, Zhenmei, et al.
Pubblicazione: (2024)
Interpretable Next-token Prediction via the Generalized Induction Head
di: Kim, Eunji, et al.
Pubblicazione: (2024)
di: Kim, Eunji, et al.
Pubblicazione: (2024)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
di: Chandak, Nikhil, et al.
Pubblicazione: (2025)
di: Chandak, Nikhil, et al.
Pubblicazione: (2025)
Pruning as a Defense: Reducing Memorization in Large Language Models
di: Gupta, Mansi, et al.
Pubblicazione: (2025)
di: Gupta, Mansi, et al.
Pubblicazione: (2025)
On Speculative Decoding for Multimodal Large Language Models
di: Gagrani, Mukul, et al.
Pubblicazione: (2024)
di: Gagrani, Mukul, et al.
Pubblicazione: (2024)
Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models
di: Puri, Isha, et al.
Pubblicazione: (2026)
di: Puri, Isha, et al.
Pubblicazione: (2026)
Model Assembly Learning with Heterogeneous Layer Weight Merging
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2025)
Convergent Evolution: How Different Language Models Learn Similar Number Representations
di: Fu, Deqing, et al.
Pubblicazione: (2026)
di: Fu, Deqing, et al.
Pubblicazione: (2026)
Rethinking Interpretability in the Era of Large Language Models
di: Singh, Chandan, et al.
Pubblicazione: (2024)
di: Singh, Chandan, et al.
Pubblicazione: (2024)
GWQ: Gradient-Aware Weight Quantization for Large Language Models
di: Shao, Yihua, et al.
Pubblicazione: (2024)
di: Shao, Yihua, et al.
Pubblicazione: (2024)
CultureLLM: Incorporating Cultural Differences into Large Language Models
di: Li, Cheng, et al.
Pubblicazione: (2024)
di: Li, Cheng, et al.
Pubblicazione: (2024)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
di: Cho, Hakaze, et al.
Pubblicazione: (2025)
di: Cho, Hakaze, et al.
Pubblicazione: (2025)
Interpreting Key Mechanisms of Factual Recall in Transformer-Based Language Models
di: Lv, Ang, et al.
Pubblicazione: (2024)
di: Lv, Ang, et al.
Pubblicazione: (2024)
DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2023)
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2023)
FeDeRA:Efficient Fine-tuning of Language Models in Federated Learning Leveraging Weight Decomposition
di: Yan, Yuxuan, et al.
Pubblicazione: (2024)
di: Yan, Yuxuan, et al.
Pubblicazione: (2024)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
di: Wang, Xu, et al.
Pubblicazione: (2026)
di: Wang, Xu, et al.
Pubblicazione: (2026)
What Do Language Models Hear? Probing for Auditory Representations in Language Models
di: Ngo, Jerry, et al.
Pubblicazione: (2024)
di: Ngo, Jerry, et al.
Pubblicazione: (2024)
Large Language Models are Skeptics: False Negative Problem of Input-conflicting Hallucination
di: Song, Jongyoon, et al.
Pubblicazione: (2024)
di: Song, Jongyoon, et al.
Pubblicazione: (2024)
Cross-Layer Discrete Concept Discovery for Interpreting Language Models
di: Garg, Ankur, et al.
Pubblicazione: (2025)
di: Garg, Ankur, et al.
Pubblicazione: (2025)
Interpreting Language Models Through Concept Descriptions: A Survey
di: Feldhus, Nils, et al.
Pubblicazione: (2025)
di: Feldhus, Nils, et al.
Pubblicazione: (2025)
Fine-Grained Interpretation of Political Opinions in Large Language Models
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
Superscopes: Amplifying Internal Feature Representations for Language Model Interpretation
di: Jacobi, Jonathan, et al.
Pubblicazione: (2025)
di: Jacobi, Jonathan, et al.
Pubblicazione: (2025)
Atlas-Alignment: Making Interpretability Transferable Across Language Models
di: Puri, Bruno, et al.
Pubblicazione: (2025)
di: Puri, Bruno, et al.
Pubblicazione: (2025)
SelfIE: Self-Interpretation of Large Language Model Embeddings
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
TracrBench: Generating Interpretability Testbeds with Large Language Models
di: Thurnherr, Hannes, et al.
Pubblicazione: (2024)
di: Thurnherr, Hannes, et al.
Pubblicazione: (2024)
The Dual-Stream Transformer: Channelized Architecture for Interpretable Language Modeling
di: Kerce, J. Clayton, et al.
Pubblicazione: (2026)
di: Kerce, J. Clayton, et al.
Pubblicazione: (2026)
Luna-2: Scalable Single-Token Evaluation with Small Language Models
di: Goel, Vatsal, et al.
Pubblicazione: (2026)
di: Goel, Vatsal, et al.
Pubblicazione: (2026)
LLMCheckup: Conversational Examination of Large Language Models via Interpretability Tools and Self-Explanations
di: Wang, Qianli, et al.
Pubblicazione: (2024)
di: Wang, Qianli, et al.
Pubblicazione: (2024)
Panza: Design and Analysis of a Fully-Local Personalized Text Writing Assistant
di: Nicolicioiu, Armand, et al.
Pubblicazione: (2024)
di: Nicolicioiu, Armand, et al.
Pubblicazione: (2024)
Morality is Contextual: Learning Interpretable Moral Contexts from Human Data with Probabilistic Clustering and Large Language Models
di: Morlat, Geoffroy, et al.
Pubblicazione: (2025)
di: Morlat, Geoffroy, et al.
Pubblicazione: (2025)
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025)
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Forbidden Facts: An Investigation of Competing Objectives in Llama-2
di: Wang, Tony T., et al.
Pubblicazione: (2023) -
Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach
di: Wang, Tony T., et al.
Pubblicazione: (2024) -
Variational Language Concepts for Interpreting Foundation Language Models
di: Wang, Hengyi, et al.
Pubblicazione: (2024) -
Scalable Energy-Based Models via Adversarial Training: Unifying Discrimination and Generation
di: Yin, Xuwang, et al.
Pubblicazione: (2025) -
Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference
di: Kim, Geonhee, et al.
Pubblicazione: (2024)