Mechanistically Interpreting Compression in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Elluru, Veeraraju, Singh, Arth, Aguero, Roberto, Agarwal, Ajay, Das, Debojyoti, Paul, Hreetam |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bias-Aware Machine Unlearning: Towards Fairer Vision Models via Controllable Forgetting
por: Aylapuram, Sai Siddhartha Chary, et al.
Publicado: (2025)
por: Aylapuram, Sai Siddhartha Chary, et al.
Publicado: (2025)
Re-Mask and Redirect: Exploiting Denoising Irreversibility in Diffusion Language Models
por: Singh, Arth
Publicado: (2026)
por: Singh, Arth
Publicado: (2026)
EMA Is Not All You Need: Mapping the Boundary Between Structure and Content in Recurrent Context
por: Singh, Arth
Publicado: (2026)
por: Singh, Arth
Publicado: (2026)
Causally Grounded Mechanistic Interpretability for LLMs with Faithful Natural-Language Explanations
por: Mahale, Ajay Pravin
Publicado: (2026)
por: Mahale, Ajay Pravin
Publicado: (2026)
Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability
por: Chhabra, Vishnu Kabir, et al.
Publicado: (2025)
por: Chhabra, Vishnu Kabir, et al.
Publicado: (2025)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
por: Che, Liwei, et al.
Publicado: (2026)
por: Che, Liwei, et al.
Publicado: (2026)
Mechanistic Interpretability of Emotion Inference in Large Language Models
por: Tak, Ala N., et al.
Publicado: (2025)
por: Tak, Ala N., et al.
Publicado: (2025)
Mechanistic Behavior Editing of Language Models
por: Singh, Joykirat, et al.
Publicado: (2024)
por: Singh, Joykirat, et al.
Publicado: (2024)
Mechanistic Interpretability of Socio-Political Frames in Language Models
por: Asghari, Hadi, et al.
Publicado: (2025)
por: Asghari, Hadi, et al.
Publicado: (2025)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
por: Cho, Hakaze, et al.
Publicado: (2025)
por: Cho, Hakaze, et al.
Publicado: (2025)
Challenges in Mechanistically Interpreting Model Representations
por: Golechha, Satvik, et al.
Publicado: (2024)
por: Golechha, Satvik, et al.
Publicado: (2024)
Seeing Through Circuits: Faithful Mechanistic Interpretability for Vision Transformers
por: Żukowska, Nina, et al.
Publicado: (2026)
por: Żukowska, Nina, et al.
Publicado: (2026)
Beyond Protein Language Models: An Agentic LLM Framework for Mechanistic Enzyme Design
por: Jacob, Bruno, et al.
Publicado: (2025)
por: Jacob, Bruno, et al.
Publicado: (2025)
Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models
por: Winninger, Thomas, et al.
Publicado: (2025)
por: Winninger, Thomas, et al.
Publicado: (2025)
Supernova Event Dataset: Interpreting Large Language Models' Personality through Critical Event Analysis
por: Agarwal, Pranav, et al.
Publicado: (2025)
por: Agarwal, Pranav, et al.
Publicado: (2025)
Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference
por: Kim, Geonhee, et al.
Publicado: (2024)
por: Kim, Geonhee, et al.
Publicado: (2024)
MALCDF: A Distributed Multi-Agent LLM Framework for Real-Time Cyber
por: Bhardwaj, Arth, et al.
Publicado: (2025)
por: Bhardwaj, Arth, et al.
Publicado: (2025)
Mechanistic Interpretability of LoRA-Adapted Language Models for Nuclear Reactor Safety Applications
por: Lee, Yoon Pyo
Publicado: (2025)
por: Lee, Yoon Pyo
Publicado: (2025)
Mechanistic Interpretability Needs Philosophy
por: Williams, Iwan, et al.
Publicado: (2025)
por: Williams, Iwan, et al.
Publicado: (2025)
Mechanistic Interpretability for AI Safety -- A Review
por: Bereska, Leonard, et al.
Publicado: (2024)
por: Bereska, Leonard, et al.
Publicado: (2024)
A Practical Review of Mechanistic Interpretability for Transformer-Based Language Models
por: Rai, Daking, et al.
Publicado: (2024)
por: Rai, Daking, et al.
Publicado: (2024)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
por: Wang, Xu, et al.
Publicado: (2026)
por: Wang, Xu, et al.
Publicado: (2026)
Mechanistic Interpretability with SAEs: Probing Religion, Violence, and Geography in Large Language Models
por: Simbeck, Katharina, et al.
Publicado: (2025)
por: Simbeck, Katharina, et al.
Publicado: (2025)
Prisma: An Open Source Toolkit for Mechanistic Interpretability in Vision and Video
por: Joseph, Sonia, et al.
Publicado: (2025)
por: Joseph, Sonia, et al.
Publicado: (2025)
Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability
por: Geiger, Atticus, et al.
Publicado: (2023)
por: Geiger, Atticus, et al.
Publicado: (2023)
Mechanistic Interpretability of Brain-to-Speech Models Across Speech Modes
por: Maghsoudi, Maryam, et al.
Publicado: (2026)
por: Maghsoudi, Maryam, et al.
Publicado: (2026)
reward-lens: A Mechanistic Interpretability Library for Reward Models
por: Nadaf, Mohammed Suhail B
Publicado: (2026)
por: Nadaf, Mohammed Suhail B
Publicado: (2026)
A Survey on Mechanistic Interpretability for Multi-Modal Foundation Models
por: Lin, Zihao, et al.
Publicado: (2025)
por: Lin, Zihao, et al.
Publicado: (2025)
Mechanistic Interpretability in the Presence of Architectural Obfuscation
por: Florencio, Marcos, et al.
Publicado: (2025)
por: Florencio, Marcos, et al.
Publicado: (2025)
Auditing Disability Representation in Vision-Language Models
por: Panda, Srikant, et al.
Publicado: (2026)
por: Panda, Srikant, et al.
Publicado: (2026)
Beyond BeautifulSoup: Benchmarking LLM-Powered Web Scraping for Everyday Users
por: Bhardwaj, Arth, et al.
Publicado: (2026)
por: Bhardwaj, Arth, et al.
Publicado: (2026)
Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models
por: Beniwal, Himanshu, et al.
Publicado: (2026)
por: Beniwal, Himanshu, et al.
Publicado: (2026)
The Security Threat of Compressed Projectors in Large Vision-Language Models
por: Zhang, Yudong, et al.
Publicado: (2025)
por: Zhang, Yudong, et al.
Publicado: (2025)
Mechanistic Interpretability of GPT-like Models on Summarization Tasks
por: Mishra, Anurag
Publicado: (2025)
por: Mishra, Anurag
Publicado: (2025)
Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models
por: Pawar, Pranav, et al.
Publicado: (2025)
por: Pawar, Pranav, et al.
Publicado: (2025)
On the Mechanistic Interpretability of Neural Networks for Causality in Bio-statistics
por: Conan, Jean-Baptiste A.
Publicado: (2025)
por: Conan, Jean-Baptiste A.
Publicado: (2025)
MINAR: Mechanistic Interpretability for Neural Algorithmic Reasoning
por: He, Jesse, et al.
Publicado: (2026)
por: He, Jesse, et al.
Publicado: (2026)
RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models
por: Chen, Yuxuan, et al.
Publicado: (2025)
por: Chen, Yuxuan, et al.
Publicado: (2025)
Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective
por: Lee, Jae Hee, et al.
Publicado: (2025)
por: Lee, Jae Hee, et al.
Publicado: (2025)
Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models
por: Seth, Ashish, et al.
Publicado: (2024)
por: Seth, Ashish, et al.
Publicado: (2024)
Ejemplares similares
-
Bias-Aware Machine Unlearning: Towards Fairer Vision Models via Controllable Forgetting
por: Aylapuram, Sai Siddhartha Chary, et al.
Publicado: (2025) -
Re-Mask and Redirect: Exploiting Denoising Irreversibility in Diffusion Language Models
por: Singh, Arth
Publicado: (2026) -
EMA Is Not All You Need: Mapping the Boundary Between Structure and Content in Recurrent Context
por: Singh, Arth
Publicado: (2026) -
Causally Grounded Mechanistic Interpretability for LLMs with Faithful Natural-Language Explanations
por: Mahale, Ajay Pravin
Publicado: (2026) -
Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability
por: Chhabra, Vishnu Kabir, et al.
Publicado: (2025)