Neuroplasticity and Corruption in Model Mechanisms: A Case Study Of Indirect Object Identification
Fuente:
arXiv
Salvato in:
| Autori principali: | Chhabra, Vishnu Kabir, Zhu, Ding, Khalili, Mohammad Mahdi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the transferability of Sparse Autoencoders for interpreting compressed models
di: Gupte, Suchit, et al.
Pubblicazione: (2025)
di: Gupte, Suchit, et al.
Pubblicazione: (2025)
Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability
di: Chhabra, Vishnu Kabir, et al.
Pubblicazione: (2025)
di: Chhabra, Vishnu Kabir, et al.
Pubblicazione: (2025)
ECG Signal Denoising Using Multi-scale Patch Embedding and Transformers
di: Zhu, Ding, et al.
Pubblicazione: (2024)
di: Zhu, Ding, et al.
Pubblicazione: (2024)
An Efficient Training Algorithm for Models with Block-wise Sparsity
di: Zhu, Ding, et al.
Pubblicazione: (2025)
di: Zhu, Ding, et al.
Pubblicazione: (2025)
Post-processing for Fair Regression via Explainable SVD
di: Zuo, Zhiqun, et al.
Pubblicazione: (2025)
di: Zuo, Zhiqun, et al.
Pubblicazione: (2025)
Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models
di: Nahin, Shahriar Kabir, et al.
Pubblicazione: (2025)
di: Nahin, Shahriar Kabir, et al.
Pubblicazione: (2025)
Individual Fairness In Strategic Classification
di: Zuo, Zhiqun, et al.
Pubblicazione: (2026)
di: Zuo, Zhiqun, et al.
Pubblicazione: (2026)
AbsTopK: Rethinking Sparse Autoencoders For Bidirectional Features
di: Zhu, Xudong, et al.
Pubblicazione: (2025)
di: Zhu, Xudong, et al.
Pubblicazione: (2025)
From Emergence to Control: Probing and Modulating Self-Reflection in Language Models
di: Zhu, Xudong, et al.
Pubblicazione: (2025)
di: Zhu, Xudong, et al.
Pubblicazione: (2025)
Unraveling Indirect In-Context Learning Using Influence Functions
di: Askari, Hadi, et al.
Pubblicazione: (2025)
di: Askari, Hadi, et al.
Pubblicazione: (2025)
Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling
di: Monjur, Ocean, et al.
Pubblicazione: (2026)
di: Monjur, Ocean, et al.
Pubblicazione: (2026)
Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers
di: Adhikari, Rabin
Pubblicazione: (2025)
di: Adhikari, Rabin
Pubblicazione: (2025)
Lookahead Counterfactual Fairness
di: Zuo, Zhiqun, et al.
Pubblicazione: (2024)
di: Zuo, Zhiqun, et al.
Pubblicazione: (2024)
Neuroplasticity-inspired dynamic ANNs for multi-task demand forecasting
di: Żarski, Mateusz, et al.
Pubblicazione: (2025)
di: Żarski, Mateusz, et al.
Pubblicazione: (2025)
Advancing Out-of-Distribution Detection via Local Neuroplasticity
di: Canevaro, Alessandro, et al.
Pubblicazione: (2025)
di: Canevaro, Alessandro, et al.
Pubblicazione: (2025)
Golden Layers and Where to Find Them: Improved Knowledge Editing for Large Language Models Via Layer Gradient Analysis
di: Datta, Shrestha, et al.
Pubblicazione: (2026)
di: Datta, Shrestha, et al.
Pubblicazione: (2026)
First is Not Really Better Than Last: Evaluating Layer Choice and Aggregation Strategies in Language Model Data Influence Estimation
di: Vitel, Dmytro, et al.
Pubblicazione: (2025)
di: Vitel, Dmytro, et al.
Pubblicazione: (2025)
Learning Tennis Strategy Through Curriculum-Based Dueling Double Deep Q-Networks
di: Mohan, Vishnu
Pubblicazione: (2025)
di: Mohan, Vishnu
Pubblicazione: (2025)
Representation Stability in a Minimal Continual Learning Agent
di: Subramanian, Vishnu
Pubblicazione: (2026)
di: Subramanian, Vishnu
Pubblicazione: (2026)
Noise Immunity in In-Context Tabular Learning: An Empirical Robustness Analysis of TabPFN's Attention Mechanisms
di: Hu, James, et al.
Pubblicazione: (2026)
di: Hu, James, et al.
Pubblicazione: (2026)
Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting
di: Wynn, Andrea, et al.
Pubblicazione: (2025)
di: Wynn, Andrea, et al.
Pubblicazione: (2025)
The Observer Effect in World Models: Invasive Adaptation Corrupts Latent Physics
di: Internò, Christian, et al.
Pubblicazione: (2026)
di: Internò, Christian, et al.
Pubblicazione: (2026)
Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling
di: Xu, Jiawei, et al.
Pubblicazione: (2024)
di: Xu, Jiawei, et al.
Pubblicazione: (2024)
Split Federated Learning Architectures for High-Accuracy and Low-Delay Model Training
di: Papageorgiou, Yiannis, et al.
Pubblicazione: (2026)
di: Papageorgiou, Yiannis, et al.
Pubblicazione: (2026)
Outlier Gradient Analysis: Efficiently Identifying Detrimental Training Samples for Deep Learning Models
di: Chhabra, Anshuman, et al.
Pubblicazione: (2024)
di: Chhabra, Anshuman, et al.
Pubblicazione: (2024)
A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior
di: Mayne, Harry, et al.
Pubblicazione: (2026)
di: Mayne, Harry, et al.
Pubblicazione: (2026)
Gate Recurrent Unit for Efficient Industrial Gas Identification
di: Wang, Ding
Pubblicazione: (2024)
di: Wang, Ding
Pubblicazione: (2024)
Generative Modeling from Black-box Corruptions via Self-Consistent Stochastic Interpolants
di: Modi, Chirag, et al.
Pubblicazione: (2025)
di: Modi, Chirag, et al.
Pubblicazione: (2025)
CNN Autoencoders for Hierarchical Feature Extraction and Fusion in Multi-sensor Human Activity Recognition
di: Arabzadeh, Saeed, et al.
Pubblicazione: (2025)
di: Arabzadeh, Saeed, et al.
Pubblicazione: (2025)
Corruption Robust Offline Reinforcement Learning with Human Feedback
di: Mandal, Debmalya, et al.
Pubblicazione: (2024)
di: Mandal, Debmalya, et al.
Pubblicazione: (2024)
FAMOUS: Flexible Accelerator for the Attention Mechanism of Transformer on UltraScale+ FPGAs
di: Kabir, Ehsan, et al.
Pubblicazione: (2024)
di: Kabir, Ehsan, et al.
Pubblicazione: (2024)
ExGRG: Explicitly-Generated Relation Graph for Self-Supervised Representation Learning
di: Naseri, Mahdi, et al.
Pubblicazione: (2024)
di: Naseri, Mahdi, et al.
Pubblicazione: (2024)
Curvature-Weighted Capacity Allocation: A Minimum Description Length Framework for Layer-Adaptive Large Language Model Optimization
di: Amaefuna, Theophilus, et al.
Pubblicazione: (2026)
di: Amaefuna, Theophilus, et al.
Pubblicazione: (2026)
Efficient Zero-Order Federated Finetuning of Language Models for Resource-Constrained Devices
di: Ahmed, Mohamed Aboelenien, et al.
Pubblicazione: (2025)
di: Ahmed, Mohamed Aboelenien, et al.
Pubblicazione: (2025)
Analytic Continual Test-Time Adaptation for Multi-Modality Corruption
di: Zhang, Yufei, et al.
Pubblicazione: (2024)
di: Zhang, Yufei, et al.
Pubblicazione: (2024)
Toward Optimal Regret in Robust Pricing: Decoupling Corruption and Time
di: Kalupahana, Kalana, et al.
Pubblicazione: (2026)
di: Kalupahana, Kalana, et al.
Pubblicazione: (2026)
Indirect Attention: Turning Context Misalignment into a Feature
di: Bahaduri, Bissmella, et al.
Pubblicazione: (2025)
di: Bahaduri, Bissmella, et al.
Pubblicazione: (2025)
Generalization and Membership Inference Attack a Practical Perspective
di: Rahmani, Fateme, et al.
Pubblicazione: (2026)
di: Rahmani, Fateme, et al.
Pubblicazione: (2026)
Model Failure or Data Corruption? Exploring Inconsistencies in Building Energy Ratings with Self-Supervised Contrastive Learning
di: Xiao, Qian, et al.
Pubblicazione: (2024)
di: Xiao, Qian, et al.
Pubblicazione: (2024)
Forecasting Application Counts in Talent Acquisition Platforms: Harnessing Multimodal Signals using LMs
di: Kabir, Md Ahsanul, et al.
Pubblicazione: (2024)
di: Kabir, Md Ahsanul, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On the transferability of Sparse Autoencoders for interpreting compressed models
di: Gupte, Suchit, et al.
Pubblicazione: (2025) -
Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability
di: Chhabra, Vishnu Kabir, et al.
Pubblicazione: (2025) -
ECG Signal Denoising Using Multi-scale Patch Embedding and Transformers
di: Zhu, Ding, et al.
Pubblicazione: (2024) -
An Efficient Training Algorithm for Models with Block-wise Sparsity
di: Zhu, Ding, et al.
Pubblicazione: (2025) -
Post-processing for Fair Regression via Explainable SVD
di: Zuo, Zhiqun, et al.
Pubblicazione: (2025)