InverseScope: Scalable Activation Inversion for Interpreting Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Yifan, Zhou, Zhennan, Dong, Bin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
An Interpretable and Scalable Framework for Evaluating Large Language Models
por: Qu, Xinhao, et al.
Publicado: (2026)
por: Qu, Xinhao, et al.
Publicado: (2026)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
por: Soo, Samuel, et al.
Publicado: (2025)
por: Soo, Samuel, et al.
Publicado: (2025)
GWT: Scalable Optimizer State Compression for Large Language Model Training
por: Wen, Ziqing, et al.
Publicado: (2025)
por: Wen, Ziqing, et al.
Publicado: (2025)
Distributed Interpretability and Control for Large Language Models
por: Desai, Dev Arpan, et al.
Publicado: (2026)
por: Desai, Dev Arpan, et al.
Publicado: (2026)
Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
From Projection to Prediction: Beyond Logits for Scalable Language Models
por: Dong, Jianbing, et al.
Publicado: (2025)
por: Dong, Jianbing, et al.
Publicado: (2025)
Steering Large Language Model Activations in Sparse Spaces
por: Bayat, Reza, et al.
Publicado: (2025)
por: Bayat, Reza, et al.
Publicado: (2025)
Medical Interpretability and Knowledge Maps of Large Language Models
por: Marinescu, Razvan, et al.
Publicado: (2025)
por: Marinescu, Razvan, et al.
Publicado: (2025)
TS-Inverse: A Gradient Inversion Attack Tailored for Federated Time Series Forecasting Models
por: Meijer, Caspar, et al.
Publicado: (2025)
por: Meijer, Caspar, et al.
Publicado: (2025)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
por: Wang, Xu, et al.
Publicado: (2026)
por: Wang, Xu, et al.
Publicado: (2026)
Activation Sparsity Opportunities for Compressing General Large Language Models
por: Dhar, Nobel, et al.
Publicado: (2024)
por: Dhar, Nobel, et al.
Publicado: (2024)
Imitating Language via Scalable Inverse Reinforcement Learning
por: Wulfmeier, Markus, et al.
Publicado: (2024)
por: Wulfmeier, Markus, et al.
Publicado: (2024)
Towards Machine Theory of Mind with Large Language Model-Augmented Inverse Planning
por: Gelpí, Rebekah A., et al.
Publicado: (2025)
por: Gelpí, Rebekah A., et al.
Publicado: (2025)
Interpretable Operator Learning for Inverse Problems via Adaptive Spectral Filtering: Convergence and Discretization Invariance
por: Dong, Hang-Cheng, et al.
Publicado: (2026)
por: Dong, Hang-Cheng, et al.
Publicado: (2026)
Polynomial Composition Activations: Unleashing the Dynamics of Large Language Models
por: Zhuo, Zhijian, et al.
Publicado: (2024)
por: Zhuo, Zhijian, et al.
Publicado: (2024)
ASER: Activation Smoothing and Error Reconstruction for Large Language Model Quantization
por: Zhao, Weibo, et al.
Publicado: (2024)
por: Zhao, Weibo, et al.
Publicado: (2024)
Inverse Flow and Consistency Models
por: Zhang, Yuchen, et al.
Publicado: (2025)
por: Zhang, Yuchen, et al.
Publicado: (2025)
Towards Interpretable Deep Reinforcement Learning Models via Inverse Reinforcement Learning
por: Xie, Sean, et al.
Publicado: (2022)
por: Xie, Sean, et al.
Publicado: (2022)
WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference
por: Chen, Sihan, et al.
Publicado: (2025)
por: Chen, Sihan, et al.
Publicado: (2025)
Uncovering Gradient Inversion Risks in Practical Language Model Training
por: Feng, Xinguo, et al.
Publicado: (2025)
por: Feng, Xinguo, et al.
Publicado: (2025)
Uncovering Scaling Laws for Large Language Models via Inverse Problems
por: Verma, Arun, et al.
Publicado: (2025)
por: Verma, Arun, et al.
Publicado: (2025)
REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model
por: Li, Bo, et al.
Publicado: (2025)
por: Li, Bo, et al.
Publicado: (2025)
Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models
por: Winninger, Thomas, et al.
Publicado: (2025)
por: Winninger, Thomas, et al.
Publicado: (2025)
Rethinking Interpretability in the Era of Large Language Models
por: Singh, Chandan, et al.
Publicado: (2024)
por: Singh, Chandan, et al.
Publicado: (2024)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
por: Shu, Dong, et al.
Publicado: (2025)
por: Shu, Dong, et al.
Publicado: (2025)
Position: What Can Large Language Models Tell Us about Time Series Analysis
por: Jin, Ming, et al.
Publicado: (2024)
por: Jin, Ming, et al.
Publicado: (2024)
IDLM: Inverse-distilled Diffusion Language Models
por: Li, David, et al.
Publicado: (2026)
por: Li, David, et al.
Publicado: (2026)
Model Inversion Attacks on Llama 3: Extracting PII from Large Language Models
por: Sivashanmugam, Sathesh P.
Publicado: (2025)
por: Sivashanmugam, Sathesh P.
Publicado: (2025)
Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention
por: Lv, Xingtai, et al.
Publicado: (2024)
por: Lv, Xingtai, et al.
Publicado: (2024)
Prototype Training with Dual Pseudo-Inverse and Optimized Hidden Activations
por: Tucci, Mauro
Publicado: (2025)
por: Tucci, Mauro
Publicado: (2025)
Bridging Large Language Models and Graph Structure Learning Models for Robust Representation Learning
por: Su, Guangxin, et al.
Publicado: (2024)
por: Su, Guangxin, et al.
Publicado: (2024)
Reducing the Scope of Language Models
por: Yunis, David, et al.
Publicado: (2024)
por: Yunis, David, et al.
Publicado: (2024)
QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models
por: Zhou, Jiajun, et al.
Publicado: (2025)
por: Zhou, Jiajun, et al.
Publicado: (2025)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
por: Zhou, Yuyan, et al.
Publicado: (2026)
por: Zhou, Yuyan, et al.
Publicado: (2026)
Spectral Editing of Activations for Large Language Model Alignment
por: Qiu, Yifu, et al.
Publicado: (2024)
por: Qiu, Yifu, et al.
Publicado: (2024)
Conda: Column-Normalized Adam for Training Large Language Models Faster
por: Wang, Junjie, et al.
Publicado: (2025)
por: Wang, Junjie, et al.
Publicado: (2025)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
por: Cho, Hakaze, et al.
Publicado: (2025)
por: Cho, Hakaze, et al.
Publicado: (2025)
Learning Interpretable Rules for Scalable Data Representation and Classification
por: Wang, Zhuo, et al.
Publicado: (2023)
por: Wang, Zhuo, et al.
Publicado: (2023)
Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models
por: An, Tai, et al.
Publicado: (2025)
por: An, Tai, et al.
Publicado: (2025)
MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering
por: Ding, Chenlu, et al.
Publicado: (2025)
por: Ding, Chenlu, et al.
Publicado: (2025)
Ejemplares similares
-
An Interpretable and Scalable Framework for Evaluating Large Language Models
por: Qu, Xinhao, et al.
Publicado: (2026) -
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
por: Soo, Samuel, et al.
Publicado: (2025) -
GWT: Scalable Optimizer State Compression for Large Language Model Training
por: Wen, Ziqing, et al.
Publicado: (2025) -
Distributed Interpretability and Control for Large Language Models
por: Desai, Dev Arpan, et al.
Publicado: (2026) -
Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning
por: Sun, Hao, et al.
Publicado: (2024)