InversionView: A General-Purpose Method for Reading Information from Neural Activations
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Xinting, Panwar, Madhur, Goyal, Navin, Hahn, Michael |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
In-Context Learning through the Bayesian Prism
por: Panwar, Madhur, et al.
Publicado: (2023)
por: Panwar, Madhur, et al.
Publicado: (2023)
Decomposing Representation Space into Interpretable Subspaces with Unsupervised Learning
por: Huang, Xinting, et al.
Publicado: (2025)
por: Huang, Xinting, et al.
Publicado: (2025)
Discovering Interpretable Algorithms by Decompiling Transformers to RASP
por: Huang, Xinting, et al.
Publicado: (2026)
por: Huang, Xinting, et al.
Publicado: (2026)
Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers
por: Karvonen, Adam, et al.
Publicado: (2025)
por: Karvonen, Adam, et al.
Publicado: (2025)
Learning Syntax Without Planting Trees: Understanding Hierarchical Generalization in Transformers
por: Ahuja, Kabir, et al.
Publicado: (2024)
por: Ahuja, Kabir, et al.
Publicado: (2024)
DCRM: A Heuristic to Measure Response Pair Quality in Preference Optimization
por: Huang, Chengyu, et al.
Publicado: (2025)
por: Huang, Chengyu, et al.
Publicado: (2025)
Tag-LLM: Repurposing General-Purpose LLMs for Specialized Domains
por: Shen, Junhong, et al.
Publicado: (2024)
por: Shen, Junhong, et al.
Publicado: (2024)
Advancing General-Purpose Reasoning Models with Modular Gradient Surgery
por: Cai, Min, et al.
Publicado: (2026)
por: Cai, Min, et al.
Publicado: (2026)
Can General-Purpose Large Language Models Generalize to English-Thai Machine Translation ?
por: Chiaranaipanich, Jirat, et al.
Publicado: (2024)
por: Chiaranaipanich, Jirat, et al.
Publicado: (2024)
LLMs as Scalable, General-Purpose Simulators For Evolving Digital Agent Training
por: Wang, Yiming, et al.
Publicado: (2025)
por: Wang, Yiming, et al.
Publicado: (2025)
Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models
por: Wang, Boxin, et al.
Publicado: (2025)
por: Wang, Boxin, et al.
Publicado: (2025)
Agentic AI framework for End-to-End Medical Data Inference
por: Shimgekar, Soorya Ram, et al.
Publicado: (2025)
por: Shimgekar, Soorya Ram, et al.
Publicado: (2025)
A comprehensive study of on-device NLP applications -- VQA, automated Form filling, Smart Replies for Linguistic Codeswitching
por: Goyal, Naman
Publicado: (2024)
por: Goyal, Naman
Publicado: (2024)
Selection-p: Self-Supervised Task-Agnostic Prompt Compression for Faithfulness and Transferability
por: Chung, Tsz Ting, et al.
Publicado: (2024)
por: Chung, Tsz Ting, et al.
Publicado: (2024)
Extracting Unlearned Information from LLMs with Activation Steering
por: Seyitoğlu, Atakan, et al.
Publicado: (2024)
por: Seyitoğlu, Atakan, et al.
Publicado: (2024)
Empowering Small-Scale Knowledge Graphs: A Strategy of Leveraging General-Purpose Knowledge Graphs for Enriched Embeddings
por: Sawczyn, Albert, et al.
Publicado: (2024)
por: Sawczyn, Albert, et al.
Publicado: (2024)
Addressing LLM Diversity by Infusing Random Concepts
por: Agrawal, Pulin, et al.
Publicado: (2026)
por: Agrawal, Pulin, et al.
Publicado: (2026)
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
por: Zhang, Fred, et al.
Publicado: (2023)
por: Zhang, Fred, et al.
Publicado: (2023)
Label-semantics Aware Generative Approach for Domain-Agnostic Multilabel Classification
por: Khatuya, Subhendu, et al.
Publicado: (2025)
por: Khatuya, Subhendu, et al.
Publicado: (2025)
LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations
por: Lugoloobi, William, et al.
Publicado: (2026)
por: Lugoloobi, William, et al.
Publicado: (2026)
Memorization vs. Reasoning: Updating LLMs with New Knowledge
por: Li, Aochong Oliver, et al.
Publicado: (2025)
por: Li, Aochong Oliver, et al.
Publicado: (2025)
Steering Safely or Off a Cliff? Rethinking Specificity and Robustness in Inference-Time Interventions
por: Goyal, Navita, et al.
Publicado: (2026)
por: Goyal, Navita, et al.
Publicado: (2026)
Learning a Generative Meta-Model of LLM Activations
por: Luo, Grace, et al.
Publicado: (2026)
por: Luo, Grace, et al.
Publicado: (2026)
DigiData: Training and Evaluating General-Purpose Mobile Control Agents
por: Sun, Yuxuan, et al.
Publicado: (2025)
por: Sun, Yuxuan, et al.
Publicado: (2025)
Beyond the Training Distribution: Mapping Generalization Boundaries in Neural Program Synthesis
por: Voigt, Henrik, et al.
Publicado: (2026)
por: Voigt, Henrik, et al.
Publicado: (2026)
AlgoTune: Can Language Models Speed Up General-Purpose Numerical Programs?
por: Press, Ori, et al.
Publicado: (2025)
por: Press, Ori, et al.
Publicado: (2025)
LoRA Users Beware: A Few Spurious Tokens Can Manipulate Your Finetuned Model
por: Salles, Marcel Mateos, et al.
Publicado: (2025)
por: Salles, Marcel Mateos, et al.
Publicado: (2025)
Improving Neutral Point-of-View Generation with Data- and Parameter-Efficient RL
por: Hoffmann, Jessica, et al.
Publicado: (2025)
por: Hoffmann, Jessica, et al.
Publicado: (2025)
MAP's not dead yet: Uncovering true language model modes by conditioning away degeneracy
por: Yoshida, Davis, et al.
Publicado: (2023)
por: Yoshida, Davis, et al.
Publicado: (2023)
Debate Helps Weak Judges Reward Stronger Models
por: Elasky, Ethan, et al.
Publicado: (2026)
por: Elasky, Ethan, et al.
Publicado: (2026)
SERPENT-VLM : Self-Refining Radiology Report Generation Using Vision Language Models
por: Kapadnis, Manav Nitin, et al.
Publicado: (2024)
por: Kapadnis, Manav Nitin, et al.
Publicado: (2024)
Contextualize-then-Aggregate: Circuits for In-Context Learning in Gemma-2 2B
por: Bakalova, Aleksandra, et al.
Publicado: (2025)
por: Bakalova, Aleksandra, et al.
Publicado: (2025)
Was it Slander? Towards Exact Inversion of Generative Language Models
por: Skapars, Adrians, et al.
Publicado: (2024)
por: Skapars, Adrians, et al.
Publicado: (2024)
You Don't Need Prompt Engineering Anymore: The Prompting Inversion
por: Khan, Imran
Publicado: (2025)
por: Khan, Imran
Publicado: (2025)
Probing to Refine: Reinforcement Distillation of LLMs via Explanatory Inversion
por: Tan, Zhen, et al.
Publicado: (2026)
por: Tan, Zhen, et al.
Publicado: (2026)
HyperSteer: Activation Steering at Scale with Hypernetworks
por: Sun, Jiuding, et al.
Publicado: (2025)
por: Sun, Jiuding, et al.
Publicado: (2025)
Mode-Conditioning Unlocks Superior Test-Time Scaling
por: Wu, Chen Henry, et al.
Publicado: (2025)
por: Wu, Chen Henry, et al.
Publicado: (2025)
Can Models Learn Skill Composition from Examples?
por: Zhao, Haoyu, et al.
Publicado: (2024)
por: Zhao, Haoyu, et al.
Publicado: (2024)
View From Above: A Framework for Evaluating Distribution Shifts in Model Behavior
por: Chopra, Tanush, et al.
Publicado: (2024)
por: Chopra, Tanush, et al.
Publicado: (2024)
Understanding Generalization in Role-Playing Models via Information Theory
por: Li, Yongqi, et al.
Publicado: (2025)
por: Li, Yongqi, et al.
Publicado: (2025)
Ejemplares similares
-
In-Context Learning through the Bayesian Prism
por: Panwar, Madhur, et al.
Publicado: (2023) -
Decomposing Representation Space into Interpretable Subspaces with Unsupervised Learning
por: Huang, Xinting, et al.
Publicado: (2025) -
Discovering Interpretable Algorithms by Decompiling Transformers to RASP
por: Huang, Xinting, et al.
Publicado: (2026) -
Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers
por: Karvonen, Adam, et al.
Publicado: (2025) -
Learning Syntax Without Planting Trees: Understanding Hierarchical Generalization in Transformers
por: Ahuja, Kabir, et al.
Publicado: (2024)