Activation Space Interventions Can Be Transferred Between Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Oozeer, Narmeen, Nathawani, Dhruv, Prakash, Nirmalendu, Lan, Michael, Harrasse, Abir, Abdullah, Amirali |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DreamReader: An Interpretability Toolkit for Text-to-Image Models
por: Prakash, Nirmalendu, et al.
Publicado: (2026)
por: Prakash, Nirmalendu, et al.
Publicado: (2026)
Distribution-Aware Feature Selection for SAEs
por: Oozeer, Narmeen, et al.
Publicado: (2025)
por: Oozeer, Narmeen, et al.
Publicado: (2025)
TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability Research
por: Harrasse, Abir, et al.
Publicado: (2025)
por: Harrasse, Abir, et al.
Publicado: (2025)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
por: Oozeer, Narmeen, et al.
Publicado: (2025)
por: Oozeer, Narmeen, et al.
Publicado: (2025)
Understanding and Mitigating Dataset Corruption in LLM Steering
por: Anderson, Cullen, et al.
Publicado: (2026)
por: Anderson, Cullen, et al.
Publicado: (2026)
Bilinear Convolution Decomposition for Causal RL Interpretability
por: Oozeer, Narmeen, et al.
Publicado: (2024)
por: Oozeer, Narmeen, et al.
Publicado: (2024)
Position: Require Frontier AI Labs To Release Small "Analog" Models
por: Upadhyay, Shriyash, et al.
Publicado: (2025)
por: Upadhyay, Shriyash, et al.
Publicado: (2025)
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
por: Prakash, Nirmalendu, et al.
Publicado: (2025)
por: Prakash, Nirmalendu, et al.
Publicado: (2025)
Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators
por: Roytburg, Dani, et al.
Publicado: (2025)
por: Roytburg, Dani, et al.
Publicado: (2025)
Curveball Steering: The Right Direction To Steer Isn't Always Linear
por: Raval, Shivam, et al.
Publicado: (2026)
por: Raval, Shivam, et al.
Publicado: (2026)
Spectral Superposition: A Theory of Feature Geometry
por: Ivanov, Georgi, et al.
Publicado: (2026)
por: Ivanov, Georgi, et al.
Publicado: (2026)
Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering
por: Prakash, Nirmalendu, et al.
Publicado: (2026)
por: Prakash, Nirmalendu, et al.
Publicado: (2026)
Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations
por: Roytburg, Dani, et al.
Publicado: (2026)
por: Roytburg, Dani, et al.
Publicado: (2026)
Multi-hop Question Answering over Knowledge Graphs using Large Language Models
por: Chakraborty, Abir
Publicado: (2024)
por: Chakraborty, Abir
Publicado: (2024)
Approximating Human Preferences Using a Multi-Judge Learned System
por: Sprejer, Eitán, et al.
Publicado: (2025)
por: Sprejer, Eitán, et al.
Publicado: (2025)
Steering Large Language Model Activations in Sparse Spaces
por: Bayat, Reza, et al.
Publicado: (2025)
por: Bayat, Reza, et al.
Publicado: (2025)
On Recovering Higher-order Interactions from Protein Language Models
por: Tsui, Darin, et al.
Publicado: (2024)
por: Tsui, Darin, et al.
Publicado: (2024)
Mind over Space: Can Multimodal Large Language Models Mentally Navigate?
por: Zhu, Qihui, et al.
Publicado: (2026)
por: Zhu, Qihui, et al.
Publicado: (2026)
Abstract Activation Spaces for Content-Invariant Reasoning in Large Language Models
por: Maraia, Gabriele, et al.
Publicado: (2026)
por: Maraia, Gabriele, et al.
Publicado: (2026)
Leveraging Large Language Models for Code Translation and Software Development in Scientific Computing
por: Dhruv, Akash, et al.
Publicado: (2024)
por: Dhruv, Akash, et al.
Publicado: (2024)
The RL/LLM Taxonomy Tree: Reviewing Synergies Between Reinforcement Learning and Large Language Models
por: Pternea, Moschoula, et al.
Publicado: (2024)
por: Pternea, Moschoula, et al.
Publicado: (2024)
Trajectory Adaptation using Large Language Models
por: Maurya, Anurag, et al.
Publicado: (2025)
por: Maurya, Anurag, et al.
Publicado: (2025)
Head-Specific Intervention Can Induce Misaligned AI Coordination in Large Language Models
por: Darm, Paul, et al.
Publicado: (2025)
por: Darm, Paul, et al.
Publicado: (2025)
Boosting Jailbreak Transferability for Large Language Models
por: Liu, Hanqing, et al.
Publicado: (2024)
por: Liu, Hanqing, et al.
Publicado: (2024)
Communicating Activations Between Language Model Agents
por: Ramesh, Vignav, et al.
Publicado: (2025)
por: Ramesh, Vignav, et al.
Publicado: (2025)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
por: Lan, Michael, et al.
Publicado: (2024)
por: Lan, Michael, et al.
Publicado: (2024)
Dynamic Adaptive Rank Space Exploration for Efficient Sentiment Analysis with Large Language Models
por: Ding, Hongcheng, et al.
Publicado: (2024)
por: Ding, Hongcheng, et al.
Publicado: (2024)
Measuring Representation Robustness in Large Language Models for Geometry
por: Jawandhia, Vedant, et al.
Publicado: (2026)
por: Jawandhia, Vedant, et al.
Publicado: (2026)
Rare Disease Differential Diagnosis with Large Language Models at Scale: From Abdominal Actinomycosis to Wilson's Disease
por: Schumacher, Elliot, et al.
Publicado: (2025)
por: Schumacher, Elliot, et al.
Publicado: (2025)
Can Large Language Models Reinvent Foundational Algorithms?
por: Zhao, Jian, et al.
Publicado: (2026)
por: Zhao, Jian, et al.
Publicado: (2026)
ALAS: Autonomous Learning Agent for Self-Updating Language Models
por: Atreja, Dhruv
Publicado: (2025)
por: Atreja, Dhruv
Publicado: (2025)
Chain-of-Thought in Large Language Models: Decoding, Projection, and Activation
por: Yang, Hao, et al.
Publicado: (2024)
por: Yang, Hao, et al.
Publicado: (2024)
Agent-Centric Projection of Prompting Techniques and Implications for Synthetic Training Data for Large Language Models
por: Dhamani, Dhruv, et al.
Publicado: (2025)
por: Dhamani, Dhruv, et al.
Publicado: (2025)
TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space?
por: Zong, Yikun, et al.
Publicado: (2026)
por: Zong, Yikun, et al.
Publicado: (2026)
Activation-Informed Merging of Large Language Models
por: Nobari, Amin Heyrani, et al.
Publicado: (2025)
por: Nobari, Amin Heyrani, et al.
Publicado: (2025)
EdgeAgentX-DT: Integrating Digital Twins and Generative AI for Resilient Edge Intelligence in Tactical Networks
por: Ray, Abir
Publicado: (2025)
por: Ray, Abir
Publicado: (2025)
An LLM Maturity Model for Reliable and Transparent Text-to-Query
por: Yu, Lei, et al.
Publicado: (2024)
por: Yu, Lei, et al.
Publicado: (2024)
Beyond Single Bugs: Benchmarking Large Language Models for Multi-Vulnerability Detection
por: Pushkar, Chinmay, et al.
Publicado: (2025)
por: Pushkar, Chinmay, et al.
Publicado: (2025)
Can Large Language Models Bridge the Gap in Environmental Knowledge?
por: Smail, Linda, et al.
Publicado: (2025)
por: Smail, Linda, et al.
Publicado: (2025)
Beyond Graphs: Can Large Language Models Comprehend Hypergraphs?
por: Feng, Yifan, et al.
Publicado: (2024)
por: Feng, Yifan, et al.
Publicado: (2024)
Ejemplares similares
-
DreamReader: An Interpretability Toolkit for Text-to-Image Models
por: Prakash, Nirmalendu, et al.
Publicado: (2026) -
Distribution-Aware Feature Selection for SAEs
por: Oozeer, Narmeen, et al.
Publicado: (2025) -
TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability Research
por: Harrasse, Abir, et al.
Publicado: (2025) -
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
por: Oozeer, Narmeen, et al.
Publicado: (2025) -
Understanding and Mitigating Dataset Corruption in LLM Steering
por: Anderson, Cullen, et al.
Publicado: (2026)