Interpreting Learned Feedback Patterns in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Marks, Luke, Abdullah, Amir, Neo, Clement, Arike, Rauno, Krueger, David, Torr, Philip, Barez, Fazl |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Interpreting Visual Information Processing in Vision-Language Models
par: Neo, Clement, et autres
Publié: (2024)
par: Neo, Clement, et autres
Publié: (2024)
Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders
par: Marks, Luke, et autres
Publié: (2024)
par: Marks, Luke, et autres
Publié: (2024)
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
par: Lan, Michael, et autres
Publié: (2023)
par: Lan, Michael, et autres
Publié: (2023)
Understanding Addition and Subtraction in Transformers
par: Quirke, Philip, et autres
Publié: (2024)
par: Quirke, Philip, et autres
Publié: (2024)
Interpreting Context Look-ups in Transformers: Investigating Attention-MLP Interactions
par: Neo, Clement, et autres
Publié: (2024)
par: Neo, Clement, et autres
Publié: (2024)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
par: Lan, Michael, et autres
Publié: (2024)
par: Lan, Michael, et autres
Publié: (2024)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
par: Oozeer, Narmeen, et autres
Publié: (2025)
par: Oozeer, Narmeen, et autres
Publié: (2025)
TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability Research
par: Harrasse, Abir, et autres
Publié: (2025)
par: Harrasse, Abir, et autres
Publié: (2025)
Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
par: Oldfield, James, et autres
Publié: (2025)
par: Oldfield, James, et autres
Publié: (2025)
Do Sparse Autoencoders Generalize? A Case Study of Answerability
par: Heindrich, Lovis, et autres
Publié: (2025)
par: Heindrich, Lovis, et autres
Publié: (2025)
Technical Report: Evaluating Goal Drift in Language Model Agents
par: Arike, Rauno, et autres
Publié: (2025)
par: Arike, Rauno, et autres
Publié: (2025)
Understanding Addition in Transformers
par: Quirke, Philip, et autres
Publié: (2023)
par: Quirke, Philip, et autres
Publié: (2023)
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
par: Kim, Minseon, et autres
Publié: (2025)
par: Kim, Minseon, et autres
Publié: (2025)
SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors
par: Chaudhary, Maheep, et autres
Publié: (2025)
par: Chaudhary, Maheep, et autres
Publié: (2025)
Same Question, Different Words: A Latent Adversarial Framework for Prompt Robustness
par: Fu, Tingchen, et autres
Publié: (2025)
par: Fu, Tingchen, et autres
Publié: (2025)
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
par: Fu, Tingchen, et autres
Publié: (2024)
par: Fu, Tingchen, et autres
Publié: (2024)
C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning
par: Mittal, Avni, et autres
Publié: (2026)
par: Mittal, Avni, et autres
Publié: (2026)
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
par: Schrodi, Simon, et autres
Publié: (2025)
par: Schrodi, Simon, et autres
Publié: (2025)
Visualizing Neural Network Imagination
par: Wichers, Nevan, et autres
Publié: (2024)
par: Wichers, Nevan, et autres
Publié: (2024)
Scaling sparse feature circuit finding for in-context learning
par: Kharlapenko, Dmitrii, et autres
Publié: (2025)
par: Kharlapenko, Dmitrii, et autres
Publié: (2025)
Large Language Models Relearn Removed Concepts
par: Lo, Michelle, et autres
Publié: (2024)
par: Lo, Michelle, et autres
Publié: (2024)
Informal Safety Guarantees for Simulated Optimizers Through Extrapolation from Partial Simulations
par: Marks, Luke
Publié: (2023)
par: Marks, Luke
Publié: (2023)
Interpreting Emergent Planning in Model-Free Reinforcement Learning
par: Bush, Thomas, et autres
Publié: (2025)
par: Bush, Thomas, et autres
Publié: (2025)
Open Problems in Machine Unlearning for AI Safety
par: Barez, Fazl, et autres
Publié: (2025)
par: Barez, Fazl, et autres
Publié: (2025)
Query Circuits: Explaining How Language Models Answer User Prompts
par: Wu, Tung-Yu, et autres
Publié: (2025)
par: Wu, Tung-Yu, et autres
Publié: (2025)
Beyond Monoliths: Expert Orchestration for More Capable, Democratic, and Safe Language Models
par: Quirke, Philip, et autres
Publié: (2025)
par: Quirke, Philip, et autres
Publié: (2025)
Interpretability Can Be Actionable
par: Orgad, Hadas, et autres
Publié: (2026)
par: Orgad, Hadas, et autres
Publié: (2026)
Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning
par: Yang, Puning, et autres
Publié: (2026)
par: Yang, Puning, et autres
Publié: (2026)
Taxonomy, Opportunities, and Challenges of Representation Engineering for Large Language Models
par: Wehner, Jan, et autres
Publié: (2025)
par: Wehner, Jan, et autres
Publié: (2025)
An MRP Formulation for Supervised Learning: Generalized Temporal Difference Learning Models
par: Pan, Yangchen, et autres
Publié: (2024)
par: Pan, Yangchen, et autres
Publié: (2024)
Measuring Progress in Dictionary Learning for Language Model Interpretability with Board Game Models
par: Karvonen, Adam, et autres
Publié: (2024)
par: Karvonen, Adam, et autres
Publié: (2024)
Revisiting Uncertainty Estimation and Calibration of Large Language Models
par: Tao, Linwei, et autres
Publié: (2025)
par: Tao, Linwei, et autres
Publié: (2025)
Do as I do (Safely): Mitigating Task-Specific Fine-tuning Risks in Large Language Models
par: Eiras, Francisco, et autres
Publié: (2024)
par: Eiras, Francisco, et autres
Publié: (2024)
VFusion3D: Learning Scalable 3D Generative Models from Video Diffusion Models
par: Han, Junlin, et autres
Publié: (2024)
par: Han, Junlin, et autres
Publié: (2024)
Towards Interpretable Deep Local Learning with Successive Gradient Reconciliation
par: Yang, Yibo, et autres
Publié: (2024)
par: Yang, Yibo, et autres
Publié: (2024)
TraceDet: Hallucination Detection from the Decoding Trace of Diffusion Large Language Models
par: Chang, Shenxu, et autres
Publié: (2025)
par: Chang, Shenxu, et autres
Publié: (2025)
Understanding Reasoning in Thinking Language Models via Steering Vectors
par: Venhoff, Constantin, et autres
Publié: (2025)
par: Venhoff, Constantin, et autres
Publié: (2025)
Improving Adversarial Transferability via Model Alignment
par: Ma, Avery, et autres
Publié: (2023)
par: Ma, Avery, et autres
Publié: (2023)
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
par: Marks, Samuel, et autres
Publié: (2024)
par: Marks, Samuel, et autres
Publié: (2024)
Base Models Know How to Reason, Thinking Models Learn When
par: Venhoff, Constantin, et autres
Publié: (2025)
par: Venhoff, Constantin, et autres
Publié: (2025)
Documents similaires
-
Towards Interpreting Visual Information Processing in Vision-Language Models
par: Neo, Clement, et autres
Publié: (2024) -
Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders
par: Marks, Luke, et autres
Publié: (2024) -
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
par: Lan, Michael, et autres
Publié: (2023) -
Understanding Addition and Subtraction in Transformers
par: Quirke, Philip, et autres
Publié: (2024) -
Interpreting Context Look-ups in Transformers: Investigating Attention-MLP Interactions
par: Neo, Clement, et autres
Publié: (2024)