Preemptive Detection and Steering of LLM Misalignment via Latent Reachability
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Karnik, Sathwik, Bansal, Somil |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Steering Away from Memorization: Reachability-Constrained Reinforcement Learning for Text-to-Image Diffusion
par: Karnik, Sathwik, et autres
Publié: (2026)
par: Karnik, Sathwik, et autres
Publié: (2026)
Verification of Neural Reachable Tubes via Scenario Optimization and Conformal Prediction
par: Lin, Albert, et autres
Publié: (2023)
par: Lin, Albert, et autres
Publié: (2023)
Discovering Closed-Loop Failures of Vision-Based Controllers via Reachability Analysis
par: Chakraborty, Kaustav, et autres
Publié: (2022)
par: Chakraborty, Kaustav, et autres
Publié: (2022)
Using Language Models as Closed-Loop High-Level Planners for Robotics Applications: A Brief Overview and Benchmarks
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
An Efficient Reachability-Based Framework for Provably Safe Autonomous Navigation in Unknown Environments
par: Bajcsy, Andrea, et autres
Publié: (2019)
par: Bajcsy, Andrea, et autres
Publié: (2019)
Steer LLM Latents for Hallucination Detection
par: Park, Seongheon, et autres
Publié: (2025)
par: Park, Seongheon, et autres
Publié: (2025)
One Filter to Deploy Them All: Robust Safety for Quadrupedal Navigation in Unknown Environments
par: Lin, Albert, et autres
Publié: (2024)
par: Lin, Albert, et autres
Publié: (2024)
LLM Misalignment via Adversarial RLHF Platforms
par: Entezami, Erfan, et autres
Publié: (2025)
par: Entezami, Erfan, et autres
Publié: (2025)
Preemptive Detection and Correction of Misaligned Actions in LLM Agents
par: Fang, Haishuo, et autres
Publié: (2024)
par: Fang, Haishuo, et autres
Publié: (2024)
BarrierSteer: LLM Safety via Learning Barrier Steering
par: Tran, Thanh Q., et autres
Publié: (2026)
par: Tran, Thanh Q., et autres
Publié: (2026)
Robust Verification of Controllers under State Uncertainty via Hamilton-Jacobi Reachability Analysis
par: Lin, Albert, et autres
Publié: (2025)
par: Lin, Albert, et autres
Publié: (2025)
Multi-Attribute Steering of Language Models via Targeted Intervention
par: Nguyen, Duy, et autres
Publié: (2025)
par: Nguyen, Duy, et autres
Publié: (2025)
Embodied Red Teaming for Auditing Robotic Foundation Models
par: Karnik, Sathwik, et autres
Publié: (2024)
par: Karnik, Sathwik, et autres
Publié: (2024)
Steered LLM Activations are Non-Surjective
par: Mishra, Aayush, et autres
Publié: (2026)
par: Mishra, Aayush, et autres
Publié: (2026)
Overtrained, Not Misaligned
par: Schreiber, Joel, et autres
Publié: (2026)
par: Schreiber, Joel, et autres
Publié: (2026)
Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
par: Egbuna, Nathan, et autres
Publié: (2025)
par: Egbuna, Nathan, et autres
Publié: (2025)
Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs
par: Liu, Andy Zeyi, et autres
Publié: (2026)
par: Liu, Andy Zeyi, et autres
Publié: (2026)
Understanding Emergent Misalignment via Feature Superposition Geometry
par: Minegishi, Gouki, et autres
Publié: (2026)
par: Minegishi, Gouki, et autres
Publié: (2026)
Steer Like the LLM: Activation Steering that Mimics Prompting
par: Heyman, Geert, et autres
Publié: (2026)
par: Heyman, Geert, et autres
Publié: (2026)
Latent Policy Steering with Embodiment-Agnostic Pretrained World Models
par: Wang, Yiqi, et autres
Publié: (2025)
par: Wang, Yiqi, et autres
Publié: (2025)
BLOCK-EM: Preventing Emergent Misalignment via Latent Blocking
par: Ustaomeroglu, Muhammed, et autres
Publié: (2026)
par: Ustaomeroglu, Muhammed, et autres
Publié: (2026)
Causal Identification in Time Series Models
par: Jahn, Erik, et autres
Publié: (2025)
par: Jahn, Erik, et autres
Publié: (2025)
The Rogue Scalpel: Activation Steering Compromises LLM Safety
par: Korznikov, Anton, et autres
Publié: (2025)
par: Korznikov, Anton, et autres
Publié: (2025)
Steering LLM Reasoning Through Bias-Only Adaptation
par: Sinii, Viacheslav, et autres
Publié: (2025)
par: Sinii, Viacheslav, et autres
Publié: (2025)
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
par: Yeon, Jehyeok, et autres
Publié: (2025)
par: Yeon, Jehyeok, et autres
Publié: (2025)
Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models
par: Wu, Jialin, et autres
Publié: (2026)
par: Wu, Jialin, et autres
Publié: (2026)
Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind
par: Xiao, Hanqi, et autres
Publié: (2026)
par: Xiao, Hanqi, et autres
Publié: (2026)
Model Organisms for Emergent Misalignment
par: Turner, Edward, et autres
Publié: (2025)
par: Turner, Edward, et autres
Publié: (2025)
KernelBand: Steering LLM-based Kernel Optimization via Hardware-Aware Multi-Armed Bandits
par: Ran, Dezhi, et autres
Publié: (2025)
par: Ran, Dezhi, et autres
Publié: (2025)
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
par: Jiang, Xinyan, et autres
Publié: (2026)
par: Jiang, Xinyan, et autres
Publié: (2026)
Convergent Linear Representations of Emergent Misalignment
par: Soligo, Anna, et autres
Publié: (2025)
par: Soligo, Anna, et autres
Publié: (2025)
Misalignment from Treating Means as Ends
par: Marklund, Henrik, et autres
Publié: (2025)
par: Marklund, Henrik, et autres
Publié: (2025)
Benchmarking Suite for Synthetic Aperture Radar Imagery Anomaly Detection (SARIAD) Algorithms
par: Chauvin, Lucian, et autres
Publié: (2025)
par: Chauvin, Lucian, et autres
Publié: (2025)
Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement
par: Wang, Anyi, et autres
Publié: (2025)
par: Wang, Anyi, et autres
Publié: (2025)
Steering LLMs via Scalable Interactive Oversight
par: Zhou, Enyu, et autres
Publié: (2026)
par: Zhou, Enyu, et autres
Publié: (2026)
The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering
par: Zhou, Yefan, et autres
Publié: (2026)
par: Zhou, Yefan, et autres
Publié: (2026)
Ulterior Motives: Detecting Misaligned Reasoning in Continuous Thought Models
par: Ramjee, Sharan
Publié: (2026)
par: Ramjee, Sharan
Publié: (2026)
Auto-Cypher: Improving LLMs on Cypher generation via LLM-supervised generation-verification framework
par: Tiwari, Aman, et autres
Publié: (2024)
par: Tiwari, Aman, et autres
Publié: (2024)
Fractional Reasoning via Latent Steering Vectors Improves Inference Time Compute
par: Liu, Sheng, et autres
Publié: (2025)
par: Liu, Sheng, et autres
Publié: (2025)
CBMAS: Cognitive Behavioral Modeling via Activation Steering
par: Ismail, Ahmed H., et autres
Publié: (2026)
par: Ismail, Ahmed H., et autres
Publié: (2026)
Documents similaires
-
Steering Away from Memorization: Reachability-Constrained Reinforcement Learning for Text-to-Image Diffusion
par: Karnik, Sathwik, et autres
Publié: (2026) -
Verification of Neural Reachable Tubes via Scenario Optimization and Conformal Prediction
par: Lin, Albert, et autres
Publié: (2023) -
Discovering Closed-Loop Failures of Vision-Based Controllers via Reachability Analysis
par: Chakraborty, Kaustav, et autres
Publié: (2022) -
Using Language Models as Closed-Loop High-Level Planners for Robotics Applications: A Brief Overview and Benchmarks
par: Wang, Hao, et autres
Publié: (2025) -
An Efficient Reachability-Based Framework for Provably Safe Autonomous Navigation in Unknown Environments
par: Bajcsy, Andrea, et autres
Publié: (2019)