Hidden State Poisoning Attacks against Mamba-based Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mercier, Alexandre Le, Develder, Chris, Demeester, Thomas |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CLASP: Defending Hybrid Large Language Models Against Hidden State Poisoning Attacks
von: Mercier, Alexandre Le, et al.
Veröffentlicht: (2026)
von: Mercier, Alexandre Le, et al.
Veröffentlicht: (2026)
GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives
von: Mercier, Alexandre Le, et al.
Veröffentlicht: (2026)
von: Mercier, Alexandre Le, et al.
Veröffentlicht: (2026)
Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment
von: D'Oosterlinck, Karel, et al.
Veröffentlicht: (2024)
von: D'Oosterlinck, Karel, et al.
Veröffentlicht: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
von: Qian, Cheng, et al.
Veröffentlicht: (2024)
von: Qian, Cheng, et al.
Veröffentlicht: (2024)
Efficient Text Encoders for Labor Market Analysis
von: Decorte, Jens-Joris, et al.
Veröffentlicht: (2025)
von: Decorte, Jens-Joris, et al.
Veröffentlicht: (2025)
Preference Poisoning Attacks on Reward Model Learning
von: Wu, Junlin, et al.
Veröffentlicht: (2024)
von: Wu, Junlin, et al.
Veröffentlicht: (2024)
The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models
von: Flamant, Cedric, et al.
Veröffentlicht: (2026)
von: Flamant, Cedric, et al.
Veröffentlicht: (2026)
Layer by Layer: Uncovering Hidden Representations in Language Models
von: Skean, Oscar, et al.
Veröffentlicht: (2025)
von: Skean, Oscar, et al.
Veröffentlicht: (2025)
In-Context Learning for Extreme Multi-Label Classification
von: D'Oosterlinck, Karel, et al.
Veröffentlicht: (2024)
von: D'Oosterlinck, Karel, et al.
Veröffentlicht: (2024)
MemMamba: Rethinking Memory Patterns in State Space Model
von: Wang, Youjin, et al.
Veröffentlicht: (2025)
von: Wang, Youjin, et al.
Veröffentlicht: (2025)
Hidden Poison: Machine Unlearning Enables Camouflaged Poisoning Attacks
von: Di, Jimmy Z., et al.
Veröffentlicht: (2022)
von: Di, Jimmy Z., et al.
Veröffentlicht: (2022)
MoE-Mamba: Efficient Selective State Space Models with Mixture of Experts
von: Pióro, Maciej, et al.
Veröffentlicht: (2024)
von: Pióro, Maciej, et al.
Veröffentlicht: (2024)
Stuffed Mamba: Oversized States Lead to the Inability to Forget
von: Chen, Yingfa, et al.
Veröffentlicht: (2024)
von: Chen, Yingfa, et al.
Veröffentlicht: (2024)
Can Small-Scale Data Poisoning Exacerbate Dialect-Linked Biases in Large Language Models?
von: Abbas, Chaymaa, et al.
Veröffentlicht: (2025)
von: Abbas, Chaymaa, et al.
Veröffentlicht: (2025)
Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
von: Baumgärtner, Tim, et al.
Veröffentlicht: (2024)
von: Baumgärtner, Tim, et al.
Veröffentlicht: (2024)
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
von: Shao, Zedian, et al.
Veröffentlicht: (2024)
von: Shao, Zedian, et al.
Veröffentlicht: (2024)
Induced Numerical Instability: Hidden Costs in Multimodal Large Language Models
von: Wong, Wai Tuck, et al.
Veröffentlicht: (2026)
von: Wong, Wai Tuck, et al.
Veröffentlicht: (2026)
Introducing Background Temperature to Characterise Hidden Randomness in Large Language Models
von: Messina, Alberto, et al.
Veröffentlicht: (2026)
von: Messina, Alberto, et al.
Veröffentlicht: (2026)
Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models
von: Sun, Shaoning, et al.
Veröffentlicht: (2026)
von: Sun, Shaoning, et al.
Veröffentlicht: (2026)
Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models
von: Ghandeharioun, Asma, et al.
Veröffentlicht: (2024)
von: Ghandeharioun, Asma, et al.
Veröffentlicht: (2024)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
von: Chang, Hongyan, et al.
Veröffentlicht: (2024)
von: Chang, Hongyan, et al.
Veröffentlicht: (2024)
Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling
von: Amin, Adil
Veröffentlicht: (2026)
von: Amin, Adil
Veröffentlicht: (2026)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
von: Sitawarin, Chawin, et al.
Veröffentlicht: (2024)
von: Sitawarin, Chawin, et al.
Veröffentlicht: (2024)
When Chain-of-Thought Fails, the Solution Hides in the Hidden States
von: Mehrafarin, Houman, et al.
Veröffentlicht: (2026)
von: Mehrafarin, Houman, et al.
Veröffentlicht: (2026)
Learning to (Learn at Test Time): RNNs with Expressive Hidden States
von: Sun, Yu, et al.
Veröffentlicht: (2024)
von: Sun, Yu, et al.
Veröffentlicht: (2024)
The Computational Limits of State-Space Models and Mamba via the Lens of Circuit Complexity
von: Chen, Yifang, et al.
Veröffentlicht: (2024)
von: Chen, Yifang, et al.
Veröffentlicht: (2024)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
von: Li, Xiao, et al.
Veröffentlicht: (2024)
von: Li, Xiao, et al.
Veröffentlicht: (2024)
Large Language Model Hacking: Quantifying the Hidden Risks of Using LLMs for Text Annotation
von: Baumann, Joachim, et al.
Veröffentlicht: (2025)
von: Baumann, Joachim, et al.
Veröffentlicht: (2025)
Revisiting Character-level Adversarial Attacks for Language Models
von: Rocamora, Elias Abad, et al.
Veröffentlicht: (2024)
von: Rocamora, Elias Abad, et al.
Veröffentlicht: (2024)
Differential Mamba
von: Schneider, Nadav, et al.
Veröffentlicht: (2025)
von: Schneider, Nadav, et al.
Veröffentlicht: (2025)
Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process
von: Ye, Tian, et al.
Veröffentlicht: (2024)
von: Ye, Tian, et al.
Veröffentlicht: (2024)
On the Hidden Objective Biases of Group-based Reinforcement Learning
von: Fontana, Aleksandar, et al.
Veröffentlicht: (2026)
von: Fontana, Aleksandar, et al.
Veröffentlicht: (2026)
MambaQuant: Quantizing the Mamba Family with Variance Aligned Rotation Methods
von: Xu, Zukang, et al.
Veröffentlicht: (2025)
von: Xu, Zukang, et al.
Veröffentlicht: (2025)
Markov Constraint as Large Language Model Surrogate
von: Bonlarron, Alexandre, et al.
Veröffentlicht: (2024)
von: Bonlarron, Alexandre, et al.
Veröffentlicht: (2024)
From Associations to Activations: Comparing Behavioral and Hidden-State Semantic Geometry in LLMs
von: Schiekiera, Louis, et al.
Veröffentlicht: (2026)
von: Schiekiera, Louis, et al.
Veröffentlicht: (2026)
Large Language Models Are Overparameterized Text Encoders
von: K, Thennal D, et al.
Veröffentlicht: (2024)
von: K, Thennal D, et al.
Veröffentlicht: (2024)
Detection vs. Execution: Single-Bucket Probes Miss Half the Mamba-2 State Sink
von: Jiang, Yuhang
Veröffentlicht: (2026)
von: Jiang, Yuhang
Veröffentlicht: (2026)
Discovering Forbidden Topics in Language Models
von: Rager, Can, et al.
Veröffentlicht: (2025)
von: Rager, Can, et al.
Veröffentlicht: (2025)
On the Expressiveness and Length Generalization of Selective State-Space Models on Regular Languages
von: Terzić, Aleksandar, et al.
Veröffentlicht: (2024)
von: Terzić, Aleksandar, et al.
Veröffentlicht: (2024)
BlackMamba: Mixture of Experts for State-Space Models
von: Anthony, Quentin, et al.
Veröffentlicht: (2024)
von: Anthony, Quentin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
CLASP: Defending Hybrid Large Language Models Against Hidden State Poisoning Attacks
von: Mercier, Alexandre Le, et al.
Veröffentlicht: (2026) -
GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives
von: Mercier, Alexandre Le, et al.
Veröffentlicht: (2026) -
Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment
von: D'Oosterlinck, Karel, et al.
Veröffentlicht: (2024) -
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
von: Qian, Cheng, et al.
Veröffentlicht: (2024) -
Efficient Text Encoders for Labor Market Analysis
von: Decorte, Jens-Joris, et al.
Veröffentlicht: (2025)