Chain-of-Thought Hijacking
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Jianli, Fu, Tingchen, Schaeffer, Rylan, Sharma, Mrinank, Barez, Fazl |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Same Question, Different Words: A Latent Adversarial Framework for Prompt Robustness
di: Fu, Tingchen, et al.
Pubblicazione: (2025)
di: Fu, Tingchen, et al.
Pubblicazione: (2025)
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
Best-of-N Jailbreaking
di: Hughes, John, et al.
Pubblicazione: (2024)
di: Hughes, John, et al.
Pubblicazione: (2024)
Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach
di: Wang, Tony T., et al.
Pubblicazione: (2024)
di: Wang, Tony T., et al.
Pubblicazione: (2024)
Understanding Addition in Transformers
di: Quirke, Philip, et al.
Pubblicazione: (2023)
di: Quirke, Philip, et al.
Pubblicazione: (2023)
Query Circuits: Explaining How Language Models Answer User Prompts
di: Wu, Tung-Yu, et al.
Pubblicazione: (2025)
di: Wu, Tung-Yu, et al.
Pubblicazione: (2025)
SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors
di: Chaudhary, Maheep, et al.
Pubblicazione: (2025)
di: Chaudhary, Maheep, et al.
Pubblicazione: (2025)
Rethinking AI Cultural Alignment
di: Bravansky, Michal, et al.
Pubblicazione: (2025)
di: Bravansky, Michal, et al.
Pubblicazione: (2025)
Large Language Models Relearn Removed Concepts
di: Lo, Michelle, et al.
Pubblicazione: (2024)
di: Lo, Michelle, et al.
Pubblicazione: (2024)
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
di: Lan, Michael, et al.
Pubblicazione: (2023)
di: Lan, Michael, et al.
Pubblicazione: (2023)
VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models
di: Gupta, Aman, et al.
Pubblicazione: (2025)
di: Gupta, Aman, et al.
Pubblicazione: (2025)
Interpreting Context Look-ups in Transformers: Investigating Attention-MLP Interactions
di: Neo, Clement, et al.
Pubblicazione: (2024)
di: Neo, Clement, et al.
Pubblicazione: (2024)
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
di: Schrodi, Simon, et al.
Pubblicazione: (2025)
di: Schrodi, Simon, et al.
Pubblicazione: (2025)
Visualizing Neural Network Imagination
di: Wichers, Nevan, et al.
Pubblicazione: (2024)
di: Wichers, Nevan, et al.
Pubblicazione: (2024)
AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation
di: Li, Changyi, et al.
Pubblicazione: (2026)
di: Li, Changyi, et al.
Pubblicazione: (2026)
Embodied AI: Emerging Risks and Opportunities for Policy Action
di: Perlo, Jared, et al.
Pubblicazione: (2025)
di: Perlo, Jared, et al.
Pubblicazione: (2025)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
di: Oozeer, Narmeen, et al.
Pubblicazione: (2025)
di: Oozeer, Narmeen, et al.
Pubblicazione: (2025)
Scaling sparse feature circuit finding for in-context learning
di: Kharlapenko, Dmitrii, et al.
Pubblicazione: (2025)
di: Kharlapenko, Dmitrii, et al.
Pubblicazione: (2025)
Old Habits Die Hard: How Conversational History Geometrically Traps LLMs
di: Simhi, Adi, et al.
Pubblicazione: (2026)
di: Simhi, Adi, et al.
Pubblicazione: (2026)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
di: Lan, Michael, et al.
Pubblicazione: (2024)
di: Lan, Michael, et al.
Pubblicazione: (2024)
Position: Model Collapse Does Not Mean What You Think
di: Schaeffer, Rylan, et al.
Pubblicazione: (2025)
di: Schaeffer, Rylan, et al.
Pubblicazione: (2025)
Understanding Adversarial Transfer: Why Representation-Space Attacks Fail Where Data-Space Attacks Succeed
di: Gupta, Isha, et al.
Pubblicazione: (2025)
di: Gupta, Isha, et al.
Pubblicazione: (2025)
Incorporating Unlabelled Data into Bayesian Neural Networks
di: Sharma, Mrinank, et al.
Pubblicazione: (2023)
di: Sharma, Mrinank, et al.
Pubblicazione: (2023)
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
di: Kim, Minseon, et al.
Pubblicazione: (2025)
di: Kim, Minseon, et al.
Pubblicazione: (2025)
Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
di: Fu, Tingchen, et al.
Pubblicazione: (2025)
di: Fu, Tingchen, et al.
Pubblicazione: (2025)
Disperse-Then-Merge: Pushing the Limits of Instruction Tuning via Alignment Tax Reduction
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
Chain-of-Thought in Large Language Models: Decoding, Projection, and Activation
di: Yang, Hao, et al.
Pubblicazione: (2024)
di: Yang, Hao, et al.
Pubblicazione: (2024)
Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
di: Li, Chengzhengxu, et al.
Pubblicazione: (2025)
di: Li, Chengzhengxu, et al.
Pubblicazione: (2025)
HijackRAG: Hijacking Attacks against Retrieval-Augmented Large Language Models
di: Zhang, Yucheng, et al.
Pubblicazione: (2024)
di: Zhang, Yucheng, et al.
Pubblicazione: (2024)
Streaming Hallucination Detection in Long Chain-of-Thought Reasoning
di: Lu, Haolang, et al.
Pubblicazione: (2026)
di: Lu, Haolang, et al.
Pubblicazione: (2026)
Supervised Chain of Thought
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
What Causes Polysemanticity? An Alternative Origin Story of Mixed Selectivity from Incidental Causes
di: Lecomte, Victor, et al.
Pubblicazione: (2023)
di: Lecomte, Victor, et al.
Pubblicazione: (2023)
Make Split, not Hijack: Preventing Feature-Space Hijacking Attacks in Split Learning
di: Khan, Tanveer, et al.
Pubblicazione: (2024)
di: Khan, Tanveer, et al.
Pubblicazione: (2024)
LLM Reasoning Is Latent, Not the Chain of Thought
di: Wang, Wenshuo
Pubblicazione: (2026)
di: Wang, Wenshuo
Pubblicazione: (2026)
Who's in Charge? Disempowerment Patterns in Real-World LLM Usage
di: Sharma, Mrinank, et al.
Pubblicazione: (2026)
di: Sharma, Mrinank, et al.
Pubblicazione: (2026)
Mitigating Misleading Chain-of-Thought Reasoning with Selective Filtering
di: Wu, Yexin, et al.
Pubblicazione: (2024)
di: Wu, Yexin, et al.
Pubblicazione: (2024)
Efficient Prediction of Pass@k Scaling in Large Language Models
di: Kazdan, Joshua, et al.
Pubblicazione: (2025)
di: Kazdan, Joshua, et al.
Pubblicazione: (2025)
Collapse or Thrive? Perils and Promises of Synthetic Data in a Self-Generating World
di: Kazdan, Joshua, et al.
Pubblicazione: (2024)
di: Kazdan, Joshua, et al.
Pubblicazione: (2024)
Consensus is Not Verification: Why Crowd Wisdom Strategies Fail for LLM Truthfulness
di: Denisov-Blanch, Yegor, et al.
Pubblicazione: (2026)
di: Denisov-Blanch, Yegor, et al.
Pubblicazione: (2026)
Curveball Steering: The Right Direction To Steer Isn't Always Linear
di: Raval, Shivam, et al.
Pubblicazione: (2026)
di: Raval, Shivam, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Same Question, Different Words: A Latent Adversarial Framework for Prompt Robustness
di: Fu, Tingchen, et al.
Pubblicazione: (2025) -
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
di: Fu, Tingchen, et al.
Pubblicazione: (2024) -
Best-of-N Jailbreaking
di: Hughes, John, et al.
Pubblicazione: (2024) -
Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach
di: Wang, Tony T., et al.
Pubblicazione: (2024) -
Understanding Addition in Transformers
di: Quirke, Philip, et al.
Pubblicazione: (2023)