Adversarial Reasoning at Jailbreaking Time
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sabbaghi, Mahdi, Kassianik, Paul, Pappas, George, Singer, Yaron, Karbasi, Amin, Hassani, Hamed |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
par: Mehrotra, Anay, et autres
Publié: (2023)
par: Mehrotra, Anay, et autres
Publié: (2023)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
par: Robey, Alexander, et autres
Publié: (2023)
par: Robey, Alexander, et autres
Publié: (2023)
InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting
par: Sabbaghi, Mahdi, et autres
Publié: (2026)
par: Sabbaghi, Mahdi, et autres
Publié: (2026)
Robust Policy Optimization to Prevent Catastrophic Forgetting
par: Sabbaghi, Mahdi, et autres
Publié: (2026)
par: Sabbaghi, Mahdi, et autres
Publié: (2026)
When to Trust the Cheap Check: Weak and Strong Verification for Reasoning
par: Kiyani, Shayan, et autres
Publié: (2026)
par: Kiyani, Shayan, et autres
Publié: (2026)
Explicitly Encoding Structural Symmetry is Key to Length Generalization in Arithmetic Tasks
par: Sabbaghi, Mahdi, et autres
Publié: (2024)
par: Sabbaghi, Mahdi, et autres
Publié: (2024)
Conformal Prediction with Learned Features
par: Kiyani, Shayan, et autres
Publié: (2024)
par: Kiyani, Shayan, et autres
Publié: (2024)
Jailbreaking Black Box Large Language Models in Twenty Queries
par: Chao, Patrick, et autres
Publié: (2023)
par: Chao, Patrick, et autres
Publié: (2023)
Length Optimization in Conformal Prediction
par: Kiyani, Shayan, et autres
Publié: (2024)
par: Kiyani, Shayan, et autres
Publié: (2024)
Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report
par: Yang, Zhuoran, et autres
Publié: (2026)
par: Yang, Zhuoran, et autres
Publié: (2026)
Decision Theoretic Foundations for Conformal Prediction: Optimal Uncertainty Quantification for Risk-Averse Agents
par: Kiyani, Shayan, et autres
Publié: (2025)
par: Kiyani, Shayan, et autres
Publié: (2025)
Conformal Prediction Beyond the Seen: A Missing Mass Perspective for Uncertainty Quantification in Generative Models
par: Noorani, Sima, et autres
Publié: (2025)
par: Noorani, Sima, et autres
Publié: (2025)
Robust Decision Making with Partially Calibrated Forecasts
par: Kiyani, Shayan, et autres
Publié: (2025)
par: Kiyani, Shayan, et autres
Publié: (2025)
Large Language Models Encode Semantics and Alignment in Linearly Separable Representations
par: Saglam, Baturay, et autres
Publié: (2025)
par: Saglam, Baturay, et autres
Publié: (2025)
Benchmarking Misuse Mitigation Against Covert Adversaries
par: Brown, Davis, et autres
Publié: (2025)
par: Brown, Davis, et autres
Publié: (2025)
Extracting Memorized Training Data via Decomposition
par: Su, Ellen, et autres
Publié: (2024)
par: Su, Ellen, et autres
Publié: (2024)
Temporal Difference Learning with Compressed Updates: Error-Feedback meets Reinforcement Learning
par: Mitra, Aritra, et autres
Publié: (2023)
par: Mitra, Aritra, et autres
Publié: (2023)
Conformal Inference under High-Dimensional Covariate Shifts via Likelihood-Ratio Regularization
par: Joshi, Sunay, et autres
Publié: (2025)
par: Joshi, Sunay, et autres
Publié: (2025)
Human-AI Collaborative Uncertainty Quantification
par: Noorani, Sima, et autres
Publié: (2025)
par: Noorani, Sima, et autres
Publié: (2025)
Exploring the Design Space of Transition Matching
par: Singer, Uriel, et autres
Publié: (2025)
par: Singer, Uriel, et autres
Publié: (2025)
Gödel Test: Can Large Language Models Solve Easy Conjectures?
par: Feldman, Moran, et autres
Publié: (2025)
par: Feldman, Moran, et autres
Publié: (2025)
LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback
par: Mura, Raffaele, et autres
Publié: (2025)
par: Mura, Raffaele, et autres
Publié: (2025)
Jailbreaking LLM-Controlled Robots
par: Robey, Alexander, et autres
Publié: (2024)
par: Robey, Alexander, et autres
Publié: (2024)
SubGen: Token Generation in Sublinear Time and Memory
par: Zandieh, Amir, et autres
Publié: (2024)
par: Zandieh, Amir, et autres
Publié: (2024)
Transition Matching: Scalable and Flexible Generative Modeling
par: Shaul, Neta, et autres
Publié: (2025)
par: Shaul, Neta, et autres
Publié: (2025)
PolarQuant: Quantizing KV Caches with Polar Transformation
par: Han, Insu, et autres
Publié: (2025)
par: Han, Insu, et autres
Publié: (2025)
Optimal Learners for Realizable Regression: PAC Learning and Online Learning
par: Attias, Idan, et autres
Publié: (2023)
par: Attias, Idan, et autres
Publié: (2023)
(Im)possibility of Automated Hallucination Detection in Large Language Models
par: Karbasi, Amin, et autres
Publié: (2025)
par: Karbasi, Amin, et autres
Publié: (2025)
Evaluating the Performance of Large Language Models via Debates
par: Moniri, Behrad, et autres
Publié: (2024)
par: Moniri, Behrad, et autres
Publié: (2024)
Capability-Based Scaling Trends for LLM-Based Red-Teaming
par: Panfilov, Alexander, et autres
Publié: (2025)
par: Panfilov, Alexander, et autres
Publié: (2025)
Stochastic Approximation with Delayed Updates: Finite-Time Rates under Markovian Sampling
par: Adibi, Arman, et autres
Publié: (2024)
par: Adibi, Arman, et autres
Publié: (2024)
A Closer Look at Adversarial Suffix Learning for Jailbreaking LLMs: Augmented Adversarial Trigger Learning
par: Wang, Zhe, et autres
Publié: (2025)
par: Wang, Zhe, et autres
Publié: (2025)
GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models
par: Holderrieth, Peter, et autres
Publié: (2025)
par: Holderrieth, Peter, et autres
Publié: (2025)
MemLoss: Enhancing Adversarial Training with Recycling Adversarial Examples
par: Mahdi, Soroush, et autres
Publié: (2025)
par: Mahdi, Soroush, et autres
Publié: (2025)
Exploring the impact of traffic signal control and connected and automated vehicles on intersections safety: A deep reinforcement learning approach
par: Karbasi, Amir Hossein, et autres
Publié: (2024)
par: Karbasi, Amir Hossein, et autres
Publié: (2024)
BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks
par: Anupam, Sagnik, et autres
Publié: (2025)
par: Anupam, Sagnik, et autres
Publié: (2025)
Conformal Information Pursuit for Interactively Guiding Large Language Models
par: Chan, Kwan Ho Ryan, et autres
Publié: (2025)
par: Chan, Kwan Ho Ryan, et autres
Publié: (2025)
Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing
par: Wang, Zehao, et autres
Publié: (2026)
par: Wang, Zehao, et autres
Publié: (2026)
CEAR: Certified Ensemble Adversarial Robustness in DNNs
par: Sadig, Daniel, et autres
Publié: (2026)
par: Sadig, Daniel, et autres
Publié: (2026)
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
par: Cao, Chentao, et autres
Publié: (2025)
par: Cao, Chentao, et autres
Publié: (2025)
Documents similaires
-
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
par: Mehrotra, Anay, et autres
Publié: (2023) -
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
par: Robey, Alexander, et autres
Publié: (2023) -
InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting
par: Sabbaghi, Mahdi, et autres
Publié: (2026) -
Robust Policy Optimization to Prevent Catastrophic Forgetting
par: Sabbaghi, Mahdi, et autres
Publié: (2026) -
When to Trust the Cheap Check: Weak and Strong Verification for Reasoning
par: Kiyani, Shayan, et autres
Publié: (2026)