Saved in:
| Main Authors: | Yang, Xiaoxue, Lee, Jaeha, Dick, Anna-Katharina, Timm, Jasper, Xie, Fei, Cruz, Diogo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2508.07646 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
by: He, Zhida, et al.
Published: (2026)
by: He, Zhida, et al.
Published: (2026)
Automating Deception: Scalable Multi-Turn LLM Jailbreaks
by: Kumarappan, Adarsh, et al.
Published: (2025)
by: Kumarappan, Adarsh, et al.
Published: (2025)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
by: Li, Songze, et al.
Published: (2026)
by: Li, Songze, et al.
Published: (2026)
Jailbreaking is (Mostly) Simpler Than You Think
by: Russinovich, Mark, et al.
Published: (2025)
by: Russinovich, Mark, et al.
Published: (2025)
How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation
by: Feldman, Shai, et al.
Published: (2026)
by: Feldman, Shai, et al.
Published: (2026)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
by: Li, Nathaniel, et al.
Published: (2024)
by: Li, Nathaniel, et al.
Published: (2024)
X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
by: Rahman, Salman, et al.
Published: (2025)
by: Rahman, Salman, et al.
Published: (2025)
Exploring the holographic entropy cone via reinforcement learning
by: He, Temple, et al.
Published: (2026)
by: He, Temple, et al.
Published: (2026)
Attention-Aware GNN-based Input Defense against Multi-Turn LLM Jailbreak
by: Huang, Zixuan, et al.
Published: (2025)
by: Huang, Zixuan, et al.
Published: (2025)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
by: Reddy, Aashray, et al.
Published: (2025)
by: Reddy, Aashray, et al.
Published: (2025)
Orthogonal Gradient Boosting for Simpler Additive Rule Ensembles
by: Yang, Fan, et al.
Published: (2024)
by: Yang, Fan, et al.
Published: (2024)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
by: Xiong, Xiqiao, et al.
Published: (2025)
by: Xiong, Xiqiao, et al.
Published: (2025)
Understanding the learned look-ahead behavior of chess neural networks
by: Cruz, Diogo
Published: (2025)
by: Cruz, Diogo
Published: (2025)
RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking
by: Jiang, Yifan, et al.
Published: (2024)
by: Jiang, Yifan, et al.
Published: (2024)
Discovering Hidden Algebraic Structures via Transformers with Rank-Aware Beam GRPO
by: Lee, Jaeha, et al.
Published: (2025)
by: Lee, Jaeha, et al.
Published: (2025)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
by: Reddy, Aashray, et al.
Published: (2025)
by: Reddy, Aashray, et al.
Published: (2025)
Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs
by: Li, Junbo, et al.
Published: (2025)
by: Li, Junbo, et al.
Published: (2025)
Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors
by: Rofin, Mark, et al.
Published: (2026)
by: Rofin, Mark, et al.
Published: (2026)
OccamNets: Mitigating Dataset Bias by Favoring Simpler Hypotheses
by: Shrestha, Robik, et al.
Published: (2022)
by: Shrestha, Robik, et al.
Published: (2022)
A Simpler Alternative to Variational Regularized Counterfactual Risk Minimization
by: Bakker, Hua Chang, et al.
Published: (2024)
by: Bakker, Hua Chang, et al.
Published: (2024)
Revisiting Generative Policies: A Simpler Reinforcement Learning Algorithmic Perspective
by: Zhang, Jinouwen, et al.
Published: (2024)
by: Zhang, Jinouwen, et al.
Published: (2024)
Adversarial Alignment for LLMs Requires Simpler, Reproducible, and More Measurable Objectives
by: Schwinn, Leo, et al.
Published: (2025)
by: Schwinn, Leo, et al.
Published: (2025)
Intent Laundering: AI Safety Datasets Are Not What They Seem
by: Golchin, Shahriar, et al.
Published: (2026)
by: Golchin, Shahriar, et al.
Published: (2026)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
by: Wei, Quan, et al.
Published: (2025)
by: Wei, Quan, et al.
Published: (2025)
From Sparsity to Simplicity: Enabling Simpler Sequential Replacements via Sparse Attention Distillation
by: Ren, Yuxin, et al.
Published: (2026)
by: Ren, Yuxin, et al.
Published: (2026)
SimpleFold: Folding Proteins is Simpler than You Think
by: Wang, Yuyang, et al.
Published: (2025)
by: Wang, Yuyang, et al.
Published: (2025)
Comparator-Adaptive $Φ$-Regret: Improved Bounds, Simpler Algorithms, and Applications to Games
by: Hait, Soumita, et al.
Published: (2025)
by: Hait, Soumita, et al.
Published: (2025)
The Simpler The Better: An Entropy-Based Importance Metric To Reduce Neural Networks' Depth
by: Quétu, Victor, et al.
Published: (2024)
by: Quétu, Victor, et al.
Published: (2024)
Try with Simpler -- An Evaluation of Improved Principal Component Analysis in Log-based Anomaly Detection
by: Yang, Lin, et al.
Published: (2023)
by: Yang, Lin, et al.
Published: (2023)
OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models
by: Koo, Jahyun, et al.
Published: (2024)
by: Koo, Jahyun, et al.
Published: (2024)
BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
by: Lee, Isack, et al.
Published: (2024)
by: Lee, Isack, et al.
Published: (2024)
Position: Understanding LLMs Requires More Than Statistical Generalization
by: Reizinger, Patrik, et al.
Published: (2024)
by: Reizinger, Patrik, et al.
Published: (2024)
MPLite: Multi-Aspect Pretraining for Mining Clinical Health Records
by: Yang, Eric, et al.
Published: (2024)
by: Yang, Eric, et al.
Published: (2024)
Seemingly Redundant Modules Enhance Robust Odor Learning in Fruit Flies
by: Li, Haiyang, et al.
Published: (2025)
by: Li, Haiyang, et al.
Published: (2025)
In-Place Feedback: Reliable Refinement for Multi-Turn Expert-LLM Collaboration
by: Choi, Youngbin, et al.
Published: (2025)
by: Choi, Youngbin, et al.
Published: (2025)
Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing
by: Yang, Ning, et al.
Published: (2026)
by: Yang, Ning, et al.
Published: (2026)
Out-of-Domain Intent Detection Considering Multi-Turn Dialogue Contexts
by: Lang, Hao, et al.
Published: (2023)
by: Lang, Hao, et al.
Published: (2023)
Mitigating Conversational Inertia in Multi-Turn Agents
by: Wan, Yang, et al.
Published: (2026)
by: Wan, Yang, et al.
Published: (2026)
Discovering Hierarchy-Grounded Domains with Adaptive Granularity for Clinical Domain Generalization
by: Hu, Pengfei, et al.
Published: (2025)
by: Hu, Pengfei, et al.
Published: (2025)
Combinatorial Approximations for Cluster Deletion: Simpler, Faster, and Better
by: Balmaseda, Vicente, et al.
Published: (2024)
by: Balmaseda, Vicente, et al.
Published: (2024)
Similar Items
-
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
by: He, Zhida, et al.
Published: (2026) -
Automating Deception: Scalable Multi-Turn LLM Jailbreaks
by: Kumarappan, Adarsh, et al.
Published: (2025) -
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
by: Li, Songze, et al.
Published: (2026) -
Jailbreaking is (Mostly) Simpler Than You Think
by: Russinovich, Mark, et al.
Published: (2025) -
How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation
by: Feldman, Shai, et al.
Published: (2026)