TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
Fuente:
arXiv
Saved in:
| Main Authors: | Xiong, Xiqiao, Li, Ouxiang, Liu, Zhuo, Li, Moxin, Shi, Wentao, Zhu, Fengbin, Wang, Qifan, Feng, Fuli |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
by: Li, Moxin, et al.
Published: (2024)
by: Li, Moxin, et al.
Published: (2024)
Direct Multi-Turn Preference Optimization for Language Agents
by: Shi, Wentao, et al.
Published: (2024)
by: Shi, Wentao, et al.
Published: (2024)
Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents
by: Li, Yongxiang, et al.
Published: (2026)
by: Li, Yongxiang, et al.
Published: (2026)
Assistant-Guided Mitigation of Teacher Preference Bias in LLM-as-a-Judge
by: Liu, Zhuo, et al.
Published: (2025)
by: Liu, Zhuo, et al.
Published: (2025)
TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
by: Zhu, Fengbin, et al.
Published: (2024)
by: Zhu, Fengbin, et al.
Published: (2024)
Reason4Rec: Large Language Models for Recommendation with Deliberative User Preference Alignment
by: Fang, Yi, et al.
Published: (2025)
by: Fang, Yi, et al.
Published: (2025)
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
by: Li, Moxin, et al.
Published: (2025)
by: Li, Moxin, et al.
Published: (2025)
Doc2SoarGraph: Discrete Reasoning over Visually-Rich Table-Text Documents via Semantic-Oriented Hierarchical Graphs
by: Zhu, Fengbin, et al.
Published: (2023)
by: Zhu, Fengbin, et al.
Published: (2023)
Robust Prompt Optimization for Large Language Models Against Distribution Shifts
by: Li, Moxin, et al.
Published: (2023)
by: Li, Moxin, et al.
Published: (2023)
PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models
by: Wang, Chengbing, et al.
Published: (2026)
by: Wang, Chengbing, et al.
Published: (2026)
K-order Ranking Preference Optimization for Large Language Models
by: Cai, Shihao, et al.
Published: (2025)
by: Cai, Shihao, et al.
Published: (2025)
CrAM: Credibility-Aware Attention Modification in LLMs for Combating Misinformation in RAG
by: Deng, Boyi, et al.
Published: (2024)
by: Deng, Boyi, et al.
Published: (2024)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
by: Li, Xiaoyuan, et al.
Published: (2024)
by: Li, Xiaoyuan, et al.
Published: (2024)
One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment
by: Cai, Hongru, et al.
Published: (2026)
by: Cai, Hongru, et al.
Published: (2026)
Large Language Models are Learnable Planners for Long-Term Recommendation
by: Shi, Wentao, et al.
Published: (2024)
by: Shi, Wentao, et al.
Published: (2024)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
by: Li, Songze, et al.
Published: (2026)
by: Li, Songze, et al.
Published: (2026)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
by: Li, Xiaoyuan, et al.
Published: (2025)
by: Li, Xiaoyuan, et al.
Published: (2025)
Model Inversion Attacks Through Target-Specific Conditional Diffusion Models
by: Li, Ouxiang, et al.
Published: (2024)
by: Li, Ouxiang, et al.
Published: (2024)
SPEED: Scalable, Precise, and Efficient Concept Erasure for Diffusion Models
by: Li, Ouxiang, et al.
Published: (2025)
by: Li, Ouxiang, et al.
Published: (2025)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
by: Sun, Xiongtao, et al.
Published: (2024)
by: Sun, Xiongtao, et al.
Published: (2024)
Latent Inter-User Difference Modeling for LLM Personalization
by: Qiu, Yilun, et al.
Published: (2025)
by: Qiu, Yilun, et al.
Published: (2025)
Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search
by: Shi, Wentao, et al.
Published: (2025)
by: Shi, Wentao, et al.
Published: (2025)
Improving Synthetic Image Detection Towards Generalization: An Image Transformation Perspective
by: Li, Ouxiang, et al.
Published: (2024)
by: Li, Ouxiang, et al.
Published: (2024)
Counterfactual Debating with Preset Stances for Hallucination Elimination of LLMs
by: Fang, Yi, et al.
Published: (2024)
by: Fang, Yi, et al.
Published: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
by: Ying, Zonghao, et al.
Published: (2025)
by: Ying, Zonghao, et al.
Published: (2025)
Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search
by: Zhou, Andy, et al.
Published: (2025)
by: Zhou, Andy, et al.
Published: (2025)
Dual-Phase Accelerated Prompt Optimization
by: Yang, Muchen, et al.
Published: (2024)
by: Yang, Muchen, et al.
Published: (2024)
CoLLM: Integrating Collaborative Embeddings into Large Language Models for Recommendation
by: Zhang, Yang, et al.
Published: (2023)
by: Zhang, Yang, et al.
Published: (2023)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
by: Ma, Zhiqing, et al.
Published: (2026)
by: Ma, Zhiqing, et al.
Published: (2026)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
by: Nihal, Ragib Amin, et al.
Published: (2025)
by: Nihal, Ragib Amin, et al.
Published: (2025)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
by: Reddy, Aashray, et al.
Published: (2025)
by: Reddy, Aashray, et al.
Published: (2025)
RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking
by: Jiang, Yifan, et al.
Published: (2024)
by: Jiang, Yifan, et al.
Published: (2024)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
by: Reddy, Aashray, et al.
Published: (2025)
by: Reddy, Aashray, et al.
Published: (2025)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
by: Zhu, Fengbin, et al.
Published: (2026)
by: Zhu, Fengbin, et al.
Published: (2026)
Order-agnostic Identifier for Large Language Model-based Generative Recommendation
by: Lin, Xinyu, et al.
Published: (2025)
by: Lin, Xinyu, et al.
Published: (2025)
Optimizing Knowledge Integration in Retrieval-Augmented Generation with Self-Selection
by: Weng, Yan, et al.
Published: (2025)
by: Weng, Yan, et al.
Published: (2025)
Leveraging Memory Retrieval to Enhance LLM-based Generative Recommendation
by: Wang, Chengbing, et al.
Published: (2024)
by: Wang, Chengbing, et al.
Published: (2024)
CAPSUL: A Comprehensive Human Protein Benchmark for Subcellular Localization
by: Hu, Yicheng, et al.
Published: (2026)
by: Hu, Yicheng, et al.
Published: (2026)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
by: Wei, Quan, et al.
Published: (2025)
by: Wei, Quan, et al.
Published: (2025)
HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
by: Narula, Sidhant, et al.
Published: (2025)
by: Narula, Sidhant, et al.
Published: (2025)
Similar Items
-
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
by: Li, Moxin, et al.
Published: (2024) -
Direct Multi-Turn Preference Optimization for Language Agents
by: Shi, Wentao, et al.
Published: (2024) -
Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents
by: Li, Yongxiang, et al.
Published: (2026) -
Assistant-Guided Mitigation of Teacher Preference Bias in LLM-as-a-Judge
by: Liu, Zhuo, et al.
Published: (2025) -
TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
by: Zhu, Fengbin, et al.
Published: (2024)