GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tang, Hua, Yan, Lingyong, Zhao, Yukun, Wang, Shuaiqiang, Huang, Jizhou, Yin, Dawei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Joint Flashback Adaptation for Forgetting-Resistant Instruction Tuning
von: Zhao, Yukun, et al.
Veröffentlicht: (2025)
von: Zhao, Yukun, et al.
Veröffentlicht: (2025)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
von: Wu, Jiulong, et al.
Veröffentlicht: (2025)
von: Wu, Jiulong, et al.
Veröffentlicht: (2025)
PA-RAG: RAG Alignment via Multi-Perspective Preference Optimization
von: Wu, Jiayi, et al.
Veröffentlicht: (2024)
von: Wu, Jiayi, et al.
Veröffentlicht: (2024)
Knowing What LLMs DO NOT Know: A Simple Yet Effective Self-Detection Method
von: Zhao, Yukun, et al.
Veröffentlicht: (2023)
von: Zhao, Yukun, et al.
Veröffentlicht: (2023)
Divide-Then-Aggregate: An Efficient Tool Learning Method via Parallel Tool Invocation
von: Zhu, Dongsheng, et al.
Veröffentlicht: (2025)
von: Zhu, Dongsheng, et al.
Veröffentlicht: (2025)
Retrieval Models Aren't Tool-Savvy: Benchmarking Tool Retrieval for Large Language Models
von: Shi, Zhengliang, et al.
Veröffentlicht: (2025)
von: Shi, Zhengliang, et al.
Veröffentlicht: (2025)
Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking
von: Zhu, Junda, et al.
Veröffentlicht: (2025)
von: Zhu, Junda, et al.
Veröffentlicht: (2025)
The Real, the Better: Aligning Large Language Models with Online Human Behaviors
von: Jiang, Guanying, et al.
Veröffentlicht: (2024)
von: Jiang, Guanying, et al.
Veröffentlicht: (2024)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
von: Lyu, Yougang, et al.
Veröffentlicht: (2024)
von: Lyu, Yougang, et al.
Veröffentlicht: (2024)
MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented Generation
von: Chen, Yiqun, et al.
Veröffentlicht: (2025)
von: Chen, Yiqun, et al.
Veröffentlicht: (2025)
KnowTuning: Knowledge-aware Fine-tuning for Large Language Models
von: Lyu, Yougang, et al.
Veröffentlicht: (2024)
von: Lyu, Yougang, et al.
Veröffentlicht: (2024)
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
von: Weng, Zixuan, et al.
Veröffentlicht: (2025)
von: Weng, Zixuan, et al.
Veröffentlicht: (2025)
X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates
von: Kim, Hyunjun, et al.
Veröffentlicht: (2025)
von: Kim, Hyunjun, et al.
Veröffentlicht: (2025)
VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning
von: Shen, Yucheng, et al.
Veröffentlicht: (2026)
von: Shen, Yucheng, et al.
Veröffentlicht: (2026)
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
von: Qu, Changle, et al.
Veröffentlicht: (2026)
von: Qu, Changle, et al.
Veröffentlicht: (2026)
AdaSwitch: Balancing Exploration and Guidance in Knowledge Distillation via Adaptive Switching
von: Peng, Jingyu, et al.
Veröffentlicht: (2025)
von: Peng, Jingyu, et al.
Veröffentlicht: (2025)
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
von: Liu, Fan, et al.
Veröffentlicht: (2024)
von: Liu, Fan, et al.
Veröffentlicht: (2024)
MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs
von: Hsu, Hsin-Ling, et al.
Veröffentlicht: (2026)
von: Hsu, Hsin-Ling, et al.
Veröffentlicht: (2026)
Adversarial Yet Cooperative: Multi-Perspective Reasoning in Retrieved-Augmented Language Models
von: Xu, Can, et al.
Veröffentlicht: (2026)
von: Xu, Can, et al.
Veröffentlicht: (2026)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
von: Ji, Haoxuan, et al.
Veröffentlicht: (2024)
von: Ji, Haoxuan, et al.
Veröffentlicht: (2024)
MemeCMD: An Automatically Generated Chinese Multi-turn Dialogue Dataset with Contextually Retrieved Memes
von: Wang, Yuheng, et al.
Veröffentlicht: (2025)
von: Wang, Yuheng, et al.
Veröffentlicht: (2025)
From Exploration to Mastery: Enabling LLMs to Master Tools via Self-Driven Interactions
von: Qu, Changle, et al.
Veröffentlicht: (2024)
von: Qu, Changle, et al.
Veröffentlicht: (2024)
Improving the Robustness of Large Language Models via Consistency Alignment
von: Zhao, Yukun, et al.
Veröffentlicht: (2024)
von: Zhao, Yukun, et al.
Veröffentlicht: (2024)
Igniting Creative Writing in Small Language Models: LLM-as-a-Judge versus Multi-Agent Refined Rewards
von: Wei, Xiaolong, et al.
Veröffentlicht: (2025)
von: Wei, Xiaolong, et al.
Veröffentlicht: (2025)
MILL: Mutual Verification with Large Language Models for Zero-Shot Query Expansion
von: Jia, Pengyue, et al.
Veröffentlicht: (2023)
von: Jia, Pengyue, et al.
Veröffentlicht: (2023)
Evaluating and Enhancing LLMs for Multi-turn Text-to-SQL with Multiple Question Types
von: Guo, Ziming, et al.
Veröffentlicht: (2024)
von: Guo, Ziming, et al.
Veröffentlicht: (2024)
Reinforced Efficient Reasoning via Semantically Diverse Exploration
von: Zhao, Ziqi, et al.
Veröffentlicht: (2026)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2026)
Tool Learning with Large Language Models: A Survey
von: Qu, Changle, et al.
Veröffentlicht: (2024)
von: Qu, Changle, et al.
Veröffentlicht: (2024)
Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation
von: Yan, Lingyong, et al.
Veröffentlicht: (2026)
von: Yan, Lingyong, et al.
Veröffentlicht: (2026)
Rethinking Patient Education as Multi-turn Multi-modal Interaction
von: Yao, Zonghai, et al.
Veröffentlicht: (2026)
von: Yao, Zonghai, et al.
Veröffentlicht: (2026)
Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search
von: Chen, Yiqun, et al.
Veröffentlicht: (2026)
von: Chen, Yiqun, et al.
Veröffentlicht: (2026)
M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs
von: Ha, Junwoo, et al.
Veröffentlicht: (2025)
von: Ha, Junwoo, et al.
Veröffentlicht: (2025)
LLM-Specific Utility: A New Perspective for Retrieval-Augmented Generation
von: Zhang, Hengran, et al.
Veröffentlicht: (2025)
von: Zhang, Hengran, et al.
Veröffentlicht: (2025)
Jailbreaking to Jailbreak
von: Kritz, Jeremy, et al.
Veröffentlicht: (2025)
von: Kritz, Jeremy, et al.
Veröffentlicht: (2025)
Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning
von: Wei, Wenda, et al.
Veröffentlicht: (2025)
von: Wei, Wenda, et al.
Veröffentlicht: (2025)
Improving Multi-turn Dialogue Consistency with Self-Recall Thinking
von: Pang, Renning, et al.
Veröffentlicht: (2026)
von: Pang, Renning, et al.
Veröffentlicht: (2026)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
von: Zhou, Weikang, et al.
Veröffentlicht: (2024)
von: Zhou, Weikang, et al.
Veröffentlicht: (2024)
LENS: Learning Ensemble Confidence from Neural States for Multi-LLM Answer Integration
von: Guo, Jizhou
Veröffentlicht: (2025)
von: Guo, Jizhou
Veröffentlicht: (2025)
From Long to Lean: Performance-aware and Adaptive Chain-of-Thought Compression via Multi-round Refinement
von: Yan, Jianzhi, et al.
Veröffentlicht: (2025)
von: Yan, Jianzhi, et al.
Veröffentlicht: (2025)
SOMA: Efficient Multi-turn LLM Serving via Small Language Model
von: Cheng, Xueqi, et al.
Veröffentlicht: (2026)
von: Cheng, Xueqi, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Joint Flashback Adaptation for Forgetting-Resistant Instruction Tuning
von: Zhao, Yukun, et al.
Veröffentlicht: (2025) -
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
von: Wu, Jiulong, et al.
Veröffentlicht: (2025) -
PA-RAG: RAG Alignment via Multi-Perspective Preference Optimization
von: Wu, Jiayi, et al.
Veröffentlicht: (2024) -
Knowing What LLMs DO NOT Know: A Simple Yet Effective Self-Detection Method
von: Zhao, Yukun, et al.
Veröffentlicht: (2023) -
Divide-Then-Aggregate: An Efficient Tool Learning Method via Parallel Tool Invocation
von: Zhu, Dongsheng, et al.
Veröffentlicht: (2025)