ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Hyunjun, Ha, Junwoo, Yu, Sangyoon, Park, Haon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs
di: Ha, Junwoo, et al.
Pubblicazione: (2025)
di: Ha, Junwoo, et al.
Pubblicazione: (2025)
sudo rm -rf agentic_security
di: Lee, Sejin, et al.
Pubblicazione: (2025)
di: Lee, Sejin, et al.
Pubblicazione: (2025)
Entropic Context Shaping: Information-Theoretic Filtering for Context-Aware LLM Agents
di: Kim, Hyunjun
Pubblicazione: (2026)
di: Kim, Hyunjun
Pubblicazione: (2026)
ELITE: Enhanced Language-Image Toxicity Evaluation for Safety
di: Lee, Wonjun, et al.
Pubblicazione: (2025)
di: Lee, Wonjun, et al.
Pubblicazione: (2025)
RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
Defensive M2S: Training Guardrail Models on Compressed Multi-turn Conversations
di: Kim, Hyunjun
Pubblicazione: (2026)
di: Kim, Hyunjun
Pubblicazione: (2026)
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
di: Tang, Yuqi, et al.
Pubblicazione: (2025)
di: Tang, Yuqi, et al.
Pubblicazione: (2025)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
di: Li, Nathaniel, et al.
Pubblicazione: (2024)
di: Li, Nathaniel, et al.
Pubblicazione: (2024)
Attention-Aware GNN-based Input Defense against Multi-Turn LLM Jailbreak
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
Many-Turn Jailbreaking
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
MT-OSC: Path for LLMs that Get Lost in Multi-Turn Conversation
di: Singh, Jyotika, et al.
Pubblicazione: (2026)
di: Singh, Jyotika, et al.
Pubblicazione: (2026)
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
di: Feng, Mingqian, et al.
Pubblicazione: (2026)
di: Feng, Mingqian, et al.
Pubblicazione: (2026)
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
di: Panpatil, Siddhant, et al.
Pubblicazione: (2025)
di: Panpatil, Siddhant, et al.
Pubblicazione: (2025)
Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection
di: Wei, Zhipeng, et al.
Pubblicazione: (2024)
di: Wei, Zhipeng, et al.
Pubblicazione: (2024)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
di: Zhu, Sicheng, et al.
Pubblicazione: (2024)
di: Zhu, Sicheng, et al.
Pubblicazione: (2024)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
di: Chen, Junhao, et al.
Pubblicazione: (2025)
di: Chen, Junhao, et al.
Pubblicazione: (2025)
AIDG: A Formal Decomposition of Information Extraction and Containment Asymmetries in Multi-Turn LLM Dialogue
di: Sakhawat, Adib, et al.
Pubblicazione: (2026)
di: Sakhawat, Adib, et al.
Pubblicazione: (2026)
DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
A Finite-Calibration Regime Map for LLM Judge Panels
di: Zhu, Bin, et al.
Pubblicazione: (2026)
di: Zhu, Bin, et al.
Pubblicazione: (2026)
PARL-MT: Learning to Call Functions in Multi-Turn Conversation with Progress Awareness
di: Chai, Huacan, et al.
Pubblicazione: (2025)
di: Chai, Huacan, et al.
Pubblicazione: (2025)
MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games
di: Eisenstein, Jacob, et al.
Pubblicazione: (2026)
di: Eisenstein, Jacob, et al.
Pubblicazione: (2026)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
Are LLM-Judges Robust to Expressions of Uncertainty? Investigating the effect of Epistemic Markers on LLM-based Evaluation
di: Lee, Dongryeol, et al.
Pubblicazione: (2024)
di: Lee, Dongryeol, et al.
Pubblicazione: (2024)
FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge
di: Yang, Bo, et al.
Pubblicazione: (2026)
di: Yang, Bo, et al.
Pubblicazione: (2026)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
di: Ma, Zhiqing, et al.
Pubblicazione: (2026)
di: Ma, Zhiqing, et al.
Pubblicazione: (2026)
HELEA: Hard-Negative Benchmark and LLM-based Reranking for Robust Entity Alignment
di: Jang, Yoonjin, et al.
Pubblicazione: (2026)
di: Jang, Yoonjin, et al.
Pubblicazione: (2026)
Adaptive Stopping for Multi-Turn LLM Reasoning
di: Zhou, Xiaofan, et al.
Pubblicazione: (2026)
di: Zhou, Xiaofan, et al.
Pubblicazione: (2026)
MacroBench: A Novel Testbed for Web Automation Scripts via Large Language Models
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
di: Sun, Xiongtao, et al.
Pubblicazione: (2024)
di: Sun, Xiongtao, et al.
Pubblicazione: (2024)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
di: Ji, Haoxuan, et al.
Pubblicazione: (2024)
di: Ji, Haoxuan, et al.
Pubblicazione: (2024)
Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges
di: Li, Yanran
Pubblicazione: (2026)
di: Li, Yanran
Pubblicazione: (2026)
ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models
di: Luo, Sichun, et al.
Pubblicazione: (2025)
di: Luo, Sichun, et al.
Pubblicazione: (2025)
TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning
di: Kong, Yaxuan, et al.
Pubblicazione: (2026)
di: Kong, Yaxuan, et al.
Pubblicazione: (2026)
Counterfactual Graph for Multi-Agent LLM Calibration
di: Huang, Jiatan, et al.
Pubblicazione: (2026)
di: Huang, Jiatan, et al.
Pubblicazione: (2026)
Jailbreaking on Text-to-Video Models via Scene Splitting Strategy
di: Lee, Wonjun, et al.
Pubblicazione: (2025)
di: Lee, Wonjun, et al.
Pubblicazione: (2025)
Not the Example, but the Process: How Self-Generated Examples Enhance LLM Reasoning
di: Gwak, Daehoon, et al.
Pubblicazione: (2026)
di: Gwak, Daehoon, et al.
Pubblicazione: (2026)
A Comprehensive Evaluation of LLM Unlearning Robustness under Multi-Turn Interaction
di: Pan, Ruihao, et al.
Pubblicazione: (2026)
di: Pan, Ruihao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates
di: Kim, Hyunjun, et al.
Pubblicazione: (2025) -
M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs
di: Ha, Junwoo, et al.
Pubblicazione: (2025) -
sudo rm -rf agentic_security
di: Lee, Sejin, et al.
Pubblicazione: (2025) -
Entropic Context Shaping: Information-Theoretic Filtering for Context-Aware LLM Agents
di: Kim, Hyunjun
Pubblicazione: (2026) -
ELITE: Enhanced Language-Image Toxicity Evaluation for Safety
di: Lee, Wonjun, et al.
Pubblicazione: (2025)