Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Chung-En, Liu, Xiaodong, Yang, Weiwei, Weng, Tsui-Wei, Cheng, Hao, San, Aidan, Galley, Michel, Gao, Jianfeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Crafting Large Language Models for Enhanced Interpretability
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
Effective Skill Unlearning through Intervention and Abstention
di: Li, Yongce, et al.
Pubblicazione: (2025)
di: Li, Yongce, et al.
Pubblicazione: (2025)
ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
Steer2Edit: From Activation Steering to Component-Level Editing
di: Sun, Chung-En, et al.
Pubblicazione: (2026)
di: Sun, Chung-En, et al.
Pubblicazione: (2026)
Teaching Language Models to Self-Improve through Interactive Demonstrations
di: Yu, Xiao, et al.
Pubblicazione: (2023)
di: Yu, Xiao, et al.
Pubblicazione: (2023)
Self-Checker: Plug-and-Play Modules for Fact-Checking with Large Language Models
di: Li, Miaoran, et al.
Pubblicazione: (2023)
di: Li, Miaoran, et al.
Pubblicazione: (2023)
Concept Bottleneck Large Language Models
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
di: Feng, Mingqian, et al.
Pubblicazione: (2026)
di: Feng, Mingqian, et al.
Pubblicazione: (2026)
Breaking the Barrier: Enhanced Utility and Robustness in Smoothed DRL Agents
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
LLM Agents Already Know When to Call Tools -- Even Without Reasoning
di: Sun, Chung-En, et al.
Pubblicazione: (2026)
di: Sun, Chung-En, et al.
Pubblicazione: (2026)
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
di: Song, Jialin, et al.
Pubblicazione: (2026)
di: Song, Jialin, et al.
Pubblicazione: (2026)
Agentic-imodels: Evolving agentic interpretability tools via autoresearch
di: Singh, Chandan, et al.
Pubblicazione: (2026)
di: Singh, Chandan, et al.
Pubblicazione: (2026)
ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning
di: Yu, Xiao, et al.
Pubblicazione: (2024)
di: Yu, Xiao, et al.
Pubblicazione: (2024)
Rethinking Interpretability in the Era of Large Language Models
di: Singh, Chandan, et al.
Pubblicazione: (2024)
di: Singh, Chandan, et al.
Pubblicazione: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Enhancing the Reasoning Capabilities of Small Language Models via Solution Guidance Fine-Tuning
di: Bi, Jing, et al.
Pubblicazione: (2024)
di: Bi, Jing, et al.
Pubblicazione: (2024)
Dyna-Think: Synergizing Reasoning, Acting, and World Model Simulation in AI Agents
di: Yu, Xiao, et al.
Pubblicazione: (2025)
di: Yu, Xiao, et al.
Pubblicazione: (2025)
ReflCtrl: Controlling LLM Reflection via Representation Engineering
di: Yan, Ge, et al.
Pubblicazione: (2025)
di: Yan, Ge, et al.
Pubblicazione: (2025)
ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks
di: Yu, Xiaodong, et al.
Pubblicazione: (2023)
di: Yu, Xiaodong, et al.
Pubblicazione: (2023)
Training Large Reasoning Models Efficiently via Progressive Thought Encoding
di: Zhang, Zeliang, et al.
Pubblicazione: (2026)
di: Zhang, Zeliang, et al.
Pubblicazione: (2026)
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
di: Weng, Zixuan, et al.
Pubblicazione: (2025)
di: Weng, Zixuan, et al.
Pubblicazione: (2025)
SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants?
di: Dou, Yao, et al.
Pubblicazione: (2025)
di: Dou, Yao, et al.
Pubblicazione: (2025)
Dyna-Mind: Learning to Simulate from Experience for Better AI Agents
di: Yu, Xiao, et al.
Pubblicazione: (2025)
di: Yu, Xiao, et al.
Pubblicazione: (2025)
Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability
di: wang, Jiaming, et al.
Pubblicazione: (2025)
di: wang, Jiaming, et al.
Pubblicazione: (2025)
Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs
di: Kong, Aobo, et al.
Pubblicazione: (2024)
di: Kong, Aobo, et al.
Pubblicazione: (2024)
Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Experts
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
MIST: Jailbreaking Black-box Large Language Models via Iterative Semantic Tuning
di: Zheng, Muyang, et al.
Pubblicazione: (2025)
di: Zheng, Muyang, et al.
Pubblicazione: (2025)
PlugMem: A Task-Agnostic Plugin Memory Module for LLM Agents
di: Yang, Ke, et al.
Pubblicazione: (2026)
di: Yang, Ke, et al.
Pubblicazione: (2026)
MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
di: Lu, Pan, et al.
Pubblicazione: (2023)
di: Lu, Pan, et al.
Pubblicazione: (2023)
Double-Checker: Enhancing Reasoning of Slow-Thinking LLMs via Self-Critical Fine-Tuning
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context Optimization
di: Wang, Yidan, et al.
Pubblicazione: (2025)
di: Wang, Yidan, et al.
Pubblicazione: (2025)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
di: Tsui, Ken
Pubblicazione: (2025)
di: Tsui, Ken
Pubblicazione: (2025)
Evolving LLMs' Self-Refinement Capability via Synergistic Training-Inference Optimization
di: Zeng, Yongcheng, et al.
Pubblicazione: (2025)
di: Zeng, Yongcheng, et al.
Pubblicazione: (2025)
Mitigating Jailbreaks with Intent-Aware LLMs
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
di: Wang, Zijun, et al.
Pubblicazione: (2024)
di: Wang, Zijun, et al.
Pubblicazione: (2024)
Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
Jailbreak Instruction-Tuned LLMs via end-of-sentence MLP Re-weighting
di: Luo, Yifan, et al.
Pubblicazione: (2024)
di: Luo, Yifan, et al.
Pubblicazione: (2024)
Braille-to-Speech Generator: Audio Generation Based on Joint Fine-Tuning of CLIP and Fastspeech2
di: Xu, Chun, et al.
Pubblicazione: (2024)
di: Xu, Chun, et al.
Pubblicazione: (2024)
Language Models as Inductive Reasoners
di: Yang, Zonglin, et al.
Pubblicazione: (2022)
di: Yang, Zonglin, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Crafting Large Language Models for Enhanced Interpretability
di: Sun, Chung-En, et al.
Pubblicazione: (2024) -
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
di: Sun, Chung-En, et al.
Pubblicazione: (2025) -
Effective Skill Unlearning through Intervention and Abstention
di: Li, Yongce, et al.
Pubblicazione: (2025) -
ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
di: Sun, Chung-En, et al.
Pubblicazione: (2025) -
Steer2Edit: From Activation Steering to Component-Level Editing
di: Sun, Chung-En, et al.
Pubblicazione: (2026)