Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Huilin, Zhao, Jian, Zhong, Yilu, Liang, Zhen, Chen, Xiuyuan, Yuan, Yuchen, Zhang, Tianle, Zhang, Chi, Zhang, Lan, Li, Xuelong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration
por: Chen, Xiuyuan, et al.
Publicado: (2025)
por: Chen, Xiuyuan, et al.
Publicado: (2025)
TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations
por: Chen, Xiuyuan, et al.
Publicado: (2025)
por: Chen, Xiuyuan, et al.
Publicado: (2025)
Visual Attention Reasoning via Hierarchical Search and Self-Verification
por: Cai, Wei, et al.
Publicado: (2025)
por: Cai, Wei, et al.
Publicado: (2025)
When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models
por: Cai, Wei, et al.
Publicado: (2025)
por: Cai, Wei, et al.
Publicado: (2025)
One-Way Policy Optimization for Self-Evolving LLMs
por: Yang, Shuo, et al.
Publicado: (2026)
por: Yang, Shuo, et al.
Publicado: (2026)
A Parameter-Efficient Mixture-of-Experts Framework for Cross-Modal Geo-Localization
por: Li, LinFeng, et al.
Publicado: (2025)
por: Li, LinFeng, et al.
Publicado: (2025)
Metis: Training LLMs with FP4 Quantization
por: Cao, Hengjie, et al.
Publicado: (2025)
por: Cao, Hengjie, et al.
Publicado: (2025)
Evolving LLMs' Self-Refinement Capability via Synergistic Training-Inference Optimization
por: Zeng, Yongcheng, et al.
Publicado: (2025)
por: Zeng, Yongcheng, et al.
Publicado: (2025)
Seeing What Matters: Visual Preference Policy Optimization for Visual Generation
por: Ni, Ziqi, et al.
Publicado: (2025)
por: Ni, Ziqi, et al.
Publicado: (2025)
Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
por: Cai, Wei, et al.
Publicado: (2025)
por: Cai, Wei, et al.
Publicado: (2025)
Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia
por: Shen, Guangyu, et al.
Publicado: (2024)
por: Shen, Guangyu, et al.
Publicado: (2024)
Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration
por: He, Yuxiang, et al.
Publicado: (2025)
por: He, Yuxiang, et al.
Publicado: (2025)
Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning
por: Lan, Xiaohan, et al.
Publicado: (2025)
por: Lan, Xiaohan, et al.
Publicado: (2025)
PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training
por: Lv, Mingrui, et al.
Publicado: (2025)
por: Lv, Mingrui, et al.
Publicado: (2025)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023)
por: Chen, Xiuyuan, et al.
Publicado: (2023)
Self-Evolved Reward Learning for LLMs
por: Huang, Chenghua, et al.
Publicado: (2024)
por: Huang, Chenghua, et al.
Publicado: (2024)
LLMs Caught in the Crossfire: Malware Requests and Jailbreak Challenges
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
por: Zhang, Zheng, et al.
Publicado: (2025)
por: Zhang, Zheng, et al.
Publicado: (2025)
Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction
por: Fan, Chenyou, et al.
Publicado: (2025)
por: Fan, Chenyou, et al.
Publicado: (2025)
TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking
por: Zeng, Churui, et al.
Publicado: (2026)
por: Zeng, Churui, et al.
Publicado: (2026)
MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
por: Zhang, Jianyi, et al.
Publicado: (2025)
por: Zhang, Jianyi, et al.
Publicado: (2025)
Intention Analysis Makes LLMs A Good Jailbreak Defender
por: Zhang, Yuqi, et al.
Publicado: (2024)
por: Zhang, Yuqi, et al.
Publicado: (2024)
CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
por: Ning, Zhiyuan, et al.
Publicado: (2025)
por: Ning, Zhiyuan, et al.
Publicado: (2025)
SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation
por: Gui, Youqiang, et al.
Publicado: (2026)
por: Gui, Youqiang, et al.
Publicado: (2026)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
por: Zhang, Tianle, et al.
Publicado: (2024)
por: Zhang, Tianle, et al.
Publicado: (2024)
Empirical Evidence for the Fragment level Understanding on Drug Molecular Structure of LLMs
por: Hu, Xiuyuan, et al.
Publicado: (2024)
por: Hu, Xiuyuan, et al.
Publicado: (2024)
The Struggle Between Continuation and Refusal: A Mechanistic Analysis of the Continuation-Triggered Jailbreak in LLMs
por: Deng, Yonghong, et al.
Publicado: (2026)
por: Deng, Yonghong, et al.
Publicado: (2026)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
por: Ji, Wence, et al.
Publicado: (2025)
por: Ji, Wence, et al.
Publicado: (2025)
Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
por: Yang, Wei, et al.
Publicado: (2026)
por: Yang, Wei, et al.
Publicado: (2026)
EoH-S: Evolution of Heuristic Set using LLMs for Automated Heuristic Design
por: Liu, Fei, et al.
Publicado: (2025)
por: Liu, Fei, et al.
Publicado: (2025)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
por: Shang, Zhengchun, et al.
Publicado: (2025)
por: Shang, Zhengchun, et al.
Publicado: (2025)
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
por: Chen, Yunhao, et al.
Publicado: (2025)
por: Chen, Yunhao, et al.
Publicado: (2025)
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
por: Zhu, Yuchen, et al.
Publicado: (2025)
por: Zhu, Yuchen, et al.
Publicado: (2025)
"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
por: Sun, Zhen, et al.
Publicado: (2025)
por: Sun, Zhen, et al.
Publicado: (2025)
Self-Evolving LLMs via Continual Instruction Tuning
por: Kang, Jiazheng, et al.
Publicado: (2025)
por: Kang, Jiazheng, et al.
Publicado: (2025)
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
por: Guo, Weiyang, et al.
Publicado: (2026)
por: Guo, Weiyang, et al.
Publicado: (2026)
NOTAM-Evolve: A Knowledge-Guided Self-Evolving Optimization Framework with LLMs for NOTAM Interpretation
por: Liu, Maoqi, et al.
Publicado: (2025)
por: Liu, Maoqi, et al.
Publicado: (2025)
FoMEMO: Towards Foundation Models for Expensive Multi-objective Optimization
por: Yao, Yiming, et al.
Publicado: (2025)
por: Yao, Yiming, et al.
Publicado: (2025)
Emulating Clinician Cognition via Self-Evolving Deep Clinical Research
por: Ren, Ruiyang, et al.
Publicado: (2026)
por: Ren, Ruiyang, et al.
Publicado: (2026)
Membership Inference for Contrastive Pre-training Models with Text-only PII Queries
por: Cheng, Ruoxi, et al.
Publicado: (2026)
por: Cheng, Ruoxi, et al.
Publicado: (2026)
Ejemplares similares
-
RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration
por: Chen, Xiuyuan, et al.
Publicado: (2025) -
TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations
por: Chen, Xiuyuan, et al.
Publicado: (2025) -
Visual Attention Reasoning via Hierarchical Search and Self-Verification
por: Cai, Wei, et al.
Publicado: (2025) -
When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models
por: Cai, Wei, et al.
Publicado: (2025) -
One-Way Policy Optimization for Self-Evolving LLMs
por: Yang, Shuo, et al.
Publicado: (2026)