Enregistré dans:
| Auteurs principaux: | Yin, Bo, Li, Qi, Wang, Xinchao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.11882 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior
par: Yin, Bo, et autres
Publié: (2026)
par: Yin, Bo, et autres
Publié: (2026)
Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Detecting Silent Failures in Multi-Agentic AI Trajectories
par: Pathak, Divya, et autres
Publié: (2025)
par: Pathak, Divya, et autres
Publié: (2025)
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
par: Zong, Zefang, et autres
Publié: (2026)
par: Zong, Zefang, et autres
Publié: (2026)
Multilingual Safety Alignment via Self-Distillation
par: Qin, Ruiyang, et autres
Publié: (2026)
par: Qin, Ruiyang, et autres
Publié: (2026)
AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
Agentic Policy Optimization via Instruction-Policy Co-Evolution
par: Zhou, Han, et autres
Publié: (2025)
par: Zhou, Han, et autres
Publié: (2025)
Discrete Diffusion in Large Language and Multimodal Models: A Survey
par: Yu, Runpeng, et autres
Publié: (2025)
par: Yu, Runpeng, et autres
Publié: (2025)
Multi-Level Collaboration in Model Merging
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
Vid-SME: Membership Inference Attacks against Large Video Understanding Models
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models
par: Zhang, Jinchuan, et autres
Publié: (2025)
par: Zhang, Jinchuan, et autres
Publié: (2025)
From Fact Overwriting to Knowledge Evolution: Causal Editing via On-Policy Self-Distillation
par: Li, Shuaike, et autres
Publié: (2026)
par: Li, Shuaike, et autres
Publié: (2026)
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
par: Cao, Chentao, et autres
Publié: (2025)
par: Cao, Chentao, et autres
Publié: (2025)
Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
par: He, Shuo, et autres
Publié: (2026)
par: He, Shuo, et autres
Publié: (2026)
GraphBridge: Towards Arbitrary Transfer Learning in GNNs
par: Ju, Li, et autres
Publié: (2025)
par: Ju, Li, et autres
Publié: (2025)
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
par: Wang, Jiaxuan, et autres
Publié: (2026)
par: Wang, Jiaxuan, et autres
Publié: (2026)
Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment
par: Zhang, Lijun, et autres
Publié: (2025)
par: Zhang, Lijun, et autres
Publié: (2025)
Alita: Generalist Agent Enabling Scalable Agentic Reasoning with Minimal Predefinition and Maximal Self-Evolution
par: Qiu, Jiahao, et autres
Publié: (2025)
par: Qiu, Jiahao, et autres
Publié: (2025)
StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs
par: Luo, Yang, et autres
Publié: (2026)
par: Luo, Yang, et autres
Publié: (2026)
Catastrophic Failure of LLM Unlearning via Quantization
par: Zhang, Zhiwei, et autres
Publié: (2024)
par: Zhang, Zhiwei, et autres
Publié: (2024)
Demystifying the Lifecycle of Failures in Platform-Orchestrated Agentic Workflows
par: Ma, Xuyan, et autres
Publié: (2025)
par: Ma, Xuyan, et autres
Publié: (2025)
Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment
par: Bajaj, Tanav Singh, et autres
Publié: (2026)
par: Bajaj, Tanav Singh, et autres
Publié: (2026)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
par: Wu, Di, et autres
Publié: (2026)
par: Wu, Di, et autres
Publié: (2026)
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
par: Wang, Yuhang, et autres
Publié: (2025)
par: Wang, Yuhang, et autres
Publié: (2025)
THINKSAFE: Self-Generated Safety Alignment for Reasoning Models
par: Lee, Seanie, et autres
Publié: (2026)
par: Lee, Seanie, et autres
Publié: (2026)
BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search
par: Liu, Shiyu, et autres
Publié: (2026)
par: Liu, Shiyu, et autres
Publié: (2026)
Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment
par: Li, Jiajia, et autres
Publié: (2026)
par: Li, Jiajia, et autres
Publié: (2026)
AI Alignment Strategies from a Risk Perspective: Independent Safety Mechanisms or Shared Failures?
par: Dung, Leonard, et autres
Publié: (2025)
par: Dung, Leonard, et autres
Publié: (2025)
HAGE: Harnessing Agentic Memory via RL-Driven Weighted Graph Evolution
par: Jiang, Dongming, et autres
Publié: (2026)
par: Jiang, Dongming, et autres
Publié: (2026)
Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth
par: Zhang, Jiawei, et autres
Publié: (2025)
par: Zhang, Jiawei, et autres
Publié: (2025)
What Matters For Safety Alignment?
par: Li, Xing, et autres
Publié: (2026)
par: Li, Xing, et autres
Publié: (2026)
Safety Alignment via Constrained Knowledge Unlearning
par: Shi, Zesheng, et autres
Publié: (2025)
par: Shi, Zesheng, et autres
Publié: (2025)
Revisiting Self-Supervised Heterogeneous Graph Learning from Spectral Clustering Perspective
par: Mo, Yujie, et autres
Publié: (2024)
par: Mo, Yujie, et autres
Publié: (2024)
Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
par: Li, Han, et autres
Publié: (2026)
par: Li, Han, et autres
Publié: (2026)
StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction
par: Xue, Xiangyuan, et autres
Publié: (2026)
par: Xue, Xiangyuan, et autres
Publié: (2026)
Agent Safety Alignment via Reinforcement Learning
par: Sha, Zeyang, et autres
Publié: (2025)
par: Sha, Zeyang, et autres
Publié: (2025)
Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems
par: Qi, Shihao, et autres
Publié: (2026)
par: Qi, Shihao, et autres
Publié: (2026)
Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron
par: Shen, Sicheng, et autres
Publié: (2026)
par: Shen, Sicheng, et autres
Publié: (2026)
To Retrieve or To Think? An Agentic Approach for Context Evolution
par: Chen, Rubing, et autres
Publié: (2026)
par: Chen, Rubing, et autres
Publié: (2026)
Documents similaires
-
Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior
par: Yin, Bo, et autres
Publié: (2026) -
Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs
par: Li, Qi, et autres
Publié: (2025) -
Detecting Silent Failures in Multi-Agentic AI Trajectories
par: Pathak, Divya, et autres
Publié: (2025) -
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
par: Zong, Zefang, et autres
Publié: (2026) -
Multilingual Safety Alignment via Self-Distillation
par: Qin, Ruiyang, et autres
Publié: (2026)