Salvato in:
| Autori principali: | Yin, Bo, Li, Qi, Wang, Xinchao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.11882 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior
di: Yin, Bo, et al.
Pubblicazione: (2026)
di: Yin, Bo, et al.
Pubblicazione: (2026)
Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs
di: Li, Qi, et al.
Pubblicazione: (2025)
di: Li, Qi, et al.
Pubblicazione: (2025)
Detecting Silent Failures in Multi-Agentic AI Trajectories
di: Pathak, Divya, et al.
Pubblicazione: (2025)
di: Pathak, Divya, et al.
Pubblicazione: (2025)
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
di: Zong, Zefang, et al.
Pubblicazione: (2026)
di: Zong, Zefang, et al.
Pubblicazione: (2026)
Multilingual Safety Alignment via Self-Distillation
di: Qin, Ruiyang, et al.
Pubblicazione: (2026)
di: Qin, Ruiyang, et al.
Pubblicazione: (2026)
AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
Agentic Policy Optimization via Instruction-Policy Co-Evolution
di: Zhou, Han, et al.
Pubblicazione: (2025)
di: Zhou, Han, et al.
Pubblicazione: (2025)
Discrete Diffusion in Large Language and Multimodal Models: A Survey
di: Yu, Runpeng, et al.
Pubblicazione: (2025)
di: Yu, Runpeng, et al.
Pubblicazione: (2025)
Multi-Level Collaboration in Model Merging
di: Li, Qi, et al.
Pubblicazione: (2025)
di: Li, Qi, et al.
Pubblicazione: (2025)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
di: Li, Hao, et al.
Pubblicazione: (2026)
di: Li, Hao, et al.
Pubblicazione: (2026)
Vid-SME: Membership Inference Attacks against Large Video Understanding Models
di: Li, Qi, et al.
Pubblicazione: (2025)
di: Li, Qi, et al.
Pubblicazione: (2025)
AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models
di: Zhang, Jinchuan, et al.
Pubblicazione: (2025)
di: Zhang, Jinchuan, et al.
Pubblicazione: (2025)
From Fact Overwriting to Knowledge Evolution: Causal Editing via On-Policy Self-Distillation
di: Li, Shuaike, et al.
Pubblicazione: (2026)
di: Li, Shuaike, et al.
Pubblicazione: (2026)
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
di: Cao, Chentao, et al.
Pubblicazione: (2025)
di: Cao, Chentao, et al.
Pubblicazione: (2025)
Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
di: He, Shuo, et al.
Pubblicazione: (2026)
di: He, Shuo, et al.
Pubblicazione: (2026)
GraphBridge: Towards Arbitrary Transfer Learning in GNNs
di: Ju, Li, et al.
Pubblicazione: (2025)
di: Ju, Li, et al.
Pubblicazione: (2025)
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
di: Wang, Jiaxuan, et al.
Pubblicazione: (2026)
di: Wang, Jiaxuan, et al.
Pubblicazione: (2026)
Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment
di: Zhang, Lijun, et al.
Pubblicazione: (2025)
di: Zhang, Lijun, et al.
Pubblicazione: (2025)
Alita: Generalist Agent Enabling Scalable Agentic Reasoning with Minimal Predefinition and Maximal Self-Evolution
di: Qiu, Jiahao, et al.
Pubblicazione: (2025)
di: Qiu, Jiahao, et al.
Pubblicazione: (2025)
StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs
di: Luo, Yang, et al.
Pubblicazione: (2026)
di: Luo, Yang, et al.
Pubblicazione: (2026)
Catastrophic Failure of LLM Unlearning via Quantization
di: Zhang, Zhiwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2024)
Demystifying the Lifecycle of Failures in Platform-Orchestrated Agentic Workflows
di: Ma, Xuyan, et al.
Pubblicazione: (2025)
di: Ma, Xuyan, et al.
Pubblicazione: (2025)
Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment
di: Bajaj, Tanav Singh, et al.
Pubblicazione: (2026)
di: Bajaj, Tanav Singh, et al.
Pubblicazione: (2026)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
di: Wu, Di, et al.
Pubblicazione: (2026)
di: Wu, Di, et al.
Pubblicazione: (2026)
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
THINKSAFE: Self-Generated Safety Alignment for Reasoning Models
di: Lee, Seanie, et al.
Pubblicazione: (2026)
di: Lee, Seanie, et al.
Pubblicazione: (2026)
BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search
di: Liu, Shiyu, et al.
Pubblicazione: (2026)
di: Liu, Shiyu, et al.
Pubblicazione: (2026)
Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment
di: Li, Jiajia, et al.
Pubblicazione: (2026)
di: Li, Jiajia, et al.
Pubblicazione: (2026)
AI Alignment Strategies from a Risk Perspective: Independent Safety Mechanisms or Shared Failures?
di: Dung, Leonard, et al.
Pubblicazione: (2025)
di: Dung, Leonard, et al.
Pubblicazione: (2025)
HAGE: Harnessing Agentic Memory via RL-Driven Weighted Graph Evolution
di: Jiang, Dongming, et al.
Pubblicazione: (2026)
di: Jiang, Dongming, et al.
Pubblicazione: (2026)
Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth
di: Zhang, Jiawei, et al.
Pubblicazione: (2025)
di: Zhang, Jiawei, et al.
Pubblicazione: (2025)
What Matters For Safety Alignment?
di: Li, Xing, et al.
Pubblicazione: (2026)
di: Li, Xing, et al.
Pubblicazione: (2026)
Safety Alignment via Constrained Knowledge Unlearning
di: Shi, Zesheng, et al.
Pubblicazione: (2025)
di: Shi, Zesheng, et al.
Pubblicazione: (2025)
Revisiting Self-Supervised Heterogeneous Graph Learning from Spectral Clustering Perspective
di: Mo, Yujie, et al.
Pubblicazione: (2024)
di: Mo, Yujie, et al.
Pubblicazione: (2024)
Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
di: Li, Han, et al.
Pubblicazione: (2026)
di: Li, Han, et al.
Pubblicazione: (2026)
StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction
di: Xue, Xiangyuan, et al.
Pubblicazione: (2026)
di: Xue, Xiangyuan, et al.
Pubblicazione: (2026)
Agent Safety Alignment via Reinforcement Learning
di: Sha, Zeyang, et al.
Pubblicazione: (2025)
di: Sha, Zeyang, et al.
Pubblicazione: (2025)
Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems
di: Qi, Shihao, et al.
Pubblicazione: (2026)
di: Qi, Shihao, et al.
Pubblicazione: (2026)
Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron
di: Shen, Sicheng, et al.
Pubblicazione: (2026)
di: Shen, Sicheng, et al.
Pubblicazione: (2026)
To Retrieve or To Think? An Agentic Approach for Context Evolution
di: Chen, Rubing, et al.
Pubblicazione: (2026)
di: Chen, Rubing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior
di: Yin, Bo, et al.
Pubblicazione: (2026) -
Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs
di: Li, Qi, et al.
Pubblicazione: (2025) -
Detecting Silent Failures in Multi-Agentic AI Trajectories
di: Pathak, Divya, et al.
Pubblicazione: (2025) -
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
di: Zong, Zefang, et al.
Pubblicazione: (2026) -
Multilingual Safety Alignment via Self-Distillation
di: Qin, Ruiyang, et al.
Pubblicazione: (2026)