Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Jingnan, Luo, Yanzhen, Xu, Jingjun, Liu, Bingnan, Chen, Yuxin, Cui, Chenhang, Deng, Gelei, Lu, Chaochao, Wang, Xiang, Zhang, An, Chua, Tat-Seng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Guard: Defending Large Reasoning Models via enhanced self-reflection
di: Zheng, Jingnan, et al.
Pubblicazione: (2026)
di: Zheng, Jingnan, et al.
Pubblicazione: (2026)
Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards
di: Zheng, Jingnan, et al.
Pubblicazione: (2025)
di: Zheng, Jingnan, et al.
Pubblicazione: (2025)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
Transport and Merge: Cross-Architecture Merging for Large Language Models
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models
di: Shi, Enyi, et al.
Pubblicazione: (2026)
di: Shi, Enyi, et al.
Pubblicazione: (2026)
The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
Ask-before-Plan: Proactive Language Agents for Real-World Planning
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
We Should Identify and Mitigate Third-Party Safety Risks in MCP-Powered Agent Systems
di: Fang, Junfeng, et al.
Pubblicazione: (2025)
di: Fang, Junfeng, et al.
Pubblicazione: (2025)
On Generative Agents in Recommendation
di: Zhang, An, et al.
Pubblicazione: (2023)
di: Zhang, An, et al.
Pubblicazione: (2023)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
di: Jin, Zhe, et al.
Pubblicazione: (2025)
di: Jin, Zhe, et al.
Pubblicazione: (2025)
Language Representations Can be What Recommenders Need: Findings and Potentials
di: Sheng, Leheng, et al.
Pubblicazione: (2024)
di: Sheng, Leheng, et al.
Pubblicazione: (2024)
Towards Goal-oriented Intelligent Tutoring Systems in Online Education
di: Deng, Yang, et al.
Pubblicazione: (2023)
di: Deng, Yang, et al.
Pubblicazione: (2023)
DRAFT: Task Decoupled Latent Reasoning for Agent Safety
di: Wang, Lin, et al.
Pubblicazione: (2026)
di: Wang, Lin, et al.
Pubblicazione: (2026)
ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation
di: Zheng, Jingnan, et al.
Pubblicazione: (2024)
di: Zheng, Jingnan, et al.
Pubblicazione: (2024)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
di: Zhang, An, et al.
Pubblicazione: (2024)
di: Zhang, An, et al.
Pubblicazione: (2024)
CARL: Criticality-Aware Agentic Reinforcement Learning
di: Shen, Leyang, et al.
Pubblicazione: (2025)
di: Shen, Leyang, et al.
Pubblicazione: (2025)
WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents
di: Liu, Bingnan, et al.
Pubblicazione: (2026)
di: Liu, Bingnan, et al.
Pubblicazione: (2026)
MASKDROID: Robust Android Malware Detection with Masked Graph Representations
di: Zheng, Jingnan, et al.
Pubblicazione: (2024)
di: Zheng, Jingnan, et al.
Pubblicazione: (2024)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Hello Again! LLM-powered Personalized Agent for Long-term Dialogue
di: Li, Hao, et al.
Pubblicazione: (2024)
di: Li, Hao, et al.
Pubblicazione: (2024)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
di: Yang, Jie, et al.
Pubblicazione: (2026)
di: Yang, Jie, et al.
Pubblicazione: (2026)
Discriminative Probing and Tuning for Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering
di: Chen, Yuxin, et al.
Pubblicazione: (2026)
di: Chen, Yuxin, et al.
Pubblicazione: (2026)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
di: Chu, Meng, et al.
Pubblicazione: (2025)
di: Chu, Meng, et al.
Pubblicazione: (2025)
Universal Scene Graph Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Learning to Ask Critical Questions for Assisting Product Search
di: Li, Zixuan, et al.
Pubblicazione: (2024)
di: Li, Zixuan, et al.
Pubblicazione: (2024)
Aligning Large Language Models for Faithful Integrity Against Opposing Argument
di: Zhao, Yong, et al.
Pubblicazione: (2025)
di: Zhao, Yong, et al.
Pubblicazione: (2025)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
di: Fang, Junfeng, et al.
Pubblicazione: (2025)
di: Fang, Junfeng, et al.
Pubblicazione: (2025)
Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
di: Wang, Ruipeng, et al.
Pubblicazione: (2026)
di: Wang, Ruipeng, et al.
Pubblicazione: (2026)
Beyond Persuasion: Towards Conversational Recommender System with Credible Explanations
di: Qin, Peixin, et al.
Pubblicazione: (2024)
di: Qin, Peixin, et al.
Pubblicazione: (2024)
Bridging Jensen Gap for Max-Min Group Fairness Optimization in Recommendation
di: Xu, Chen, et al.
Pubblicazione: (2025)
di: Xu, Chen, et al.
Pubblicazione: (2025)
A Study of Implicit Ranking Unfairness in Large Language Models
di: Xu, Chen, et al.
Pubblicazione: (2023)
di: Xu, Chen, et al.
Pubblicazione: (2023)
On Softmax Direct Preference Optimization for Recommendation
di: Chen, Yuxin, et al.
Pubblicazione: (2024)
di: Chen, Yuxin, et al.
Pubblicazione: (2024)
Measuring What Matters: A Framework for Evaluating Safety Risks in Real-World LLM Applications
di: Goh, Jia Yi, et al.
Pubblicazione: (2025)
di: Goh, Jia Yi, et al.
Pubblicazione: (2025)
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
Distilling Transitional Pattern to Large Language Models for Multimodal Session-based Recommendation
di: Su, Jiajie, et al.
Pubblicazione: (2025)
di: Su, Jiajie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Self-Guard: Defending Large Reasoning Models via enhanced self-reflection
di: Zheng, Jingnan, et al.
Pubblicazione: (2026) -
Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer
di: Cui, Chenhang, et al.
Pubblicazione: (2026) -
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
di: Cui, Chenhang, et al.
Pubblicazione: (2024) -
RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards
di: Zheng, Jingnan, et al.
Pubblicazione: (2025) -
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
di: Cui, Chenhang, et al.
Pubblicazione: (2024)