Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ying, Zonghao, Wu, Siyang, Hao, Run, Ying, Peng, Sun, Shixuan, Chen, Pengyu, Chen, Junze, Du, Hao, Shen, Kaiwen, Wu, Shangkun, Wei, Jiwei, He, Shiyuan, Yang, Yang, Xu, Xiaohai, Ma, Ke, Xu, Qianqian, Huang, Qingming, Lin, Shi, Wang, Xun, Lin, Changting, Han, Meng, Jiang, Yilei, Lai, Siqi, Zheng, Yaozhi, Song, Yifei, Yue, Xiangyu, Jing, Zonglei, Zhang, Tianyuan, Zhu, Zhilei, Liu, Aishan, Wang, Jiakai, Liang, Siyuan, Kong, Xianglong, Li, Hainan, Mu, Junjie, Qin, Haotong, Yu, Yue, Chen, Lei, Juefei-Xu, Felix, Guo, Qing, Chen, Xinyun, Ong, Yew Soon, Liu, Xianglong, Song, Dawn, Yuille, Alan, Torr, Philip, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
par: Ying, Zonghao, et autres
Publié: (2024)
par: Ying, Zonghao, et autres
Publié: (2024)
CogMorph: Cognitive Morphing Attacks for Text-to-Image Models
par: Jing, Zonglei, et autres
Publié: (2025)
par: Jing, Zonglei, et autres
Publié: (2025)
Uncovering Security Threats and Architecting Defenses in Autonomous Agents: A Case Study of OpenClaw
par: Ying, Zonghao, et autres
Publié: (2026)
par: Ying, Zonghao, et autres
Publié: (2026)
SPARK: Jailbreaking T2V Models by Synergistically Prompting Auditory and Recontextualized Knowledge
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
par: Ying, Zonghao, et autres
Publié: (2026)
par: Ying, Zonghao, et autres
Publié: (2026)
Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
par: Xiao, Yisong, et autres
Publié: (2025)
par: Xiao, Yisong, et autres
Publié: (2025)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic
par: Zhang, Tianyuan, et autres
Publié: (2026)
par: Zhang, Tianyuan, et autres
Publié: (2026)
Exploring Semantic-constrained Adversarial Example with Instruction Uncertainty Reduction
par: Hu, Jin, et autres
Publié: (2025)
par: Hu, Jin, et autres
Publié: (2025)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
par: Ying, Zonghao, et autres
Publié: (2024)
par: Ying, Zonghao, et autres
Publié: (2024)
Uncovering Strategic Egoism Behaviors in Large Language Models
par: Zhang, Yaoyuan, et autres
Publié: (2025)
par: Zhang, Yaoyuan, et autres
Publié: (2025)
AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
PromptSafe: Gated Prompt Tuning for Safe Text-to-Image Generation
par: Jing, Zonglei, et autres
Publié: (2025)
par: Jing, Zonglei, et autres
Publié: (2025)
MetAdv: A Unified and Interactive Adversarial Testing Platform for Autonomous Driving
par: Liu, Aishan, et autres
Publié: (2025)
par: Liu, Aishan, et autres
Publié: (2025)
Adversarial Generation and Collaborative Evolution of Safety-Critical Scenarios for Autonomous Vehicles
par: Liu, Jiangfan, et autres
Publié: (2025)
par: Liu, Jiangfan, et autres
Publié: (2025)
AgentVisor: Defending LLM Agents Against Prompt Injection via Semantic Virtualization
par: Ying, Zonghao, et autres
Publié: (2026)
par: Ying, Zonghao, et autres
Publié: (2026)
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
par: Ying, Zonghao, et autres
Publié: (2024)
par: Ying, Zonghao, et autres
Publié: (2024)
Manipulating Multimodal Agents via Cross-Modal Prompt Injection
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
PRJ: Perception-Retrieval-Judgement for Generated Images
par: Fu, Qiang, et autres
Publié: (2025)
par: Fu, Qiang, et autres
Publié: (2025)
DynamicPAE: Generating Scene-Aware Physical Adversarial Examples in Real-Time
par: Hu, Jin, et autres
Publié: (2024)
par: Hu, Jin, et autres
Publié: (2024)
Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
Evolving Deception: When Agents Evolve, Deception Wins
par: Ying, Zonghao, et autres
Publié: (2026)
par: Ying, Zonghao, et autres
Publié: (2026)
SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
Byzantine Robust Cooperative Multi-Agent Reinforcement Learning as a Bayesian Game
par: Li, Simin, et autres
Publié: (2023)
par: Li, Simin, et autres
Publié: (2023)
Latent Imitator: Generating Natural Individual Discriminatory Instances for Black-Box Fairness Testing
par: Xiao, Yisong, et autres
Publié: (2023)
par: Xiao, Yisong, et autres
Publié: (2023)
M2G-Eval: Enhancing and Evaluating Multi-granularity Multilingual Code Generation
par: Xu, Fanglin, et autres
Publié: (2025)
par: Xu, Fanglin, et autres
Publié: (2025)
LanEvil: Benchmarking the Robustness of Lane Detection to Environmental Illusions
par: Zhang, Tianyuan, et autres
Publié: (2024)
par: Zhang, Tianyuan, et autres
Publié: (2024)
RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
BiDM: Pushing the Limit of Quantization for Diffusion Models
par: Zheng, Xingyu, et autres
Publié: (2024)
par: Zheng, Xingyu, et autres
Publié: (2024)
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
par: Zheng, Xingyu, et autres
Publié: (2025)
par: Zheng, Xingyu, et autres
Publié: (2025)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
par: Lin, Baijiong, et autres
Publié: (2025)
par: Lin, Baijiong, et autres
Publié: (2025)
BinaryDM: Accurate Weight Binarization for Efficient Diffusion Models
par: Zheng, Xingyu, et autres
Publié: (2024)
par: Zheng, Xingyu, et autres
Publié: (2024)
Token Masking Improves Transformer-Based Text Classification
par: Xu, Xianglong, et autres
Publié: (2025)
par: Xu, Xianglong, et autres
Publié: (2025)
statliang89/Pharmaceutical-product-approval-timelines: Predicting and Interpreting Pharmaceutical Product Approval Timelines through Structural Characteristics of Literature Citation Networks
par: Xianglong Liang
Publié: (2025)
par: Xianglong Liang
Publié: (2025)
Fairness Mediator: Neutralize Stereotype Associations to Mitigate Bias in Large Language Models
par: Xiao, Yisong, et autres
Publié: (2025)
par: Xiao, Yisong, et autres
Publié: (2025)
Towards Robust Physical-world Backdoor Attacks on Lane Detection
par: Zhang, Xinwei, et autres
Publié: (2024)
par: Zhang, Xinwei, et autres
Publié: (2024)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
Adversarial Examples in the Physical World: A Survey
par: Wang, Jiakai, et autres
Publié: (2023)
par: Wang, Jiakai, et autres
Publié: (2023)
Bandwidth-Efficient Two-Server ORAMs with O(1) Client Storage
par: Wang, Wei, et autres
Publié: (2025)
par: Wang, Wei, et autres
Publié: (2025)
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
par: Yang, Ge, et autres
Publié: (2024)
par: Yang, Ge, et autres
Publié: (2024)
Documents similaires
-
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
par: Ying, Zonghao, et autres
Publié: (2024) -
CogMorph: Cognitive Morphing Attacks for Text-to-Image Models
par: Jing, Zonglei, et autres
Publié: (2025) -
Uncovering Security Threats and Architecting Defenses in Autonomous Agents: A Case Study of OpenClaw
par: Ying, Zonghao, et autres
Publié: (2026) -
SPARK: Jailbreaking T2V Models by Synergistically Prompting Auditory and Recontextualized Knowledge
par: Ying, Zonghao, et autres
Publié: (2025) -
Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
par: Ying, Zonghao, et autres
Publié: (2026)