TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Xiuyuan, Zhao, Jian, He, Yuxiang, Xun, Yuan, Liu, Xinwei, Li, Yanshu, Zhou, Huilin, Cai, Wei, Shi, Ziyan, Yuan, Yuchen, Zhang, Tianle, Zhang, Chi, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration
by: Chen, Xiuyuan, et al.
Published: (2025)
by: Chen, Xiuyuan, et al.
Published: (2025)
When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models
by: Cai, Wei, et al.
Published: (2025)
by: Cai, Wei, et al.
Published: (2025)
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
by: Zhou, Huilin, et al.
Published: (2026)
by: Zhou, Huilin, et al.
Published: (2026)
Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration
by: He, Yuxiang, et al.
Published: (2025)
by: He, Yuxiang, et al.
Published: (2025)
Multi-round jailbreak attack on large language models
by: Zhou, Yihua, et al.
Published: (2024)
by: Zhou, Yihua, et al.
Published: (2024)
Visual Attention Reasoning via Hierarchical Search and Self-Verification
by: Cai, Wei, et al.
Published: (2025)
by: Cai, Wei, et al.
Published: (2025)
Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
by: Cai, Wei, et al.
Published: (2025)
by: Cai, Wei, et al.
Published: (2025)
TeleStyle: Content-Preserving Style Transfer in Images and Videos
by: Zhang, Shiwen, et al.
Published: (2026)
by: Zhang, Shiwen, et al.
Published: (2026)
The Emotional Baby Is Truly Deadly: Does your Multimodal Large Reasoning Model Have Emotional Flattery towards Humans?
by: Xun, Yuan, et al.
Published: (2025)
by: Xun, Yuan, et al.
Published: (2025)
A Parameter-Efficient Mixture-of-Experts Framework for Cross-Modal Geo-Localization
by: Li, LinFeng, et al.
Published: (2025)
by: Li, LinFeng, et al.
Published: (2025)
Recursive language models for jailbreak detection: a procedural defense for tool-augmented agents
by: Shavit, Doron
Published: (2026)
by: Shavit, Doron
Published: (2026)
Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks
by: Yi, Xin, et al.
Published: (2025)
by: Yi, Xin, et al.
Published: (2025)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
by: Chen, Xiuyuan, et al.
Published: (2023)
by: Chen, Xiuyuan, et al.
Published: (2023)
PathBench: A comprehensive comparison benchmark for pathology foundation models towards precision oncology
by: Ma, Jiabo, et al.
Published: (2025)
by: Ma, Jiabo, et al.
Published: (2025)
DLP: towards active defense against backdoor attacks with decoupled learning process
by: Ying, Zonghao, et al.
Published: (2024)
by: Ying, Zonghao, et al.
Published: (2024)
TelePhysics: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time Interaction
by: Zhang, Xin, et al.
Published: (2026)
by: Zhang, Xin, et al.
Published: (2026)
Poisoning ML attack and defenses
by: Battista, Biggio, et al.
Published: (2025)
by: Battista, Biggio, et al.
Published: (2025)
ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding
by: Yang, Jianjiang, et al.
Published: (2025)
by: Yang, Jianjiang, et al.
Published: (2025)
TeleEgo: Benchmarking Egocentric AI Assistants in the Wild
by: Yan, Jiaqi, et al.
Published: (2025)
by: Yan, Jiaqi, et al.
Published: (2025)
Primase and polymerase α tango to make an RNA–DNA hybrid primer
by: Zuanning Yuan, et al.
Published: (2024)
by: Zuanning Yuan, et al.
Published: (2024)
Highlight & Summarize: RAG without the jailbreaks
by: Cherubin, Giovanni, et al.
Published: (2025)
by: Cherubin, Giovanni, et al.
Published: (2025)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
by: Li, Yanshu
Published: (2025)
by: Li, Yanshu
Published: (2025)
Uncovering collateral damages and advanced defense strategies in cloud environments against DDoS attacks: A comprehensive review
by: Priyanka Verma, et al.
Published: (2024)
by: Priyanka Verma, et al.
Published: (2024)
Project MPG: towards a generalized performance benchmark for LLM capabilities
by: Spangher, Lucas, et al.
Published: (2024)
by: Spangher, Lucas, et al.
Published: (2024)
TeleChat Technical Report
by: He, Zhongjiang, et al.
Published: (2024)
by: He, Zhongjiang, et al.
Published: (2024)
A comprehensive survey of oracle character recognition: challenges, benchmarks, and beyond
by: Li, Jing, et al.
Published: (2024)
by: Li, Jing, et al.
Published: (2024)
The attack‐and‐defense conflict with the gun‐and‐butter dilemma
by: Subhasish M. Chowdhury, et al.
Published: (2025)
by: Subhasish M. Chowdhury, et al.
Published: (2025)
MER-Inspector: Assessing model extraction risks from an attack-agnostic perspective
by: Zhang, Xinwei, et al.
Published: (2025)
by: Zhang, Xinwei, et al.
Published: (2025)
Tele-FLM Technical Report
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
SA-Attack: Speed-adaptive stealthy adversarial attack on trajectory prediction
by: Yin, Huilin, et al.
Published: (2024)
by: Yin, Huilin, et al.
Published: (2024)
TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling
by: Li, Jiaqian, et al.
Published: (2026)
by: Li, Jiaqian, et al.
Published: (2026)
TeleMem: Building Long-Term and Multimodal Memory for Agentic AI
by: Chen, Chunliang, et al.
Published: (2025)
by: Chen, Chunliang, et al.
Published: (2025)
From static to adaptive: immune memory-based jailbreak detection for large language models
by: Leng, Jun, et al.
Published: (2025)
by: Leng, Jun, et al.
Published: (2025)
PersGuard: Preventing Malicious Personalization via Backdoor Attacks on Pre-trained Text-to-Image Diffusion Models
by: Liu, Xinwei, et al.
Published: (2025)
by: Liu, Xinwei, et al.
Published: (2025)
DTP-Attack: A decision-based black-box adversarial attack on trajectory prediction
by: Li, Jiaxiang, et al.
Published: (2026)
by: Li, Jiaxiang, et al.
Published: (2026)
TeleDex: Accessible Dexterous Teleoperation
by: Rayyan, Omar, et al.
Published: (2026)
by: Rayyan, Omar, et al.
Published: (2026)
Adversarial versification in portuguese as a jailbreak operator in LLMs
by: Queiroz, Joao
Published: (2025)
by: Queiroz, Joao
Published: (2025)
Multilingual jailbreaking of LLMs using low-resource languages
by: Marx, Dylan, et al.
Published: (2026)
by: Marx, Dylan, et al.
Published: (2026)
PsychBench: A comprehensive and professional benchmark for evaluating the performance of LLM-assisted psychiatric clinical practice
by: Liu, Shuyu, et al.
Published: (2025)
by: Liu, Shuyu, et al.
Published: (2025)
CAMB: A comprehensive industrial LLM benchmark on civil aviation maintenance
by: Zhang, Feng, et al.
Published: (2025)
by: Zhang, Feng, et al.
Published: (2025)
Similar Items
-
RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration
by: Chen, Xiuyuan, et al.
Published: (2025) -
When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models
by: Cai, Wei, et al.
Published: (2025) -
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
by: Zhou, Huilin, et al.
Published: (2026) -
Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration
by: He, Yuxiang, et al.
Published: (2025) -
Multi-round jailbreak attack on large language models
by: Zhou, Yihua, et al.
Published: (2024)