Robust and Generalizable Safety Steering for Text-to-Image Diffusion Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Xue, Zihao, Wang, Yan, Bi, Zhen, Ma, Long, Zheng, Zhonglong, Yang, Zeyu, Zhu, Bingyu, Huang, Longtao, Xiao, Jie, Lou, Jungang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
por: Wang, Yan, et al.
Publicado: (2026)
por: Wang, Yan, et al.
Publicado: (2026)
Make LLM Learn to Synthesize from Streaming Experiences through Feedback
por: Hu, Zhenlin, et al.
Publicado: (2026)
por: Hu, Zhenlin, et al.
Publicado: (2026)
Thought Purity: A Defense Framework For Chain-of-Thought Attack
por: Xue, Zihao, et al.
Publicado: (2025)
por: Xue, Zihao, et al.
Publicado: (2025)
Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion Models
por: Dai, Haoran, et al.
Publicado: (2025)
por: Dai, Haoran, et al.
Publicado: (2025)
Structure-guided Diffusion Transformer for Low-Light Image Enhancement
por: Yin, Xiangchen, et al.
Publicado: (2025)
por: Yin, Xiangchen, et al.
Publicado: (2025)
SteerDiff: Steering towards Safe Text-to-Image Diffusion Models
por: Zhang, Hongxiang, et al.
Publicado: (2024)
por: Zhang, Hongxiang, et al.
Publicado: (2024)
Spatial Knowledge Graph-Guided Multimodal Synthesis
por: Xue, Yida, et al.
Publicado: (2025)
por: Xue, Yida, et al.
Publicado: (2025)
Steering Guidance for Personalized Text-to-Image Diffusion Models
por: Park, Sunghyun, et al.
Publicado: (2025)
por: Park, Sunghyun, et al.
Publicado: (2025)
Elucidating and Endowing the Diffusion Training Paradigm for General Image Restoration
por: Lu, Xin, et al.
Publicado: (2025)
por: Lu, Xin, et al.
Publicado: (2025)
SteerFlow: Steering Rectified Flows for Faithful Inversion-Based Image Editing
por: Dao, Thinh, et al.
Publicado: (2026)
por: Dao, Thinh, et al.
Publicado: (2026)
Harnessing Foundation Models for Robust and Generalizable 6-DOF Bronchoscopy Localization
por: Tian, Qingyao, et al.
Publicado: (2025)
por: Tian, Qingyao, et al.
Publicado: (2025)
SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation
por: Ma, Yingzi, et al.
Publicado: (2026)
por: Ma, Yingzi, et al.
Publicado: (2026)
WDformer: A Wavelet-based Differential Transformer Model for Time Series Forecasting
por: Wang, Xiaojian, et al.
Publicado: (2025)
por: Wang, Xiaojian, et al.
Publicado: (2025)
From Specificity to Generality: Revisiting Generalizable Artifacts in Detecting Face Deepfakes
por: Ma, Long, et al.
Publicado: (2025)
por: Ma, Long, et al.
Publicado: (2025)
Personalized Safety Alignment for Text-to-Image Diffusion Models
por: Lei, Yu, et al.
Publicado: (2025)
por: Lei, Yu, et al.
Publicado: (2025)
Steering Video Diffusion Transformers with Massive Activations
por: Cheng, Xianhang, et al.
Publicado: (2026)
por: Cheng, Xianhang, et al.
Publicado: (2026)
RooflineBench: A Benchmarking Framework for On-Device LLMs via Roofline Analysis
por: Bi, Zhen, et al.
Publicado: (2026)
por: Bi, Zhen, et al.
Publicado: (2026)
Diffusion Reconstruction towards Generalizable Audio Deepfake Detection
por: Cheng, Bo, et al.
Publicado: (2026)
por: Cheng, Bo, et al.
Publicado: (2026)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
por: Tong, Shengbang, et al.
Publicado: (2026)
por: Tong, Shengbang, et al.
Publicado: (2026)
Logical Structure as Knowledge: Enhancing LLM Reasoning via Structured Logical Knowledge Density Estimation
por: Bi, Zhen, et al.
Publicado: (2025)
por: Bi, Zhen, et al.
Publicado: (2025)
EruDiff: Refactoring Knowledge in Diffusion Models for Advanced Text-to-Image Synthesis
por: Guo, Xiefan, et al.
Publicado: (2026)
por: Guo, Xiefan, et al.
Publicado: (2026)
Breaking the Generator Barrier: Disentangled Representation for Generalizable AI-Text Detection
por: Pu, Xiao, et al.
Publicado: (2026)
por: Pu, Xiao, et al.
Publicado: (2026)
RoGSplat: Learning Robust Generalizable Human Gaussian Splatting from Sparse Multi-View Images
por: Xiao, Junjin, et al.
Publicado: (2025)
por: Xiao, Junjin, et al.
Publicado: (2025)
UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
por: Zhao, Min, et al.
Publicado: (2025)
por: Zhao, Min, et al.
Publicado: (2025)
Your One-Stop Solution for AI-Generated Video Detection
por: Ma, Long, et al.
Publicado: (2026)
por: Ma, Long, et al.
Publicado: (2026)
Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning
por: Koleilat, Taha, et al.
Publicado: (2026)
por: Koleilat, Taha, et al.
Publicado: (2026)
Evaluating the Robustness and Accuracy of Text Watermarking Under Real-World Cross-Lingual Manipulations
por: Ghanim, Mansour Al, et al.
Publicado: (2025)
por: Ghanim, Mansour Al, et al.
Publicado: (2025)
PD-SORT: Occlusion-Robust Multi-Object Tracking Using Pseudo-Depth Cues
por: Wang, Yanchao, et al.
Publicado: (2025)
por: Wang, Yanchao, et al.
Publicado: (2025)
Radiation‐induced fibrosis: Mechanisms and therapeutic strategies from an immune microenvironment perspective
por: Mengting Zheng, et al.
Publicado: (2024)
por: Mengting Zheng, et al.
Publicado: (2024)
Text Data-Centric Image Captioning with Interactive Prompts
por: Wang, Yiyu, et al.
Publicado: (2024)
por: Wang, Yiyu, et al.
Publicado: (2024)
Detail++: Training-Free Detail Enhancer for Text-to-Image Diffusion Models
por: Chen, Lifeng, et al.
Publicado: (2025)
por: Chen, Lifeng, et al.
Publicado: (2025)
SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models
por: Qi, Peigui, et al.
Publicado: (2025)
por: Qi, Peigui, et al.
Publicado: (2025)
DiT4Edit: Diffusion Transformer for Image Editing
por: Feng, Kunyu, et al.
Publicado: (2024)
por: Feng, Kunyu, et al.
Publicado: (2024)
Enhancing Transformers for Generalizable First-Order Logical Entailment
por: Zheng, Tianshi, et al.
Publicado: (2025)
por: Zheng, Tianshi, et al.
Publicado: (2025)
Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
por: Zheng, Youwei, et al.
Publicado: (2025)
por: Zheng, Youwei, et al.
Publicado: (2025)
BarrierSteer: LLM Safety via Learning Barrier Steering
por: Tran, Thanh Q., et al.
Publicado: (2026)
por: Tran, Thanh Q., et al.
Publicado: (2026)
Controlling Text-to-Image Diffusion by Orthogonal Finetuning
por: Qiu, Zeju, et al.
Publicado: (2023)
por: Qiu, Zeju, et al.
Publicado: (2023)
Steering Away from Memorization: Reachability-Constrained Reinforcement Learning for Text-to-Image Diffusion
por: Karnik, Sathwik, et al.
Publicado: (2026)
por: Karnik, Sathwik, et al.
Publicado: (2026)
Steerable Pyramid Transform Enables Robust Left Ventricle Quantification
por: Zhu, Xiangyang, et al.
Publicado: (2022)
por: Zhu, Xiangyang, et al.
Publicado: (2022)
CR-UTP: Certified Robustness against Universal Text Perturbations on Large Language Models
por: Lou, Qian, et al.
Publicado: (2024)
por: Lou, Qian, et al.
Publicado: (2024)
Ejemplares similares
-
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
por: Wang, Yan, et al.
Publicado: (2026) -
Make LLM Learn to Synthesize from Streaming Experiences through Feedback
por: Hu, Zhenlin, et al.
Publicado: (2026) -
Thought Purity: A Defense Framework For Chain-of-Thought Attack
por: Xue, Zihao, et al.
Publicado: (2025) -
Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion Models
por: Dai, Haoran, et al.
Publicado: (2025) -
Structure-guided Diffusion Transformer for Low-Light Image Enhancement
por: Yin, Xiangchen, et al.
Publicado: (2025)