Jailbreaking on Text-to-Video Models via Scene Splitting Strategy
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Wonjun, Park, Haon, Lee, Doehyeon, Ham, Bumsub, Kim, Suhyun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ELITE: Enhanced Language-Image Toxicity Evaluation for Safety
por: Lee, Wonjun, et al.
Publicado: (2025)
por: Lee, Wonjun, et al.
Publicado: (2025)
Maximizing the Position Embedding for Vision Transformers with Global Average Pooling
por: Lee, Wonjun, et al.
Publicado: (2025)
por: Lee, Wonjun, et al.
Publicado: (2025)
Disentangled Representations for Short-Term and Long-Term Person Re-Identification
por: Eom, Chanho, et al.
Publicado: (2024)
por: Eom, Chanho, et al.
Publicado: (2024)
Benign-to-Toxic Jailbreaking: Inducing Harmful Responses from Harmless Prompts
por: Kim, Hee-Seon, et al.
Publicado: (2025)
por: Kim, Hee-Seon, et al.
Publicado: (2025)
Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection
por: Lee, Sanghoon, et al.
Publicado: (2026)
por: Lee, Sanghoon, et al.
Publicado: (2026)
AZ-NAS: Assembling Zero-Cost Proxies for Network Architecture Search
por: Lee, Junghyup, et al.
Publicado: (2024)
por: Lee, Junghyup, et al.
Publicado: (2024)
3DPillars: Pillar-based two-stage 3D object detection
por: Noh, Jongyoun, et al.
Publicado: (2025)
por: Noh, Jongyoun, et al.
Publicado: (2025)
TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts
por: Jeon, Jeimin, et al.
Publicado: (2026)
por: Jeon, Jeimin, et al.
Publicado: (2026)
Efficient Few-Shot Neural Architecture Search by Counting the Number of Nonlinear Functions
por: Oh, Youngmin, et al.
Publicado: (2024)
por: Oh, Youngmin, et al.
Publicado: (2024)
REPrune: Channel Pruning via Kernel Representative Selection
por: Park, Mincheol, et al.
Publicado: (2024)
por: Park, Mincheol, et al.
Publicado: (2024)
VideoRFSplat: Direct Scene-Level Text-to-3D Gaussian Splatting Generation with Flexible Pose and Multi-View Joint Modeling
por: Go, Hyojun, et al.
Publicado: (2025)
por: Go, Hyojun, et al.
Publicado: (2025)
Task-Specific Preconditioner for Cross-Domain Few-Shot Learning
por: Kang, Suhyun, et al.
Publicado: (2024)
por: Kang, Suhyun, et al.
Publicado: (2024)
Scheduling Weight Transitions for Quantization-Aware Training
por: Lee, Junghyup, et al.
Publicado: (2024)
por: Lee, Junghyup, et al.
Publicado: (2024)
Diffusion Model Patching via Mixture-of-Prompts
por: Ham, Seokil, et al.
Publicado: (2024)
por: Ham, Seokil, et al.
Publicado: (2024)
MERLIN: Multimodal Embedding Refinement via LLM-based Iterative Navigation for Text-Video Retrieval-Rerank Pipeline
por: Han, Donghoon, et al.
Publicado: (2024)
por: Han, Donghoon, et al.
Publicado: (2024)
Scene Graph Generation Strategy with Co-occurrence Knowledge and Learnable Term Frequency
por: Kim, Hyeongjin, et al.
Publicado: (2024)
por: Kim, Hyeongjin, et al.
Publicado: (2024)
Toward INT4 Fixed-Point Training via Exploring Quantization Error for Gradients
por: Kim, Dohyung, et al.
Publicado: (2024)
por: Kim, Dohyung, et al.
Publicado: (2024)
Catch-Up Mix: Catch-Up Class for Struggling Filters in CNN
por: Kang, Minsoo, et al.
Publicado: (2024)
por: Kang, Minsoo, et al.
Publicado: (2024)
Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection
por: Lee, Uichan, et al.
Publicado: (2026)
por: Lee, Uichan, et al.
Publicado: (2026)
InstructBooth: Instruction-following Personalized Text-to-Image Generation
por: Chae, Daewon, et al.
Publicado: (2023)
por: Chae, Daewon, et al.
Publicado: (2023)
Language-guided Recursive Spatiotemporal Graph Modeling for Video Summarization
por: Park, Jungin, et al.
Publicado: (2025)
por: Park, Jungin, et al.
Publicado: (2025)
See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis
por: Park, Jaehyun, et al.
Publicado: (2026)
por: Park, Jaehyun, et al.
Publicado: (2026)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
por: Kang, Minseok, et al.
Publicado: (2026)
por: Kang, Minseok, et al.
Publicado: (2026)
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
por: Park, Yohan, et al.
Publicado: (2025)
por: Park, Yohan, et al.
Publicado: (2025)
MAMS: Model-Agnostic Module Selection Framework for Video Captioning
por: Lee, Sangho, et al.
Publicado: (2025)
por: Lee, Sangho, et al.
Publicado: (2025)
Gather-Scatter Mamba: Accelerating Propagation with Efficient State Space Model
por: Ko, Hyun-kyu, et al.
Publicado: (2025)
por: Ko, Hyun-kyu, et al.
Publicado: (2025)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
por: Kang, Choongwon, et al.
Publicado: (2026)
por: Kang, Choongwon, et al.
Publicado: (2026)
Refining Visual Artifacts in Diffusion Models via Explainable AI-based Flaw Activation Maps
por: Lee, Seoyeon, et al.
Publicado: (2025)
por: Lee, Seoyeon, et al.
Publicado: (2025)
FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models
por: Lim, Youngsun, et al.
Publicado: (2026)
por: Lim, Youngsun, et al.
Publicado: (2026)
VideoICL: Confidence-based Iterative In-context Learning for Out-of-Distribution Video Understanding
por: Kim, Kangsan, et al.
Publicado: (2024)
por: Kim, Kangsan, et al.
Publicado: (2024)
GLYPH-SR: Can We Achieve Both High-Quality Image Super-Resolution and High-Fidelity Text Recovery via VLM-guided Latent Diffusion Model?
por: Sung, Mingyu, et al.
Publicado: (2025)
por: Sung, Mingyu, et al.
Publicado: (2025)
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
Watermarking for Factuality: Guiding Vision-Language Models Toward Truth via Tri-layer Contrastive Decoding
por: Back, Kyungryul, et al.
Publicado: (2025)
por: Back, Kyungryul, et al.
Publicado: (2025)
Personalized Reward Modeling for Text-to-Image Generation
por: Lee, Jeongeun, et al.
Publicado: (2025)
por: Lee, Jeongeun, et al.
Publicado: (2025)
Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
por: Lee, Dong In, et al.
Publicado: (2025)
por: Lee, Dong In, et al.
Publicado: (2025)
KOALA: Empirical Lessons Toward Memory-Efficient and Fast Diffusion Models for Text-to-Image Synthesis
por: Lee, Youngwan, et al.
Publicado: (2023)
por: Lee, Youngwan, et al.
Publicado: (2023)
Motif-Video 2B: Technical Report
por: Lim, Junghwan, et al.
Publicado: (2026)
por: Lim, Junghwan, et al.
Publicado: (2026)
Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video Representations
por: Park, Jungin, et al.
Publicado: (2025)
por: Park, Jungin, et al.
Publicado: (2025)
Beta Sampling is All You Need: Efficient Image Generation Strategy for Diffusion Models using Stepwise Spectral Analysis
por: Lee, Haeil, et al.
Publicado: (2024)
por: Lee, Haeil, et al.
Publicado: (2024)
Seen-to-Scene: Keep the Seen, Generate the Unseen for Video Outpainting
por: Jeon, Inseok, et al.
Publicado: (2026)
por: Jeon, Inseok, et al.
Publicado: (2026)
Ejemplares similares
-
ELITE: Enhanced Language-Image Toxicity Evaluation for Safety
por: Lee, Wonjun, et al.
Publicado: (2025) -
Maximizing the Position Embedding for Vision Transformers with Global Average Pooling
por: Lee, Wonjun, et al.
Publicado: (2025) -
Disentangled Representations for Short-Term and Long-Term Person Re-Identification
por: Eom, Chanho, et al.
Publicado: (2024) -
Benign-to-Toxic Jailbreaking: Inducing Harmful Responses from Harmless Prompts
por: Kim, Hee-Seon, et al.
Publicado: (2025) -
Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection
por: Lee, Sanghoon, et al.
Publicado: (2026)