Guiding a Diffusion Model by Swapping Its Tokens
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Weijia, Liu, Yuehao, Guan, Shanyan, Ran, Wu, Ge, Yanhao, Li, Wei, Ma, Chao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models
por: Liu, Yuehao, et al.
Publicado: (2026)
por: Liu, Yuehao, et al.
Publicado: (2026)
ACE-LoRA: Adaptive Orthogonal Decoupling for Continual Image Editing
por: Liu, Yuehao, et al.
Publicado: (2026)
por: Liu, Yuehao, et al.
Publicado: (2026)
Cross-Architecture Distillation Made Simple with Redundancy Suppression
por: Zhang, Weijia, et al.
Publicado: (2025)
por: Zhang, Weijia, et al.
Publicado: (2025)
Neural Material Adaptor for Visual Grounding of Intrinsic Dynamics
por: Cao, Junyi, et al.
Publicado: (2024)
por: Cao, Junyi, et al.
Publicado: (2024)
RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations
por: Ge, Yanhao, et al.
Publicado: (2026)
por: Ge, Yanhao, et al.
Publicado: (2026)
HybridBooth: Hybrid Prompt Inversion for Efficient Subject-Driven Generation
por: Guan, Shanyan, et al.
Publicado: (2024)
por: Guan, Shanyan, et al.
Publicado: (2024)
NeoWorld: Neural Simulation of Explorable Virtual Worlds via Progressive 3D Unfolding
por: Zhao, Yanpeng, et al.
Publicado: (2025)
por: Zhao, Yanpeng, et al.
Publicado: (2025)
Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent
por: Ci, En, et al.
Publicado: (2025)
por: Ci, En, et al.
Publicado: (2025)
PostEdit: Posterior Sampling for Efficient Zero-Shot Image Editing
por: Tian, Feng, et al.
Publicado: (2024)
por: Tian, Feng, et al.
Publicado: (2024)
HiFiVFS: High Fidelity Video Face Swapping
por: Chen, Xu, et al.
Publicado: (2024)
por: Chen, Xu, et al.
Publicado: (2024)
VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset
por: Chen, Zhizhou, et al.
Publicado: (2026)
por: Chen, Zhizhou, et al.
Publicado: (2026)
UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
por: Zhao, Chen, et al.
Publicado: (2025)
por: Zhao, Chen, et al.
Publicado: (2025)
Face Swap via Diffusion Model
por: Wang, Feifei
Publicado: (2024)
por: Wang, Feifei
Publicado: (2024)
CP-VoteNet: Contrastive Prototypical VoteNet for Few-Shot Point Cloud Object Detection
por: Li, Xuejing, et al.
Publicado: (2024)
por: Li, Xuejing, et al.
Publicado: (2024)
Guiding Token-Sparse Diffusion Models
por: Krause, Felix, et al.
Publicado: (2026)
por: Krause, Felix, et al.
Publicado: (2026)
TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models
por: Zhang, Zhifang, et al.
Publicado: (2025)
por: Zhang, Zhifang, et al.
Publicado: (2025)
Face Adapter for Pre-Trained Diffusion Models with Fine-Grained ID and Attribute Control
por: Han, Yue, et al.
Publicado: (2024)
por: Han, Yue, et al.
Publicado: (2024)
High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning
por: He, Dailan, et al.
Publicado: (2025)
por: He, Dailan, et al.
Publicado: (2025)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
por: Ge, Yuying, et al.
Publicado: (2024)
por: Ge, Yuying, et al.
Publicado: (2024)
RoboSwap: A GAN-driven Video Diffusion Framework For Unsupervised Robot Arm Swapping
por: Bai, Yang, et al.
Publicado: (2025)
por: Bai, Yang, et al.
Publicado: (2025)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
por: Wang, Bohan, et al.
Publicado: (2025)
por: Wang, Bohan, et al.
Publicado: (2025)
Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens
por: Xie, Qingsong, et al.
Publicado: (2025)
por: Xie, Qingsong, et al.
Publicado: (2025)
QuadMamba: Learning Quadtree-based Selective Scan for Visual State Space Model
por: Xie, Fei, et al.
Publicado: (2024)
por: Xie, Fei, et al.
Publicado: (2024)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
por: Li, Yizhuo, et al.
Publicado: (2024)
por: Li, Yizhuo, et al.
Publicado: (2024)
Cross-View Consistency Regularisation for Knowledge Distillation
por: Zhang, Weijia, et al.
Publicado: (2024)
por: Zhang, Weijia, et al.
Publicado: (2024)
SwapAnyone: Consistent and Realistic Video Synthesis for Swapping Any Person into Any Video
por: Zhao, Chengshu, et al.
Publicado: (2025)
por: Zhao, Chengshu, et al.
Publicado: (2025)
DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping
por: Bondurant, Weston, et al.
Publicado: (2025)
por: Bondurant, Weston, et al.
Publicado: (2025)
Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation
por: Wang, Wenjing, et al.
Publicado: (2023)
por: Wang, Wenjing, et al.
Publicado: (2023)
CA-IDD: Cross-Attention Guided Identity-Conditional Diffusion for Identity-Consistent Face Swapping
por: Rana, Md Shohel, et al.
Publicado: (2026)
por: Rana, Md Shohel, et al.
Publicado: (2026)
GDTS: Goal-Guided Diffusion Model with Tree Sampling for Multi-Modal Pedestrian Trajectory Prediction
por: Sun, Ge, et al.
Publicado: (2023)
por: Sun, Ge, et al.
Publicado: (2023)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
Realistic and Efficient Face Swapping: A Unified Approach with Diffusion Models
por: Baliah, Sanoojan, et al.
Publicado: (2024)
por: Baliah, Sanoojan, et al.
Publicado: (2024)
GrOCE:Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models
por: Han, Ning, et al.
Publicado: (2025)
por: Han, Ning, et al.
Publicado: (2025)
SDPose: Tokenized Pose Estimation via Circulation-Guide Self-Distillation
por: Chen, Sichen, et al.
Publicado: (2024)
por: Chen, Sichen, et al.
Publicado: (2024)
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
por: Zou, Jialv, et al.
Publicado: (2025)
por: Zou, Jialv, et al.
Publicado: (2025)
Detect-and-Guide: Self-regulation of Diffusion Models for Safe Text-to-Image Generation via Guideline Token Optimization
por: Li, Feifei, et al.
Publicado: (2025)
por: Li, Feifei, et al.
Publicado: (2025)
DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing
por: Wang, Weitao, et al.
Publicado: (2025)
por: Wang, Weitao, et al.
Publicado: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
por: Zhang, Luyuan, et al.
Publicado: (2026)
por: Zhang, Luyuan, et al.
Publicado: (2026)
EfficientDM: Efficient Quantization-Aware Fine-Tuning of Low-Bit Diffusion Models
por: He, Yefei, et al.
Publicado: (2023)
por: He, Yefei, et al.
Publicado: (2023)
VRM: Knowledge Distillation via Virtual Relation Matching
por: Zhang, Weijia, et al.
Publicado: (2025)
por: Zhang, Weijia, et al.
Publicado: (2025)
Ejemplares similares
-
Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models
por: Liu, Yuehao, et al.
Publicado: (2026) -
ACE-LoRA: Adaptive Orthogonal Decoupling for Continual Image Editing
por: Liu, Yuehao, et al.
Publicado: (2026) -
Cross-Architecture Distillation Made Simple with Redundancy Suppression
por: Zhang, Weijia, et al.
Publicado: (2025) -
Neural Material Adaptor for Visual Grounding of Intrinsic Dynamics
por: Cao, Junyi, et al.
Publicado: (2024) -
RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations
por: Ge, Yanhao, et al.
Publicado: (2026)