Phantom: Subject-consistent video generation via cross-modal alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Lijie, Ma, Tianxiang, Li, Bingchuan, Chen, Zhuowei, Liu, Jiawei, Li, Gen, Zhou, Siyu, He, Qian, Wu, Xinglong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset
por: Chen, Zhuowei, et al.
Publicado: (2025)
por: Chen, Zhuowei, et al.
Publicado: (2025)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
por: Chen, Liyang, et al.
Publicado: (2025)
por: Chen, Liyang, et al.
Publicado: (2025)
LibraGen: Playing a Balance Game in Subject-Driven Video Generation
por: Zhu, Jiahao, et al.
Publicado: (2026)
por: Zhu, Jiahao, et al.
Publicado: (2026)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
por: Chen, Jinshu, et al.
Publicado: (2025)
por: Chen, Jinshu, et al.
Publicado: (2025)
DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
por: Liu, Jiawei, et al.
Publicado: (2025)
por: Liu, Jiawei, et al.
Publicado: (2025)
VLA-Mark: A cross modal watermark for large vision-language alignment model
por: Liu, Shuliang, et al.
Publicado: (2025)
por: Liu, Shuliang, et al.
Publicado: (2025)
Customize Your Own Paired Data via Few-shot Way
por: Chen, Jinshu, et al.
Publicado: (2024)
por: Chen, Jinshu, et al.
Publicado: (2024)
I2VControl-Camera: Precise Video Camera Control with Adjustable Motion Strength
por: Feng, Wanquan, et al.
Publicado: (2024)
por: Feng, Wanquan, et al.
Publicado: (2024)
AGA: An adaptive group alignment framework for structured medical cross-modal representation learning
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
I2VControl: Disentangled and Unified Video Motion Synthesis Control
por: Feng, Wanquan, et al.
Publicado: (2024)
por: Feng, Wanquan, et al.
Publicado: (2024)
SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment
por: Mao, Xinyu, et al.
Publicado: (2025)
por: Mao, Xinyu, et al.
Publicado: (2025)
Can video generation replace cinematographers? Research on the cinematic language of generated video
por: Li, Xiaozhe, et al.
Publicado: (2024)
por: Li, Xiaozhe, et al.
Publicado: (2024)
XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation
por: Chen, Bowen, et al.
Publicado: (2025)
por: Chen, Bowen, et al.
Publicado: (2025)
PuLID: Pure and Lightning ID Customization via Contrastive Alignment
por: Guo, Zinan, et al.
Publicado: (2024)
por: Guo, Zinan, et al.
Publicado: (2024)
FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing
por: Cong, Yuren, et al.
Publicado: (2023)
por: Cong, Yuren, et al.
Publicado: (2023)
DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation
por: Guo, Xu, et al.
Publicado: (2026)
por: Guo, Xu, et al.
Publicado: (2026)
3DGS-Enhancer: Enhancing Unbounded 3D Gaussian Splatting with View-consistent 2D Diffusion Priors
por: Liu, Xi, et al.
Publicado: (2024)
por: Liu, Xi, et al.
Publicado: (2024)
DartControl: A Diffusion-Based Autoregressive Motion Model for Real-Time Text-Driven Motion Control
por: Zhao, Kaifeng, et al.
Publicado: (2024)
por: Zhao, Kaifeng, et al.
Publicado: (2024)
HyperLoRA: Parameter-Efficient Adaptive Generation for Portrait Synthesis
por: Li, Mengtian, et al.
Publicado: (2025)
por: Li, Mengtian, et al.
Publicado: (2025)
Improving Diffusion-based Inverse Algorithms under Few-Step Constraint via Learnable Linear Extrapolation
por: Zhang, Jiawei, et al.
Publicado: (2025)
por: Zhang, Jiawei, et al.
Publicado: (2025)
Show and Segment: Universal Medical Image Segmentation via In-Context Learning
por: Gao, Yunhe, et al.
Publicado: (2025)
por: Gao, Yunhe, et al.
Publicado: (2025)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
por: Li, Shuang, et al.
Publicado: (2024)
por: Li, Shuang, et al.
Publicado: (2024)
MUSAR: Exploring Multi-Subject Customization from Single-Subject Dataset via Attention Routing
por: Guo, Zinan, et al.
Publicado: (2025)
por: Guo, Zinan, et al.
Publicado: (2025)
Towards multi-modal forgery representation learning for AI-generated video detection and localization
por: Le, Dat, et al.
Publicado: (2026)
por: Le, Dat, et al.
Publicado: (2026)
ECHOPulse: ECG controlled echocardio-grams video generation
por: Li, Yiwei, et al.
Publicado: (2024)
por: Li, Yiwei, et al.
Publicado: (2024)
Improving vision-language alignment with graph spiking hybrid Networks
por: Zhang, Siyu, et al.
Publicado: (2025)
por: Zhang, Siyu, et al.
Publicado: (2025)
AR-Diffusion: Asynchronous Video Generation with Auto-Regressive Diffusion
por: Sun, Mingzhen, et al.
Publicado: (2025)
por: Sun, Mingzhen, et al.
Publicado: (2025)
FFA Sora, video generation as fundus fluorescein angiography simulator
por: Wu, Xinyuan, et al.
Publicado: (2024)
por: Wu, Xinyuan, et al.
Publicado: (2024)
KPL: Training-Free Medical Knowledge Mining of Vision-Language Models
por: Liu, Jiaxiang, et al.
Publicado: (2025)
por: Liu, Jiaxiang, et al.
Publicado: (2025)
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
por: Li, Ling, et al.
Publicado: (2024)
por: Li, Ling, et al.
Publicado: (2024)
Flow caching for autoregressive video generation
por: Ma, Yuexiao, et al.
Publicado: (2026)
por: Ma, Yuexiao, et al.
Publicado: (2026)
Model alignment using inter-modal bridges
por: Gholamzadeh, Ali, et al.
Publicado: (2025)
por: Gholamzadeh, Ali, et al.
Publicado: (2025)
FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation
por: Li, Gen, et al.
Publicado: (2026)
por: Li, Gen, et al.
Publicado: (2026)
MoDA: Multi-modal Diffusion Architecture for Talking Head Generation
por: Li, Xinyang, et al.
Publicado: (2025)
por: Li, Xinyang, et al.
Publicado: (2025)
CustomContrast: A Multilevel Contrastive Perspective For Subject-Driven Text-to-Image Customization
por: Chen, Nan, et al.
Publicado: (2024)
por: Chen, Nan, et al.
Publicado: (2024)
DreamID: High-Fidelity and Fast diffusion-based Face Swapping via Triplet ID Group Learning
por: Ye, Fulong, et al.
Publicado: (2025)
por: Ye, Fulong, et al.
Publicado: (2025)
Training Like a Medical Resident: Context-Prior Learning Toward Universal Medical Image Segmentation
por: Gao, Yunhe, et al.
Publicado: (2023)
por: Gao, Yunhe, et al.
Publicado: (2023)
Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction
por: He, Chaoqun, et al.
Publicado: (2026)
por: He, Chaoqun, et al.
Publicado: (2026)
Multi-modality transrectal ultrasound video classification for identification of clinically significant prostate cancer
por: Wu, Hong, et al.
Publicado: (2024)
por: Wu, Hong, et al.
Publicado: (2024)
A cross-modal network for facial expression recognition
por: Tian, Chunwei, et al.
Publicado: (2026)
por: Tian, Chunwei, et al.
Publicado: (2026)
Ejemplares similares
-
Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset
por: Chen, Zhuowei, et al.
Publicado: (2025) -
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
por: Chen, Liyang, et al.
Publicado: (2025) -
LibraGen: Playing a Balance Game in Subject-Driven Video Generation
por: Zhu, Jiahao, et al.
Publicado: (2026) -
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
por: Chen, Jinshu, et al.
Publicado: (2025) -
DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
por: Liu, Jiawei, et al.
Publicado: (2025)