AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yexin, Shu, Wen-Jie, Huang, Zile, Zheng, Haoze, Wang, Yueze, Zhu, Jingjin, Zhang, Manyuan, Lim, Ser-Nam, Yang, Harry |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VideoMerge: Towards Training-free Long Video Generation
di: Zhang, Siyang, et al.
Pubblicazione: (2025)
di: Zhang, Siyang, et al.
Pubblicazione: (2025)
Temporal Regularization Makes Your Video Generator Stronger
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis
di: Chen, Shunian, et al.
Pubblicazione: (2025)
di: Chen, Shunian, et al.
Pubblicazione: (2025)
When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization
di: Wu, Xianfeng, et al.
Pubblicazione: (2025)
di: Wu, Xianfeng, et al.
Pubblicazione: (2025)
Towards Chunk-Wise Generation for Long Videos
di: Zhang, Siyang, et al.
Pubblicazione: (2024)
di: Zhang, Siyang, et al.
Pubblicazione: (2024)
Model Reveals What to Cache: Profiling-Based Feature Reuse for Video Diffusion Models
di: Ma, Xuran, et al.
Pubblicazione: (2025)
di: Ma, Xuran, et al.
Pubblicazione: (2025)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
di: Liu, Yexin, et al.
Pubblicazione: (2025)
di: Liu, Yexin, et al.
Pubblicazione: (2025)
Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop
di: Qian, Zhaofang, et al.
Pubblicazione: (2024)
di: Qian, Zhaofang, et al.
Pubblicazione: (2024)
Video Decomposition Prior: A Methodology to Decompose Videos into Layers
di: Shrivastava, Gaurav, et al.
Pubblicazione: (2024)
di: Shrivastava, Gaurav, et al.
Pubblicazione: (2024)
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
di: Zheng, Mingzhe, et al.
Pubblicazione: (2025)
di: Zheng, Mingzhe, et al.
Pubblicazione: (2025)
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
di: Zheng, Mingzhe, et al.
Pubblicazione: (2024)
di: Zheng, Mingzhe, et al.
Pubblicazione: (2024)
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
di: Chen, Harold Haodong, et al.
Pubblicazione: (2024)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2024)
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
Metric Compatible Training for Online Backfilling in Large-Scale Retrieval
di: Seo, Seonguk, et al.
Pubblicazione: (2023)
di: Seo, Seonguk, et al.
Pubblicazione: (2023)
LoopViT: Scaling Visual ARC with Looped Transformers
di: Shu, Wen-Jie, et al.
Pubblicazione: (2026)
di: Shu, Wen-Jie, et al.
Pubblicazione: (2026)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
Zero-shot Synthetic Video Realism Enhancement via Structure-aware Denoising
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
Composing Object Relations and Attributes for Image-Text Matching
di: Pham, Khoi, et al.
Pubblicazione: (2024)
di: Pham, Khoi, et al.
Pubblicazione: (2024)
BachVid: Training-Free Video Generation with Consistent Background and Character
di: Yan, Han, et al.
Pubblicazione: (2025)
di: Yan, Han, et al.
Pubblicazione: (2025)
Fast Encoding and Decoding for Implicit Video Representation
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
Enhancing Semantic Fidelity in Text-to-Image Synthesis: Attention Regulation in Diffusion Models
di: Zhang, Yang, et al.
Pubblicazione: (2024)
di: Zhang, Yang, et al.
Pubblicazione: (2024)
StarVid: Enhancing Semantic Alignment in Video Diffusion Models via Spatial and SynTactic Guided Attention Refocusing
di: Li, Yuanhang, et al.
Pubblicazione: (2024)
di: Li, Yuanhang, et al.
Pubblicazione: (2024)
Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending
di: Hou, Jingqi, et al.
Pubblicazione: (2026)
di: Hou, Jingqi, et al.
Pubblicazione: (2026)
Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale
di: Kulkarni, Parth Parag, et al.
Pubblicazione: (2026)
di: Kulkarni, Parth Parag, et al.
Pubblicazione: (2026)
DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
di: Meyarian, Abolfazl, et al.
Pubblicazione: (2026)
di: Meyarian, Abolfazl, et al.
Pubblicazione: (2026)
VidLA: Video-Language Alignment at Scale
di: Rizve, Mamshad Nayeem, et al.
Pubblicazione: (2024)
di: Rizve, Mamshad Nayeem, et al.
Pubblicazione: (2024)
Towards Generalized and Training-Free Text-Guided Semantic Manipulation
di: Hong, Yu, et al.
Pubblicazione: (2025)
di: Hong, Yu, et al.
Pubblicazione: (2025)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
di: Peng, Bo, et al.
Pubblicazione: (2023)
di: Peng, Bo, et al.
Pubblicazione: (2023)
Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy
di: Chen, Haijier, et al.
Pubblicazione: (2025)
di: Chen, Haijier, et al.
Pubblicazione: (2025)
Edit Fidelity Field: Semantics-Aware Region Isolation for Training-Free Scene Text Editing
di: Li, Guandong, et al.
Pubblicazione: (2026)
di: Li, Guandong, et al.
Pubblicazione: (2026)
VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
di: Tzachor, Issar, et al.
Pubblicazione: (2026)
di: Tzachor, Issar, et al.
Pubblicazione: (2026)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation
di: Vandersanden, Jente, et al.
Pubblicazione: (2026)
di: Vandersanden, Jente, et al.
Pubblicazione: (2026)
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations
di: Feng, Weixi, et al.
Pubblicazione: (2025)
di: Feng, Weixi, et al.
Pubblicazione: (2025)
Free$^2$Guide: Training-Free Text-to-Video Alignment using Image LVLM
di: Kim, Jaemin, et al.
Pubblicazione: (2024)
di: Kim, Jaemin, et al.
Pubblicazione: (2024)
Niagara: Normal-Integrated Geometric Affine Field for Scene Reconstruction from a Single View
di: Wu, Xianzu, et al.
Pubblicazione: (2025)
di: Wu, Xianzu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VideoMerge: Towards Training-free Long Video Generation
di: Zhang, Siyang, et al.
Pubblicazione: (2025) -
Temporal Regularization Makes Your Video Generator Stronger
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025) -
TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis
di: Chen, Shunian, et al.
Pubblicazione: (2025) -
When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding
di: Shu, Yan, et al.
Pubblicazione: (2025) -
LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization
di: Wu, Xianfeng, et al.
Pubblicazione: (2025)