Lights, Camera, Consistency: A Multistage Pipeline for Character-Stable AI Video Stories
Fuente:
arXiv
Salvato in:
| Autori principali: | Jain, Chayan, Sharma, Rishant, Garg, Archit, Bhanuka, Ishan, Narang, Pratik, Kumar, Dhruv |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Investigating Spatial Attention Bias in Vision-Language Models
di: Chaudhary, Aryan, et al.
Pubblicazione: (2025)
di: Chaudhary, Aryan, et al.
Pubblicazione: (2025)
InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions
di: Elmoghany, Mohamed, et al.
Pubblicazione: (2026)
di: Elmoghany, Mohamed, et al.
Pubblicazione: (2026)
StoryMaker: Towards Holistic Consistent Characters in Text-to-image Generation
di: Zhou, Zhengguang, et al.
Pubblicazione: (2024)
di: Zhou, Zhengguang, et al.
Pubblicazione: (2024)
Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation
di: Gupta, Arnav, et al.
Pubblicazione: (2025)
di: Gupta, Arnav, et al.
Pubblicazione: (2025)
"Previously on ..." From Recaps to Story Summarization
di: Singh, Aditya Kumar, et al.
Pubblicazione: (2024)
di: Singh, Aditya Kumar, et al.
Pubblicazione: (2024)
LDFaceNet: Latent Diffusion-based Network for High-Fidelity Deepfake Generation
di: Mehta, Dwij, et al.
Pubblicazione: (2024)
di: Mehta, Dwij, et al.
Pubblicazione: (2024)
Gloria: Consistent Character Video Generation via Content Anchors
di: Yang, Yuhang, et al.
Pubblicazione: (2026)
di: Yang, Yuhang, et al.
Pubblicazione: (2026)
Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration
di: Saraswat, Unnati, et al.
Pubblicazione: (2025)
di: Saraswat, Unnati, et al.
Pubblicazione: (2025)
AffectSRNet : Facial Emotion-Aware Super-Resolution Network
di: Rizvi, Syed Sameen Ahmad, et al.
Pubblicazione: (2025)
di: Rizvi, Syed Sameen Ahmad, et al.
Pubblicazione: (2025)
BachVid: Training-Free Video Generation with Consistent Background and Character
di: Yan, Han, et al.
Pubblicazione: (2025)
di: Yan, Han, et al.
Pubblicazione: (2025)
Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation
di: Hu, Li, et al.
Pubblicazione: (2023)
di: Hu, Li, et al.
Pubblicazione: (2023)
StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization
di: Zhang, Jinlu, et al.
Pubblicazione: (2024)
di: Zhang, Jinlu, et al.
Pubblicazione: (2024)
CharacterFactory: Sampling Consistent Characters with GANs for Diffusion Models
di: Wang, Qinghe, et al.
Pubblicazione: (2024)
di: Wang, Qinghe, et al.
Pubblicazione: (2024)
CharacterShot: Controllable and Consistent 4D Character Animation
di: Gao, Junyao, et al.
Pubblicazione: (2025)
di: Gao, Junyao, et al.
Pubblicazione: (2025)
Persistent Story World Simulation with Continuous Character Customization
di: Zhang, Jinlu, et al.
Pubblicazione: (2026)
di: Zhang, Jinlu, et al.
Pubblicazione: (2026)
Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation
di: Jain, Daksh, et al.
Pubblicazione: (2025)
di: Jain, Daksh, et al.
Pubblicazione: (2025)
CharaConsist: Fine-Grained Consistent Character Generation
di: Wang, Mengyu, et al.
Pubblicazione: (2025)
di: Wang, Mengyu, et al.
Pubblicazione: (2025)
Automating Video Thumbnails Selection and Generation with Multimodal and Multistage Analysis
di: Fantini, Elia
Pubblicazione: (2024)
di: Fantini, Elia
Pubblicazione: (2024)
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
di: Zhou, Yupeng, et al.
Pubblicazione: (2024)
di: Zhou, Yupeng, et al.
Pubblicazione: (2024)
A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows
di: Han, Yuxuan, et al.
Pubblicazione: (2026)
di: Han, Yuxuan, et al.
Pubblicazione: (2026)
Exposing DeepFakes via Hyperspectral Domain Mapping
di: Mehta, Aditya, et al.
Pubblicazione: (2025)
di: Mehta, Aditya, et al.
Pubblicazione: (2025)
FairyGen: Storied Cartoon Video from a Single Child-Drawn Character
di: Zheng, Jiayi, et al.
Pubblicazione: (2025)
di: Zheng, Jiayi, et al.
Pubblicazione: (2025)
TaleDiffusion: Multi-Character Story Generation with Dialogue Rendering
di: Banerjee, Ayan, et al.
Pubblicazione: (2025)
di: Banerjee, Ayan, et al.
Pubblicazione: (2025)
UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer
di: Sharma, Dhruv, et al.
Pubblicazione: (2024)
di: Sharma, Dhruv, et al.
Pubblicazione: (2024)
CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation
di: Xu, Dejia, et al.
Pubblicazione: (2024)
di: Xu, Dejia, et al.
Pubblicazione: (2024)
3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation
di: Lee, JoungBin, et al.
Pubblicazione: (2025)
di: Lee, JoungBin, et al.
Pubblicazione: (2025)
StoryGPT-V: Large Language Models as Consistent Story Visualizers
di: Shen, Xiaoqian, et al.
Pubblicazione: (2023)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2023)
Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments
di: Nagaonkar, Sankalp, et al.
Pubblicazione: (2025)
di: Nagaonkar, Sankalp, et al.
Pubblicazione: (2025)
StableWorld: Towards Stable and Consistent Long Interactive Video Generation
di: Yang, Ying, et al.
Pubblicazione: (2026)
di: Yang, Ying, et al.
Pubblicazione: (2026)
Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control
di: Kuang, Zhengfei, et al.
Pubblicazione: (2024)
di: Kuang, Zhengfei, et al.
Pubblicazione: (2024)
Text2Stereo: Repurposing Stable Diffusion for Stereo Generation with Consistency Rewards
di: Garg, Aakash, et al.
Pubblicazione: (2025)
di: Garg, Aakash, et al.
Pubblicazione: (2025)
StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification
di: He, Yichen, et al.
Pubblicazione: (2024)
di: He, Yichen, et al.
Pubblicazione: (2024)
CamLit: Unified Video Diffusion with Explicit Camera and Lighting Control
di: Kuang, Zhiyi, et al.
Pubblicazione: (2026)
di: Kuang, Zhiyi, et al.
Pubblicazione: (2026)
MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation
di: Cai, Xianbo, et al.
Pubblicazione: (2026)
di: Cai, Xianbo, et al.
Pubblicazione: (2026)
DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models
di: Kwon, Patrick, et al.
Pubblicazione: (2025)
di: Kwon, Patrick, et al.
Pubblicazione: (2025)
MyGo: Consistent and Controllable Multi-View Driving Video Generation with Camera Control
di: Yao, Yining, et al.
Pubblicazione: (2024)
di: Yao, Yining, et al.
Pubblicazione: (2024)
ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation
di: Sarkar, Ayushman, et al.
Pubblicazione: (2026)
di: Sarkar, Ayushman, et al.
Pubblicazione: (2026)
Balancing the Scales: Enhancing Fairness in Facial Expression Recognition with Latent Alignment
di: Rizvi, Syed Sameen Ahmad, et al.
Pubblicazione: (2024)
di: Rizvi, Syed Sameen Ahmad, et al.
Pubblicazione: (2024)
ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation
di: Mai, Ziyang, et al.
Pubblicazione: (2025)
di: Mai, Ziyang, et al.
Pubblicazione: (2025)
Learning Degradation-Independent Representations for Camera ISP Pipelines
di: Guo, Yanhui, et al.
Pubblicazione: (2023)
di: Guo, Yanhui, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Investigating Spatial Attention Bias in Vision-Language Models
di: Chaudhary, Aryan, et al.
Pubblicazione: (2025) -
InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions
di: Elmoghany, Mohamed, et al.
Pubblicazione: (2026) -
StoryMaker: Towards Holistic Consistent Characters in Text-to-image Generation
di: Zhou, Zhengguang, et al.
Pubblicazione: (2024) -
Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation
di: Gupta, Arnav, et al.
Pubblicazione: (2025) -
"Previously on ..." From Recaps to Story Summarization
di: Singh, Aditya Kumar, et al.
Pubblicazione: (2024)