Let Storytelling Tell Vivid Stories: An Expressive and Fluent Multimodal Storyteller
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zang, Chuanqi, Tang, Jiji, Zhang, Rongsheng, Zhao, Zeng, Lv, Tangjie, Pei, Mingtao, Liang, Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization
von: Zhang, Jinlu, et al.
Veröffentlicht: (2024)
von: Zhang, Jinlu, et al.
Veröffentlicht: (2024)
Customized Visual Storytelling with Unified Multimodal LLMs
von: Li, Wei-Hua, et al.
Veröffentlicht: (2026)
von: Li, Wei-Hua, et al.
Veröffentlicht: (2026)
StoryMem: Multi-shot Long Video Storytelling with Memory
von: Zhang, Kaiwen, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiwen, et al.
Veröffentlicht: (2025)
Persistent Story World Simulation with Continuous Character Customization
von: Zhang, Jinlu, et al.
Veröffentlicht: (2026)
von: Zhang, Jinlu, et al.
Veröffentlicht: (2026)
Beyond First Impressions: Integrating Joint Multi-modal Cues for Comprehensive 3D Representation
von: Wang, Haowei, et al.
Veröffentlicht: (2023)
von: Wang, Haowei, et al.
Veröffentlicht: (2023)
DeCorStory: Gram-Schmidt Prompt Embedding Decorrelation for Consistent Storytelling
von: Sarkar, Ayushman, et al.
Veröffentlicht: (2026)
von: Sarkar, Ayushman, et al.
Veröffentlicht: (2026)
AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models
von: Sreenivas, Manogna, et al.
Veröffentlicht: (2026)
von: Sreenivas, Manogna, et al.
Veröffentlicht: (2026)
Dialogue Director: Bridging the Gap in Dialogue Visualization for Multimodal Storytelling
von: Zhang, Min, et al.
Veröffentlicht: (2024)
von: Zhang, Min, et al.
Veröffentlicht: (2024)
Improving Visual Storytelling with Multimodal Large Language Models
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models
von: Huang, Yuzhou, et al.
Veröffentlicht: (2024)
von: Huang, Yuzhou, et al.
Veröffentlicht: (2024)
StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration
von: Hu, Panwen, et al.
Veröffentlicht: (2024)
von: Hu, Panwen, et al.
Veröffentlicht: (2024)
ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context
von: Zheng, Sixiao, et al.
Veröffentlicht: (2024)
von: Zheng, Sixiao, et al.
Veröffentlicht: (2024)
Is Your Image a Good Storyteller?
von: Song, Xiujie, et al.
Veröffentlicht: (2024)
von: Song, Xiujie, et al.
Veröffentlicht: (2024)
VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction
von: Li, Shiying, et al.
Veröffentlicht: (2025)
von: Li, Shiying, et al.
Veröffentlicht: (2025)
From Image Captioning to Visual Storytelling
von: Passadakis, Admitos, et al.
Veröffentlicht: (2025)
von: Passadakis, Admitos, et al.
Veröffentlicht: (2025)
Character-Adapter: Prompt-Guided Region Control for High-Fidelity Character Customization
von: Ma, Yuhang, et al.
Veröffentlicht: (2024)
von: Ma, Yuhang, et al.
Veröffentlicht: (2024)
GaussianFluent: Gaussian Simulation for Dynamic Scenes with Mixed Materials
von: Huang, Bei, et al.
Veröffentlicht: (2026)
von: Huang, Bei, et al.
Veröffentlicht: (2026)
Scene-Action Prompt Fusion for Coherent Text-to-Video Storytelling
von: Kang, Taewon, et al.
Veröffentlicht: (2025)
von: Kang, Taewon, et al.
Veröffentlicht: (2025)
TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling
von: Chen, Weiran, et al.
Veröffentlicht: (2024)
von: Chen, Weiran, et al.
Veröffentlicht: (2024)
Generating Storytelling Images with Rich Chains-of-Reasoning
von: Song, Xiujie, et al.
Veröffentlicht: (2025)
von: Song, Xiujie, et al.
Veröffentlicht: (2025)
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
von: Liu, Chang, et al.
Veröffentlicht: (2023)
von: Liu, Chang, et al.
Veröffentlicht: (2023)
TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles
von: Ma, Yifeng, et al.
Veröffentlicht: (2023)
von: Ma, Yifeng, et al.
Veröffentlicht: (2023)
Evolving Storytelling: Benchmarks and Methods for New Character Customization with Diffusion Models
von: Wang, Xiyu, et al.
Veröffentlicht: (2024)
von: Wang, Xiyu, et al.
Veröffentlicht: (2024)
ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
von: Luo, Yawen, et al.
Veröffentlicht: (2026)
von: Luo, Yawen, et al.
Veröffentlicht: (2026)
A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality
von: Elmoghany, Mohamed, et al.
Veröffentlicht: (2025)
von: Elmoghany, Mohamed, et al.
Veröffentlicht: (2025)
Event-Driven Storytelling with Multiple Lifelike Humans in a 3D Scene
von: Lim, Donggeun, et al.
Veröffentlicht: (2025)
von: Lim, Donggeun, et al.
Veröffentlicht: (2025)
Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks
von: Zou, Siyu, et al.
Veröffentlicht: (2024)
von: Zou, Siyu, et al.
Veröffentlicht: (2024)
Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity
von: Fang, Zhengyao, et al.
Veröffentlicht: (2026)
von: Fang, Zhengyao, et al.
Veröffentlicht: (2026)
Make-It-Vivid: Dressing Your Animatable Biped Cartoon Characters from Text
von: Tang, Junshu, et al.
Veröffentlicht: (2024)
von: Tang, Junshu, et al.
Veröffentlicht: (2024)
AnimeAgent: Is the Multi-Agent via Image-to-Video models a Good Disney Storytelling Artist?
von: Yan, Hailong, et al.
Veröffentlicht: (2026)
von: Yan, Hailong, et al.
Veröffentlicht: (2026)
Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization
von: Zhang, Zhiwang, et al.
Veröffentlicht: (2025)
von: Zhang, Zhiwang, et al.
Veröffentlicht: (2025)
Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling
von: Ye, Zilyu, et al.
Veröffentlicht: (2024)
von: Ye, Zilyu, et al.
Veröffentlicht: (2024)
The Lost Melody: Empirical Observations on Text-to-Video Generation From A Storytelling Perspective
von: Shin, Andrew, et al.
Veröffentlicht: (2024)
von: Shin, Andrew, et al.
Veröffentlicht: (2024)
AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation
von: Shi, Haoyuan, et al.
Veröffentlicht: (2025)
von: Shi, Haoyuan, et al.
Veröffentlicht: (2025)
PromptTea: Let Prompts Tell TeaCache the Optimal Threshold
von: Huang, Zishen, et al.
Veröffentlicht: (2025)
von: Huang, Zishen, et al.
Veröffentlicht: (2025)
SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling
von: Wang, Eileen, et al.
Veröffentlicht: (2024)
von: Wang, Eileen, et al.
Veröffentlicht: (2024)
Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning
von: Song, Yingjin, et al.
Veröffentlicht: (2024)
von: Song, Yingjin, et al.
Veröffentlicht: (2024)
ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models
von: Dong, Sibo, et al.
Veröffentlicht: (2025)
von: Dong, Sibo, et al.
Veröffentlicht: (2025)
HairDiffusion: Vivid Multi-Colored Hair Editing via Latent Diffusion
von: Zeng, Yu, et al.
Veröffentlicht: (2024)
von: Zeng, Yu, et al.
Veröffentlicht: (2024)
Telling Stories for Common Sense Zero-Shot Action Recognition
von: Gowda, Shreyank N, et al.
Veröffentlicht: (2023)
von: Gowda, Shreyank N, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization
von: Zhang, Jinlu, et al.
Veröffentlicht: (2024) -
Customized Visual Storytelling with Unified Multimodal LLMs
von: Li, Wei-Hua, et al.
Veröffentlicht: (2026) -
StoryMem: Multi-shot Long Video Storytelling with Memory
von: Zhang, Kaiwen, et al.
Veröffentlicht: (2025) -
Persistent Story World Simulation with Continuous Character Customization
von: Zhang, Jinlu, et al.
Veröffentlicht: (2026) -
Beyond First Impressions: Integrating Joint Multi-modal Cues for Comprehensive 3D Representation
von: Wang, Haowei, et al.
Veröffentlicht: (2023)