Guardado en:
| Autores principales: | Tao, Ming, Bao, Bing-Kun, Tang, Hao, Wang, Yaowei, Xu, Changsheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2404.05979 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC
por: Tao, Ming, et al.
Publicado: (2024)
por: Tao, Ming, et al.
Publicado: (2024)
Causal-Story: Local Causal Attention Utilizing Parameter-Efficient Tuning For Visual Story Synthesis
por: Song, Tianyi, et al.
Publicado: (2023)
por: Song, Tianyi, et al.
Publicado: (2023)
StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization
por: Zhang, Jinlu, et al.
Publicado: (2024)
por: Zhang, Jinlu, et al.
Publicado: (2024)
Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance
por: Xu, Mengling, et al.
Publicado: (2025)
por: Xu, Mengling, et al.
Publicado: (2025)
ViStoryBench: Comprehensive Benchmark Suite for Story Visualization
por: Zhuang, Cailin, et al.
Publicado: (2025)
por: Zhuang, Cailin, et al.
Publicado: (2025)
ReCap: Lightweight Referential Grounding for Coherent Story Visualization
por: Arora, Aditya, et al.
Publicado: (2026)
por: Arora, Aditya, et al.
Publicado: (2026)
Story-Iter: A Training-free Iterative Paradigm for Long Story Visualization
por: Mao, Jiawei, et al.
Publicado: (2024)
por: Mao, Jiawei, et al.
Publicado: (2024)
ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation
por: Sarkar, Ayushman, et al.
Publicado: (2026)
por: Sarkar, Ayushman, et al.
Publicado: (2026)
Towards Visual Grounding: A Survey
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization
por: Meng, Chutian, et al.
Publicado: (2026)
por: Meng, Chutian, et al.
Publicado: (2026)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2023)
por: Xiao, Linhui, et al.
Publicado: (2023)
OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
StoryGPT-V: Large Language Models as Consistent Story Visualizers
por: Shen, Xiaoqian, et al.
Publicado: (2023)
por: Shen, Xiaoqian, et al.
Publicado: (2023)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
Towards Long Video Understanding via Fine-detailed Video Story Generation
por: You, Zeng, et al.
Publicado: (2024)
por: You, Zeng, et al.
Publicado: (2024)
OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
por: An, Zhaochong, et al.
Publicado: (2025)
por: An, Zhaochong, et al.
Publicado: (2025)
DMC$^3$: Dual-Modal Counterfactual Contrastive Construction for Egocentric Video Question Answering
por: Zou, Jiayi, et al.
Publicado: (2025)
por: Zou, Jiayi, et al.
Publicado: (2025)
VisAgent: Narrative-Preserving Story Visualization Framework
por: Kim, Seungkwon, et al.
Publicado: (2025)
por: Kim, Seungkwon, et al.
Publicado: (2025)
EmoStory: Emotion-Aware Story Generation
por: Yang, Jingyuan, et al.
Publicado: (2026)
por: Yang, Jingyuan, et al.
Publicado: (2026)
Object Isolated Attention for Consistent Story Visualization
por: Luo, Xiangyang, et al.
Publicado: (2025)
por: Luo, Xiangyang, et al.
Publicado: (2025)
From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations
por: Li, Yuzhi, et al.
Publicado: (2025)
por: Li, Yuzhi, et al.
Publicado: (2025)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
por: Wang, Zhaozhi, et al.
Publicado: (2025)
por: Wang, Zhaozhi, et al.
Publicado: (2025)
Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation
por: Ma, Ao, et al.
Publicado: (2025)
por: Ma, Ao, et al.
Publicado: (2025)
Audit & Repair: An Agentic Framework for Consistent Story Visualization in Text-to-Image Diffusion Models
por: Akdemir, Kiymet, et al.
Publicado: (2025)
por: Akdemir, Kiymet, et al.
Publicado: (2025)
SEED-Story: Multimodal Long Story Generation with Large Language Model
por: Yang, Shuai, et al.
Publicado: (2024)
por: Yang, Shuai, et al.
Publicado: (2024)
DreamStory: Open-Domain Story Visualization by LLM-Guided Multi-Subject Consistent Diffusion
por: He, Huiguo, et al.
Publicado: (2024)
por: He, Huiguo, et al.
Publicado: (2024)
MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive Orchestration
por: Sun, Wenzhang, et al.
Publicado: (2026)
por: Sun, Wenzhang, et al.
Publicado: (2026)
Boosting Consistency in Story Visualization with Rich-Contextual Conditional Diffusion Models
por: Shen, Fei, et al.
Publicado: (2024)
por: Shen, Fei, et al.
Publicado: (2024)
Pilot: Building the Federated Multimodal Instruction Tuning Framework
por: Xiong, Baochen, et al.
Publicado: (2025)
por: Xiong, Baochen, et al.
Publicado: (2025)
StoryMaker: Towards Holistic Consistent Characters in Text-to-image Generation
por: Zhou, Zhengguang, et al.
Publicado: (2024)
por: Zhou, Zhengguang, et al.
Publicado: (2024)
Directing the Narrative: A Finetuning Method for Controlling Coherence and Style in Story Generation
por: Zhang, Jianzhang, et al.
Publicado: (2026)
por: Zhang, Jianzhang, et al.
Publicado: (2026)
IdentityStory: Taming Your Identity-Preserving Generator for Human-Centric Story Generation
por: Zhou, Donghao, et al.
Publicado: (2025)
por: Zhou, Donghao, et al.
Publicado: (2025)
Adaptive Visual Conditioning for Semantic Consistency in Diffusion-Based Story Continuation
por: Mousavi, Seyed Mohammad, et al.
Publicado: (2025)
por: Mousavi, Seyed Mohammad, et al.
Publicado: (2025)
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
por: Zhou, Yupeng, et al.
Publicado: (2024)
por: Zhou, Yupeng, et al.
Publicado: (2024)
MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation
por: Wang, Muyao, et al.
Publicado: (2026)
por: Wang, Muyao, et al.
Publicado: (2026)
AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation
por: He, Junjie, et al.
Publicado: (2025)
por: He, Junjie, et al.
Publicado: (2025)
StoryMem: Multi-shot Long Video Storytelling with Memory
por: Zhang, Kaiwen, et al.
Publicado: (2025)
por: Zhang, Kaiwen, et al.
Publicado: (2025)
Visualization of Age Distributions as Elements of Medical Data-Stories
por: Dowlatabadi, Sophia, et al.
Publicado: (2024)
por: Dowlatabadi, Sophia, et al.
Publicado: (2024)
LEARN: A Story-Driven Layout-to-Image Generation Framework for STEM Instruction
por: Zhang, Maoquan, et al.
Publicado: (2025)
por: Zhang, Maoquan, et al.
Publicado: (2025)
EduStory: A Unified Framework for Pedagogically-Consistent Multi-Shot STEM Instructional Video Generation
por: Wu, Xinyi, et al.
Publicado: (2026)
por: Wu, Xinyi, et al.
Publicado: (2026)
Ejemplares similares
-
Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC
por: Tao, Ming, et al.
Publicado: (2024) -
Causal-Story: Local Causal Attention Utilizing Parameter-Efficient Tuning For Visual Story Synthesis
por: Song, Tianyi, et al.
Publicado: (2023) -
StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization
por: Zhang, Jinlu, et al.
Publicado: (2024) -
Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance
por: Xu, Mengling, et al.
Publicado: (2025) -
ViStoryBench: Comprehensive Benchmark Suite for Story Visualization
por: Zhuang, Cailin, et al.
Publicado: (2025)