Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Chang, Wu, Haoning, Zhong, Yujie, Zhang, Xiaoyun, Wang, Yanfeng, Xie, Weidi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MatchTime: Towards Automatic Soccer Game Commentary Generation
di: Rao, Jiayuan, et al.
Pubblicazione: (2024)
di: Rao, Jiayuan, et al.
Pubblicazione: (2024)
Count Anything at Any Granularity
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
di: Wu, Haoning, et al.
Pubblicazione: (2025)
di: Wu, Haoning, et al.
Pubblicazione: (2025)
MegaFusion: Extend Diffusion Models towards Higher-resolution Image Generation without Further Tuning
di: Wu, Haoning, et al.
Pubblicazione: (2024)
di: Wu, Haoning, et al.
Pubblicazione: (2024)
MRGen: Segmentation Data Engine for Underrepresented MRI Modalities
di: Wu, Haoning, et al.
Pubblicazione: (2024)
di: Wu, Haoning, et al.
Pubblicazione: (2024)
Towards Universal Soccer Video Understanding
di: Rao, Jiayuan, et al.
Pubblicazione: (2024)
di: Rao, Jiayuan, et al.
Pubblicazione: (2024)
Multi-Agent System for Comprehensive Soccer Understanding
di: Rao, Jiayuan, et al.
Pubblicazione: (2025)
di: Rao, Jiayuan, et al.
Pubblicazione: (2025)
SoccerMaster: A Vision Foundation Model for Soccer Understanding
di: Yang, Haolin, et al.
Pubblicazione: (2025)
di: Yang, Haolin, et al.
Pubblicazione: (2025)
SceneGen: Single-Image 3D Scene Generation in One Feedforward Pass
di: Meng, Yanxu, et al.
Pubblicazione: (2025)
di: Meng, Yanxu, et al.
Pubblicazione: (2025)
Towards Open-ended Visual Quality Comparison
di: Wu, Haoning, et al.
Pubblicazione: (2024)
di: Wu, Haoning, et al.
Pubblicazione: (2024)
Knowledge-enhanced Visual-Language Pretraining for Computational Pathology
di: Zhou, Xiao, et al.
Pubblicazione: (2024)
di: Zhou, Xiao, et al.
Pubblicazione: (2024)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams
di: Yan, Yibin, et al.
Pubblicazione: (2026)
di: Yan, Yibin, et al.
Pubblicazione: (2026)
EchoSight: Advancing Visual-Language Models with Wiki Knowledge
di: Yan, Yibin, et al.
Pubblicazione: (2024)
di: Yan, Yibin, et al.
Pubblicazione: (2024)
ProBench: Judging Multimodal Foundation Models on Open-ended Multi-domain Expert Tasks
di: Yang, Yan, et al.
Pubblicazione: (2025)
di: Yang, Yan, et al.
Pubblicazione: (2025)
A Sanity Check on Composed Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2026)
di: Liu, Yikun, et al.
Pubblicazione: (2026)
Zero-shot Composed Text-Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2023)
di: Liu, Yikun, et al.
Pubblicazione: (2023)
Can Visual Foundation Models Achieve Long-term Point Tracking?
di: Aydemir, Görkay, et al.
Pubblicazione: (2024)
di: Aydemir, Görkay, et al.
Pubblicazione: (2024)
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
di: Feng, Chengjian, et al.
Pubblicazione: (2024)
di: Feng, Chengjian, et al.
Pubblicazione: (2024)
Latent Diffusion for Medical Image Segmentation: End to end learning for fast sampling and accuracy
di: Zaman, Fahim Ahmed, et al.
Pubblicazione: (2024)
di: Zaman, Fahim Ahmed, et al.
Pubblicazione: (2024)
Improving Human Image Animation via Semantic Representation Alignment
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
Revisiting Multi-Task Visual Representation Learning
di: Di, Shangzhe, et al.
Pubblicazione: (2026)
di: Di, Shangzhe, et al.
Pubblicazione: (2026)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch
di: Liu, Yikun, et al.
Pubblicazione: (2026)
di: Liu, Yikun, et al.
Pubblicazione: (2026)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
di: Li, Zeqian, et al.
Pubblicazione: (2025)
di: Li, Zeqian, et al.
Pubblicazione: (2025)
RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis
di: Zhang, Xiaoman, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoman, et al.
Pubblicazione: (2024)
AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models
di: Sreenivas, Manogna, et al.
Pubblicazione: (2026)
di: Sreenivas, Manogna, et al.
Pubblicazione: (2026)
Multi-Sentence Grounding for Long-term Instructional Video
di: Li, Zeqian, et al.
Pubblicazione: (2023)
di: Li, Zeqian, et al.
Pubblicazione: (2023)
How Well Can Modern LLMs Act as Agent Cores in Radiology Environments?
di: Zheng, Qiaoyu, et al.
Pubblicazione: (2024)
di: Zheng, Qiaoyu, et al.
Pubblicazione: (2024)
Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling
di: Ye, Zilyu, et al.
Pubblicazione: (2024)
di: Ye, Zilyu, et al.
Pubblicazione: (2024)
PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining
di: Liang, Cheng, et al.
Pubblicazione: (2026)
di: Liang, Cheng, et al.
Pubblicazione: (2026)
ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification
di: Fan, Ziqing, et al.
Pubblicazione: (2025)
di: Fan, Ziqing, et al.
Pubblicazione: (2025)
DENOISER: Rethinking the Robustness for Open-Vocabulary Action Recognition
di: Cheng, Haozhe, et al.
Pubblicazione: (2024)
di: Cheng, Haozhe, et al.
Pubblicazione: (2024)
v-CLR: View-Consistent Learning for Open-World Instance Segmentation
di: Zhang, Chang-Bin, et al.
Pubblicazione: (2025)
di: Zhang, Chang-Bin, et al.
Pubblicazione: (2025)
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
di: Liu, Yikun, et al.
Pubblicazione: (2024)
di: Liu, Yikun, et al.
Pubblicazione: (2024)
ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models
di: Dong, Sibo, et al.
Pubblicazione: (2025)
di: Dong, Sibo, et al.
Pubblicazione: (2025)
LoRKD: Low-Rank Knowledge Decomposition for Medical Foundation Models
di: Li, Haolin, et al.
Pubblicazione: (2024)
di: Li, Haolin, et al.
Pubblicazione: (2024)
LADB: Latent Aligned Diffusion Bridges for Semi-Supervised Domain Translation
di: Wang, Xuqin, et al.
Pubblicazione: (2025)
di: Wang, Xuqin, et al.
Pubblicazione: (2025)
UFO: A Unified Approach to Fine-grained Visual Perception via Open-ended Language Interface
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
Grounded Question-Answering in Long Egocentric Videos
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
Documenti analoghi
-
MatchTime: Towards Automatic Soccer Game Commentary Generation
di: Rao, Jiayuan, et al.
Pubblicazione: (2024) -
Count Anything at Any Granularity
di: Liu, Chang, et al.
Pubblicazione: (2026) -
SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
di: Wu, Haoning, et al.
Pubblicazione: (2025) -
MegaFusion: Extend Diffusion Models towards Higher-resolution Image Generation without Further Tuning
di: Wu, Haoning, et al.
Pubblicazione: (2024) -
MRGen: Segmentation Data Engine for Underrepresented MRI Modalities
di: Wu, Haoning, et al.
Pubblicazione: (2024)