Improving Visual Storytelling with Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Xiaochuan, Chen, Xiangyong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models
di: Lin, Xiaochuan, et al.
Pubblicazione: (2025)
di: Lin, Xiaochuan, et al.
Pubblicazione: (2025)
Dialogue Director: Bridging the Gap in Dialogue Visualization for Multimodal Storytelling
di: Zhang, Min, et al.
Pubblicazione: (2024)
di: Zhang, Min, et al.
Pubblicazione: (2024)
Customized Visual Storytelling with Unified Multimodal LLMs
di: Li, Wei-Hua, et al.
Pubblicazione: (2026)
di: Li, Wei-Hua, et al.
Pubblicazione: (2026)
Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
di: Chen, Xiangyong, et al.
Pubblicazione: (2026)
di: Chen, Xiangyong, et al.
Pubblicazione: (2026)
Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models
di: Huang, Yuzhou, et al.
Pubblicazione: (2024)
di: Huang, Yuzhou, et al.
Pubblicazione: (2024)
Let Storytelling Tell Vivid Stories: An Expressive and Fluent Multimodal Storyteller
di: Zang, Chuanqi, et al.
Pubblicazione: (2024)
di: Zang, Chuanqi, et al.
Pubblicazione: (2024)
Latent Denoising Improves Visual Alignment in Large Multimodal Models
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
Can Multimodal Large Language Models be Guided to Improve Industrial Anomaly Detection?
di: Chen, Zhiling, et al.
Pubblicazione: (2025)
di: Chen, Zhiling, et al.
Pubblicazione: (2025)
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025)
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025)
Visual Representation Alignment for Multimodal Large Language Models
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
di: Chen, Jian, et al.
Pubblicazione: (2025)
di: Chen, Jian, et al.
Pubblicazione: (2025)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
di: Lin, Zhihang, et al.
Pubblicazione: (2024)
di: Lin, Zhihang, et al.
Pubblicazione: (2024)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
di: Ge, Junqi, et al.
Pubblicazione: (2024)
di: Ge, Junqi, et al.
Pubblicazione: (2024)
Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling
di: Ye, Zilyu, et al.
Pubblicazione: (2024)
di: Ye, Zilyu, et al.
Pubblicazione: (2024)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
di: Zhang, Jiacheng, et al.
Pubblicazione: (2024)
di: Zhang, Jiacheng, et al.
Pubblicazione: (2024)
Storybooth: Training-free Multi-Subject Consistency for Improved Visual Storytelling
di: Singh, Jaskirat, et al.
Pubblicazione: (2025)
di: Singh, Jaskirat, et al.
Pubblicazione: (2025)
Semantic Alignment for Multimodal Large Language Models
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
di: Liu, Haogeng, et al.
Pubblicazione: (2024)
di: Liu, Haogeng, et al.
Pubblicazione: (2024)
Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models
di: Zhou, Haoran, et al.
Pubblicazione: (2025)
di: Zhou, Haoran, et al.
Pubblicazione: (2025)
When Visual Privacy Protection Meets Multimodal Large Language Models
di: Hui, Xiaofei, et al.
Pubblicazione: (2026)
di: Hui, Xiaofei, et al.
Pubblicazione: (2026)
TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling
di: Chen, Weiran, et al.
Pubblicazione: (2024)
di: Chen, Weiran, et al.
Pubblicazione: (2024)
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
di: Zhang, Renshan, et al.
Pubblicazione: (2025)
di: Zhang, Renshan, et al.
Pubblicazione: (2025)
From Image Captioning to Visual Storytelling
di: Passadakis, Admitos, et al.
Pubblicazione: (2025)
di: Passadakis, Admitos, et al.
Pubblicazione: (2025)
SemiCD-VL: Visual-Language Model Guidance Makes Better Semi-supervised Change Detector
di: Li, Kaiyu, et al.
Pubblicazione: (2024)
di: Li, Kaiyu, et al.
Pubblicazione: (2024)
Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement
di: Khan, Zaid, et al.
Pubblicazione: (2024)
di: Khan, Zaid, et al.
Pubblicazione: (2024)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
di: Lawrence, Logan, et al.
Pubblicazione: (2025)
di: Lawrence, Logan, et al.
Pubblicazione: (2025)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
di: Liu, Juntao, et al.
Pubblicazione: (2025)
di: Liu, Juntao, et al.
Pubblicazione: (2025)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
di: Xu, Mingjie, et al.
Pubblicazione: (2025)
di: Xu, Mingjie, et al.
Pubblicazione: (2025)
ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
di: Liu, Chang, et al.
Pubblicazione: (2023)
di: Liu, Chang, et al.
Pubblicazione: (2023)
AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models
di: Sreenivas, Manogna, et al.
Pubblicazione: (2026)
di: Sreenivas, Manogna, et al.
Pubblicazione: (2026)
Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
di: Gan, Woody Haosheng, et al.
Pubblicazione: (2025)
di: Gan, Woody Haosheng, et al.
Pubblicazione: (2025)
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
di: Majeedi, Abrar, et al.
Pubblicazione: (2026)
di: Majeedi, Abrar, et al.
Pubblicazione: (2026)
ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model
di: Sun, Yiming, et al.
Pubblicazione: (2024)
di: Sun, Yiming, et al.
Pubblicazione: (2024)
OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models
di: Weng, Tengjin, et al.
Pubblicazione: (2026)
di: Weng, Tengjin, et al.
Pubblicazione: (2026)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
di: Jiang, Jingjing, et al.
Pubblicazione: (2025)
di: Jiang, Jingjing, et al.
Pubblicazione: (2025)
Enhancing Multimodal Large Language Models with Multi-instance Visual Prompt Generator for Visual Representation Enrichment
di: Zhong, Wenliang, et al.
Pubblicazione: (2024)
di: Zhong, Wenliang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models
di: Lin, Xiaochuan, et al.
Pubblicazione: (2025) -
Dialogue Director: Bridging the Gap in Dialogue Visualization for Multimodal Storytelling
di: Zhang, Min, et al.
Pubblicazione: (2024) -
Customized Visual Storytelling with Unified Multimodal LLMs
di: Li, Wei-Hua, et al.
Pubblicazione: (2026) -
Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
di: Chen, Xiangyong, et al.
Pubblicazione: (2026) -
Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models
di: Huang, Yuzhou, et al.
Pubblicazione: (2024)