Salvato in:
| Autori principali: | Zhang, Min, Wang, Zilin, Chen, Liyan, Liu, Kunhong, Lin, Juncong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2412.20725 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Visual Storytelling with Multimodal Large Language Models
di: Lin, Xiaochuan, et al.
Pubblicazione: (2024)
di: Lin, Xiaochuan, et al.
Pubblicazione: (2024)
MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation
di: Pang, Youxin, et al.
Pubblicazione: (2025)
di: Pang, Youxin, et al.
Pubblicazione: (2025)
Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN
di: Su, Jiacheng, et al.
Pubblicazione: (2024)
di: Su, Jiacheng, et al.
Pubblicazione: (2024)
Customized Visual Storytelling with Unified Multimodal LLMs
di: Li, Wei-Hua, et al.
Pubblicazione: (2026)
di: Li, Wei-Hua, et al.
Pubblicazione: (2026)
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
di: Tang, Changli, et al.
Pubblicazione: (2026)
di: Tang, Changli, et al.
Pubblicazione: (2026)
TV-Dialogue: Crafting Theme-Aware Video Dialogues with Immersive Interaction
di: Wang, Sai, et al.
Pubblicazione: (2025)
di: Wang, Sai, et al.
Pubblicazione: (2025)
DNPM: A Neural Parametric Model for the Synthesis of Facial Geometric Details
di: Cao, Haitao, et al.
Pubblicazione: (2024)
di: Cao, Haitao, et al.
Pubblicazione: (2024)
MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
di: Jiang, Yue, et al.
Pubblicazione: (2026)
di: Jiang, Yue, et al.
Pubblicazione: (2026)
Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings
di: Rose, Daniel, et al.
Pubblicazione: (2023)
di: Rose, Daniel, et al.
Pubblicazione: (2023)
Taking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learning
di: Liu, Jiazheng, et al.
Pubblicazione: (2025)
di: Liu, Jiazheng, et al.
Pubblicazione: (2025)
Let Storytelling Tell Vivid Stories: An Expressive and Fluent Multimodal Storyteller
di: Zang, Chuanqi, et al.
Pubblicazione: (2024)
di: Zang, Chuanqi, et al.
Pubblicazione: (2024)
Twin Co-Adaptive Dialogue for Progressive Image Generation
di: Wang, Jianhui, et al.
Pubblicazione: (2025)
di: Wang, Jianhui, et al.
Pubblicazione: (2025)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
di: Tong, Wenwen, et al.
Pubblicazione: (2025)
di: Tong, Wenwen, et al.
Pubblicazione: (2025)
LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
di: Huang, Guolei, et al.
Pubblicazione: (2025)
di: Huang, Guolei, et al.
Pubblicazione: (2025)
Character-Centered Dialogue Generation from Scene-Level Prompts
di: Kang, Taewon, et al.
Pubblicazione: (2025)
di: Kang, Taewon, et al.
Pubblicazione: (2025)
Bridging the Intent Gap: Knowledge-Enhanced Visual Generation
di: Cheng, Yi, et al.
Pubblicazione: (2024)
di: Cheng, Yi, et al.
Pubblicazione: (2024)
Divide-and-Conquer: Tree-structured Strategy with Answer Distribution Estimator for Goal-Oriented Visual Dialogue
di: Cai, Shuo, et al.
Pubblicazione: (2025)
di: Cai, Shuo, et al.
Pubblicazione: (2025)
MicroEmo: Time-Sensitive Multimodal Emotion Recognition with Micro-Expression Dynamics in Video Dialogues
di: Zhang, Liyun
Pubblicazione: (2024)
di: Zhang, Liyun
Pubblicazione: (2024)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
di: Pan, Yaning, et al.
Pubblicazione: (2025)
di: Pan, Yaning, et al.
Pubblicazione: (2025)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
di: Liu, Ziyan, et al.
Pubblicazione: (2025)
di: Liu, Ziyan, et al.
Pubblicazione: (2025)
TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling
di: Chen, Weiran, et al.
Pubblicazione: (2024)
di: Chen, Weiran, et al.
Pubblicazione: (2024)
AV-Dialog: Spoken Dialogue Models with Audio-Visual Input
di: Chen, Tuochao, et al.
Pubblicazione: (2025)
di: Chen, Tuochao, et al.
Pubblicazione: (2025)
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
di: Liu, Chang, et al.
Pubblicazione: (2023)
di: Liu, Chang, et al.
Pubblicazione: (2023)
FAMSeC: A Few-shot-sample-based General AI-generated Image Detection Method
di: Xu, Juncong, et al.
Pubblicazione: (2024)
di: Xu, Juncong, et al.
Pubblicazione: (2024)
Bridging Your Imagination with Audio-Video Generation via a Unified Director
di: Zhang, Jiaxu, et al.
Pubblicazione: (2025)
di: Zhang, Jiaxu, et al.
Pubblicazione: (2025)
Smile on the Face, Sadness in the Eyes: Bridging the Emotion Gap with a Multimodal Dataset of Eye and Facial Behaviors
di: Liu, Kejun, et al.
Pubblicazione: (2025)
di: Liu, Kejun, et al.
Pubblicazione: (2025)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
di: Li, Zhangpu, et al.
Pubblicazione: (2024)
di: Li, Zhangpu, et al.
Pubblicazione: (2024)
Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
di: Sun, Kaiser, et al.
Pubblicazione: (2026)
di: Sun, Kaiser, et al.
Pubblicazione: (2026)
TDRI: Two-Phase Dialogue Refinement and Co-Adaptation for Interactive Image Generation
di: Feng, Yuheng, et al.
Pubblicazione: (2025)
di: Feng, Yuheng, et al.
Pubblicazione: (2025)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
di: Yanuka, Moran, et al.
Pubblicazione: (2024)
di: Yanuka, Moran, et al.
Pubblicazione: (2024)
From Image Captioning to Visual Storytelling
di: Passadakis, Admitos, et al.
Pubblicazione: (2025)
di: Passadakis, Admitos, et al.
Pubblicazione: (2025)
Free-Grained Hierarchical Visual Recognition
di: Park, Seulki, et al.
Pubblicazione: (2025)
di: Park, Seulki, et al.
Pubblicazione: (2025)
GoodSAM++: Bridging Domain and Capacity Gaps via Segment Anything Model for Panoramic Semantic Segmentation
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
Federated Dialogue-Semantic Diffusion for Emotion Recognition under Incomplete Modalities
di: Qiu, Xihang, et al.
Pubblicazione: (2025)
di: Qiu, Xihang, et al.
Pubblicazione: (2025)
A Unified Hierarchical Framework for Fine-grained Cross-view Geo-localization over Large-scale Scenarios
di: Song, Zhuo, et al.
Pubblicazione: (2025)
di: Song, Zhuo, et al.
Pubblicazione: (2025)
CIRCLED: A Multi-turn CIR Dataset with Consistent Dialogues across Domains
di: Takeda, Tomohisa, et al.
Pubblicazione: (2026)
di: Takeda, Tomohisa, et al.
Pubblicazione: (2026)
Generating Dialogues from Egocentric Instructional Videos for Task Assistance: Dataset, Method and Benchmark
di: Aggarwal, Lavisha, et al.
Pubblicazione: (2025)
di: Aggarwal, Lavisha, et al.
Pubblicazione: (2025)
The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue
di: Hakimov, Sherzod, et al.
Pubblicazione: (2026)
di: Hakimov, Sherzod, et al.
Pubblicazione: (2026)
Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling
di: Ye, Zilyu, et al.
Pubblicazione: (2024)
di: Ye, Zilyu, et al.
Pubblicazione: (2024)
GoodSAM: Bridging Domain and Capacity Gaps via Segment Anything Model for Distortion-aware Panoramic Semantic Segmentation
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Improving Visual Storytelling with Multimodal Large Language Models
di: Lin, Xiaochuan, et al.
Pubblicazione: (2024) -
MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation
di: Pang, Youxin, et al.
Pubblicazione: (2025) -
Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN
di: Su, Jiacheng, et al.
Pubblicazione: (2024) -
Customized Visual Storytelling with Unified Multimodal LLMs
di: Li, Wei-Hua, et al.
Pubblicazione: (2026) -
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
di: Tang, Changli, et al.
Pubblicazione: (2026)