Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Xin, Zhou, Yuwei, Huang, Bin, Chen, Hong, Zhu, Wenwu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VIMI: Grounding Video Generation through Multi-modal Instruction
di: Fang, Yuwei, et al.
Pubblicazione: (2024)
di: Fang, Yuwei, et al.
Pubblicazione: (2024)
Awesome Multi-modal Object Tracking
di: Zhang, Chunhui, et al.
Pubblicazione: (2024)
di: Zhang, Chunhui, et al.
Pubblicazione: (2024)
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
UNIAA: A Unified Multi-modal Image Aesthetic Assessment Baseline and Benchmark
di: Zhou, Zhaokun, et al.
Pubblicazione: (2024)
di: Zhou, Zhaokun, et al.
Pubblicazione: (2024)
Can Multi-modal (reasoning) LLMs work as deepfake detectors?
di: Ren, Simiao, et al.
Pubblicazione: (2025)
di: Ren, Simiao, et al.
Pubblicazione: (2025)
The Labyrinth of Links: Navigating the Associative Maze of Multi-modal LLMs
di: Li, Hong, et al.
Pubblicazione: (2024)
di: Li, Hong, et al.
Pubblicazione: (2024)
Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)
Rethinking Patient Education as Multi-turn Multi-modal Interaction
di: Yao, Zonghai, et al.
Pubblicazione: (2026)
di: Yao, Zonghai, et al.
Pubblicazione: (2026)
World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and Filtering
di: Wang, Jiacong, et al.
Pubblicazione: (2024)
di: Wang, Jiacong, et al.
Pubblicazione: (2024)
MGHanD: Multi-modal Guidance for authentic Hand Diffusion
di: Eum, Taehyeon, et al.
Pubblicazione: (2025)
di: Eum, Taehyeon, et al.
Pubblicazione: (2025)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
Robust Domain Generalization for Multi-modal Object Recognition
di: Qiao, Yuxin, et al.
Pubblicazione: (2024)
di: Qiao, Yuxin, et al.
Pubblicazione: (2024)
EMMA: Empowering Multi-modal Mamba with Structural and Hierarchical Alignment
di: Xing, Yifei, et al.
Pubblicazione: (2024)
di: Xing, Yifei, et al.
Pubblicazione: (2024)
Vision-Language Consistency Guided Multi-modal Prompt Learning for Blind AI Generated Image Quality Assessment
di: Fu, Jun, et al.
Pubblicazione: (2024)
di: Fu, Jun, et al.
Pubblicazione: (2024)
Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke
di: Chen, Liren, et al.
Pubblicazione: (2026)
di: Chen, Liren, et al.
Pubblicazione: (2026)
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
di: Gao, Zhi, et al.
Pubblicazione: (2024)
di: Gao, Zhi, et al.
Pubblicazione: (2024)
Multi-modality Anomaly Segmentation on the Road
di: Gao, Heng, et al.
Pubblicazione: (2025)
di: Gao, Heng, et al.
Pubblicazione: (2025)
Towards a Universal 3D Medical Multi-modality Generalization via Learning Personalized Invariant Representation
di: Tan, Zhaorui, et al.
Pubblicazione: (2024)
di: Tan, Zhaorui, et al.
Pubblicazione: (2024)
Multi-weather Cross-view Geo-localization Using Denoising Diffusion Models
di: Feng, Tongtong, et al.
Pubblicazione: (2024)
di: Feng, Tongtong, et al.
Pubblicazione: (2024)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
di: Hong, Haodong, et al.
Pubblicazione: (2024)
di: Hong, Haodong, et al.
Pubblicazione: (2024)
Instruct-Imagen: Image Generation with Multi-modal Instruction
di: Hu, Hexiang, et al.
Pubblicazione: (2024)
di: Hu, Hexiang, et al.
Pubblicazione: (2024)
Cross-modality Guidance-aided Multi-modal Learning with Dual Attention for MRI Brain Tumor Grading
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)
LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models
di: Liao, Pan, et al.
Pubblicazione: (2026)
di: Liao, Pan, et al.
Pubblicazione: (2026)
M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding
di: Liu, Shenxi, et al.
Pubblicazione: (2025)
di: Liu, Shenxi, et al.
Pubblicazione: (2025)
Multi-modal Situated Reasoning in 3D Scenes
di: Linghu, Xiongkun, et al.
Pubblicazione: (2024)
di: Linghu, Xiongkun, et al.
Pubblicazione: (2024)
Multi-modal Relation Distillation for Unified 3D Representation Learning
di: Wang, Huiqun, et al.
Pubblicazione: (2024)
di: Wang, Huiqun, et al.
Pubblicazione: (2024)
How Well Do Multi-modal LLMs Interpret CT Scans? An Auto-Evaluation Framework for Analyses
di: Zhu, Qingqing, et al.
Pubblicazione: (2024)
di: Zhu, Qingqing, et al.
Pubblicazione: (2024)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
RAMer: Reconstruction-based Adversarial Model for Multi-party Multi-modal Multi-label Emotion Recognition
di: Yang, Xudong, et al.
Pubblicazione: (2025)
di: Yang, Xudong, et al.
Pubblicazione: (2025)
Multi-modal Deep Learning
di: Yuhua, Chen
Pubblicazione: (2024)
di: Yuhua, Chen
Pubblicazione: (2024)
MedMAP: Promoting Incomplete Multi-modal Brain Tumor Segmentation with Alignment
di: Liu, Tianyi, et al.
Pubblicazione: (2024)
di: Liu, Tianyi, et al.
Pubblicazione: (2024)
SpatialLLM: From Multi-modality Data to Urban Spatial Intelligence
di: Chen, Jiabin, et al.
Pubblicazione: (2025)
di: Chen, Jiabin, et al.
Pubblicazione: (2025)
Modality-Aware and Shift Mixer for Multi-modal Brain Tumor Segmentation
di: Huang, Zhongzhen, et al.
Pubblicazione: (2024)
di: Huang, Zhongzhen, et al.
Pubblicazione: (2024)
Generative Multi-modal Models are Good Class-Incremental Learners
di: Cao, Xusheng, et al.
Pubblicazione: (2024)
di: Cao, Xusheng, et al.
Pubblicazione: (2024)
IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes
di: Liang, Yujia, et al.
Pubblicazione: (2025)
di: Liang, Yujia, et al.
Pubblicazione: (2025)
mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation
di: Hu, Chan-Wei, et al.
Pubblicazione: (2025)
di: Hu, Chan-Wei, et al.
Pubblicazione: (2025)
Multi-modal Auto-regressive Modeling via Visual Words
di: Peng, Tianshuo, et al.
Pubblicazione: (2024)
di: Peng, Tianshuo, et al.
Pubblicazione: (2024)
Multi-modal Spatio-Temporal Transformer for High-resolution Land Subsidence Prediction
di: Yao, Wendong, et al.
Pubblicazione: (2025)
di: Yao, Wendong, et al.
Pubblicazione: (2025)
MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models
di: Chen, Tianwei, et al.
Pubblicazione: (2026)
di: Chen, Tianwei, et al.
Pubblicazione: (2026)
Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation
di: Lei, Yinjie, et al.
Pubblicazione: (2023)
di: Lei, Yinjie, et al.
Pubblicazione: (2023)
Documenti analoghi
-
VIMI: Grounding Video Generation through Multi-modal Instruction
di: Fang, Yuwei, et al.
Pubblicazione: (2024) -
Awesome Multi-modal Object Tracking
di: Zhang, Chunhui, et al.
Pubblicazione: (2024) -
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
di: Zhou, Jiayi, et al.
Pubblicazione: (2025) -
UNIAA: A Unified Multi-modal Image Aesthetic Assessment Baseline and Benchmark
di: Zhou, Zhaokun, et al.
Pubblicazione: (2024) -
Can Multi-modal (reasoning) LLMs work as deepfake detectors?
di: Ren, Simiao, et al.
Pubblicazione: (2025)