Explaining latent representations of generative models with large multimodal models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Mengdan, Liu, Zhenke, Pan, Bo, Angirekula, Abhinav, Zhao, Liang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MAIRA-1: A specialised large multimodal model for radiology report generation
by: Hyland, Stephanie L., et al.
Published: (2023)
by: Hyland, Stephanie L., et al.
Published: (2023)
Human-like object concept representations emerge naturally in multimodal large language models
by: Du, Changde, et al.
Published: (2024)
by: Du, Changde, et al.
Published: (2024)
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
by: Zhu, Mengdan, et al.
Published: (2025)
by: Zhu, Mengdan, et al.
Published: (2025)
Automatic benchmarking of large multimodal models via iterative experiment programming
by: Conti, Alessandro, et al.
Published: (2024)
by: Conti, Alessandro, et al.
Published: (2024)
GlitchBench: Can large multimodal models detect video game glitches?
by: Taesiri, Mohammad Reza, et al.
Published: (2023)
by: Taesiri, Mohammad Reza, et al.
Published: (2023)
LatentExplainer: Explaining Latent Representations in Deep Generative Models with Multimodal Large Language Models
by: Zhu, Mengdan, et al.
Published: (2024)
by: Zhu, Mengdan, et al.
Published: (2024)
When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis
by: Zhang, Ruixuan, et al.
Published: (2025)
by: Zhang, Ruixuan, et al.
Published: (2025)
Vibe-Eval: A hard evaluation suite for measuring progress of multimodal language models
by: Padlewski, Piotr, et al.
Published: (2024)
by: Padlewski, Piotr, et al.
Published: (2024)
What to align in multimodal contrastive learning?
by: Dufumier, Benoit, et al.
Published: (2024)
by: Dufumier, Benoit, et al.
Published: (2024)
A benchmark multimodal oro-dental dataset for large vision-language models
by: Lv, Haoxin, et al.
Published: (2025)
by: Lv, Haoxin, et al.
Published: (2025)
Opportunities and challenges in the application of large artificial intelligence models in radiology
by: Pan, Liangrui, et al.
Published: (2024)
by: Pan, Liangrui, et al.
Published: (2024)
Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation
by: Rädsch, Tim, et al.
Published: (2025)
by: Rädsch, Tim, et al.
Published: (2025)
An attempt to generate new bridge types from latent space of denoising diffusion Implicit model
by: Zhang, Hongjun
Published: (2024)
by: Zhang, Hongjun
Published: (2024)
Explaining multimodal LLMs via intra-modal token interactions
by: Liang, Jiawei, et al.
Published: (2025)
by: Liang, Jiawei, et al.
Published: (2025)
Self-learned representation-guided latent diffusion model for breast cancer classification in deep ultraviolet whole surface images
by: Afshin, Pouya, et al.
Published: (2026)
by: Afshin, Pouya, et al.
Published: (2026)
Self-Supervised Visual Preference Alignment
by: Zhu, Ke, et al.
Published: (2024)
by: Zhu, Ke, et al.
Published: (2024)
Investigating the impact of 2D gesture representation on co-speech gesture generation
by: Guichoux, Teo, et al.
Published: (2024)
by: Guichoux, Teo, et al.
Published: (2024)
Explainable AI: Context-Aware Layer-Wise Integrated Gradients for Explaining Transformer Models
by: Mersha, Melkamu Abay, et al.
Published: (2026)
by: Mersha, Melkamu Abay, et al.
Published: (2026)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
by: Nguyen, Phu-Vinh, et al.
Published: (2025)
by: Nguyen, Phu-Vinh, et al.
Published: (2025)
POSESTITCH-SLT: Linguistically Inspired Pose-Stitching for End-to-End Sign Language Translation
by: Joshi, Abhinav, et al.
Published: (2025)
by: Joshi, Abhinav, et al.
Published: (2025)
Do multimodal models imagine electric sheep?
by: Ramakrishnan, Santhosh Kumar, et al.
Published: (2026)
by: Ramakrishnan, Santhosh Kumar, et al.
Published: (2026)
Explaining Black-box Model Predictions via Two-level Nested Feature Attributions with Consistency Property
by: Yoshikawa, Yuya, et al.
Published: (2024)
by: Yoshikawa, Yuya, et al.
Published: (2024)
Evaluating point-light biological motion in multimodal large language models
by: Kadambi, Akila, et al.
Published: (2025)
by: Kadambi, Akila, et al.
Published: (2025)
RandLoRA: Full-rank parameter-efficient fine-tuning of large models
by: Albert, Paul, et al.
Published: (2025)
by: Albert, Paul, et al.
Published: (2025)
Advancing vision-language models in front-end development via data synthesis
by: Ge, Tong, et al.
Published: (2025)
by: Ge, Tong, et al.
Published: (2025)
An attempt to generate new bridge types from latent space of generative flow
by: Zhang, Hongjun
Published: (2024)
by: Zhang, Hongjun
Published: (2024)
An attempt to generate new bridge types from latent space of generative adversarial network
by: Zhang, Hongjun
Published: (2024)
by: Zhang, Hongjun
Published: (2024)
PathAlign: A vision-language model for whole slide images in histopathology
by: Ahmed, Faruk, et al.
Published: (2024)
by: Ahmed, Faruk, et al.
Published: (2024)
Generating floorplans for various building functionalities via latent diffusion model
by: Ibrahim, Mohamed R., et al.
Published: (2024)
by: Ibrahim, Mohamed R., et al.
Published: (2024)
Using Shapley interactions to understand how models use structure
by: Singhvi, Divyansh, et al.
Published: (2024)
by: Singhvi, Divyansh, et al.
Published: (2024)
Cross-modal linkage risk in clinical vision-language models
by: Arasteh, Soroosh Tayebi, et al.
Published: (2026)
by: Arasteh, Soroosh Tayebi, et al.
Published: (2026)
iSign: A Benchmark for Indian Sign Language Processing
by: Joshi, Abhinav, et al.
Published: (2024)
by: Joshi, Abhinav, et al.
Published: (2024)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
by: Jiang, Jiachen, et al.
Published: (2025)
by: Jiang, Jiachen, et al.
Published: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
by: Zhou, Chenyu, et al.
Published: (2024)
by: Zhou, Chenyu, et al.
Published: (2024)
Chaining text-to-image and large language model: A novel approach for generating personalized e-commerce banners
by: Vashishtha, Shanu, et al.
Published: (2024)
by: Vashishtha, Shanu, et al.
Published: (2024)
Cautious Optimizers: Improving Training with One Line of Code
by: Liang, Kaizhao, et al.
Published: (2024)
by: Liang, Kaizhao, et al.
Published: (2024)
AI-generated data contamination erodes pathological variability and diagnostic reliability
by: He, Hongyu, et al.
Published: (2026)
by: He, Hongyu, et al.
Published: (2026)
Founder effects shape the evolutionary dynamics of multimodality in open LLM families
by: Cebrian, Manuel
Published: (2026)
by: Cebrian, Manuel
Published: (2026)
An attempt to generate new bridge types from latent space of PixelCNN
by: Zhang, Hongjun
Published: (2024)
by: Zhang, Hongjun
Published: (2024)
An attempt to generate new bridge types from latent space of variational autoencoder
by: Zhang, Hongjun
Published: (2023)
by: Zhang, Hongjun
Published: (2023)
Similar Items
-
MAIRA-1: A specialised large multimodal model for radiology report generation
by: Hyland, Stephanie L., et al.
Published: (2023) -
Human-like object concept representations emerge naturally in multimodal large language models
by: Du, Changde, et al.
Published: (2024) -
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
by: Zhu, Mengdan, et al.
Published: (2025) -
Automatic benchmarking of large multimodal models via iterative experiment programming
by: Conti, Alessandro, et al.
Published: (2024) -
GlitchBench: Can large multimodal models detect video game glitches?
by: Taesiri, Mohammad Reza, et al.
Published: (2023)