Closing the gap in multimodal medical representation alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Grassucci, Eleonora, Cicchetti, Giordano, Comminiello, Danilo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A TRIANGLE Enables Multimodal Alignment Beyond Cosine Similarity
di: Cicchetti, Giordano, et al.
Pubblicazione: (2025)
di: Cicchetti, Giordano, et al.
Pubblicazione: (2025)
Closing the Modality Gap Aligns Group-Wise Semantics
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026)
Gramian Multimodal Representation Learning and Alignment
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
Multi-View Hypercomplex Learning for Breast Cancer Screening
di: Lopez, Eleonora, et al.
Pubblicazione: (2022)
di: Lopez, Eleonora, et al.
Pubblicazione: (2022)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
NAF-DPM: A Nonlinear Activation-Free Diffusion Probabilistic Model for Document Enhancement
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
Generalizing Medical Image Representations via Quaternion Wavelet Networks
di: Sigillo, Luigi, et al.
Pubblicazione: (2023)
di: Sigillo, Luigi, et al.
Pubblicazione: (2023)
Language-Oriented Semantic Latent Representation for Image Transmission
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
Semantic Compression via Multimodal Representation Learning
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
Towards Explaining Hypercomplex Neural Networks
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
TACE: Tumor-Aware Counterfactual Explanations
di: Rossi, Eleonora Beatrice, et al.
Pubblicazione: (2024)
di: Rossi, Eleonora Beatrice, et al.
Pubblicazione: (2024)
Hierarchical Hypercomplex Network for Multimodal Emotion Recognition
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
Attention-Map Augmentation for Hypercomplex Breast Cancer Classification
di: Lopez, Eleonora, et al.
Pubblicazione: (2023)
di: Lopez, Eleonora, et al.
Pubblicazione: (2023)
Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
Can multimodal representation learning by alignment preserve modality-specific information?
di: Thoreau, Romain, et al.
Pubblicazione: (2025)
di: Thoreau, Romain, et al.
Pubblicazione: (2025)
Metadata, Wavelet, and Time Aware Diffusion Models for Satellite Image Super Resolution
di: Sigillo, Luigi, et al.
Pubblicazione: (2025)
di: Sigillo, Luigi, et al.
Pubblicazione: (2025)
Guess What I Think: Streamlined EEG-to-Image Generation with Latent Diffusion Models
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
Training-Free Multimodal Guidance for Video to Audio Generation
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
Quaternion Wavelet-Conditioned Diffusion Models for Image Super-Resolution
di: Sigillo, Luigi, et al.
Pubblicazione: (2025)
di: Sigillo, Luigi, et al.
Pubblicazione: (2025)
Ship in Sight: Diffusion Models for Ship-Image Super Resolution
di: Sigillo, Luigi, et al.
Pubblicazione: (2024)
di: Sigillo, Luigi, et al.
Pubblicazione: (2024)
Training-Free Multi-User Generative Semantic Communications via Null-Space Diffusion Sampling
di: Grassucci, Eleonora, et al.
Pubblicazione: (2024)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2024)
Latent Wavelet Diffusion For Ultra-High-Resolution Image Synthesis
di: Sigillo, Luigi, et al.
Pubblicazione: (2025)
di: Sigillo, Luigi, et al.
Pubblicazione: (2025)
AGA: An adaptive group alignment framework for structured medical cross-modal representation learning
di: Li, Wei, et al.
Pubblicazione: (2025)
di: Li, Wei, et al.
Pubblicazione: (2025)
What to align in multimodal contrastive learning?
di: Dufumier, Benoit, et al.
Pubblicazione: (2024)
di: Dufumier, Benoit, et al.
Pubblicazione: (2024)
Lightweight Diffusion Models for Resource-Constrained Semantic Communication
di: Pignata, Giovanni, et al.
Pubblicazione: (2024)
di: Pignata, Giovanni, et al.
Pubblicazione: (2024)
Visual concept ranking uncovers medical shortcuts used by large multimodal models
di: Janizek, Joseph D., et al.
Pubblicazione: (2026)
di: Janizek, Joseph D., et al.
Pubblicazione: (2026)
Intrinsic Dimension Correlation: uncovering nonlinear connections in multimodal representations
di: Basile, Lorenzo, et al.
Pubblicazione: (2024)
di: Basile, Lorenzo, et al.
Pubblicazione: (2024)
A multimodal slice discovery framework for systematic failure detection and explanation in medical image classification
di: Liu, Yixuan, et al.
Pubblicazione: (2026)
di: Liu, Yixuan, et al.
Pubblicazione: (2026)
Visual representations in the human brain are aligned with large language models
di: Doerig, Adrien, et al.
Pubblicazione: (2022)
di: Doerig, Adrien, et al.
Pubblicazione: (2022)
Human alignment of neural network representations
di: Muttenthaler, Lukas, et al.
Pubblicazione: (2022)
di: Muttenthaler, Lukas, et al.
Pubblicazione: (2022)
Differential privacy representation geometry for medical image analysis
di: Arasteh, Soroosh Tayebi, et al.
Pubblicazione: (2026)
di: Arasteh, Soroosh Tayebi, et al.
Pubblicazione: (2026)
Explaining latent representations of generative models with large multimodal models
di: Zhu, Mengdan, et al.
Pubblicazione: (2024)
di: Zhu, Mengdan, et al.
Pubblicazione: (2024)
MULTIAQUA: A multimodal maritime dataset and robust training strategies for multimodal semantic segmentation
di: Muhovič, Jon, et al.
Pubblicazione: (2025)
di: Muhovič, Jon, et al.
Pubblicazione: (2025)
Self-supervised video pretraining yields robust and more human-aligned visual representations
di: Parthasarathy, Nikhil, et al.
Pubblicazione: (2022)
di: Parthasarathy, Nikhil, et al.
Pubblicazione: (2022)
Evaluating alignment between humans and neural network representations in image-based learning tasks
di: Demircan, Can, et al.
Pubblicazione: (2023)
di: Demircan, Can, et al.
Pubblicazione: (2023)
Transferring disentangled representations: bridging the gap between synthetic and real images
di: Dapueto, Jacopo, et al.
Pubblicazione: (2024)
di: Dapueto, Jacopo, et al.
Pubblicazione: (2024)
Demystifying the Hypercomplex: Inductive Biases in Hypercomplex Deep Learning
di: Comminiello, Danilo, et al.
Pubblicazione: (2024)
di: Comminiello, Danilo, et al.
Pubblicazione: (2024)
LayerSync: Self-aligning Intermediate Layers
di: Haghighi, Yasaman, et al.
Pubblicazione: (2025)
di: Haghighi, Yasaman, et al.
Pubblicazione: (2025)
Model alignment using inter-modal bridges
di: Gholamzadeh, Ali, et al.
Pubblicazione: (2025)
di: Gholamzadeh, Ali, et al.
Pubblicazione: (2025)
Dimensions underlying the representational alignment of deep neural networks with humans
di: Mahner, Florian P., et al.
Pubblicazione: (2024)
di: Mahner, Florian P., et al.
Pubblicazione: (2024)
Documenti analoghi
-
A TRIANGLE Enables Multimodal Alignment Beyond Cosine Similarity
di: Cicchetti, Giordano, et al.
Pubblicazione: (2025) -
Closing the Modality Gap Aligns Group-Wise Semantics
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026) -
Gramian Multimodal Representation Learning and Alignment
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024) -
Multi-View Hypercomplex Learning for Breast Cancer Screening
di: Lopez, Eleonora, et al.
Pubblicazione: (2022) -
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)