A TRIANGLE Enables Multimodal Alignment Beyond Cosine Similarity
Fuente:
arXiv
Salvato in:
| Autori principali: | Cicchetti, Giordano, Grassucci, Eleonora, Comminiello, Danilo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Gramian Multimodal Representation Learning and Alignment
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
Closing the gap in multimodal medical representation alignment
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026)
Multi-View Hypercomplex Learning for Breast Cancer Screening
di: Lopez, Eleonora, et al.
Pubblicazione: (2022)
di: Lopez, Eleonora, et al.
Pubblicazione: (2022)
RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?
di: Ghosh, Arijit, et al.
Pubblicazione: (2026)
di: Ghosh, Arijit, et al.
Pubblicazione: (2026)
Closing the Modality Gap Aligns Group-Wise Semantics
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
Hierarchical Hypercomplex Network for Multimodal Emotion Recognition
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
NAF-DPM: A Nonlinear Activation-Free Diffusion Probabilistic Model for Document Enhancement
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
Semantic Compression via Multimodal Representation Learning
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
Generalizing Medical Image Representations via Quaternion Wavelet Networks
di: Sigillo, Luigi, et al.
Pubblicazione: (2023)
di: Sigillo, Luigi, et al.
Pubblicazione: (2023)
Language-Oriented Semantic Latent Representation for Image Transmission
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
Guess What I Think: Streamlined EEG-to-Image Generation with Latent Diffusion Models
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
Towards Explaining Hypercomplex Neural Networks
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
TACE: Tumor-Aware Counterfactual Explanations
di: Rossi, Eleonora Beatrice, et al.
Pubblicazione: (2024)
di: Rossi, Eleonora Beatrice, et al.
Pubblicazione: (2024)
Training-Free Multimodal Guidance for Video to Audio Generation
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
Decoupling Semantic Similarity from Spatial Alignment for Neural Networks
di: Wald, Tassilo, et al.
Pubblicazione: (2024)
di: Wald, Tassilo, et al.
Pubblicazione: (2024)
Beyond Cosine Similarity: Magnitude-Aware CLIP for No-Reference Image Quality Assessment
di: Liao, Zhicheng, et al.
Pubblicazione: (2025)
di: Liao, Zhicheng, et al.
Pubblicazione: (2025)
Beyond the Veil of Similarity: Quantifying Semantic Continuity in Explainable AI
di: Huang, Qi, et al.
Pubblicazione: (2024)
di: Huang, Qi, et al.
Pubblicazione: (2024)
ArcVQ-VAE: A Spherical Vector Quantization Framework with ArcCosine Additive Margin
di: Kim, Jaeyung, et al.
Pubblicazione: (2026)
di: Kim, Jaeyung, et al.
Pubblicazione: (2026)
Attention-Map Augmentation for Hypercomplex Breast Cancer Classification
di: Lopez, Eleonora, et al.
Pubblicazione: (2023)
di: Lopez, Eleonora, et al.
Pubblicazione: (2023)
Reconstruction Alignment Improves Unified Multimodal Models
di: Xie, Ji, et al.
Pubblicazione: (2025)
di: Xie, Ji, et al.
Pubblicazione: (2025)
Meet JEANIE: a Similarity Measure for 3D Skeleton Sequences via Temporal-Viewpoint Alignment
di: Wang, Lei, et al.
Pubblicazione: (2024)
di: Wang, Lei, et al.
Pubblicazione: (2024)
Beyond Scalars: Concept-Based Alignment Analysis in Vision Transformers
di: Vielhaben, Johanna, et al.
Pubblicazione: (2024)
di: Vielhaben, Johanna, et al.
Pubblicazione: (2024)
With Limited Data for Multimodal Alignment, Let the STRUCTURE Guide You
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
Learning Hyperspectral Images with Curated Text Prompts for Efficient Multimodal Alignment
di: Chatterjee, Abhiroop, et al.
Pubblicazione: (2025)
di: Chatterjee, Abhiroop, et al.
Pubblicazione: (2025)
Align Your Query: Representation Alignment for Multimodality Medical Object Detection
di: Seo, Ara, et al.
Pubblicazione: (2025)
di: Seo, Ara, et al.
Pubblicazione: (2025)
Learning Relative Representations for Fine-Grained Multimodal Alignment with Limited Data
di: Kim, Shiwon, et al.
Pubblicazione: (2026)
di: Kim, Shiwon, et al.
Pubblicazione: (2026)
Beyond Sight: Towards Cognitive Alignment in LVLM via Enriched Visual Knowledge
di: Zhao, Yaqi, et al.
Pubblicazione: (2024)
di: Zhao, Yaqi, et al.
Pubblicazione: (2024)
Metadata, Wavelet, and Time Aware Diffusion Models for Satellite Image Super Resolution
di: Sigillo, Luigi, et al.
Pubblicazione: (2025)
di: Sigillo, Luigi, et al.
Pubblicazione: (2025)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
di: Miao, Yanting, et al.
Pubblicazione: (2026)
di: Miao, Yanting, et al.
Pubblicazione: (2026)
Relational Visual Similarity
di: Nguyen, Thao, et al.
Pubblicazione: (2025)
di: Nguyen, Thao, et al.
Pubblicazione: (2025)
Generative Semantic Communication: Diffusion Models Beyond Bit Recovery
di: Grassucci, Eleonora, et al.
Pubblicazione: (2023)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2023)
MTA: Multimodal Task Alignment for BEV Perception and Captioning
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
Beyond Interpretability: When, Why, and How Sparse Autoencoders Enable Label-Free Visual Steering
di: Chatzoudis, Gerasimos, et al.
Pubblicazione: (2025)
di: Chatzoudis, Gerasimos, et al.
Pubblicazione: (2025)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
di: Huang, Brandon, et al.
Pubblicazione: (2024)
di: Huang, Brandon, et al.
Pubblicazione: (2024)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
di: Lu, Shiyin, et al.
Pubblicazione: (2024)
di: Lu, Shiyin, et al.
Pubblicazione: (2024)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
di: Wang, Yongxin, et al.
Pubblicazione: (2024)
di: Wang, Yongxin, et al.
Pubblicazione: (2024)
Towards Achieving Perfect Multimodal Alignment
di: Kamboj, Abhi, et al.
Pubblicazione: (2025)
di: Kamboj, Abhi, et al.
Pubblicazione: (2025)
Seeing Beyond Frames: Zero-Shot Pedestrian Intention Prediction with Raw Temporal Video and Multimodal Cues
di: Zambare, Pallavi, et al.
Pubblicazione: (2025)
di: Zambare, Pallavi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Gramian Multimodal Representation Learning and Alignment
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024) -
Closing the gap in multimodal medical representation alignment
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026) -
Multi-View Hypercomplex Learning for Breast Cancer Screening
di: Lopez, Eleonora, et al.
Pubblicazione: (2022) -
RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?
di: Ghosh, Arijit, et al.
Pubblicazione: (2026) -
Closing the Modality Gap Aligns Group-Wise Semantics
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026)