With Limited Data for Multimodal Alignment, Let the STRUCTURE Guide You
Fuente:
arXiv
Salvato in:
| Autori principali: | Gröger, Fabian, Wen, Shuo, Le, Huyen, Brbić, Maria |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Revisiting the Platonic Representation Hypothesis: An Aristotelian View
di: Gröger, Fabian, et al.
Pubblicazione: (2026)
di: Gröger, Fabian, et al.
Pubblicazione: (2026)
Is Hyperbolic Space All You Need for Medical Anomaly Detection?
di: Gonzalez-Jimenez, Alvaro, et al.
Pubblicazione: (2025)
di: Gonzalez-Jimenez, Alvaro, et al.
Pubblicazione: (2025)
Learning Relative Representations for Fine-Grained Multimodal Alignment with Limited Data
di: Kim, Shiwon, et al.
Pubblicazione: (2026)
di: Kim, Shiwon, et al.
Pubblicazione: (2026)
Gramian Multimodal Representation Learning and Alignment
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
Alignment-Guided Score Matching for Text-to-Image Alignment in Diffusion Models
di: Lee, Jaa-Yeon, et al.
Pubblicazione: (2026)
di: Lee, Jaa-Yeon, et al.
Pubblicazione: (2026)
Clinical Uncertainty Impacts Machine Learning Evaluations
di: Lionetti, Simone, et al.
Pubblicazione: (2025)
di: Lionetti, Simone, et al.
Pubblicazione: (2025)
Reconstruction Alignment Improves Unified Multimodal Models
di: Xie, Ji, et al.
Pubblicazione: (2025)
di: Xie, Ji, et al.
Pubblicazione: (2025)
MEGL: Multimodal Explanation-Guided Learning
di: Zhang, Yifei, et al.
Pubblicazione: (2024)
di: Zhang, Yifei, et al.
Pubblicazione: (2024)
Exploring Perceptual Limitation of Multimodal Large Language Models
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
A TRIANGLE Enables Multimodal Alignment Beyond Cosine Similarity
di: Cicchetti, Giordano, et al.
Pubblicazione: (2025)
di: Cicchetti, Giordano, et al.
Pubblicazione: (2025)
CleanPatrick: A Benchmark for Image Data Cleaning
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
Learning Hyperspectral Images with Curated Text Prompts for Efficient Multimodal Alignment
di: Chatterjee, Abhiroop, et al.
Pubblicazione: (2025)
di: Chatterjee, Abhiroop, et al.
Pubblicazione: (2025)
Align Your Query: Representation Alignment for Multimodality Medical Object Detection
di: Seo, Ara, et al.
Pubblicazione: (2025)
di: Seo, Ara, et al.
Pubblicazione: (2025)
GLAM: Geometry-Guided Local Alignment for Multi-View VLP in Mammography
di: Du, Yuexi, et al.
Pubblicazione: (2025)
di: Du, Yuexi, et al.
Pubblicazione: (2025)
Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
Learning from Limited and Imperfect Data
di: Rangwani, Harsh
Pubblicazione: (2025)
di: Rangwani, Harsh
Pubblicazione: (2025)
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
di: Chen, Shuo, et al.
Pubblicazione: (2023)
di: Chen, Shuo, et al.
Pubblicazione: (2023)
MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
di: Jiang, Yulun, et al.
Pubblicazione: (2025)
di: Jiang, Yulun, et al.
Pubblicazione: (2025)
Free$^2$Guide: Training-Free Text-to-Video Alignment using Image LVLM
di: Kim, Jaemin, et al.
Pubblicazione: (2024)
di: Kim, Jaemin, et al.
Pubblicazione: (2024)
Reasoning Limitations of Multimodal Large Language Models. A Case Study of Bongard Problems
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2024)
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2024)
Invariant Representation Guided Multimodal Sentiment Decoding with Sequential Variation Regularization
di: Xu, Guoyang, et al.
Pubblicazione: (2024)
di: Xu, Guoyang, et al.
Pubblicazione: (2024)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
di: Miao, Yanting, et al.
Pubblicazione: (2026)
di: Miao, Yanting, et al.
Pubblicazione: (2026)
Visual Planning: Let's Think Only with Images
di: Xu, Yi, et al.
Pubblicazione: (2025)
di: Xu, Yi, et al.
Pubblicazione: (2025)
MTA: Multimodal Task Alignment for BEV Perception and Captioning
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
Set-CLIP: Exploring Aligned Semantic From Low-Alignment Multimodal Data Through A Distribution View
di: Song, Zijia, et al.
Pubblicazione: (2024)
di: Song, Zijia, et al.
Pubblicazione: (2024)
QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Models
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2025)
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2025)
Decoupling Semantic Similarity from Spatial Alignment for Neural Networks
di: Wald, Tassilo, et al.
Pubblicazione: (2024)
di: Wald, Tassilo, et al.
Pubblicazione: (2024)
What You See is What You Classify: Black Box Attributions
di: Stalder, Steven, et al.
Pubblicazione: (2022)
di: Stalder, Steven, et al.
Pubblicazione: (2022)
VOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question Answering
di: Bhope, Rahul Atul, et al.
Pubblicazione: (2026)
di: Bhope, Rahul Atul, et al.
Pubblicazione: (2026)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
di: Lu, Shiyin, et al.
Pubblicazione: (2024)
di: Lu, Shiyin, et al.
Pubblicazione: (2024)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
di: Wang, Yongxin, et al.
Pubblicazione: (2024)
di: Wang, Yongxin, et al.
Pubblicazione: (2024)
Towards Achieving Perfect Multimodal Alignment
di: Kamboj, Abhi, et al.
Pubblicazione: (2025)
di: Kamboj, Abhi, et al.
Pubblicazione: (2025)
Multi-Surrogate-Teacher Assistance for Representation Alignment in Fingerprint-based Indoor Localization
di: Nguyen, Son Minh, et al.
Pubblicazione: (2024)
di: Nguyen, Son Minh, et al.
Pubblicazione: (2024)
Data-Efficient Multimodal Fusion on a Single GPU
di: Vouitsis, Noël, et al.
Pubblicazione: (2023)
di: Vouitsis, Noël, et al.
Pubblicazione: (2023)
Local Lesion Generation is Effective for Capsule Endoscopy Image Data Augmentation in a Limited Data Setting
di: Chłopowiec, Adrian B., et al.
Pubblicazione: (2024)
di: Chłopowiec, Adrian B., et al.
Pubblicazione: (2024)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026)
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026)
Motivation is Something You Need
di: Acheli, Mehdi, et al.
Pubblicazione: (2026)
di: Acheli, Mehdi, et al.
Pubblicazione: (2026)
VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety
di: Palaskar, Shruti, et al.
Pubblicazione: (2025)
di: Palaskar, Shruti, et al.
Pubblicazione: (2025)
A Comparative Study in Surgical AI: Potential and Limitations of Data, Compute, and Scaling
di: Skobelev, Kirill, et al.
Pubblicazione: (2026)
di: Skobelev, Kirill, et al.
Pubblicazione: (2026)
Semi-Supervised Masked Autoencoders: Unlocking Vision Transformer Potential with Limited Data
di: Faysal, Atik, et al.
Pubblicazione: (2026)
di: Faysal, Atik, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Revisiting the Platonic Representation Hypothesis: An Aristotelian View
di: Gröger, Fabian, et al.
Pubblicazione: (2026) -
Is Hyperbolic Space All You Need for Medical Anomaly Detection?
di: Gonzalez-Jimenez, Alvaro, et al.
Pubblicazione: (2025) -
Learning Relative Representations for Fine-Grained Multimodal Alignment with Limited Data
di: Kim, Shiwon, et al.
Pubblicazione: (2026) -
Gramian Multimodal Representation Learning and Alignment
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024) -
Alignment-Guided Score Matching for Text-to-Image Alignment in Diffusion Models
di: Lee, Jaa-Yeon, et al.
Pubblicazione: (2026)