EMMA: Efficient Visual Alignment in Multi-Modal LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Ghazanfari, Sara, Araujo, Alexandre, Krishnamurthy, Prashanth, Garg, Siddharth, Khorrami, Farshad |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LipSim: A Provably Robust Perceptual Similarity Metric
di: Ghazanfari, Sara, et al.
Pubblicazione: (2023)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2023)
Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024)
SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding
di: Ghazanfari, Sara, et al.
Pubblicazione: (2026)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2026)
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
RAZER: Robust Accelerated Zero-Shot 3D Open-Vocabulary Panoptic Reconstruction with Spatio-Temporal Aggregation
di: Patel, Naman, et al.
Pubblicazione: (2025)
di: Patel, Naman, et al.
Pubblicazione: (2025)
Multi-Modal Hallucination Control by Visual Information Grounding
di: Favero, Alessandro, et al.
Pubblicazione: (2024)
di: Favero, Alessandro, et al.
Pubblicazione: (2024)
CLIPScope: Enhancing Zero-Shot OOD Detection with Bayesian Scoring
di: Fu, Hao, et al.
Pubblicazione: (2024)
di: Fu, Hao, et al.
Pubblicazione: (2024)
Efficient and Distributed Large-Scale 3D Map Registration using Tomographic Features
di: Unlu, Halil Utku, et al.
Pubblicazione: (2024)
di: Unlu, Halil Utku, et al.
Pubblicazione: (2024)
Text-centric Alignment for Multi-Modality Learning
di: Tsai, Yun-Da, et al.
Pubblicazione: (2024)
di: Tsai, Yun-Da, et al.
Pubblicazione: (2024)
FlashMix: Fast Map-Free LiDAR Localization via Feature Mixing and Contrastive-Constrained Accelerated Training
di: Goswami, Raktim Gautam, et al.
Pubblicazione: (2024)
di: Goswami, Raktim Gautam, et al.
Pubblicazione: (2024)
SALSA: Swift Adaptive Lightweight Self-Attention for Enhanced LiDAR Place Recognition
di: Goswami, Raktim Gautam, et al.
Pubblicazione: (2024)
di: Goswami, Raktim Gautam, et al.
Pubblicazione: (2024)
SpotEdit: Evaluating Visually-Guided Image Editing Methods
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
EMMA: End-to-End Multimodal Model for Autonomous Driving
di: Hwang, Jyh-Jing, et al.
Pubblicazione: (2024)
di: Hwang, Jyh-Jing, et al.
Pubblicazione: (2024)
RoboPEPP: Vision-Based Robot Pose and Joint Angle Estimation through Embedding Predictive Pre-Training
di: Goswami, Raktim Gautam, et al.
Pubblicazione: (2024)
di: Goswami, Raktim Gautam, et al.
Pubblicazione: (2024)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
X-VILA: Cross-Modality Alignment for Large Language Model
di: Ye, Hanrong, et al.
Pubblicazione: (2024)
di: Ye, Hanrong, et al.
Pubblicazione: (2024)
MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets
di: Wei, Lai, et al.
Pubblicazione: (2023)
di: Wei, Lai, et al.
Pubblicazione: (2023)
3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks
di: Bhat, Vineet, et al.
Pubblicazione: (2025)
di: Bhat, Vineet, et al.
Pubblicazione: (2025)
Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs
di: Shukor, Mustafa, et al.
Pubblicazione: (2024)
di: Shukor, Mustafa, et al.
Pubblicazione: (2024)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
di: Du, Mengfei, et al.
Pubblicazione: (2024)
di: Du, Mengfei, et al.
Pubblicazione: (2024)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
LLMs as Visual Explainers: Advancing Image Classification with Evolving Visual Descriptions
di: Han, Songhao, et al.
Pubblicazione: (2023)
di: Han, Songhao, et al.
Pubblicazione: (2023)
CROME: Cross-Modal Adapters for Efficient Multimodal LLM
di: Ebrahimi, Sayna, et al.
Pubblicazione: (2024)
di: Ebrahimi, Sayna, et al.
Pubblicazione: (2024)
ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?
di: Meshram, Pragati Shuddhodhan, et al.
Pubblicazione: (2024)
di: Meshram, Pragati Shuddhodhan, et al.
Pubblicazione: (2024)
VLLaVO: Mitigating Visual Gap through LLMs
di: Chen, Shuhao, et al.
Pubblicazione: (2024)
di: Chen, Shuhao, et al.
Pubblicazione: (2024)
A U-Net and Transformer Pipeline for Multilingual Image Translation
di: Sahay, Siddharth, et al.
Pubblicazione: (2025)
di: Sahay, Siddharth, et al.
Pubblicazione: (2025)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
di: Yu, Jiazuo, et al.
Pubblicazione: (2024)
di: Yu, Jiazuo, et al.
Pubblicazione: (2024)
Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?
di: Park, Simon, et al.
Pubblicazione: (2025)
di: Park, Simon, et al.
Pubblicazione: (2025)
Jointly Modeling Inter- & Intra-Modality Dependencies for Multi-modal Learning
di: Madaan, Divyam, et al.
Pubblicazione: (2024)
di: Madaan, Divyam, et al.
Pubblicazione: (2024)
Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
di: Huang, Siteng, et al.
Pubblicazione: (2023)
di: Huang, Siteng, et al.
Pubblicazione: (2023)
MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2026)
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2026)
PAPERCLIP: Associating Astronomical Observations and Natural Language with Multi-Modal Models
di: Mishra-Sharma, Siddharth, et al.
Pubblicazione: (2024)
di: Mishra-Sharma, Siddharth, et al.
Pubblicazione: (2024)
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
di: Li, Shengzhi, et al.
Pubblicazione: (2024)
di: Li, Shengzhi, et al.
Pubblicazione: (2024)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
di: Le, Quang-Hung, et al.
Pubblicazione: (2024)
di: Le, Quang-Hung, et al.
Pubblicazione: (2024)
Exploring Attention Mechanisms in Integration of Multi-Modal Information for Sign Language Recognition and Translation
di: Hakim, Zaber Ibn Abdul, et al.
Pubblicazione: (2023)
di: Hakim, Zaber Ibn Abdul, et al.
Pubblicazione: (2023)
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023)
Self-Supervised Visual Preference Alignment
di: Zhu, Ke, et al.
Pubblicazione: (2024)
di: Zhu, Ke, et al.
Pubblicazione: (2024)
Mitigate the Gap: Investigating Approaches for Improving Cross-Modal Alignment in CLIP
di: Eslami, Sedigheh, et al.
Pubblicazione: (2024)
di: Eslami, Sedigheh, et al.
Pubblicazione: (2024)
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LipSim: A Provably Robust Perceptual Similarity Metric
di: Ghazanfari, Sara, et al.
Pubblicazione: (2023) -
Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024) -
SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding
di: Ghazanfari, Sara, et al.
Pubblicazione: (2026) -
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025) -
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)