Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Abootorabi, Mohammad Mahdi, Zobeiri, Amirhosein, Dehghani, Mahdi, Mohammadkhani, Mohammadali, Mohammadi, Bardia, Ghahroodi, Omid, Baghshah, Mahdieh Soleymani, Asgari, Ehsaneddin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2024)
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2024)
The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation
par: Marioriyad, Arash, et autres
Publié: (2026)
par: Marioriyad, Arash, et autres
Publié: (2026)
Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?
par: Ghahroodi, Omid, et autres
Publié: (2024)
par: Ghahroodi, Omid, et autres
Publié: (2024)
The Illusion of Procedural Reasoning: Measuring Long-Horizon FSM Execution in LLMs
par: Samiei, Mahdi, et autres
Publié: (2025)
par: Samiei, Mahdi, et autres
Publié: (2025)
Generative AI for Character Animation: A Comprehensive Survey of Techniques, Applications, and Future Directions
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
MEENA (PersianMMMU): Multimodal-Multilingual Educational Exams for N-level Assessment
par: Ghahroodi, Omid, et autres
Publié: (2025)
par: Ghahroodi, Omid, et autres
Publié: (2025)
MultiMind at SemEval-2025 Task 7: Crosslingual Fact-Checked Claim Retrieval via Multi-Source Alignment
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
AIMA at SemEval-2024 Task 3: Simple Yet Powerful Emotion Cause Pair Analysis
par: Kure, Alireza Ghahramani, et autres
Publié: (2025)
par: Kure, Alireza Ghahramani, et autres
Publié: (2025)
AIMA at SemEval-2024 Task 10: History-Based Emotion Recognition in Hindi-English Code-Mixed Conversations
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
VQEL: Enabling Self-Play in Emergent Language Games via Agent-Internal Vector Quantization
par: Paqaleh, Mohammad Mahdi Samiei, et autres
Publié: (2025)
par: Paqaleh, Mohammad Mahdi Samiei, et autres
Publié: (2025)
Limits and Gains of Test-Time Scaling in Vision-Language Reasoning
par: Ahmadpour, Mohammadjavad, et autres
Publié: (2025)
par: Ahmadpour, Mohammadjavad, et autres
Publié: (2025)
Structure Matters: Evaluating Multi-Agents Orchestration in Generative Therapeutic Chatbots
par: Elahimanesh, Sina, et autres
Publié: (2026)
par: Elahimanesh, Sina, et autres
Publié: (2026)
ADAM: A Diverse Archive of Mankind for Evaluating and Enhancing LLMs in Biographical Reasoning
par: Cekinmez, Jasin, et autres
Publié: (2025)
par: Cekinmez, Jasin, et autres
Publié: (2025)
Learning to Ask: Decision Transformers for Adaptive Quantitative Group Testing
par: Soleymani, Mahdi, et autres
Publié: (2025)
par: Soleymani, Mahdi, et autres
Publié: (2025)
Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!
par: Marioriyad, Arash, et autres
Publié: (2024)
par: Marioriyad, Arash, et autres
Publié: (2024)
ELAB: Extensive LLM Alignment Benchmark in Persian Language
par: Pourbahman, Zahra, et autres
Publié: (2025)
par: Pourbahman, Zahra, et autres
Publié: (2025)
Bridging Reasoning to Learning: Unmasking Illusions using Complexity Out of Distribution Generalization
par: Paqaleh, Mohammad Mahdi Samiei, et autres
Publié: (2025)
par: Paqaleh, Mohammad Mahdi Samiei, et autres
Publié: (2025)
SUSD: Structured Unsupervised Skill Discovery through State Factorization
par: Hosseini, Seyed Mohammad Hadi, et autres
Publié: (2026)
par: Hosseini, Seyed Mohammad Hadi, et autres
Publié: (2026)
Inductive Biases for Zero-shot Systematic Generalization in Language-informed Reinforcement Learning
par: Dijujin, Negin Hashemi, et autres
Publié: (2025)
par: Dijujin, Negin Hashemi, et autres
Publié: (2025)
Dilated Balanced Cross Entropy Loss for Medical Image Segmentation
par: Hosseini, Seyed Mohsen, et autres
Publié: (2024)
par: Hosseini, Seyed Mohsen, et autres
Publié: (2024)
The Silent Judge: Unacknowledged Shortcut Bias in LLM-as-a-Judge
par: Marioriyad, Arash, et autres
Publié: (2025)
par: Marioriyad, Arash, et autres
Publié: (2025)
LibraGrad: Balancing Gradient Flow for Universally Better Vision Transformer Attributions
par: Mehri, Faridoun, et autres
Publié: (2024)
par: Mehri, Faridoun, et autres
Publié: (2024)
Deciphering the Role of Representation Disentanglement: Investigating Compositional Generalization in CLIP Models
par: Abbasi, Reza, et autres
Publié: (2024)
par: Abbasi, Reza, et autres
Publié: (2024)
Analyzing CLIP's Performance Limitations in Multi-Object Scenarios: A Controlled High-Resolution Study
par: Abbasi, Reza, et autres
Publié: (2025)
par: Abbasi, Reza, et autres
Publié: (2025)
CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation
par: Abbasi, Reza, et autres
Publié: (2025)
par: Abbasi, Reza, et autres
Publié: (2025)
TuringQ: Benchmarking AI Comprehension in Theory of Computation
par: Zahraei, Pardis Sadat, et autres
Publié: (2024)
par: Zahraei, Pardis Sadat, et autres
Publié: (2024)
CER: Confidence Enhanced Reasoning in LLMs
par: Razghandi, Ali, et autres
Publié: (2025)
par: Razghandi, Ali, et autres
Publié: (2025)
Efficient Adversarial Attacks on High-dimensional Offline Bandits
par: Hosseini, Seyed Mohammad Hadi, et autres
Publié: (2026)
par: Hosseini, Seyed Mohammad Hadi, et autres
Publié: (2026)
Language Plays a Pivotal Role in the Object-Attribute Compositional Generalization of CLIP
par: Abbasi, Reza, et autres
Publié: (2024)
par: Abbasi, Reza, et autres
Publié: (2024)
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
par: Izadi, Amirmohammad, et autres
Publié: (2025)
par: Izadi, Amirmohammad, et autres
Publié: (2025)
Hidden in the Metadata: Stealth Poisoning Attacks on Multimodal Retrieval-Augmented Generation
par: Edemacu, Kennedy, et autres
Publié: (2026)
par: Edemacu, Kennedy, et autres
Publié: (2026)
Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models
par: Rezaei, Parham, et autres
Publié: (2025)
par: Rezaei, Parham, et autres
Publié: (2025)
Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models
par: Marioriyad, Arash, et autres
Publié: (2024)
par: Marioriyad, Arash, et autres
Publié: (2024)
Lying to Win: Assessing LLM Deception through Human-AI Games and Parallel-World Probing
par: Marioriyad, Arash, et autres
Publié: (2026)
par: Marioriyad, Arash, et autres
Publié: (2026)
PreND: Enhancing Intrinsic Motivation in Reinforcement Learning through Pre-trained Network Distillation
par: Davoodabadi, Mohammadamin, et autres
Publié: (2024)
par: Davoodabadi, Mohammadamin, et autres
Publié: (2024)
Classification of Breast Cancer Histopathology Images using a Modified Supervised Contrastive Learning Method
par: Sani, Matina Mahdizadeh, et autres
Publié: (2024)
par: Sani, Matina Mahdizadeh, et autres
Publié: (2024)
Persian Musical Instruments Classification Using Polyphonic Data Augmentation
par: Esfangereh, Diba Hadi, et autres
Publié: (2025)
par: Esfangereh, Diba Hadi, et autres
Publié: (2025)
Causal Attribution via Activation Patching
par: Izadi, Amirmohammad, et autres
Publié: (2026)
par: Izadi, Amirmohammad, et autres
Publié: (2026)
M$^3$Face: A Unified Multi-Modal Multilingual Framework for Human Face Generation and Editing
par: Mofayezi, Mohammadreza, et autres
Publié: (2024)
par: Mofayezi, Mohammadreza, et autres
Publié: (2024)
EICAP: Deep Dive in Assessment and Enhancement of Large Language Models in Emotional Intelligence through Multi-Turn Conversations
par: Nazar, Nizi, et autres
Publié: (2025)
par: Nazar, Nizi, et autres
Publié: (2025)
Documents similaires
-
CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2024) -
The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation
par: Marioriyad, Arash, et autres
Publié: (2026) -
Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?
par: Ghahroodi, Omid, et autres
Publié: (2024) -
The Illusion of Procedural Reasoning: Measuring Long-Horizon FSM Execution in LLMs
par: Samiei, Mahdi, et autres
Publié: (2025) -
Generative AI for Character Animation: A Comprehensive Survey of Techniques, Applications, and Future Directions
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)