Leveraging Large Language Models for Multimodal Search
Fuente:
arXiv
Saved in:
| Main Authors: | Barbany, Oriol, Huang, Michael, Zhu, Xinliang, Dhua, Arnab |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Bringing Multimodality to Amazon Visual Search System
by: Zhu, Xinliang, et al.
Published: (2024)
by: Zhu, Xinliang, et al.
Published: (2024)
BiFold: Bimanual Cloth Folding with Language Guidance
by: Barbany, Oriol, et al.
Published: (2025)
by: Barbany, Oriol, et al.
Published: (2025)
Beyond Static Perception: Integrating Temporal Context into VLMs for Cloth Folding
by: Barbany, Oriol, et al.
Published: (2025)
by: Barbany, Oriol, et al.
Published: (2025)
Rethinking Visual Information Processing in Multimodal LLMs
by: Kim, Dongwan, et al.
Published: (2025)
by: Kim, Dongwan, et al.
Published: (2025)
SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models
by: Rabasseda, Oriol, et al.
Published: (2026)
by: Rabasseda, Oriol, et al.
Published: (2026)
Benchmarking the Sim-to-Real Gap in Cloth Manipulation
by: Blanco-Mulero, David, et al.
Published: (2023)
by: Blanco-Mulero, David, et al.
Published: (2023)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
by: Zhao, Shiyu, et al.
Published: (2024)
by: Zhao, Shiyu, et al.
Published: (2024)
Chat-CBM: Towards Interactive Concept Bottleneck Models with Frozen Large Language Models
by: He, Hangzhou, et al.
Published: (2025)
by: He, Hangzhou, et al.
Published: (2025)
ColorGPT: Leveraging Large Language Models for Multimodal Color Recommendation
by: Xia, Ding, et al.
Published: (2025)
by: Xia, Ding, et al.
Published: (2025)
Explainable Search and Discovery of Visual Cultural Heritage Collections with Multimodal Large Language Models
by: Arnold, Taylor, et al.
Published: (2024)
by: Arnold, Taylor, et al.
Published: (2024)
Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning
by: Xu, Hai-Ming, et al.
Published: (2024)
by: Xu, Hai-Ming, et al.
Published: (2024)
Safety of Multimodal Large Language Models on Images and Texts
by: Liu, Xin, et al.
Published: (2024)
by: Liu, Xin, et al.
Published: (2024)
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
by: Imajuku, Yuki, et al.
Published: (2024)
by: Imajuku, Yuki, et al.
Published: (2024)
Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
by: Ma, Xueqi, et al.
Published: (2025)
by: Ma, Xueqi, et al.
Published: (2025)
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
by: Yu, Linhao, et al.
Published: (2025)
by: Yu, Linhao, et al.
Published: (2025)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
by: Huang, Xiaoshuang, et al.
Published: (2024)
by: Huang, Xiaoshuang, et al.
Published: (2024)
Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts
by: Lee, Eunho, et al.
Published: (2026)
by: Lee, Eunho, et al.
Published: (2026)
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
by: Wang, Hanqing, et al.
Published: (2025)
by: Wang, Hanqing, et al.
Published: (2025)
Sparsity Meets Similarity: Leveraging Long-Tail Distribution for Dynamic Optimized Token Representation in Multimodal Large Language Models
by: Yu, Gaotong, et al.
Published: (2024)
by: Yu, Gaotong, et al.
Published: (2024)
GSVA: Generalized Segmentation via Multimodal Large Language Models
by: Xia, Zhuofan, et al.
Published: (2023)
by: Xia, Zhuofan, et al.
Published: (2023)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
by: Wang, Yunnan, et al.
Published: (2025)
by: Wang, Yunnan, et al.
Published: (2025)
Leveraging Chat-Based Large Vision Language Models for Multimodal Out-Of-Context Detection
by: Shalabi, Fatma, et al.
Published: (2024)
by: Shalabi, Fatma, et al.
Published: (2024)
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
by: Tian, Shi-Yu, et al.
Published: (2026)
by: Tian, Shi-Yu, et al.
Published: (2026)
A Medical Multimodal Large Language Model for Pediatric Pneumonia
by: Tian, Weiwei, et al.
Published: (2024)
by: Tian, Weiwei, et al.
Published: (2024)
VIP: Versatile Image Outpainting Empowered by Multimodal Large Language Model
by: Yang, Jinze, et al.
Published: (2024)
by: Yang, Jinze, et al.
Published: (2024)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
by: Zhu, Xingyu, et al.
Published: (2026)
by: Zhu, Xingyu, et al.
Published: (2026)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
by: Jiang, Chaoya, et al.
Published: (2023)
by: Jiang, Chaoya, et al.
Published: (2023)
Dynamic Pyramid Network for Efficient Multimodal Large Language Model
by: Ai, Hao, et al.
Published: (2025)
by: Ai, Hao, et al.
Published: (2025)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
by: Liu, Haogeng, et al.
Published: (2024)
by: Liu, Haogeng, et al.
Published: (2024)
Semantic Alignment for Multimodal Large Language Models
by: Wu, Tao, et al.
Published: (2024)
by: Wu, Tao, et al.
Published: (2024)
Multimodal Large Language Models as Image Classifiers
by: Kisel, Nikita, et al.
Published: (2026)
by: Kisel, Nikita, et al.
Published: (2026)
Advanced Feature Manipulation for Enhanced Change Detection Leveraging Natural Language Models
by: Li, Zhenglin, et al.
Published: (2024)
by: Li, Zhenglin, et al.
Published: (2024)
DesignProbe: A Graphic Design Benchmark for Multimodal Large Language Models
by: Lin, Jieru, et al.
Published: (2024)
by: Lin, Jieru, et al.
Published: (2024)
ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection
by: Huang, Tai-Ming, et al.
Published: (2025)
by: Huang, Tai-Ming, et al.
Published: (2025)
Leveraging Prior Knowledge of Diffusion Model for Person Search
by: Kim, Giyeol, et al.
Published: (2025)
by: Kim, Giyeol, et al.
Published: (2025)
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
by: Huang, Mouxiao, et al.
Published: (2025)
by: Huang, Mouxiao, et al.
Published: (2025)
GENIUS: A Generative Framework for Universal Multimodal Search
by: Kim, Sungyeon, et al.
Published: (2025)
by: Kim, Sungyeon, et al.
Published: (2025)
CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models
by: Zhou, Nan, et al.
Published: (2026)
by: Zhou, Nan, et al.
Published: (2026)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
by: Zhu, Wenxin, et al.
Published: (2025)
by: Zhu, Wenxin, et al.
Published: (2025)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
by: Liu, Haowei, et al.
Published: (2024)
by: Liu, Haowei, et al.
Published: (2024)
Similar Items
-
Bringing Multimodality to Amazon Visual Search System
by: Zhu, Xinliang, et al.
Published: (2024) -
BiFold: Bimanual Cloth Folding with Language Guidance
by: Barbany, Oriol, et al.
Published: (2025) -
Beyond Static Perception: Integrating Temporal Context into VLMs for Cloth Folding
by: Barbany, Oriol, et al.
Published: (2025) -
Rethinking Visual Information Processing in Multimodal LLMs
by: Kim, Dongwan, et al.
Published: (2025) -
SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models
by: Rabasseda, Oriol, et al.
Published: (2026)