GENIUS: A Generative Framework for Universal Multimodal Search
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Sungyeon, Zhu, Xinliang, Lin, Xiaofan, Bastan, Muhammet, Gray, Douglas, Kwak, Suha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning Unified Distance Metric Across Diverse Data Distributions with Parameter-Efficient Transfer Learning
por: Kim, Sungyeon, et al.
Publicado: (2023)
por: Kim, Sungyeon, et al.
Publicado: (2023)
Smart Routing for Multimodal Video Retrieval: When to Search What
por: Rosa, Kevin Dela
Publicado: (2025)
por: Rosa, Kevin Dela
Publicado: (2025)
HV-Attack: Hierarchical Visual Attack for Multimodal Retrieval Augmented Generation
por: Luo, Linyin, et al.
Publicado: (2025)
por: Luo, Linyin, et al.
Publicado: (2025)
Dreaming User Multimodal Representation Guided by The Platonic Representation Hypothesis for Micro-Video Recommendation
por: Lin, Chengzhi, et al.
Publicado: (2024)
por: Lin, Chengzhi, et al.
Publicado: (2024)
Pailitao-VL: Unified Embedding and Reranker for Real-Time Multi-Modal Industrial Search
por: Chen, Lei, et al.
Publicado: (2026)
por: Chen, Lei, et al.
Publicado: (2026)
MOON Embedding: Multimodal Representation Learning for E-commerce Search Advertising
por: Fu, Chenghan, et al.
Publicado: (2025)
por: Fu, Chenghan, et al.
Publicado: (2025)
Scale Up Composed Image Retrieval Learning via Modification Text Generation
por: Zhou, Yinan, et al.
Publicado: (2025)
por: Zhou, Yinan, et al.
Publicado: (2025)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
por: Zhang, Zhixin, et al.
Publicado: (2024)
por: Zhang, Zhixin, et al.
Publicado: (2024)
MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrieval
por: Ju, Yeong-Joon, et al.
Publicado: (2024)
por: Ju, Yeong-Joon, et al.
Publicado: (2024)
Beyond Unimodal Boundaries: Generative Recommendation with Multimodal Semantics
por: Zhu, Jing, et al.
Publicado: (2025)
por: Zhu, Jing, et al.
Publicado: (2025)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
por: Lin, Sheng-Chieh, et al.
Publicado: (2024)
por: Lin, Sheng-Chieh, et al.
Publicado: (2024)
Attribute-Aware Implicit Modality Alignment for Text Attribute Person Search
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search
por: Yin, Xinlei, et al.
Publicado: (2026)
por: Yin, Xinlei, et al.
Publicado: (2026)
Provenance Analysis of Archaeological Artifacts via Multimodal RAG Systems
por: Zhang, Tuo, et al.
Publicado: (2025)
por: Zhang, Tuo, et al.
Publicado: (2025)
Good Scores, Bad Data: A Metric for Multimodal Coherence
por: Srinivasan, Vasundra
Publicado: (2026)
por: Srinivasan, Vasundra
Publicado: (2026)
OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
por: Yang, Wei, et al.
Publicado: (2025)
por: Yang, Wei, et al.
Publicado: (2025)
MegaRAG: Multimodal Knowledge Graph-Based Retrieval Augmented Generation
por: Hsiao, Chi-Hsiang, et al.
Publicado: (2025)
por: Hsiao, Chi-Hsiang, et al.
Publicado: (2025)
DetailFusion: A Dual-branch Framework with Detail Enhancement for Composed Image Retrieval
por: Yang, Yuxin, et al.
Publicado: (2025)
por: Yang, Yuxin, et al.
Publicado: (2025)
Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships
por: Waseda, Futa, et al.
Publicado: (2024)
por: Waseda, Futa, et al.
Publicado: (2024)
Sell It Before You Make It: Revolutionizing E-Commerce with Personalized AI-Generated Items
por: Lin, Jianghao, et al.
Publicado: (2025)
por: Lin, Jianghao, et al.
Publicado: (2025)
ContextIQ: A Multimodal Expert-Based Video Retrieval System for Contextual Advertising
por: Chaubey, Ashutosh, et al.
Publicado: (2024)
por: Chaubey, Ashutosh, et al.
Publicado: (2024)
TalentMine: LLM-Based Extraction and Question-Answering from Multimodal Talent Tables
por: Mannam, Varun, et al.
Publicado: (2025)
por: Mannam, Varun, et al.
Publicado: (2025)
Read and Think: An Efficient Step-wise Multimodal Language Model for Document Understanding and Reasoning
por: Zhang, Jinxu
Publicado: (2024)
por: Zhang, Jinxu
Publicado: (2024)
RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?
por: Ghosh, Arijit, et al.
Publicado: (2026)
por: Ghosh, Arijit, et al.
Publicado: (2026)
LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval
por: Kim, Seonok
Publicado: (2026)
por: Kim, Seonok
Publicado: (2026)
M3DR: Towards Universal Multilingual Multimodal Document Retrieval
por: Kolavi, Adithya S, et al.
Publicado: (2025)
por: Kolavi, Adithya S, et al.
Publicado: (2025)
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
por: Giahi, Ramin, et al.
Publicado: (2025)
por: Giahi, Ramin, et al.
Publicado: (2025)
Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion
por: Thanh, Toan Le Ngo, et al.
Publicado: (2025)
por: Thanh, Toan Le Ngo, et al.
Publicado: (2025)
HotelMatch-LLM: Joint Multi-Task Training of Small and Large Language Models for Efficient Multimodal Hotel Retrieval
por: Askari, Arian, et al.
Publicado: (2025)
por: Askari, Arian, et al.
Publicado: (2025)
Open Multimodal Retrieval-Augmented Factual Image Generation
por: Tian, Yang, et al.
Publicado: (2025)
por: Tian, Yang, et al.
Publicado: (2025)
ImageGem: In-the-wild Generative Image Interaction Dataset for Generative Model Personalization
por: Guo, Yuanhe, et al.
Publicado: (2025)
por: Guo, Yuanhe, et al.
Publicado: (2025)
Towards Human-Like Machine Comprehension: Few-Shot Relational Learning in Visually-Rich Documents
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
A Survey of Multimodal Composite Editing and Retrieval
por: Li, Suyan, et al.
Publicado: (2024)
por: Li, Suyan, et al.
Publicado: (2024)
Progressive Multimodal Reasoning via Active Retrieval
por: Dong, Guanting, et al.
Publicado: (2024)
por: Dong, Guanting, et al.
Publicado: (2024)
Retrieval-Guided Generation for Safer Histopathology Image Captioning
por: Hoq, Md. Enamul, et al.
Publicado: (2026)
por: Hoq, Md. Enamul, et al.
Publicado: (2026)
From Videos to Indexed Knowledge Graphs -- Framework to Marry Methods for Multimodal Content Analysis and Understanding
por: Rizk, Basem, et al.
Publicado: (2025)
por: Rizk, Basem, et al.
Publicado: (2025)
The CASTLE 2024 Dataset: Advancing the Art of Multimodal Understanding
por: Rossetto, Luca, et al.
Publicado: (2025)
por: Rossetto, Luca, et al.
Publicado: (2025)
Very Efficient Listwise Multimodal Reranking for Long Documents
por: Sun, Yiqun, et al.
Publicado: (2026)
por: Sun, Yiqun, et al.
Publicado: (2026)
A Multi-Stage Hybrid Framework for Automated Interpretation of Multi-View Engineering Drawings Using Vision Language Model
por: Khan, Muhammad Tayyab, et al.
Publicado: (2025)
por: Khan, Muhammad Tayyab, et al.
Publicado: (2025)
From Drawings to Decisions: A Hybrid Vision-Language Framework for Parsing 2D Engineering Drawings into Structured Manufacturing Knowledge
por: Khan, Muhammad Tayyab, et al.
Publicado: (2025)
por: Khan, Muhammad Tayyab, et al.
Publicado: (2025)
Ejemplares similares
-
Learning Unified Distance Metric Across Diverse Data Distributions with Parameter-Efficient Transfer Learning
por: Kim, Sungyeon, et al.
Publicado: (2023) -
Smart Routing for Multimodal Video Retrieval: When to Search What
por: Rosa, Kevin Dela
Publicado: (2025) -
HV-Attack: Hierarchical Visual Attack for Multimodal Retrieval Augmented Generation
por: Luo, Linyin, et al.
Publicado: (2025) -
Dreaming User Multimodal Representation Guided by The Platonic Representation Hypothesis for Micro-Video Recommendation
por: Lin, Chengzhi, et al.
Publicado: (2024) -
Pailitao-VL: Unified Embedding and Reranker for Real-Time Multi-Modal Industrial Search
por: Chen, Lei, et al.
Publicado: (2026)