Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Hao, Hou, Yingyan, Guo, Jiayan, Wang, Bo, Yang, Chunyu, Ni, Jinsong, Zhang, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
di: Li, Shuang, et al.
Pubblicazione: (2024)
di: Li, Shuang, et al.
Pubblicazione: (2024)
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
di: Yu, Shi, et al.
Pubblicazione: (2024)
di: Yu, Shi, et al.
Pubblicazione: (2024)
Retrieved In-Context Principles from Previous Mistakes
di: Sun, Hao, et al.
Pubblicazione: (2024)
di: Sun, Hao, et al.
Pubblicazione: (2024)
Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing
di: Wijegunarathna, Kalana, et al.
Pubblicazione: (2025)
di: Wijegunarathna, Kalana, et al.
Pubblicazione: (2025)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
Attention Grounded Enhancement for Visual Document Retrieval
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs
di: Mo, Wentao, et al.
Pubblicazione: (2026)
di: Mo, Wentao, et al.
Pubblicazione: (2026)
Efficient End-to-End Visual Document Understanding with Rationale Distillation
di: Zhu, Wang, et al.
Pubblicazione: (2023)
di: Zhu, Wang, et al.
Pubblicazione: (2023)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
di: Sun, Yubo, et al.
Pubblicazione: (2025)
di: Sun, Yubo, et al.
Pubblicazione: (2025)
T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
CLEAR: Character Unlearning in Textual and Visual Modalities
di: Dontsov, Alexey, et al.
Pubblicazione: (2024)
di: Dontsov, Alexey, et al.
Pubblicazione: (2024)
VisText-Mosquito: A Unified Multimodal Dataset for Visual Detection, Segmentation, and Textual Explanation on Mosquito Breeding Sites
di: Islam, Md. Adnanul, et al.
Pubblicazione: (2025)
di: Islam, Md. Adnanul, et al.
Pubblicazione: (2025)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2024)
di: Wang, Yabing, et al.
Pubblicazione: (2024)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
di: Luo, Yang, et al.
Pubblicazione: (2024)
di: Luo, Yang, et al.
Pubblicazione: (2024)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
Documents Are People and Words Are Items: A Psychometric Approach to Textual Data with Contextual Embeddings
di: Chen, Jinsong
Pubblicazione: (2025)
di: Chen, Jinsong
Pubblicazione: (2025)
Beyond the Textual: Generating Coherent Visual Options for MCQs
di: Wang, Wanqiang, et al.
Pubblicazione: (2025)
di: Wang, Wanqiang, et al.
Pubblicazione: (2025)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
di: Li, Xuchen, et al.
Pubblicazione: (2024)
di: Li, Xuchen, et al.
Pubblicazione: (2024)
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
RoboSVG: A Unified Framework for Interactive SVG Generation with Multi-modal Guidance
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
di: Wu, Siwei, et al.
Pubblicazione: (2024)
di: Wu, Siwei, et al.
Pubblicazione: (2024)
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
di: Gordon, Brian, et al.
Pubblicazione: (2023)
di: Gordon, Brian, et al.
Pubblicazione: (2023)
Customizing Visual-Language Foundation Models for Multi-modal Anomaly Detection and Reasoning
di: Xu, Xiaohao, et al.
Pubblicazione: (2024)
di: Xu, Xiaohao, et al.
Pubblicazione: (2024)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
GeoGPT4V: Towards Geometric Multi-modal Large Language Models with Geometric Image Generation
di: Cai, Shihao, et al.
Pubblicazione: (2024)
di: Cai, Shihao, et al.
Pubblicazione: (2024)
ZeroSearch: Incentivize the Search Capability of LLMs without Searching
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation
di: Uehara, Kohei, et al.
Pubblicazione: (2024)
di: Uehara, Kohei, et al.
Pubblicazione: (2024)
JEP-KD: Joint-Embedding Predictive Architecture Based Knowledge Distillation for Visual Speech Recognition
di: Sun, Chang, et al.
Pubblicazione: (2024)
di: Sun, Chang, et al.
Pubblicazione: (2024)
Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models
di: Liu, Bingshuai, et al.
Pubblicazione: (2023)
di: Liu, Bingshuai, et al.
Pubblicazione: (2023)
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
di: Zang, Yuan, et al.
Pubblicazione: (2025)
di: Zang, Yuan, et al.
Pubblicazione: (2025)
NAU-QMUL: Utilizing BERT and CLIP for Multi-modal AI-Generated Image Detection
di: Guo, Xiaoyu, et al.
Pubblicazione: (2026)
di: Guo, Xiaoyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
di: Guo, Ziyu, et al.
Pubblicazione: (2025) -
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
di: Li, Shuang, et al.
Pubblicazione: (2024) -
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
di: Yu, Shi, et al.
Pubblicazione: (2024) -
Retrieved In-Context Principles from Previous Mistakes
di: Sun, Hao, et al.
Pubblicazione: (2024) -
Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing
di: Wijegunarathna, Kalana, et al.
Pubblicazione: (2025)