MMFactory: A Universal Solution Search Engine for Vision-Language Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fan, Wan-Cyuan, Rahman, Tanzila, Sigal, Leonid |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
par: Luo, Jiayun, et autres
Publié: (2025)
par: Luo, Jiayun, et autres
Publié: (2025)
On Pre-training of Multimodal Language Models Customized for Chart Understanding
par: Fan, Wan-Cyuan, et autres
Publié: (2024)
par: Fan, Wan-Cyuan, et autres
Publié: (2024)
All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding
par: Rahman, Tanzila, et autres
Publié: (2026)
par: Rahman, Tanzila, et autres
Publié: (2026)
In-Depth and In-Breadth: Pre-training Multimodal Language Models Customized for Comprehensive Chart Understanding
par: Fan, Wan-Cyuan, et autres
Publié: (2025)
par: Fan, Wan-Cyuan, et autres
Publié: (2025)
ChartGaze: Enhancing Chart Understanding in LVLMs with Eye-Tracking Guided Attention Refinement
par: Salamatian, Ali, et autres
Publié: (2025)
par: Salamatian, Ali, et autres
Publié: (2025)
Response Wide Shut: Surprising Observations in Basic Vision Language Model Capabilities
par: Chandhok, Shivam, et autres
Publié: (2024)
par: Chandhok, Shivam, et autres
Publié: (2024)
Exposing and Addressing Cross-Task Inconsistency in Unified Vision-Language Models
par: Maharana, Adyasha, et autres
Publié: (2023)
par: Maharana, Adyasha, et autres
Publié: (2023)
Exploring Curriculum Learning for Vision-Language Tasks: A Study on Small-Scale Multimodal Training
par: Saha, Rohan, et autres
Publié: (2024)
par: Saha, Rohan, et autres
Publié: (2024)
Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training
par: Wan, David, et autres
Publié: (2024)
par: Wan, David, et autres
Publié: (2024)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
par: Zeng, Yu, et autres
Publié: (2026)
par: Zeng, Yu, et autres
Publié: (2026)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
par: Zhang, Zhixin, et autres
Publié: (2024)
par: Zhang, Zhixin, et autres
Publié: (2024)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
par: Sinha, Neelabh, et autres
Publié: (2024)
par: Sinha, Neelabh, et autres
Publié: (2024)
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
par: Lian, Shijie, et autres
Publié: (2025)
par: Lian, Shijie, et autres
Publié: (2025)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
par: Huang, Brandon, et autres
Publié: (2024)
par: Huang, Brandon, et autres
Publié: (2024)
Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images
par: Wu, Shengguang, et autres
Publié: (2025)
par: Wu, Shengguang, et autres
Publié: (2025)
Mamba in Vision: A Comprehensive Survey of Techniques and Applications
par: Rahman, Md Maklachur, et autres
Publié: (2024)
par: Rahman, Md Maklachur, et autres
Publié: (2024)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
par: Nguyen, Phu-Vinh, et autres
Publié: (2025)
par: Nguyen, Phu-Vinh, et autres
Publié: (2025)
VisionZip: Longer is Better but Not Necessary in Vision Language Models
par: Yang, Senqiao, et autres
Publié: (2024)
par: Yang, Senqiao, et autres
Publié: (2024)
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
par: Panos, Aristeidis, et autres
Publié: (2024)
par: Panos, Aristeidis, et autres
Publié: (2024)
MHA2MLA-VLM: Enabling DeepSeek's Economical Multi-Head Latent Attention across Vision-Language Models
par: Fan, Xiaoran, et autres
Publié: (2026)
par: Fan, Xiaoran, et autres
Publié: (2026)
MouSi: Poly-Visual-Expert Vision-Language Models
par: Fan, Xiaoran, et autres
Publié: (2024)
par: Fan, Xiaoran, et autres
Publié: (2024)
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models
par: Zhou, Andy, et autres
Publié: (2023)
par: Zhou, Andy, et autres
Publié: (2023)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
par: Yang, Senqiao, et autres
Publié: (2025)
par: Yang, Senqiao, et autres
Publié: (2025)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
par: Lin, Zichuan, et autres
Publié: (2025)
par: Lin, Zichuan, et autres
Publié: (2025)
Vision-Language Model Based Handwriting Verification
par: Chauhan, Mihir, et autres
Publié: (2024)
par: Chauhan, Mihir, et autres
Publié: (2024)
Differentiable Prompt Learning for Vision Language Models
par: Huang, Zhenhan, et autres
Publié: (2024)
par: Huang, Zhenhan, et autres
Publié: (2024)
How Culturally Aware are Vision-Language Models?
par: Burda-Lassen, Olena, et autres
Publié: (2024)
par: Burda-Lassen, Olena, et autres
Publié: (2024)
Renaissance: Investigating the Pretraining of Vision-Language Encoders
par: Fields, Clayton, et autres
Publié: (2024)
par: Fields, Clayton, et autres
Publié: (2024)
GutenOCR: A Grounded Vision-Language Front-End for Documents
par: Heidenreich, Hunter, et autres
Publié: (2026)
par: Heidenreich, Hunter, et autres
Publié: (2026)
Small Vision-Language Models: A Survey on Compact Architectures and Techniques
par: Patnaik, Nitesh, et autres
Publié: (2025)
par: Patnaik, Nitesh, et autres
Publié: (2025)
Voila-A: Aligning Vision-Language Models with User's Gaze Attention
par: Yan, Kun, et autres
Publié: (2023)
par: Yan, Kun, et autres
Publié: (2023)
Tinted Frames: Question Framing Blinds Vision-Language Models
par: Fan, Wan-Cyuan, et autres
Publié: (2026)
par: Fan, Wan-Cyuan, et autres
Publié: (2026)
Prismer: A Vision-Language Model with Multi-Task Experts
par: Liu, Shikun, et autres
Publié: (2023)
par: Liu, Shikun, et autres
Publié: (2023)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
par: Lavoie, Samuel, et autres
Publié: (2024)
par: Lavoie, Samuel, et autres
Publié: (2024)
Do Vision and Language Encoders Represent the World Similarly?
par: Maniparambil, Mayug, et autres
Publié: (2024)
par: Maniparambil, Mayug, et autres
Publié: (2024)
Efficient Architectures for High Resolution Vision-Language Models
par: Carvalho, Miguel, et autres
Publié: (2025)
par: Carvalho, Miguel, et autres
Publié: (2025)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
par: Bae, Jiyun, et autres
Publié: (2025)
par: Bae, Jiyun, et autres
Publié: (2025)
Coordinated Robustness Evaluation Framework for Vision-Language Models
par: Babu, Ashwin Ramesh, et autres
Publié: (2025)
par: Babu, Ashwin Ramesh, et autres
Publié: (2025)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
Benchmarking the Thinking Mode of Multimodal Large Language Models in Clinical Tasks
par: Hong, Jindong, et autres
Publié: (2025)
par: Hong, Jindong, et autres
Publié: (2025)
Documents similaires
-
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
par: Luo, Jiayun, et autres
Publié: (2025) -
On Pre-training of Multimodal Language Models Customized for Chart Understanding
par: Fan, Wan-Cyuan, et autres
Publié: (2024) -
All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding
par: Rahman, Tanzila, et autres
Publié: (2026) -
In-Depth and In-Breadth: Pre-training Multimodal Language Models Customized for Comprehensive Chart Understanding
par: Fan, Wan-Cyuan, et autres
Publié: (2025) -
ChartGaze: Enhancing Chart Understanding in LVLMs with Eye-Tracking Guided Attention Refinement
par: Salamatian, Ali, et autres
Publié: (2025)