VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yikun, Liu, Yuan, Di, Shangzhe, Wang, Haicheng, Zhao, Zhongyin, Tian, Le, Zhou, Xiao, Zhou, Jie, Yao, Jiangchao, Wang, Yanfeng, Xie, Weidi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Sanity Check on Composed Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2026)
di: Liu, Yikun, et al.
Pubblicazione: (2026)
POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch
di: Liu, Yikun, et al.
Pubblicazione: (2026)
di: Liu, Yikun, et al.
Pubblicazione: (2026)
Zero-shot Composed Text-Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2023)
di: Liu, Yikun, et al.
Pubblicazione: (2023)
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
di: Wang, Haicheng, et al.
Pubblicazione: (2026)
di: Wang, Haicheng, et al.
Pubblicazione: (2026)
Revisiting Multi-Task Visual Representation Learning
di: Di, Shangzhe, et al.
Pubblicazione: (2026)
di: Di, Shangzhe, et al.
Pubblicazione: (2026)
Grounded Question-Answering in Long Egocentric Videos
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
di: Liu, Yikun, et al.
Pubblicazione: (2024)
di: Liu, Yikun, et al.
Pubblicazione: (2024)
POINTS-GUI-G: GUI-Grounding Journey
di: Zhao, Zhongyin, et al.
Pubblicazione: (2026)
di: Zhao, Zhongyin, et al.
Pubblicazione: (2026)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
di: Chen, Qirui, et al.
Pubblicazione: (2024)
di: Chen, Qirui, et al.
Pubblicazione: (2024)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
di: Li, Zeqian, et al.
Pubblicazione: (2025)
di: Li, Zeqian, et al.
Pubblicazione: (2025)
POINTS: Improving Your Vision-language Model with Affordable Strategies
di: Liu, Yuan, et al.
Pubblicazione: (2024)
di: Liu, Yuan, et al.
Pubblicazione: (2024)
POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document Conversion
di: Liu, Yuan, et al.
Pubblicazione: (2025)
di: Liu, Yuan, et al.
Pubblicazione: (2025)
LoRKD: Low-Rank Knowledge Decomposition for Medical Foundation Models
di: Li, Haolin, et al.
Pubblicazione: (2024)
di: Li, Haolin, et al.
Pubblicazione: (2024)
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
di: Shi, Yudi, et al.
Pubblicazione: (2024)
di: Shi, Yudi, et al.
Pubblicazione: (2024)
Learning Streaming Video Representation via Multitask Training
di: Yan, Yibin, et al.
Pubblicazione: (2025)
di: Yan, Yibin, et al.
Pubblicazione: (2025)
OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams
di: Yan, Yibin, et al.
Pubblicazione: (2026)
di: Yan, Yibin, et al.
Pubblicazione: (2026)
Towards Building Multilingual Language Model for Medicine
di: Qiu, Pengcheng, et al.
Pubblicazione: (2024)
di: Qiu, Pengcheng, et al.
Pubblicazione: (2024)
ViR: Towards Efficient Vision Retention Backbones
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
di: Shi, Yudi, et al.
Pubblicazione: (2026)
di: Shi, Yudi, et al.
Pubblicazione: (2026)
Wide-In, Narrow-Out: Revokable Decoding for Efficient and Effective DLLMs
di: Hong, Feng, et al.
Pubblicazione: (2025)
di: Hong, Feng, et al.
Pubblicazione: (2025)
MatchTime: Towards Automatic Soccer Game Commentary Generation
di: Rao, Jiayuan, et al.
Pubblicazione: (2024)
di: Rao, Jiayuan, et al.
Pubblicazione: (2024)
Reprogramming Distillation for Medical Foundation Models
di: Zhou, Yuhang, et al.
Pubblicazione: (2024)
di: Zhou, Yuhang, et al.
Pubblicazione: (2024)
Low-Rank Knowledge Decomposition for Medical Foundation Models
di: Zhou, Yuhang, et al.
Pubblicazione: (2024)
di: Zhou, Yuhang, et al.
Pubblicazione: (2024)
Rethinking Overlooked Aspects in Vision-Language Models
di: Liu, Yuan, et al.
Pubblicazione: (2024)
di: Liu, Yuan, et al.
Pubblicazione: (2024)
PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining
di: Liang, Cheng, et al.
Pubblicazione: (2026)
di: Liang, Cheng, et al.
Pubblicazione: (2026)
Knowledge-enhanced Visual-Language Pretraining for Computational Pathology
di: Zhou, Xiao, et al.
Pubblicazione: (2024)
di: Zhou, Xiao, et al.
Pubblicazione: (2024)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
di: Sun, Luoyi, et al.
Pubblicazione: (2026)
di: Sun, Luoyi, et al.
Pubblicazione: (2026)
DS-ViT: Dual-Stream Vision Transformer for Cross-Task Distillation in Alzheimer's Early Diagnosis
di: Chen, Ke, et al.
Pubblicazione: (2024)
di: Chen, Ke, et al.
Pubblicazione: (2024)
Decouple before Align: Visual Disentanglement Enhances Prompt Tuning
di: Zhang, Fei, et al.
Pubblicazione: (2025)
di: Zhang, Fei, et al.
Pubblicazione: (2025)
Causality $\neq$ Decodability, and Vice Versa: Lessons from Interpreting Counting ViTs
di: Huang, Lianghuan, et al.
Pubblicazione: (2025)
di: Huang, Lianghuan, et al.
Pubblicazione: (2025)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models
di: Zhang, Tianjiao, et al.
Pubblicazione: (2025)
di: Zhang, Tianjiao, et al.
Pubblicazione: (2025)
Domain-Inspired Sharpness-Aware Minimization Under Domain Shifts
di: Zhang, Ruipeng, et al.
Pubblicazione: (2024)
di: Zhang, Ruipeng, et al.
Pubblicazione: (2024)
Exploring Training on Heterogeneous Data with Mixture of Low-rank Adapters
di: Zhou, Yuhang, et al.
Pubblicazione: (2024)
di: Zhou, Yuhang, et al.
Pubblicazione: (2024)
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
di: Liu, Chang, et al.
Pubblicazione: (2023)
di: Liu, Chang, et al.
Pubblicazione: (2023)
Large-Vocabulary Segmentation for Medical Images with Text Prompts
di: Zhao, Ziheng, et al.
Pubblicazione: (2023)
di: Zhao, Ziheng, et al.
Pubblicazione: (2023)
Distilled Protein Backbone Generation
di: Xie, Liyang, et al.
Pubblicazione: (2025)
di: Xie, Liyang, et al.
Pubblicazione: (2025)
ADFQ-ViT: Activation-Distribution-Friendly Post-Training Quantization for Vision Transformers
di: Jiang, Yanfeng, et al.
Pubblicazione: (2024)
di: Jiang, Yanfeng, et al.
Pubblicazione: (2024)
RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis
di: Zhang, Xiaoman, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoman, et al.
Pubblicazione: (2024)
IntuiTF: MLLM-Guided Transfer Function Optimization for Direct Volume Rendering
di: Wang, Yiyao, et al.
Pubblicazione: (2025)
di: Wang, Yiyao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Sanity Check on Composed Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2026) -
POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch
di: Liu, Yikun, et al.
Pubblicazione: (2026) -
Zero-shot Composed Text-Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2023) -
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
di: Wang, Haicheng, et al.
Pubblicazione: (2026) -
Revisiting Multi-Task Visual Representation Learning
di: Di, Shangzhe, et al.
Pubblicazione: (2026)