Rethinking Overlooked Aspects in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yuan, Tian, Le, Zhou, Xiao, Zhou, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
POINTS1.5: Building a Vision-Language Model towards Real World Applications
par: Liu, Yuan, et autres
Publié: (2024)
par: Liu, Yuan, et autres
Publié: (2024)
POINTS: Improving Your Vision-language Model with Affordable Strategies
par: Liu, Yuan, et autres
Publié: (2024)
par: Liu, Yuan, et autres
Publié: (2024)
POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document Conversion
par: Liu, Yuan, et autres
Publié: (2025)
par: Liu, Yuan, et autres
Publié: (2025)
VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
par: Liu, Yikun, et autres
Publié: (2026)
par: Liu, Yikun, et autres
Publié: (2026)
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
par: Guo, Xiao, et autres
Publié: (2025)
par: Guo, Xiao, et autres
Publié: (2025)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
par: Shang, Zhenhao, et autres
Publié: (2026)
par: Shang, Zhenhao, et autres
Publié: (2026)
Rethinking the Need for Source Models: Source-Free Domain Adaptation from Scratch Guided by a Vision-Language Model
par: Bingtao, Zhou, et autres
Publié: (2026)
par: Bingtao, Zhou, et autres
Publié: (2026)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
Modest-Align: Data-Efficient Alignment for Vision-Language Models
par: Liu, Jiaxiang, et autres
Publié: (2025)
par: Liu, Jiaxiang, et autres
Publié: (2025)
Rethinking Vision Transformer Depth via Structural Reparameterization
par: Zhou, Chengwei, et autres
Publié: (2025)
par: Zhou, Chengwei, et autres
Publié: (2025)
POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch
par: Liu, Yikun, et autres
Publié: (2026)
par: Liu, Yikun, et autres
Publié: (2026)
Rethinking Token Reduction for Large Vision-Language Models
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
Probabilistic Prototype Calibration of Vision-Language Models for Generalized Few-shot Semantic Segmentation
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
InPK: Infusing Prior Knowledge into Prompt for Vision-Language Models
par: Zhou, Shuchang, et autres
Publié: (2025)
par: Zhou, Shuchang, et autres
Publié: (2025)
CAS-IQA: Teaching Vision-Language Models for Synthetic Angiography Quality Assessment
par: Wang, Bo, et autres
Publié: (2025)
par: Wang, Bo, et autres
Publié: (2025)
LanP: Rethinking the Impact of Language Priors in Large Vision-Language Models
par: Wu, Zongyu, et autres
Publié: (2025)
par: Wu, Zongyu, et autres
Publié: (2025)
POINTS-GUI-G: GUI-Grounding Journey
par: Zhao, Zhongyin, et autres
Publié: (2026)
par: Zhao, Zhongyin, et autres
Publié: (2026)
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
par: Liu, Xinqi, et autres
Publié: (2024)
par: Liu, Xinqi, et autres
Publié: (2024)
Rethinking Preference Alignment for Diffusion Models with Classifier-Free Guidance
par: Jiang, Zhou, et autres
Publié: (2026)
par: Jiang, Zhou, et autres
Publié: (2026)
Q-VLM: Post-training Quantization for Large Vision-Language Models
par: Wang, Changyuan, et autres
Publié: (2024)
par: Wang, Changyuan, et autres
Publié: (2024)
GuiDINO: Rethinking Vision Foundation Model in Medical Image Segmentation
par: Liang, Zhuonan, et autres
Publié: (2026)
par: Liang, Zhuonan, et autres
Publié: (2026)
Multi-modal Attribute Prompting for Vision-Language Models
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
Effectively Enhancing Vision Language Large Models by Prompt Augmentation and Caption Utilization
par: Zhao, Minyi, et autres
Publié: (2024)
par: Zhao, Minyi, et autres
Publié: (2024)
LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
par: Takezoe, Rinyoichi, et autres
Publié: (2026)
par: Takezoe, Rinyoichi, et autres
Publié: (2026)
HiMix: Reducing Computational Complexity in Large Vision-Language Models
par: Zhang, Xuange, et autres
Publié: (2025)
par: Zhang, Xuange, et autres
Publié: (2025)
Vision Language Models for Spreadsheet Understanding: Challenges and Opportunities
par: Xia, Shiyu, et autres
Publié: (2024)
par: Xia, Shiyu, et autres
Publié: (2024)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
par: Liu, Fan, et autres
Publié: (2023)
par: Liu, Fan, et autres
Publié: (2023)
Distilling Vision-Language Models on Millions of Videos
par: Zhao, Yue, et autres
Publié: (2024)
par: Zhao, Yue, et autres
Publié: (2024)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
par: Zhou, Wenlve, et autres
Publié: (2024)
par: Zhou, Wenlve, et autres
Publié: (2024)
MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models
par: Zhao, Shiji, et autres
Publié: (2025)
par: Zhao, Shiji, et autres
Publié: (2025)
Towards Cross-View Point Correspondence in Vision-Language Models
par: Wang, Yipu, et autres
Publié: (2025)
par: Wang, Yipu, et autres
Publié: (2025)
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
par: Xiong, Yuwen, et autres
Publié: (2024)
par: Xiong, Yuwen, et autres
Publié: (2024)
Rethinking Domain Generalization: Discriminability and Generalizability
par: Long, Shaocong, et autres
Publié: (2023)
par: Long, Shaocong, et autres
Publié: (2023)
Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
par: Suo, Wei, et autres
Publié: (2024)
par: Suo, Wei, et autres
Publié: (2024)
Towards Vision-Language Geo-Foundation Model: A Survey
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
Delving into Out-of-Distribution Detection with Medical Vision-Language Models
par: Ju, Lie, et autres
Publié: (2025)
par: Ju, Lie, et autres
Publié: (2025)
KPL: Training-Free Medical Knowledge Mining of Vision-Language Models
par: Liu, Jiaxiang, et autres
Publié: (2025)
par: Liu, Jiaxiang, et autres
Publié: (2025)
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
par: Wang, Feng, et autres
Publié: (2023)
par: Wang, Feng, et autres
Publié: (2023)
Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models
par: Zang, Zehua, et autres
Publié: (2026)
par: Zang, Zehua, et autres
Publié: (2026)
Documents similaires
-
POINTS1.5: Building a Vision-Language Model towards Real World Applications
par: Liu, Yuan, et autres
Publié: (2024) -
POINTS: Improving Your Vision-language Model with Affordable Strategies
par: Liu, Yuan, et autres
Publié: (2024) -
POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document Conversion
par: Liu, Yuan, et autres
Publié: (2025) -
VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
par: Liu, Yikun, et autres
Publié: (2026) -
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
par: Guo, Xiao, et autres
Publié: (2025)