Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Wei, Xinyu, Yang, Guoli, Zhou, Jialu, Yang, Mingyue, Li, Leqian, Zhang, Kedi, Qiu, Chunping |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation
por: Yang, Mingyue, et al.
Publicado: (2025)
por: Yang, Mingyue, et al.
Publicado: (2025)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
por: Jie, Shibo, et al.
Publicado: (2024)
por: Jie, Shibo, et al.
Publicado: (2024)
PEFT A2Z: Parameter-Efficient Fine-Tuning Survey for Large Language and Vision Models
por: Prottasha, Nusrat Jahan, et al.
Publicado: (2025)
por: Prottasha, Nusrat Jahan, et al.
Publicado: (2025)
HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
por: Wang, Yimu, et al.
Publicado: (2025)
por: Wang, Yimu, et al.
Publicado: (2025)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
Expert Pyramid Tuning: Efficient Parameter Fine-Tuning for Expertise-Driven Task Allocation
por: Zhang, Jia-Chen, et al.
Publicado: (2026)
por: Zhang, Jia-Chen, et al.
Publicado: (2026)
Beyond Accuracy Optimization: Computer Vision Losses for Large Language Model Fine-Tuning
por: Cambrin, Daniele Rege, et al.
Publicado: (2024)
por: Cambrin, Daniele Rege, et al.
Publicado: (2024)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
por: Liu, Zikang, et al.
Publicado: (2025)
por: Liu, Zikang, et al.
Publicado: (2025)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
por: Ding, Yi, et al.
Publicado: (2025)
por: Ding, Yi, et al.
Publicado: (2025)
Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning
por: Cao, Qinglong, et al.
Publicado: (2026)
por: Cao, Qinglong, et al.
Publicado: (2026)
Task-Specific Directions: Definition, Exploration, and Utilization in Parameter Efficient Fine-Tuning
por: Si, Chongjie, et al.
Publicado: (2024)
por: Si, Chongjie, et al.
Publicado: (2024)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
por: Lin, Zichuan, et al.
Publicado: (2025)
por: Lin, Zichuan, et al.
Publicado: (2025)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
por: Qiu, Yifu, et al.
Publicado: (2025)
por: Qiu, Yifu, et al.
Publicado: (2025)
FrEVL: Leveraging Frozen Pretrained Embeddings for Efficient Vision-Language Understanding
por: Bourigault, Emmanuelle, et al.
Publicado: (2025)
por: Bourigault, Emmanuelle, et al.
Publicado: (2025)
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
por: Wei, Canshi
Publicado: (2024)
por: Wei, Canshi
Publicado: (2024)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
por: Kim, Jeonghwan, et al.
Publicado: (2024)
por: Kim, Jeonghwan, et al.
Publicado: (2024)
Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
por: Jiang, Songtao, et al.
Publicado: (2025)
por: Jiang, Songtao, et al.
Publicado: (2025)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
por: Wang, Zhecan, et al.
Publicado: (2023)
por: Wang, Zhecan, et al.
Publicado: (2023)
BabyVision: Visual Reasoning Beyond Language
por: Chen, Liang, et al.
Publicado: (2026)
por: Chen, Liang, et al.
Publicado: (2026)
Visual In-Context Learning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
por: Jian, Pu, et al.
Publicado: (2025)
por: Jian, Pu, et al.
Publicado: (2025)
Efficient Few-Shot Medical Image Analysis via Hierarchical Contrastive Vision-Language Learning
por: Fuller, Harrison, et al.
Publicado: (2025)
por: Fuller, Harrison, et al.
Publicado: (2025)
TuneVLSeg: Prompt Tuning Benchmark for Vision-Language Segmentation Models
por: Adhikari, Rabin, et al.
Publicado: (2024)
por: Adhikari, Rabin, et al.
Publicado: (2024)
Pairwise Similarity Regularization for Semi-supervised Graph Medical Image Segmentation
por: Zhou, Jialu, et al.
Publicado: (2025)
por: Zhou, Jialu, et al.
Publicado: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
por: Zhang, Ce, et al.
Publicado: (2025)
por: Zhang, Ce, et al.
Publicado: (2025)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
por: Li, Jialu, et al.
Publicado: (2024)
por: Li, Jialu, et al.
Publicado: (2024)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
por: Jiang, Ziyan, et al.
Publicado: (2024)
por: Jiang, Ziyan, et al.
Publicado: (2024)
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
por: Xing, Shangyu, et al.
Publicado: (2024)
por: Xing, Shangyu, et al.
Publicado: (2024)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
por: Xu, Zhiyang, et al.
Publicado: (2024)
por: Xu, Zhiyang, et al.
Publicado: (2024)
Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning
por: Koleilat, Taha, et al.
Publicado: (2026)
por: Koleilat, Taha, et al.
Publicado: (2026)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
por: Kim, Geewook, et al.
Publicado: (2024)
por: Kim, Geewook, et al.
Publicado: (2024)
Lost in Embeddings: Information Loss in Vision-Language Models
por: Li, Wenyan, et al.
Publicado: (2025)
por: Li, Wenyan, et al.
Publicado: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
por: Zhang, Wenqiao, et al.
Publicado: (2024)
por: Zhang, Wenqiao, et al.
Publicado: (2024)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
por: Li, Bin, et al.
Publicado: (2025)
por: Li, Bin, et al.
Publicado: (2025)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
por: Zhang, Yanzhe, et al.
Publicado: (2023)
por: Zhang, Yanzhe, et al.
Publicado: (2023)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
por: Tan, Zhiyu, et al.
Publicado: (2024)
por: Tan, Zhiyu, et al.
Publicado: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
por: Zhu, Yingjie, et al.
Publicado: (2024)
por: Zhu, Yingjie, et al.
Publicado: (2024)
Data-Efficient Fine-Tuning of Vision-Language Models for Diagnosis of Alzheimer's Disease
por: Cheng, Fangqi, et al.
Publicado: (2025)
por: Cheng, Fangqi, et al.
Publicado: (2025)
Ejemplares similares
-
CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation
por: Yang, Mingyue, et al.
Publicado: (2025) -
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
por: Jie, Shibo, et al.
Publicado: (2024) -
PEFT A2Z: Parameter-Efficient Fine-Tuning Survey for Large Language and Vision Models
por: Prottasha, Nusrat Jahan, et al.
Publicado: (2025) -
HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
por: Wang, Yimu, et al.
Publicado: (2025) -
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)