HyDRA: Hierarchical and Dynamic Rank Adaptation for Mobile Vision Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Xi, Yuanhao, Bing, Xiaohuan, Yahyapour, Ramin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HyDRA: Hybrid Domain-Aware Robust Architecture for Heterogeneous Collaborative Perception
by: Song, Minwoo, et al.
Published: (2026)
by: Song, Minwoo, et al.
Published: (2026)
HyDRA: Hybrid Denoising Regularization for Measurement-Only DEQ Training
by: Haltmeier, Markus, et al.
Published: (2026)
by: Haltmeier, Markus, et al.
Published: (2026)
PLMM: Personal Large Language Models on Mobile Devices
by: Gong, Yuanhao
Published: (2023)
by: Gong, Yuanhao
Published: (2023)
Weight Copy and Low-Rank Adaptation for Few-Shot Distillation of Vision Transformers
by: Grigore, Diana-Nicoleta, et al.
Published: (2024)
by: Grigore, Diana-Nicoleta, et al.
Published: (2024)
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
by: Ming, Yifei, et al.
Published: (2024)
by: Ming, Yifei, et al.
Published: (2024)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
by: Park, Jihwan, et al.
Published: (2025)
by: Park, Jihwan, et al.
Published: (2025)
Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model
by: Ma, Huan, et al.
Published: (2024)
by: Ma, Huan, et al.
Published: (2024)
Hierarchically Robust Zero-shot Vision-language Models
by: Dong, Junhao, et al.
Published: (2026)
by: Dong, Junhao, et al.
Published: (2026)
ProKeR: A Kernel Perspective on Few-Shot Adaptation of Large Vision-Language Models
by: Bendou, Yassir, et al.
Published: (2025)
by: Bendou, Yassir, et al.
Published: (2025)
HiPath: Hierarchical Vision-Language Alignment for Structured Pathology Report Prediction
by: Yuan, Ruicheng, et al.
Published: (2026)
by: Yuan, Ruicheng, et al.
Published: (2026)
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models
by: Zhang, Yabin, et al.
Published: (2024)
by: Zhang, Yabin, et al.
Published: (2024)
DINORANKCLIP: DINOv3 Distillation and Injection for Vision-Language Pretraining with High-Order Ranking Consistency
by: Jiang, Shuyang, et al.
Published: (2026)
by: Jiang, Shuyang, et al.
Published: (2026)
RankCLIP: Ranking-Consistent Language-Image Pretraining
by: Zhang, Yiming, et al.
Published: (2024)
by: Zhang, Yiming, et al.
Published: (2024)
Continual Adaptation of Vision Transformers for Federated Learning
by: Halbe, Shaunak, et al.
Published: (2023)
by: Halbe, Shaunak, et al.
Published: (2023)
A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition
by: Zhao, Xinkui, et al.
Published: (2025)
by: Zhao, Xinkui, et al.
Published: (2025)
InfLoRA: Interference-Free Low-Rank Adaptation for Continual Learning
by: Liang, Yan-Shuo, et al.
Published: (2024)
by: Liang, Yan-Shuo, et al.
Published: (2024)
Do Language Models Understand Time?
by: Ding, Xi, et al.
Published: (2024)
by: Ding, Xi, et al.
Published: (2024)
FastVLM: Efficient Vision Encoding for Vision Language Models
by: Vasu, Pavan Kumar Anasosalu, et al.
Published: (2024)
by: Vasu, Pavan Kumar Anasosalu, et al.
Published: (2024)
RoHyDR: Robust Hybrid Diffusion Recovery for Incomplete Multimodal Emotion Recognition
by: Jin, Yuehan, et al.
Published: (2025)
by: Jin, Yuehan, et al.
Published: (2025)
MTLoRA: A Low-Rank Adaptation Approach for Efficient Multi-Task Learning
by: Agiza, Ahmed, et al.
Published: (2024)
by: Agiza, Ahmed, et al.
Published: (2024)
FasterViT: Fast Vision Transformers with Hierarchical Attention
by: Hatamizadeh, Ali, et al.
Published: (2023)
by: Hatamizadeh, Ali, et al.
Published: (2023)
MambaMixer: Efficient Selective State Space Models with Dual Token and Channel Selection
by: Behrouz, Ali, et al.
Published: (2024)
by: Behrouz, Ali, et al.
Published: (2024)
Adapting Vision-Language Models for Evaluating World Models
by: Hendriksen, Mariya, et al.
Published: (2025)
by: Hendriksen, Mariya, et al.
Published: (2025)
SRLoRA: Subspace Recomposition in Low-Rank Adaptation via Importance-Based Fusion and Reinitialization
by: Yang, Haodong, et al.
Published: (2025)
by: Yang, Haodong, et al.
Published: (2025)
Multi-Modal Adapter for Vision-Language Models
by: Seputis, Dominykas, et al.
Published: (2024)
by: Seputis, Dominykas, et al.
Published: (2024)
AdaRank: Adaptive Rank Pruning for Enhanced Model Merging
by: Lee, Chanhyuk, et al.
Published: (2025)
by: Lee, Chanhyuk, et al.
Published: (2025)
Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models
by: Lian, Chenyu, et al.
Published: (2025)
by: Lian, Chenyu, et al.
Published: (2025)
VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
by: Yu, Xinlei, et al.
Published: (2025)
by: Yu, Xinlei, et al.
Published: (2025)
Vision Language Models for Dynamic Human Activity Recognition in Healthcare Settings
by: Abid, Abderrazek, et al.
Published: (2025)
by: Abid, Abderrazek, et al.
Published: (2025)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
by: Villegas, Danae Sánchez, et al.
Published: (2026)
by: Villegas, Danae Sánchez, et al.
Published: (2026)
Memory-Efficient Vision Transformers: An Activation-Aware Mixed-Rank Compression Strategy
by: Azizi, Seyedarmin, et al.
Published: (2024)
by: Azizi, Seyedarmin, et al.
Published: (2024)
AdapterTune: Zero-Initialized Low-Rank Adapters for Frozen Vision Transformers
by: Khazem, Salim
Published: (2026)
by: Khazem, Salim
Published: (2026)
Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models
by: Wang, Hongjun, et al.
Published: (2026)
by: Wang, Hongjun, et al.
Published: (2026)
Beyond Human Vision: The Role of Large Vision Language Models in Microscope Image Analysis
by: Verma, Prateek, et al.
Published: (2024)
by: Verma, Prateek, et al.
Published: (2024)
Efficient Few-Shot Learning in Remote Sensing: Fusing Vision and Vision-Language Models
by: Chua, Jia Yun, et al.
Published: (2025)
by: Chua, Jia Yun, et al.
Published: (2025)
ElaLoRA: Elastic & Learnable Low-Rank Adaptation for Efficient Model Fine-Tuning
by: Chang, Huandong, et al.
Published: (2025)
by: Chang, Huandong, et al.
Published: (2025)
AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment
by: Kao, Kuei-Chun, et al.
Published: (2026)
by: Kao, Kuei-Chun, et al.
Published: (2026)
CFM: Language-aligned Concept Foundation Model for Vision
by: Wittenmayer, Kai, et al.
Published: (2026)
by: Wittenmayer, Kai, et al.
Published: (2026)
Compositional Entailment Learning for Hyperbolic Vision-Language Models
by: Pal, Avik, et al.
Published: (2024)
by: Pal, Avik, et al.
Published: (2024)
Effectiveness Assessment of Recent Large Vision-Language Models
by: Jiang, Yao, et al.
Published: (2024)
by: Jiang, Yao, et al.
Published: (2024)
Similar Items
-
HyDRA: Hybrid Domain-Aware Robust Architecture for Heterogeneous Collaborative Perception
by: Song, Minwoo, et al.
Published: (2026) -
HyDRA: Hybrid Denoising Regularization for Measurement-Only DEQ Training
by: Haltmeier, Markus, et al.
Published: (2026) -
PLMM: Personal Large Language Models on Mobile Devices
by: Gong, Yuanhao
Published: (2023) -
Weight Copy and Low-Rank Adaptation for Few-Shot Distillation of Vision Transformers
by: Grigore, Diana-Nicoleta, et al.
Published: (2024) -
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
by: Ming, Yifei, et al.
Published: (2024)