Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Ming, Zhong, Jike, Li, Chenxin, Li, Liuzhuozheng, Lin, Nie, Sugiyama, Masashi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
von: Fei, Senyu, et al.
Veröffentlicht: (2025)
von: Fei, Senyu, et al.
Veröffentlicht: (2025)
Parameter-Efficient Fine-Tuning of Vision Foundation Model for Forest Floor Segmentation from UAV Imagery
von: Wasil, Mohammad, et al.
Veröffentlicht: (2025)
von: Wasil, Mohammad, et al.
Veröffentlicht: (2025)
The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
von: Jiang, Titong, et al.
Veröffentlicht: (2025)
von: Jiang, Titong, et al.
Veröffentlicht: (2025)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
von: Qian, Kangan, et al.
Veröffentlicht: (2025)
von: Qian, Kangan, et al.
Veröffentlicht: (2025)
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
von: Fei, Senyu, et al.
Veröffentlicht: (2025)
von: Fei, Senyu, et al.
Veröffentlicht: (2025)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
von: Mitra, Chancharik, et al.
Veröffentlicht: (2025)
von: Mitra, Chancharik, et al.
Veröffentlicht: (2025)
PEFT A2Z: Parameter-Efficient Fine-Tuning Survey for Large Language and Vision Models
von: Prottasha, Nusrat Jahan, et al.
Veröffentlicht: (2025)
von: Prottasha, Nusrat Jahan, et al.
Veröffentlicht: (2025)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
von: Wei, Ziming, et al.
Veröffentlicht: (2025)
von: Wei, Ziming, et al.
Veröffentlicht: (2025)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
von: Lin, Bingqian, et al.
Veröffentlicht: (2024)
von: Lin, Bingqian, et al.
Veröffentlicht: (2024)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
von: Wei, Xinyu, et al.
Veröffentlicht: (2025)
von: Wei, Xinyu, et al.
Veröffentlicht: (2025)
Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
von: Lu, Jinghui, et al.
Veröffentlicht: (2026)
von: Lu, Jinghui, et al.
Veröffentlicht: (2026)
Expert Pyramid Tuning: Efficient Parameter Fine-Tuning for Expertise-Driven Task Allocation
von: Zhang, Jia-Chen, et al.
Veröffentlicht: (2026)
von: Zhang, Jia-Chen, et al.
Veröffentlicht: (2026)
DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models
von: Li, Chenyang, et al.
Veröffentlicht: (2026)
von: Li, Chenyang, et al.
Veröffentlicht: (2026)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
von: Li, Wei, et al.
Veröffentlicht: (2025)
von: Li, Wei, et al.
Veröffentlicht: (2025)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
von: Ding, Yi, et al.
Veröffentlicht: (2025)
von: Ding, Yi, et al.
Veröffentlicht: (2025)
End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering
von: Goetting, Dylan, et al.
Veröffentlicht: (2024)
von: Goetting, Dylan, et al.
Veröffentlicht: (2024)
X-Driver: Explainable Autonomous Driving with Vision-Language Models
von: Liu, Wei, et al.
Veröffentlicht: (2025)
von: Liu, Wei, et al.
Veröffentlicht: (2025)
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
von: Wang, Tianyu, et al.
Veröffentlicht: (2024)
von: Wang, Tianyu, et al.
Veröffentlicht: (2024)
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
von: Darabi, Nastaran, et al.
Veröffentlicht: (2026)
von: Darabi, Nastaran, et al.
Veröffentlicht: (2026)
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
von: Wang, Zhaowei, et al.
Veröffentlicht: (2024)
von: Wang, Zhaowei, et al.
Veröffentlicht: (2024)
Motion Generation from Fine-grained Textual Descriptions
von: Li, Kunhang, et al.
Veröffentlicht: (2024)
von: Li, Kunhang, et al.
Veröffentlicht: (2024)
What Limits Vision-and-Language Navigation ?
von: Wang, Yunheng, et al.
Veröffentlicht: (2026)
von: Wang, Yunheng, et al.
Veröffentlicht: (2026)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
von: Zhang, Pingrui, et al.
Veröffentlicht: (2025)
von: Zhang, Pingrui, et al.
Veröffentlicht: (2025)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
von: Li, Zerui, et al.
Veröffentlicht: (2025)
von: Li, Zerui, et al.
Veröffentlicht: (2025)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
von: An, Dong, et al.
Veröffentlicht: (2023)
von: An, Dong, et al.
Veröffentlicht: (2023)
MG-SLAM: Structure Gaussian Splatting SLAM with Manhattan World Hypothesis
von: Liu, Shuhong, et al.
Veröffentlicht: (2024)
von: Liu, Shuhong, et al.
Veröffentlicht: (2024)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
von: Chen, Yi, et al.
Veröffentlicht: (2023)
von: Chen, Yi, et al.
Veröffentlicht: (2023)
VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
von: Su, Hung-Ting, et al.
Veröffentlicht: (2026)
von: Su, Hung-Ting, et al.
Veröffentlicht: (2026)
Forecast-PEFT: Parameter-Efficient Fine-Tuning for Pre-trained Motion Forecasting Models
von: Wang, Jifeng, et al.
Veröffentlicht: (2024)
von: Wang, Jifeng, et al.
Veröffentlicht: (2024)
Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
von: Wei, Yifei, et al.
Veröffentlicht: (2026)
von: Wei, Yifei, et al.
Veröffentlicht: (2026)
LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models
von: Hou, Yuchen, et al.
Veröffentlicht: (2026)
von: Hou, Yuchen, et al.
Veröffentlicht: (2026)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
von: Li, Hao, et al.
Veröffentlicht: (2025)
von: Li, Hao, et al.
Veröffentlicht: (2025)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
von: Lin, Tao, et al.
Veröffentlicht: (2025)
von: Lin, Tao, et al.
Veröffentlicht: (2025)
Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning
von: Li, Xueying, et al.
Veröffentlicht: (2026)
von: Li, Xueying, et al.
Veröffentlicht: (2026)
RoboUniView: Visual-Language Model with Unified View Representation for Robotic Manipulation
von: Liu, Fanfan, et al.
Veröffentlicht: (2024)
von: Liu, Fanfan, et al.
Veröffentlicht: (2024)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
von: Chow, Wei, et al.
Veröffentlicht: (2025)
von: Chow, Wei, et al.
Veröffentlicht: (2025)
FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions
von: Li, Peng, et al.
Veröffentlicht: (2026)
von: Li, Peng, et al.
Veröffentlicht: (2026)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
von: Chen, Boyuan, et al.
Veröffentlicht: (2024)
von: Chen, Boyuan, et al.
Veröffentlicht: (2024)
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
von: Li, Kailing, et al.
Veröffentlicht: (2026)
von: Li, Kailing, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
von: Fei, Senyu, et al.
Veröffentlicht: (2025) -
Parameter-Efficient Fine-Tuning of Vision Foundation Model for Forest Floor Segmentation from UAV Imagery
von: Wasil, Mohammad, et al.
Veröffentlicht: (2025) -
The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
von: Jiang, Titong, et al.
Veröffentlicht: (2025) -
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
von: Qian, Kangan, et al.
Veröffentlicht: (2025) -
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
von: Fei, Senyu, et al.
Veröffentlicht: (2025)