CityLLaVA: Efficient Fine-Tuning for VLMs in City Scenario
Fuente:
arXiv
Salvato in:
| Autori principali: | Duan, Zhizhao, Cheng, Hao, Xu, Duo, Wu, Xi, Zhang, Xiangxie, Ye, Xi, Xie, Zhen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multi-Task Dense Prediction Fine-Tuning with Mixture of Fine-Grained Experts
di: Xu, Yangyang, et al.
Pubblicazione: (2025)
di: Xu, Yangyang, et al.
Pubblicazione: (2025)
Enhancing Subsequent Video Retrieval via Vision-Language Models (VLMs)
di: Duan, Yicheng, et al.
Pubblicazione: (2025)
di: Duan, Yicheng, et al.
Pubblicazione: (2025)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
di: Liang, Han, et al.
Pubblicazione: (2024)
di: Liang, Han, et al.
Pubblicazione: (2024)
SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning
di: Ye, Xi, et al.
Pubblicazione: (2026)
di: Ye, Xi, et al.
Pubblicazione: (2026)
FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression
di: Zhu, Yuke, et al.
Pubblicazione: (2024)
di: Zhu, Yuke, et al.
Pubblicazione: (2024)
GeoLLaVA: Efficient Fine-Tuned Vision-Language Models for Temporal Change Detection in Remote Sensing
di: Elgendy, Hosam, et al.
Pubblicazione: (2024)
di: Elgendy, Hosam, et al.
Pubblicazione: (2024)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
di: Zhao, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2024)
TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler
di: Zhang, Xingjian, et al.
Pubblicazione: (2025)
di: Zhang, Xingjian, et al.
Pubblicazione: (2025)
LLaVA-c: Continual Improved Visual Instruction Tuning
di: Liu, Wenzhuo, et al.
Pubblicazione: (2025)
di: Liu, Wenzhuo, et al.
Pubblicazione: (2025)
FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
di: Shu, Fangxun, et al.
Pubblicazione: (2024)
di: Shu, Fangxun, et al.
Pubblicazione: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
di: Cao, Meng, et al.
Pubblicazione: (2024)
di: Cao, Meng, et al.
Pubblicazione: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
di: Yan, Dawei, et al.
Pubblicazione: (2024)
di: Yan, Dawei, et al.
Pubblicazione: (2024)
Imagine a City: CityGenAgent for Procedural 3D City Generation
di: Liu, Zishan, et al.
Pubblicazione: (2026)
di: Liu, Zishan, et al.
Pubblicazione: (2026)
LLaVA-ReID: Selective Multi-image Questioner for Interactive Person Re-Identification
di: Lu, Yiding, et al.
Pubblicazione: (2025)
di: Lu, Yiding, et al.
Pubblicazione: (2025)
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
di: Gao, Mingze, et al.
Pubblicazione: (2024)
di: Gao, Mingze, et al.
Pubblicazione: (2024)
CityCraft: A Real Crafter for 3D City Generation
di: Deng, Jie, et al.
Pubblicazione: (2024)
di: Deng, Jie, et al.
Pubblicazione: (2024)
ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension
di: Xu, Duo, et al.
Pubblicazione: (2025)
di: Xu, Duo, et al.
Pubblicazione: (2025)
CitySeg: A 3D Open Vocabulary Semantic Segmentation Foundation Model in City-scale Scenarios
di: Xu, Jialei, et al.
Pubblicazione: (2025)
di: Xu, Jialei, et al.
Pubblicazione: (2025)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
di: Xu, Guowei, et al.
Pubblicazione: (2024)
di: Xu, Guowei, et al.
Pubblicazione: (2024)
WeGeFT: Weight-Generative Fine-Tuning for Multi-Faceted Efficient Adaptation of Large Models
di: Savadikar, Chinmay, et al.
Pubblicazione: (2023)
di: Savadikar, Chinmay, et al.
Pubblicazione: (2023)
EfficientLLaVA:Generalizable Auto-Pruning for Large Vision-language Models
di: Liang, Yinan, et al.
Pubblicazione: (2025)
di: Liang, Yinan, et al.
Pubblicazione: (2025)
LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations
di: Xu, Mingjie, et al.
Pubblicazione: (2024)
di: Xu, Mingjie, et al.
Pubblicazione: (2024)
Selecting Fine-Tuning Examples by Quizzing VLMs
di: Ji, Tenghao, et al.
Pubblicazione: (2025)
di: Ji, Tenghao, et al.
Pubblicazione: (2025)
LLaVA-Pose: Enhancing Human Pose and Action Understanding via Keypoint-Integrated Instruction Tuning
di: Zhang, Dewen, et al.
Pubblicazione: (2025)
di: Zhang, Dewen, et al.
Pubblicazione: (2025)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024)
di: Ye, Xubing, et al.
Pubblicazione: (2024)
LLaVA$^3$: Representing 3D Scenes like a Cubist Painter to Boost 3D Scene Understanding of VLMs
di: Petit, Doriand, et al.
Pubblicazione: (2025)
di: Petit, Doriand, et al.
Pubblicazione: (2025)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
di: Xu, Jinjin, et al.
Pubblicazione: (2023)
di: Xu, Jinjin, et al.
Pubblicazione: (2023)
EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning
di: Xing, Bohao, et al.
Pubblicazione: (2024)
di: Xing, Bohao, et al.
Pubblicazione: (2024)
AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference
di: Huang, Kai, et al.
Pubblicazione: (2025)
di: Huang, Kai, et al.
Pubblicazione: (2025)
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
di: An, Xiang, et al.
Pubblicazione: (2026)
di: An, Xiang, et al.
Pubblicazione: (2026)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
$h$-control: Training-Free Camera Control via Block-Conditional Gibbs Refinement
di: Wang, Yuzhu, et al.
Pubblicazione: (2026)
di: Wang, Yuzhu, et al.
Pubblicazione: (2026)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
di: Zhang, Tao, et al.
Pubblicazione: (2024)
di: Zhang, Tao, et al.
Pubblicazione: (2024)
Multi-Object Tracking Retrieval with LLaVA-Video: A Training-Free Solution to MOT25-StAG Challenge
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models
di: Jin, Juseong, et al.
Pubblicazione: (2024)
di: Jin, Juseong, et al.
Pubblicazione: (2024)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
di: Lin, Bin, et al.
Pubblicazione: (2024)
di: Lin, Bin, et al.
Pubblicazione: (2024)
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
di: Zhang, Xingjian, et al.
Pubblicazione: (2025)
di: Zhang, Xingjian, et al.
Pubblicazione: (2025)
CityDreamer: Compositional Generative Model of Unbounded 3D Cities
di: Xie, Haozhe, et al.
Pubblicazione: (2023)
di: Xie, Haozhe, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Multi-Task Dense Prediction Fine-Tuning with Mixture of Fine-Grained Experts
di: Xu, Yangyang, et al.
Pubblicazione: (2025) -
Enhancing Subsequent Video Retrieval via Vision-Language Models (VLMs)
di: Duan, Yicheng, et al.
Pubblicazione: (2025) -
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
di: Liang, Han, et al.
Pubblicazione: (2024) -
SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning
di: Ye, Xi, et al.
Pubblicazione: (2026) -
FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression
di: Zhu, Yuke, et al.
Pubblicazione: (2024)