Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Junjie, Wang, Ziao, Ma, Jianghong, Zhang, Xiaofeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GiVE: Guiding Visual Encoder to Perceive Overlooked Information
di: Li, Junjie, et al.
Pubblicazione: (2024)
di: Li, Junjie, et al.
Pubblicazione: (2024)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training
di: Li, Junjie, et al.
Pubblicazione: (2026)
di: Li, Junjie, et al.
Pubblicazione: (2026)
Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2023)
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2023)
Uncovering Bias in Large Vision-Language Models with Counterfactuals
di: Howard, Phillip, et al.
Pubblicazione: (2024)
di: Howard, Phillip, et al.
Pubblicazione: (2024)
Single-Pixel Vision-Language Model for Intrinsic Privacy-Preserving Behavioral Intelligence
di: An, Hongjun, et al.
Pubblicazione: (2026)
di: An, Hongjun, et al.
Pubblicazione: (2026)
Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving
di: Zhang, Enming, et al.
Pubblicazione: (2025)
di: Zhang, Enming, et al.
Pubblicazione: (2025)
Prompting Large Vision-Language Models for Compositional Reasoning
di: Ossowski, Timothy, et al.
Pubblicazione: (2024)
di: Ossowski, Timothy, et al.
Pubblicazione: (2024)
The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection
di: Ai, Wei, et al.
Pubblicazione: (2026)
di: Ai, Wei, et al.
Pubblicazione: (2026)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2026)
di: Huang, Wenxuan, et al.
Pubblicazione: (2026)
LIBERO-X: Robustness Litmus for Vision-Language-Action Models
di: Wang, Guodong, et al.
Pubblicazione: (2026)
di: Wang, Guodong, et al.
Pubblicazione: (2026)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
di: Ren, Yiming, et al.
Pubblicazione: (2026)
di: Ren, Yiming, et al.
Pubblicazione: (2026)
Adversarial Prompt Tuning for Vision-Language Models
di: Zhang, Jiaming, et al.
Pubblicazione: (2023)
di: Zhang, Jiaming, et al.
Pubblicazione: (2023)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
di: Zhao, Fei, et al.
Pubblicazione: (2024)
di: Zhao, Fei, et al.
Pubblicazione: (2024)
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
di: Wu, Junfei, et al.
Pubblicazione: (2024)
di: Wu, Junfei, et al.
Pubblicazione: (2024)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
The Role of Data Curation in Image Captioning
di: Li, Wenyan, et al.
Pubblicazione: (2023)
di: Li, Wenyan, et al.
Pubblicazione: (2023)
VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
di: Gao, Chongkai, et al.
Pubblicazione: (2025)
di: Gao, Chongkai, et al.
Pubblicazione: (2025)
Data Metabolism: An Efficient Data Design Schema For Vision Language Model
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025)
SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery
di: Ma, Qiwei, et al.
Pubblicazione: (2025)
di: Ma, Qiwei, et al.
Pubblicazione: (2025)
Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
di: Zhang, Congzhi, et al.
Pubblicazione: (2025)
di: Zhang, Congzhi, et al.
Pubblicazione: (2025)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
Enhancing Medical Large Vision-Language Models via Alignment Distillation
di: Chang, Aofei, et al.
Pubblicazione: (2025)
di: Chang, Aofei, et al.
Pubblicazione: (2025)
VLMine: Long-Tail Data Mining with Vision Language Models
di: Ye, Mao, et al.
Pubblicazione: (2024)
di: Ye, Mao, et al.
Pubblicazione: (2024)
Adversarial Prompt Distillation for Vision-Language Models
di: Luo, Lin, et al.
Pubblicazione: (2024)
di: Luo, Lin, et al.
Pubblicazione: (2024)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
di: Li, Ao, et al.
Pubblicazione: (2025)
di: Li, Ao, et al.
Pubblicazione: (2025)
SPHERE: Unveiling Spatial Blind Spots in Vision-Language Models Through Hierarchical Evaluation
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models
di: Ji, Xingguang, et al.
Pubblicazione: (2025)
di: Ji, Xingguang, et al.
Pubblicazione: (2025)
Detecting Performance Degradation under Data Shift in Pathology Vision-Language Model
di: Guan, Hao, et al.
Pubblicazione: (2026)
di: Guan, Hao, et al.
Pubblicazione: (2026)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
di: Ghosh, Dhruba, et al.
Pubblicazione: (2026)
di: Ghosh, Dhruba, et al.
Pubblicazione: (2026)
Object-Centric Vision Token Pruning for Vision Language Models
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
Evolving Prompt Adaptation for Vision-Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2026)
di: Zhang, Enming, et al.
Pubblicazione: (2026)
Representation Calibration and Uncertainty Guidance for Class-Incremental Learning based on Vision Language Model
di: Tan, Jiantao, et al.
Pubblicazione: (2025)
di: Tan, Jiantao, et al.
Pubblicazione: (2025)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
di: Zhao, Baining, et al.
Pubblicazione: (2025)
di: Zhao, Baining, et al.
Pubblicazione: (2025)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
ArtVLM: Attribute Recognition Through Vision-Based Prefix Language Modeling
di: Zhu, William Yicheng, et al.
Pubblicazione: (2024)
di: Zhu, William Yicheng, et al.
Pubblicazione: (2024)
Egocentric Bias in Vision-Language Models
di: Wang, Maijunxian, et al.
Pubblicazione: (2026)
di: Wang, Maijunxian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
GiVE: Guiding Visual Encoder to Perceive Overlooked Information
di: Li, Junjie, et al.
Pubblicazione: (2024) -
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
di: Li, Hengzhuang, et al.
Pubblicazione: (2025) -
GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training
di: Li, Junjie, et al.
Pubblicazione: (2026) -
Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2023) -
Uncovering Bias in Large Vision-Language Models with Counterfactuals
di: Howard, Phillip, et al.
Pubblicazione: (2024)