Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Keunwoo Peter, Zhang, Zheyuan, Hu, Fengyuan, Storks, Shane, Chai, Joyce |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
par: Zhang, Zheyuan, et autres
Publié: (2024)
par: Zhang, Zheyuan, et autres
Publié: (2024)
Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models
par: Yu, Keunwoo Peter, et autres
Publié: (2025)
par: Yu, Keunwoo Peter, et autres
Publié: (2025)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
par: Zha, Yuheng, et autres
Publié: (2025)
par: Zha, Yuheng, et autres
Publié: (2025)
Scalable Vision Language Model Training via High Quality Data Curation
par: Dong, Hongyuan, et autres
Publié: (2025)
par: Dong, Hongyuan, et autres
Publié: (2025)
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
par: Ma, Ziqiao, et autres
Publié: (2023)
par: Ma, Ziqiao, et autres
Publié: (2023)
Espresso: High Compression For Rich Extraction From Videos for Your Vision-Language Model
par: Yu, Keunwoo Peter, et autres
Publié: (2024)
par: Yu, Keunwoo Peter, et autres
Publié: (2024)
NAVIG: Natural Language-guided Analysis with Vision Language Models for Image Geo-localization
par: Zhang, Zheyuan, et autres
Publié: (2025)
par: Zhang, Zheyuan, et autres
Publié: (2025)
RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning
par: Dai, Yinpei, et autres
Publié: (2024)
par: Dai, Yinpei, et autres
Publié: (2024)
Transparent and Coherent Procedural Mistake Detection
par: Storks, Shane, et autres
Publié: (2024)
par: Storks, Shane, et autres
Publié: (2024)
LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision
par: Ganguly, Debargha, et autres
Publié: (2025)
par: Ganguly, Debargha, et autres
Publié: (2025)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
par: Liao, Yuan-Hong, et autres
Publié: (2024)
par: Liao, Yuan-Hong, et autres
Publié: (2024)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
par: Tang, Yihong, et autres
Publié: (2024)
par: Tang, Yihong, et autres
Publié: (2024)
Discovering Properties of Inflectional Morphology in Neural Emergent Communication
par: Gilberti, Miles, et autres
Publié: (2025)
par: Gilberti, Miles, et autres
Publié: (2025)
Multi-Object Hallucination in Vision-Language Models
par: Chen, Xuweiyi, et autres
Publié: (2024)
par: Chen, Xuweiyi, et autres
Publié: (2024)
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
par: Joshi, Siddharth, et autres
Publié: (2025)
par: Joshi, Siddharth, et autres
Publié: (2025)
Inference Compute-Optimal Video Vision Language Models
par: Wang, Peiqi, et autres
Publié: (2025)
par: Wang, Peiqi, et autres
Publié: (2025)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
par: Dou, Zi-Yi, et autres
Publié: (2024)
par: Dou, Zi-Yi, et autres
Publié: (2024)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
par: Wang, Zhaowei, et autres
Publié: (2025)
par: Wang, Zhaowei, et autres
Publié: (2025)
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
par: Ganesan, Mugilan, et autres
Publié: (2025)
par: Ganesan, Mugilan, et autres
Publié: (2025)
Intriguing Properties of Large Language and Vision Models
par: Lee, Young-Jun, et autres
Publié: (2024)
par: Lee, Young-Jun, et autres
Publié: (2024)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
par: Diao, Xingjian, et autres
Publié: (2026)
par: Diao, Xingjian, et autres
Publié: (2026)
Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
Medical Context Distorts Decisions in Clinical Vision Language Models
par: Restrepo, David, et autres
Publié: (2026)
par: Restrepo, David, et autres
Publié: (2026)
The Mechanistic Emergence of Symbol Grounding in Language Models
par: Wu, Shuyu, et autres
Publié: (2025)
par: Wu, Shuyu, et autres
Publié: (2025)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
par: Chen, Yukang, et autres
Publié: (2024)
par: Chen, Yukang, et autres
Publié: (2024)
Conflict Adaptation in Vision-Language Models
par: Hu, Xiaoyang
Publié: (2025)
par: Hu, Xiaoyang
Publié: (2025)
The Role of Data Curation in Image Captioning
par: Li, Wenyan, et autres
Publié: (2023)
par: Li, Wenyan, et autres
Publié: (2023)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
par: Yu, Shoubin, et autres
Publié: (2025)
par: Yu, Shoubin, et autres
Publié: (2025)
No Tokens Wasted: Leveraging Long Context in Biomedical Vision-Language Models
par: Sun, Min Woo, et autres
Publié: (2025)
par: Sun, Min Woo, et autres
Publié: (2025)
Dual Tuning for Reasoning Efficacy-Driven Data Curation in Multimodal LLM Training
par: Zheng, Ruobing, et autres
Publié: (2026)
par: Zheng, Ruobing, et autres
Publié: (2026)
Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
par: Nazir, Maham, et autres
Publié: (2026)
par: Nazir, Maham, et autres
Publié: (2026)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
par: Hannan, Tanveer, et autres
Publié: (2024)
par: Hannan, Tanveer, et autres
Publié: (2024)
CROPE: Evaluating In-Context Adaptation of Vision and Language Models to Culture-Specific Concepts
par: Nikandrou, Malvina, et autres
Publié: (2024)
par: Nikandrou, Malvina, et autres
Publié: (2024)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models
par: Deng, Ruixuan, et autres
Publié: (2025)
par: Deng, Ruixuan, et autres
Publié: (2025)
Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
par: Stamatakis, Markos, et autres
Publié: (2025)
par: Stamatakis, Markos, et autres
Publié: (2025)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
par: Nguyen, Thong, et autres
Publié: (2023)
par: Nguyen, Thong, et autres
Publié: (2023)
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Documents similaires
-
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
par: Zhang, Zheyuan, et autres
Publié: (2024) -
Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models
par: Yu, Keunwoo Peter, et autres
Publié: (2025) -
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
par: Zha, Yuheng, et autres
Publié: (2025) -
Scalable Vision Language Model Training via High Quality Data Curation
par: Dong, Hongyuan, et autres
Publié: (2025) -
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
par: Ma, Ziqiao, et autres
Publié: (2023)