Analyzing the Roles of Language and Vision in Learning from Limited Data
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Allison, Sucholutsky, Ilia, Russakovsky, Olga, Griffiths, Thomas L. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ICONS: Influence Consensus for Vision-Language Data Selection
por: Wu, Xindi, et al.
Publicado: (2024)
por: Wu, Xindi, et al.
Publicado: (2024)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
por: Jiang, Jiachen, et al.
Publicado: (2025)
por: Jiang, Jiachen, et al.
Publicado: (2025)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
por: Villegas, Danae Sánchez, et al.
Publicado: (2026)
por: Villegas, Danae Sánchez, et al.
Publicado: (2026)
Differentiable Prompt Learning for Vision Language Models
por: Huang, Zhenhan, et al.
Publicado: (2024)
por: Huang, Zhenhan, et al.
Publicado: (2024)
Analyzing The Language of Visual Tokens
por: Chan, David M., et al.
Publicado: (2024)
por: Chan, David M., et al.
Publicado: (2024)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
por: Zang, Yuan, et al.
Publicado: (2024)
por: Zang, Yuan, et al.
Publicado: (2024)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
por: Yang, Senqiao, et al.
Publicado: (2025)
por: Yang, Senqiao, et al.
Publicado: (2025)
LLaRA: Supercharging Robot Learning Data for Vision-Language Policy
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Developing Lightweight DNN Models With Limited Data For Real-Time Sign Language Recognition
por: Nikitin, Nikita, et al.
Publicado: (2025)
por: Nikitin, Nikita, et al.
Publicado: (2025)
VisionZip: Longer is Better but Not Necessary in Vision Language Models
por: Yang, Senqiao, et al.
Publicado: (2024)
por: Yang, Senqiao, et al.
Publicado: (2024)
CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception
por: Carvalho, Miguel, et al.
Publicado: (2025)
por: Carvalho, Miguel, et al.
Publicado: (2025)
Seeing Beyond the Scene: Analyzing and Mitigating Background Bias in Action Recognition
por: Zhou, Ellie, et al.
Publicado: (2025)
por: Zhou, Ellie, et al.
Publicado: (2025)
Large Language Models Assume People are More Rational than We Really are
por: Liu, Ryan, et al.
Publicado: (2024)
por: Liu, Ryan, et al.
Publicado: (2024)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
por: Li, Chen-An, et al.
Publicado: (2025)
por: Li, Chen-An, et al.
Publicado: (2025)
Exploring Transfer Learning in Medical Image Segmentation using Vision-Language Models
por: Poudel, Kanchan, et al.
Publicado: (2023)
por: Poudel, Kanchan, et al.
Publicado: (2023)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
por: Huang, Chengyue, et al.
Publicado: (2025)
por: Huang, Chengyue, et al.
Publicado: (2025)
Feedback-Driven Vision-Language Alignment with Minimal Human Supervision
por: Giannone, Giorgio, et al.
Publicado: (2025)
por: Giannone, Giorgio, et al.
Publicado: (2025)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
por: Lan, Zhibin, et al.
Publicado: (2025)
por: Lan, Zhibin, et al.
Publicado: (2025)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
por: He, Hulingxiao, et al.
Publicado: (2025)
por: He, Hulingxiao, et al.
Publicado: (2025)
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
por: Panos, Aristeidis, et al.
Publicado: (2024)
por: Panos, Aristeidis, et al.
Publicado: (2024)
Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models
por: Wu, Junjie, et al.
Publicado: (2024)
por: Wu, Junjie, et al.
Publicado: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
por: Sun, Guohao, et al.
Publicado: (2024)
por: Sun, Guohao, et al.
Publicado: (2024)
Exploring Curriculum Learning for Vision-Language Tasks: A Study on Small-Scale Multimodal Training
por: Saha, Rohan, et al.
Publicado: (2024)
por: Saha, Rohan, et al.
Publicado: (2024)
Examining Modality Incongruity in Multimodal Federated Learning for Medical Vision and Language-based Disease Detection
por: Saha, Pramit, et al.
Publicado: (2024)
por: Saha, Pramit, et al.
Publicado: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
por: Zhai, Yuexiang, et al.
Publicado: (2024)
por: Zhai, Yuexiang, et al.
Publicado: (2024)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
por: Lin, Zichuan, et al.
Publicado: (2025)
por: Lin, Zichuan, et al.
Publicado: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
Internal Activation Revision: Safeguarding Vision Language Models Without Parameter Update
por: Li, Qing, et al.
Publicado: (2025)
por: Li, Qing, et al.
Publicado: (2025)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
por: Nguyen, Phu-Vinh, et al.
Publicado: (2025)
por: Nguyen, Phu-Vinh, et al.
Publicado: (2025)
Vision-Language Model Based Handwriting Verification
por: Chauhan, Mihir, et al.
Publicado: (2024)
por: Chauhan, Mihir, et al.
Publicado: (2024)
How Culturally Aware are Vision-Language Models?
por: Burda-Lassen, Olena, et al.
Publicado: (2024)
por: Burda-Lassen, Olena, et al.
Publicado: (2024)
Renaissance: Investigating the Pretraining of Vision-Language Encoders
por: Fields, Clayton, et al.
Publicado: (2024)
por: Fields, Clayton, et al.
Publicado: (2024)
MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models
por: Kim, Soo Yong, et al.
Publicado: (2025)
por: Kim, Soo Yong, et al.
Publicado: (2025)
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
MouSi: Poly-Visual-Expert Vision-Language Models
por: Fan, Xiaoran, et al.
Publicado: (2024)
por: Fan, Xiaoran, et al.
Publicado: (2024)
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
por: Deng, Ailin, et al.
Publicado: (2025)
por: Deng, Ailin, et al.
Publicado: (2025)
Small Vision-Language Models are Smart Compressors for Long Video Understanding
por: Fei, Junjie, et al.
Publicado: (2026)
por: Fei, Junjie, et al.
Publicado: (2026)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
por: Zeng, Yu, et al.
Publicado: (2026)
por: Zeng, Yu, et al.
Publicado: (2026)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
por: Lavoie, Samuel, et al.
Publicado: (2024)
por: Lavoie, Samuel, et al.
Publicado: (2024)
Ejemplares similares
-
ICONS: Influence Consensus for Vision-Language Data Selection
por: Wu, Xindi, et al.
Publicado: (2024) -
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
por: Jiang, Jiachen, et al.
Publicado: (2025) -
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
por: Villegas, Danae Sánchez, et al.
Publicado: (2026) -
Differentiable Prompt Learning for Vision Language Models
por: Huang, Zhenhan, et al.
Publicado: (2024) -
Analyzing The Language of Visual Tokens
por: Chan, David M., et al.
Publicado: (2024)