ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fields, Clayton, Kennington, Casey |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Renaissance: Investigating the Pretraining of Vision-Language Encoders
von: Fields, Clayton, et al.
Veröffentlicht: (2024)
von: Fields, Clayton, et al.
Veröffentlicht: (2024)
Evaluating Vision Language Model Adaptations for Radiology Report Generation in Low-Resource Languages
von: Salmè, Marco, et al.
Veröffentlicht: (2025)
von: Salmè, Marco, et al.
Veröffentlicht: (2025)
PromptSync: Bridging Domain Gaps in Vision-Language Models through Class-Aware Prototype Alignment and Discrimination
von: Khandelwal, Anant
Veröffentlicht: (2024)
von: Khandelwal, Anant
Veröffentlicht: (2024)
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
von: Zhang, Jipeng, et al.
Veröffentlicht: (2025)
von: Zhang, Jipeng, et al.
Veröffentlicht: (2025)
LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task
von: Asgarov, Ali, et al.
Veröffentlicht: (2024)
von: Asgarov, Ali, et al.
Veröffentlicht: (2024)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
von: Wu, Xueqing, et al.
Veröffentlicht: (2026)
von: Wu, Xueqing, et al.
Veröffentlicht: (2026)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
von: Wen, Yuxin, et al.
Veröffentlicht: (2024)
von: Wen, Yuxin, et al.
Veröffentlicht: (2024)
Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models
von: Gröpl, Marcel, et al.
Veröffentlicht: (2026)
von: Gröpl, Marcel, et al.
Veröffentlicht: (2026)
Scalable Vision Language Model Training via High Quality Data Curation
von: Dong, Hongyuan, et al.
Veröffentlicht: (2025)
von: Dong, Hongyuan, et al.
Veröffentlicht: (2025)
Lifelong Knowledge Editing for Vision Language Models with Low-Rank Mixture-of-Experts
von: Chen, Qizhou, et al.
Veröffentlicht: (2024)
von: Chen, Qizhou, et al.
Veröffentlicht: (2024)
CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers
von: Shi, Dachuan, et al.
Veröffentlicht: (2023)
von: Shi, Dachuan, et al.
Veröffentlicht: (2023)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
von: Lim, Qi Zhi, et al.
Veröffentlicht: (2025)
von: Lim, Qi Zhi, et al.
Veröffentlicht: (2025)
SentiMaithili: A Benchmark Dataset for Sentiment and Reason Generation for the Low-Resource Maithili Language
von: Ranjan, Rahul, et al.
Veröffentlicht: (2025)
von: Ranjan, Rahul, et al.
Veröffentlicht: (2025)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
von: Wu, Juncheng, et al.
Veröffentlicht: (2026)
von: Wu, Juncheng, et al.
Veröffentlicht: (2026)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
von: Nguyen, Thong, et al.
Veröffentlicht: (2023)
von: Nguyen, Thong, et al.
Veröffentlicht: (2023)
VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters
von: Fan, Jiaxin, et al.
Veröffentlicht: (2026)
von: Fan, Jiaxin, et al.
Veröffentlicht: (2026)
Improved Visually Prompted Keyword Localisation in Real Low-Resource Settings
von: Nortje, Leanne, et al.
Veröffentlicht: (2024)
von: Nortje, Leanne, et al.
Veröffentlicht: (2024)
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
von: Lee, Seongyun, et al.
Veröffentlicht: (2024)
von: Lee, Seongyun, et al.
Veröffentlicht: (2024)
RoundTripOCR: A Data Generation Technique for Enhancing Post-OCR Error Correction in Low-Resource Devanagari Languages
von: Kashid, Harshvivek, et al.
Veröffentlicht: (2024)
von: Kashid, Harshvivek, et al.
Veröffentlicht: (2024)
Towards Compact Sign Language Translation: Frame Rate and Model Size Trade-offs
von: Chen, Kuanwei, et al.
Veröffentlicht: (2026)
von: Chen, Kuanwei, et al.
Veröffentlicht: (2026)
Matryoshka Query Transformer for Large Vision-Language Models
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
von: Wang, Weihang, et al.
Veröffentlicht: (2025)
von: Wang, Weihang, et al.
Veröffentlicht: (2025)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
von: Chen, Siyi, et al.
Veröffentlicht: (2026)
von: Chen, Siyi, et al.
Veröffentlicht: (2026)
S-GRPO: Unified Post-Training for Large Vision-Language Models
von: Yan, Yuming, et al.
Veröffentlicht: (2026)
von: Yan, Yuming, et al.
Veröffentlicht: (2026)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
von: Cai, Hengxing, et al.
Veröffentlicht: (2025)
von: Cai, Hengxing, et al.
Veröffentlicht: (2025)
End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering
von: Goetting, Dylan, et al.
Veröffentlicht: (2024)
von: Goetting, Dylan, et al.
Veröffentlicht: (2024)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
von: Ye, Jiacheng, et al.
Veröffentlicht: (2025)
von: Ye, Jiacheng, et al.
Veröffentlicht: (2025)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
von: Chen, Yangyi, et al.
Veröffentlicht: (2024)
von: Chen, Yangyi, et al.
Veröffentlicht: (2024)
CHURRO: Making History Readable with an Open-Weight Large Vision-Language Model for High-Accuracy, Low-Cost Historical Text Recognition
von: Semnani, Sina J., et al.
Veröffentlicht: (2025)
von: Semnani, Sina J., et al.
Veröffentlicht: (2025)
Small Vision-Language Models: A Survey on Compact Architectures and Techniques
von: Patnaik, Nitesh, et al.
Veröffentlicht: (2025)
von: Patnaik, Nitesh, et al.
Veröffentlicht: (2025)
Conflict Adaptation in Vision-Language Models
von: Hu, Xiaoyang
Veröffentlicht: (2025)
von: Hu, Xiaoyang
Veröffentlicht: (2025)
Vision Language Models are Confused Tourists
von: Irawan, Patrick Amadeus, et al.
Veröffentlicht: (2025)
von: Irawan, Patrick Amadeus, et al.
Veröffentlicht: (2025)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
von: Chen, Yangyi, et al.
Veröffentlicht: (2025)
von: Chen, Yangyi, et al.
Veröffentlicht: (2025)
Natural Language Inference Improves Compositionality in Vision-Language Models
von: Cascante-Bonilla, Paola, et al.
Veröffentlicht: (2024)
von: Cascante-Bonilla, Paola, et al.
Veröffentlicht: (2024)
Do Vision-Language Models Really Understand Visual Language?
von: Hou, Yifan, et al.
Veröffentlicht: (2024)
von: Hou, Yifan, et al.
Veröffentlicht: (2024)
Behind Maya: Building a Multilingual Vision Language Model
von: Alam, Nahid, et al.
Veröffentlicht: (2025)
von: Alam, Nahid, et al.
Veröffentlicht: (2025)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
von: Kang, Jialiang, et al.
Veröffentlicht: (2025)
von: Kang, Jialiang, et al.
Veröffentlicht: (2025)
MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs
von: Gao, Yufei, et al.
Veröffentlicht: (2025)
von: Gao, Yufei, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Renaissance: Investigating the Pretraining of Vision-Language Encoders
von: Fields, Clayton, et al.
Veröffentlicht: (2024) -
Evaluating Vision Language Model Adaptations for Radiology Report Generation in Low-Resource Languages
von: Salmè, Marco, et al.
Veröffentlicht: (2025) -
PromptSync: Bridging Domain Gaps in Vision-Language Models through Class-Aware Prototype Alignment and Discrimination
von: Khandelwal, Anant
Veröffentlicht: (2024) -
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
von: Zhang, Jipeng, et al.
Veröffentlicht: (2025) -
LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task
von: Asgarov, Ali, et al.
Veröffentlicht: (2024)