Breaking Language Barriers in Visual Language Models via Multilingual Textual Regularization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Pikabea, Iñigo, Lacunza, Iñaki, Pareras, Oriol, Escolano, Carlos, Gonzalez-Agirre, Aitor, Hernando, Javier, Villegas, Marta |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
XDoGE: Multilingual Data Reweighting to Enhance Language Inclusivity in LLMs
von: Lacunza, Iñaki, et al.
Veröffentlicht: (2025)
von: Lacunza, Iñaki, et al.
Veröffentlicht: (2025)
MrBERT: Modern Multilingual Encoders via Vocabulary, Domain, and Dimensional Adaptation
von: Tamayo, Daniel, et al.
Veröffentlicht: (2026)
von: Tamayo, Daniel, et al.
Veröffentlicht: (2026)
TABLET: A Large-Scale Dataset for Robust Visual Table Understanding
von: Alonso, Iñigo, et al.
Veröffentlicht: (2025)
von: Alonso, Iñigo, et al.
Veröffentlicht: (2025)
Mass-Editing Memory with Attention in Transformers: A cross-lingual exploration of knowledge
von: Tamayo, Daniel, et al.
Veröffentlicht: (2025)
von: Tamayo, Daniel, et al.
Veröffentlicht: (2025)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
von: Li, Handong, et al.
Veröffentlicht: (2025)
von: Li, Handong, et al.
Veröffentlicht: (2025)
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
von: Buitrago, Pol, et al.
Veröffentlicht: (2026)
von: Buitrago, Pol, et al.
Veröffentlicht: (2026)
PROCESO DE COMPARABILIDAD DE TITULACIONES DE EUSKARA Y ADECUACIÓN AL MARCO COMÚN EUROPEO DE REFERENCIA (MCER)
von: Iñaki Pikabea Torrano
Veröffentlicht: (2009)
von: Iñaki Pikabea Torrano
Veröffentlicht: (2009)
ACADATA: Parallel Dataset of Academic Data for Machine Translation
von: Lacunza, Iñaki, et al.
Veröffentlicht: (2025)
von: Lacunza, Iñaki, et al.
Veröffentlicht: (2025)
Breaking the Barriers: Video Vision Transformers for Word-Level Sign Language Recognition
von: Brettmann, Alexander, et al.
Veröffentlicht: (2025)
von: Brettmann, Alexander, et al.
Veröffentlicht: (2025)
TCP:Textual-based Class-aware Prompt tuning for Visual-Language Model
von: Yao, Hantao, et al.
Veröffentlicht: (2023)
von: Yao, Hantao, et al.
Veröffentlicht: (2023)
ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning
von: Luo, Wen, et al.
Veröffentlicht: (2026)
von: Luo, Wen, et al.
Veröffentlicht: (2026)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
von: Atuhurra, Jesse, et al.
Veröffentlicht: (2024)
von: Atuhurra, Jesse, et al.
Veröffentlicht: (2024)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
von: Feng, X., et al.
Veröffentlicht: (2024)
von: Feng, X., et al.
Veröffentlicht: (2024)
Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models
von: Liu, Jingming, et al.
Veröffentlicht: (2024)
von: Liu, Jingming, et al.
Veröffentlicht: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
von: Zhang, Beichen, et al.
Veröffentlicht: (2025)
von: Zhang, Beichen, et al.
Veröffentlicht: (2025)
SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
von: Chen, Hao, et al.
Veröffentlicht: (2024)
von: Chen, Hao, et al.
Veröffentlicht: (2024)
Adding simple structure at inference improves Vision-Language Compositionality
von: Miranda, Imanol, et al.
Veröffentlicht: (2025)
von: Miranda, Imanol, et al.
Veröffentlicht: (2025)
Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference
von: Miranda, Imanol, et al.
Veröffentlicht: (2026)
von: Miranda, Imanol, et al.
Veröffentlicht: (2026)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
von: Miranda, Imanol, et al.
Veröffentlicht: (2024)
von: Miranda, Imanol, et al.
Veröffentlicht: (2024)
Alleviating Textual Reliance in Medical Language-guided Segmentation via Prototype-driven Semantic Approximation
von: Ye, Shuchang, et al.
Veröffentlicht: (2025)
von: Ye, Shuchang, et al.
Veröffentlicht: (2025)
BiFold: Bimanual Cloth Folding with Language Guidance
von: Barbany, Oriol, et al.
Veröffentlicht: (2025)
von: Barbany, Oriol, et al.
Veröffentlicht: (2025)
Leveraging Large Language Models for Multimodal Search
von: Barbany, Oriol, et al.
Veröffentlicht: (2024)
von: Barbany, Oriol, et al.
Veröffentlicht: (2024)
Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
von: Buitrago, Pol, et al.
Veröffentlicht: (2026)
von: Buitrago, Pol, et al.
Veröffentlicht: (2026)
FontCLIP: A Semantic Typography Visual-Language Model for Multilingual Font Applications
von: Tatsukawa, Yuki, et al.
Veröffentlicht: (2024)
von: Tatsukawa, Yuki, et al.
Veröffentlicht: (2024)
Improving Explicit Spatial Relationships in Text-to-Image Generation through an Automatically Derived Dataset
von: Salaberria, Ander, et al.
Veröffentlicht: (2024)
von: Salaberria, Ander, et al.
Veröffentlicht: (2024)
Exploring Textual Semantics Diversity for Image Transmission in Semantic Communication Systems using Visual Language Model
von: Huang, Peishan, et al.
Veröffentlicht: (2025)
von: Huang, Peishan, et al.
Veröffentlicht: (2025)
Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
von: Gan, Woody Haosheng, et al.
Veröffentlicht: (2025)
von: Gan, Woody Haosheng, et al.
Veröffentlicht: (2025)
BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models
von: Gupta, Sunny, et al.
Veröffentlicht: (2026)
von: Gupta, Sunny, et al.
Veröffentlicht: (2026)
Visual Textualization for Image Prompted Object Detection
von: Wu, Yongjian, et al.
Veröffentlicht: (2025)
von: Wu, Yongjian, et al.
Veröffentlicht: (2025)
Textualize Visual Prompt for Image Editing via Diffusion Bridge
von: Xu, Pengcheng, et al.
Veröffentlicht: (2025)
von: Xu, Pengcheng, et al.
Veröffentlicht: (2025)
Breaking the Batch Barrier (B3) of Contrastive Learning via Smart Batch Mining
von: Thirukovalluru, Raghuveer, et al.
Veröffentlicht: (2025)
von: Thirukovalluru, Raghuveer, et al.
Veröffentlicht: (2025)
Context-Aware Multi-Turn Visual-Textual Reasoning in LVLMs via Dynamic Memory and Adaptive Visual Guidance
von: Shen, Weijie, et al.
Veröffentlicht: (2025)
von: Shen, Weijie, et al.
Veröffentlicht: (2025)
Breaking the Discretization Barrier of Continuous Physics Simulation Learning
von: Xu, Fan, et al.
Veröffentlicht: (2025)
von: Xu, Fan, et al.
Veröffentlicht: (2025)
LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining
von: Shen, Huawen, et al.
Veröffentlicht: (2024)
von: Shen, Huawen, et al.
Veröffentlicht: (2024)
A Similarity Paradigm Through Textual Regularization Without Forgetting
von: Cui, Fangming, et al.
Veröffentlicht: (2025)
von: Cui, Fangming, et al.
Veröffentlicht: (2025)
Visual and Textual Prompts in VLLMs for Enhancing Emotion Recognition
von: Wang, Zhifeng, et al.
Veröffentlicht: (2025)
von: Wang, Zhifeng, et al.
Veröffentlicht: (2025)
Unleashing the Power of Image-Tabular Self-Supervised Learning via Breaking Cross-Tabular Barriers
von: Fu, Yibing, et al.
Veröffentlicht: (2025)
von: Fu, Yibing, et al.
Veröffentlicht: (2025)
Breaking Barriers in Physical-World Adversarial Examples: Improving Robustness and Transferability via Robust Feature
von: Wang, Yichen, et al.
Veröffentlicht: (2024)
von: Wang, Yichen, et al.
Veröffentlicht: (2024)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
von: Cai, Chengyi, et al.
Veröffentlicht: (2026)
von: Cai, Chengyi, et al.
Veröffentlicht: (2026)
Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
von: Wang, Enguang, et al.
Veröffentlicht: (2026)
von: Wang, Enguang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
XDoGE: Multilingual Data Reweighting to Enhance Language Inclusivity in LLMs
von: Lacunza, Iñaki, et al.
Veröffentlicht: (2025) -
MrBERT: Modern Multilingual Encoders via Vocabulary, Domain, and Dimensional Adaptation
von: Tamayo, Daniel, et al.
Veröffentlicht: (2026) -
TABLET: A Large-Scale Dataset for Robust Visual Table Understanding
von: Alonso, Iñigo, et al.
Veröffentlicht: (2025) -
Mass-Editing Memory with Attention in Transformers: A cross-lingual exploration of knowledge
von: Tamayo, Daniel, et al.
Veröffentlicht: (2025) -
Breaking the Encoder Barrier for Seamless Video-Language Understanding
von: Li, Handong, et al.
Veröffentlicht: (2025)