Breaking Language Barriers in Visual Language Models via Multilingual Textual Regularization
Fuente:
arXiv
Salvato in:
| Autori principali: | Pikabea, Iñigo, Lacunza, Iñaki, Pareras, Oriol, Escolano, Carlos, Gonzalez-Agirre, Aitor, Hernando, Javier, Villegas, Marta |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
XDoGE: Multilingual Data Reweighting to Enhance Language Inclusivity in LLMs
di: Lacunza, Iñaki, et al.
Pubblicazione: (2025)
di: Lacunza, Iñaki, et al.
Pubblicazione: (2025)
MrBERT: Modern Multilingual Encoders via Vocabulary, Domain, and Dimensional Adaptation
di: Tamayo, Daniel, et al.
Pubblicazione: (2026)
di: Tamayo, Daniel, et al.
Pubblicazione: (2026)
TABLET: A Large-Scale Dataset for Robust Visual Table Understanding
di: Alonso, Iñigo, et al.
Pubblicazione: (2025)
di: Alonso, Iñigo, et al.
Pubblicazione: (2025)
Mass-Editing Memory with Attention in Transformers: A cross-lingual exploration of knowledge
di: Tamayo, Daniel, et al.
Pubblicazione: (2025)
di: Tamayo, Daniel, et al.
Pubblicazione: (2025)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
di: Li, Handong, et al.
Pubblicazione: (2025)
di: Li, Handong, et al.
Pubblicazione: (2025)
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
PROCESO DE COMPARABILIDAD DE TITULACIONES DE EUSKARA Y ADECUACIÓN AL MARCO COMÚN EUROPEO DE REFERENCIA (MCER)
di: Iñaki Pikabea Torrano
Pubblicazione: (2009)
di: Iñaki Pikabea Torrano
Pubblicazione: (2009)
ACADATA: Parallel Dataset of Academic Data for Machine Translation
di: Lacunza, Iñaki, et al.
Pubblicazione: (2025)
di: Lacunza, Iñaki, et al.
Pubblicazione: (2025)
Breaking the Barriers: Video Vision Transformers for Word-Level Sign Language Recognition
di: Brettmann, Alexander, et al.
Pubblicazione: (2025)
di: Brettmann, Alexander, et al.
Pubblicazione: (2025)
TCP:Textual-based Class-aware Prompt tuning for Visual-Language Model
di: Yao, Hantao, et al.
Pubblicazione: (2023)
di: Yao, Hantao, et al.
Pubblicazione: (2023)
ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning
di: Luo, Wen, et al.
Pubblicazione: (2026)
di: Luo, Wen, et al.
Pubblicazione: (2026)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
di: Atuhurra, Jesse, et al.
Pubblicazione: (2024)
di: Atuhurra, Jesse, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
di: Feng, X., et al.
Pubblicazione: (2024)
di: Feng, X., et al.
Pubblicazione: (2024)
Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models
di: Liu, Jingming, et al.
Pubblicazione: (2024)
di: Liu, Jingming, et al.
Pubblicazione: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
Adding simple structure at inference improves Vision-Language Compositionality
di: Miranda, Imanol, et al.
Pubblicazione: (2025)
di: Miranda, Imanol, et al.
Pubblicazione: (2025)
Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference
di: Miranda, Imanol, et al.
Pubblicazione: (2026)
di: Miranda, Imanol, et al.
Pubblicazione: (2026)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
di: Miranda, Imanol, et al.
Pubblicazione: (2024)
di: Miranda, Imanol, et al.
Pubblicazione: (2024)
Alleviating Textual Reliance in Medical Language-guided Segmentation via Prototype-driven Semantic Approximation
di: Ye, Shuchang, et al.
Pubblicazione: (2025)
di: Ye, Shuchang, et al.
Pubblicazione: (2025)
BiFold: Bimanual Cloth Folding with Language Guidance
di: Barbany, Oriol, et al.
Pubblicazione: (2025)
di: Barbany, Oriol, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Multimodal Search
di: Barbany, Oriol, et al.
Pubblicazione: (2024)
di: Barbany, Oriol, et al.
Pubblicazione: (2024)
Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
FontCLIP: A Semantic Typography Visual-Language Model for Multilingual Font Applications
di: Tatsukawa, Yuki, et al.
Pubblicazione: (2024)
di: Tatsukawa, Yuki, et al.
Pubblicazione: (2024)
Improving Explicit Spatial Relationships in Text-to-Image Generation through an Automatically Derived Dataset
di: Salaberria, Ander, et al.
Pubblicazione: (2024)
di: Salaberria, Ander, et al.
Pubblicazione: (2024)
Exploring Textual Semantics Diversity for Image Transmission in Semantic Communication Systems using Visual Language Model
di: Huang, Peishan, et al.
Pubblicazione: (2025)
di: Huang, Peishan, et al.
Pubblicazione: (2025)
Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
di: Gan, Woody Haosheng, et al.
Pubblicazione: (2025)
di: Gan, Woody Haosheng, et al.
Pubblicazione: (2025)
BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models
di: Gupta, Sunny, et al.
Pubblicazione: (2026)
di: Gupta, Sunny, et al.
Pubblicazione: (2026)
Visual Textualization for Image Prompted Object Detection
di: Wu, Yongjian, et al.
Pubblicazione: (2025)
di: Wu, Yongjian, et al.
Pubblicazione: (2025)
Textualize Visual Prompt for Image Editing via Diffusion Bridge
di: Xu, Pengcheng, et al.
Pubblicazione: (2025)
di: Xu, Pengcheng, et al.
Pubblicazione: (2025)
Breaking the Batch Barrier (B3) of Contrastive Learning via Smart Batch Mining
di: Thirukovalluru, Raghuveer, et al.
Pubblicazione: (2025)
di: Thirukovalluru, Raghuveer, et al.
Pubblicazione: (2025)
Context-Aware Multi-Turn Visual-Textual Reasoning in LVLMs via Dynamic Memory and Adaptive Visual Guidance
di: Shen, Weijie, et al.
Pubblicazione: (2025)
di: Shen, Weijie, et al.
Pubblicazione: (2025)
Breaking the Discretization Barrier of Continuous Physics Simulation Learning
di: Xu, Fan, et al.
Pubblicazione: (2025)
di: Xu, Fan, et al.
Pubblicazione: (2025)
LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining
di: Shen, Huawen, et al.
Pubblicazione: (2024)
di: Shen, Huawen, et al.
Pubblicazione: (2024)
A Similarity Paradigm Through Textual Regularization Without Forgetting
di: Cui, Fangming, et al.
Pubblicazione: (2025)
di: Cui, Fangming, et al.
Pubblicazione: (2025)
Visual and Textual Prompts in VLLMs for Enhancing Emotion Recognition
di: Wang, Zhifeng, et al.
Pubblicazione: (2025)
di: Wang, Zhifeng, et al.
Pubblicazione: (2025)
Unleashing the Power of Image-Tabular Self-Supervised Learning via Breaking Cross-Tabular Barriers
di: Fu, Yibing, et al.
Pubblicazione: (2025)
di: Fu, Yibing, et al.
Pubblicazione: (2025)
Breaking Barriers in Physical-World Adversarial Examples: Improving Robustness and Transferability via Robust Feature
di: Wang, Yichen, et al.
Pubblicazione: (2024)
di: Wang, Yichen, et al.
Pubblicazione: (2024)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
di: Cai, Chengyi, et al.
Pubblicazione: (2026)
di: Cai, Chengyi, et al.
Pubblicazione: (2026)
Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
di: Wang, Enguang, et al.
Pubblicazione: (2026)
di: Wang, Enguang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
XDoGE: Multilingual Data Reweighting to Enhance Language Inclusivity in LLMs
di: Lacunza, Iñaki, et al.
Pubblicazione: (2025) -
MrBERT: Modern Multilingual Encoders via Vocabulary, Domain, and Dimensional Adaptation
di: Tamayo, Daniel, et al.
Pubblicazione: (2026) -
TABLET: A Large-Scale Dataset for Robust Visual Table Understanding
di: Alonso, Iñigo, et al.
Pubblicazione: (2025) -
Mass-Editing Memory with Attention in Transformers: A cross-lingual exploration of knowledge
di: Tamayo, Daniel, et al.
Pubblicazione: (2025) -
Breaking the Encoder Barrier for Seamless Video-Language Understanding
di: Li, Handong, et al.
Pubblicazione: (2025)