Language-Conditioned Visual Grounding with CLIP Multilingual
Fuente:
arXiv
Guardado en:
| Autores principales: | de Curtò, J., Liz, Mauro, de Zarzà, I. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models
por: de Curtò, J., et al.
Publicado: (2025)
por: de Curtò, J., et al.
Publicado: (2025)
Semantic Invariance in Agentic AI
por: de Zarzà, I., et al.
Publicado: (2026)
por: de Zarzà, I., et al.
Publicado: (2026)
ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation
por: Ciesiółka, Michał, et al.
Publicado: (2026)
por: Ciesiółka, Michał, et al.
Publicado: (2026)
ValueGround: Evaluating Culture-Conditioned Visual Value Grounding in MLLMs
por: Wang, Zhipin, et al.
Publicado: (2026)
por: Wang, Zhipin, et al.
Publicado: (2026)
PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts
por: An, Bang, et al.
Publicado: (2023)
por: An, Bang, et al.
Publicado: (2023)
LLM Constitutional Multi-Agent Governance
por: de Curtò, J., et al.
Publicado: (2026)
por: de Curtò, J., et al.
Publicado: (2026)
Grounding Multilingual Multimodal LLMs With Cultural Knowledge
por: Nyandwi, Jean de Dieu, et al.
Publicado: (2025)
por: Nyandwi, Jean de Dieu, et al.
Publicado: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
por: Atuhurra, Jesse, et al.
Publicado: (2024)
por: Atuhurra, Jesse, et al.
Publicado: (2024)
Don't Learn, Ground: A Case for Natural Language Inference with Visual Grounding
por: Ignatev, Daniil, et al.
Publicado: (2025)
por: Ignatev, Daniil, et al.
Publicado: (2025)
Conditions for Catastrophic Forgetting in Multilingual Translation
por: Liu, Danni, et al.
Publicado: (2025)
por: Liu, Danni, et al.
Publicado: (2025)
Multilingual Large Language Models and Curse of Multilinguality
por: Gurgurov, Daniil, et al.
Publicado: (2024)
por: Gurgurov, Daniil, et al.
Publicado: (2024)
Grounding Language Models for Visual Entity Recognition
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia
por: Tasawong, Panuthep, et al.
Publicado: (2026)
por: Tasawong, Panuthep, et al.
Publicado: (2026)
The Roles of English in Evaluating Multilingual Language Models
por: Poelman, Wessel, et al.
Publicado: (2024)
por: Poelman, Wessel, et al.
Publicado: (2024)
Towards Corpus-Grounded Agentic LLMs for Multilingual Grammatical Analysis
por: Klemen, Matej, et al.
Publicado: (2025)
por: Klemen, Matej, et al.
Publicado: (2025)
Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?
por: Gomes, Gonçalo, et al.
Publicado: (2025)
por: Gomes, Gonçalo, et al.
Publicado: (2025)
Pruning Multilingual Large Language Models for Multilingual Inference
por: Kim, Hwichan, et al.
Publicado: (2024)
por: Kim, Hwichan, et al.
Publicado: (2024)
GroundCocoa: A Benchmark for Evaluating Compositional & Conditional Reasoning in Language Models
por: Kohli, Harsh, et al.
Publicado: (2024)
por: Kohli, Harsh, et al.
Publicado: (2024)
Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages
por: Puranegedara, Imalsha, et al.
Publicado: (2025)
por: Puranegedara, Imalsha, et al.
Publicado: (2025)
The Curious Case of Visual Grounding: Different Effects for Speech- and Text-based Language Encoders
por: Sauter, Adrian, et al.
Publicado: (2025)
por: Sauter, Adrian, et al.
Publicado: (2025)
EVJVQA Challenge: Multilingual Visual Question Answering
por: Nguyen, Ngan Luu-Thuy, et al.
Publicado: (2023)
por: Nguyen, Ngan Luu-Thuy, et al.
Publicado: (2023)
Culturally-Grounded Governance for Multilingual Language Models: Rights, Data Boundaries, and Accountable AI Design
por: Shi, Hanjing, et al.
Publicado: (2026)
por: Shi, Hanjing, et al.
Publicado: (2026)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
por: Zhao, Yunhan, et al.
Publicado: (2026)
por: Zhao, Yunhan, et al.
Publicado: (2026)
SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages
por: Kautsar, Muhammad Dehan Al, et al.
Publicado: (2025)
por: Kautsar, Muhammad Dehan Al, et al.
Publicado: (2025)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
por: Xu, Xiaoxu, et al.
Publicado: (2023)
por: Xu, Xiaoxu, et al.
Publicado: (2023)
TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives
por: Patel, Maitreya, et al.
Publicado: (2024)
por: Patel, Maitreya, et al.
Publicado: (2024)
From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation
por: Pan, Yu, et al.
Publicado: (2026)
por: Pan, Yu, et al.
Publicado: (2026)
EuroLLM: Multilingual Language Models for Europe
por: Martins, Pedro Henrique, et al.
Publicado: (2024)
por: Martins, Pedro Henrique, et al.
Publicado: (2024)
Does Visual Grounding Enhance the Understanding of Embodied Knowledge in Large Language Models?
por: Yang, Zhihui, et al.
Publicado: (2025)
por: Yang, Zhihui, et al.
Publicado: (2025)
Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings
por: Huemann, Zachary, et al.
Publicado: (2025)
por: Huemann, Zachary, et al.
Publicado: (2025)
FactNet: A Billion-Scale Knowledge Graph for Multilingual Factual Grounding
por: Shen, Yingli, et al.
Publicado: (2026)
por: Shen, Yingli, et al.
Publicado: (2026)
Toward Responsible and Epistemically Grounded Multilingual LLMs for Computational Social Science and Humanities
por: Zaghouani, Wajdi
Publicado: (2026)
por: Zaghouani, Wajdi
Publicado: (2026)
MultiHal: Multilingual Dataset for Knowledge-Graph Grounded Evaluation of LLM Hallucinations
por: Lavrinovics, Ernests, et al.
Publicado: (2025)
por: Lavrinovics, Ernests, et al.
Publicado: (2025)
Dictionary Insertion Prompting for Multilingual Reasoning on Multilingual Large Language Models
por: Lu, Hongyuan, et al.
Publicado: (2024)
por: Lu, Hongyuan, et al.
Publicado: (2024)
What Is Missing in Multilingual Visual Reasoning and How to Fix It
por: Song, Yueqi, et al.
Publicado: (2024)
por: Song, Yueqi, et al.
Publicado: (2024)
Is CLIP Cross-Eyed? Revealing and Mitigating Center Bias in the CLIP Family
por: Chew, Oscar, et al.
Publicado: (2026)
por: Chew, Oscar, et al.
Publicado: (2026)
Language Surgery in Multilingual Large Language Models
por: Lopo, Joanito Agili, et al.
Publicado: (2025)
por: Lopo, Joanito Agili, et al.
Publicado: (2025)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
por: Chaffin, Antoine, et al.
Publicado: (2024)
por: Chaffin, Antoine, et al.
Publicado: (2024)
LINGO-Space: Language-Conditioned Incremental Grounding for Space
por: Kim, Dohyun, et al.
Publicado: (2024)
por: Kim, Dohyun, et al.
Publicado: (2024)
LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining
por: Shen, Huawen, et al.
Publicado: (2024)
por: Shen, Huawen, et al.
Publicado: (2024)
Ejemplares similares
-
Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models
por: de Curtò, J., et al.
Publicado: (2025) -
Semantic Invariance in Agentic AI
por: de Zarzà, I., et al.
Publicado: (2026) -
ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation
por: Ciesiółka, Michał, et al.
Publicado: (2026) -
ValueGround: Evaluating Culture-Conditioned Visual Value Grounding in MLLMs
por: Wang, Zhipin, et al.
Publicado: (2026) -
PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts
por: An, Bang, et al.
Publicado: (2023)