Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Irawan, Patrick Amadeus, Winata, Genta Indra, Cahyawijaya, Samuel, Purwarianti, Ayu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
What Causes Knowledge Loss in Multilingual Language Models?
di: Khelli, Maria, et al.
Pubblicazione: (2025)
di: Khelli, Maria, et al.
Pubblicazione: (2025)
Vision Language Models are Confused Tourists
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)
LinguAlchemy: Fusing Typological and Geographical Elements for Unseen Language Generalization
di: Adilazuarda, Muhammad Farid, et al.
Pubblicazione: (2024)
di: Adilazuarda, Muhammad Farid, et al.
Pubblicazione: (2024)
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
di: Anugraha, David, et al.
Pubblicazione: (2025)
di: Anugraha, David, et al.
Pubblicazione: (2025)
Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations
di: Merin, Adril Putra, et al.
Pubblicazione: (2026)
di: Merin, Adril Putra, et al.
Pubblicazione: (2026)
ProxyLM: Predicting Language Model Performance on Multilingual Tasks via Proxy Models
di: Anugraha, David, et al.
Pubblicazione: (2024)
di: Anugraha, David, et al.
Pubblicazione: (2024)
IndoPref: A Multi-Domain Pairwise Preference Dataset for Indonesian
di: Wiyono, Vanessa Rebecca, et al.
Pubblicazione: (2025)
di: Wiyono, Vanessa Rebecca, et al.
Pubblicazione: (2025)
Entropy2Vec: Crosslingual Language Modeling Entropy as End-to-End Learnable Language Representations
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2026)
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2026)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
di: Yeh, Yahsin, et al.
Pubblicazione: (2025)
di: Yeh, Yahsin, et al.
Pubblicazione: (2025)
MetaMetrics: Calibrating Metrics For Generation Tasks Using Human Preferences
di: Winata, Genta Indra, et al.
Pubblicazione: (2024)
di: Winata, Genta Indra, et al.
Pubblicazione: (2024)
Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models
di: Lovenia, Holy, et al.
Pubblicazione: (2023)
di: Lovenia, Holy, et al.
Pubblicazione: (2023)
Cendol: Open Instruction-tuned Generative Large Language Models for Indonesian Languages
di: Cahyawijaya, Samuel, et al.
Pubblicazione: (2024)
di: Cahyawijaya, Samuel, et al.
Pubblicazione: (2024)
Preference Tuning with Human Feedback on Language, Speech, and Vision Tasks: A Survey
di: Winata, Genta Indra, et al.
Pubblicazione: (2024)
di: Winata, Genta Indra, et al.
Pubblicazione: (2024)
Datasheets Aren't Enough: DataRubrics for Automated Quality Metrics and Accountability
di: Winata, Genta Indra, et al.
Pubblicazione: (2025)
di: Winata, Genta Indra, et al.
Pubblicazione: (2025)
Linguistics Theory Meets LLM: Code-Switched Text Generation via Equivalence Constrained Large Language Models
di: Kuwanto, Garry, et al.
Pubblicazione: (2024)
di: Kuwanto, Garry, et al.
Pubblicazione: (2024)
MINERS: Multilingual Language Models as Semantic Retrievers
di: Winata, Genta Indra, et al.
Pubblicazione: (2024)
di: Winata, Genta Indra, et al.
Pubblicazione: (2024)
Behind Maya: Building a Multilingual Vision Language Model
di: Alam, Nahid, et al.
Pubblicazione: (2025)
di: Alam, Nahid, et al.
Pubblicazione: (2025)
Language Surgery in Multilingual Large Language Models
di: Lopo, Joanito Agili, et al.
Pubblicazione: (2025)
di: Lopo, Joanito Agili, et al.
Pubblicazione: (2025)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
di: Zhu, Wenhui, et al.
Pubblicazione: (2025)
di: Zhu, Wenhui, et al.
Pubblicazione: (2025)
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
di: Shahgir, Haz Sameen, et al.
Pubblicazione: (2024)
di: Shahgir, Haz Sameen, et al.
Pubblicazione: (2024)
Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA
di: Karim, A H M Rezaul, et al.
Pubblicazione: (2025)
di: Karim, A H M Rezaul, et al.
Pubblicazione: (2025)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
di: Kim, Yoonshik, et al.
Pubblicazione: (2025)
di: Kim, Yoonshik, et al.
Pubblicazione: (2025)
Subobject-level Image Tokenization
di: Chen, Delong, et al.
Pubblicazione: (2024)
di: Chen, Delong, et al.
Pubblicazione: (2024)
Toward Interactive Regional Understanding in Vision-Large Language Models
di: Lee, Jungbeom, et al.
Pubblicazione: (2024)
di: Lee, Jungbeom, et al.
Pubblicazione: (2024)
Moment and Highlight Detection via MLLM Frame Segmentation
di: Jiwanta, I Putu Andika Bagas, et al.
Pubblicazione: (2025)
di: Jiwanta, I Putu Andika Bagas, et al.
Pubblicazione: (2025)
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
di: Fan, Yue, et al.
Pubblicazione: (2024)
di: Fan, Yue, et al.
Pubblicazione: (2024)
Counting to Four is still a Chore for VLMs
di: Anh, Duy Le Dinh, et al.
Pubblicazione: (2026)
di: Anh, Duy Le Dinh, et al.
Pubblicazione: (2026)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
di: Zha, Yuheng, et al.
Pubblicazione: (2025)
di: Zha, Yuheng, et al.
Pubblicazione: (2025)
LLM for Everyone: Representing the Underrepresented in Large Language Models
di: Cahyawijaya, Samuel
Pubblicazione: (2024)
di: Cahyawijaya, Samuel
Pubblicazione: (2024)
NegVQA: Can Vision Language Models Understand Negation?
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies
di: Pathak, Surendra, et al.
Pubblicazione: (2026)
di: Pathak, Surendra, et al.
Pubblicazione: (2026)
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
di: Hudi, Frederikus, et al.
Pubblicazione: (2025)
di: Hudi, Frederikus, et al.
Pubblicazione: (2025)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
VLMInferSlow: Evaluating the Efficiency Robustness of Large Vision-Language Models as a Service
di: Wang, Xiasi, et al.
Pubblicazione: (2025)
di: Wang, Xiasi, et al.
Pubblicazione: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
Improving Automatic VQA Evaluation Using Large Language Models
di: Mañas, Oscar, et al.
Pubblicazione: (2023)
di: Mañas, Oscar, et al.
Pubblicazione: (2023)
Efficient Whole Slide Pathology VQA via Token Compression
di: Lyu, Weimin, et al.
Pubblicazione: (2025)
di: Lyu, Weimin, et al.
Pubblicazione: (2025)
Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA
di: Li, Zhuowan, et al.
Pubblicazione: (2024)
di: Li, Zhuowan, et al.
Pubblicazione: (2024)
Enhancing Financial VQA in Vision Language Models using Intermediate Structured Representations
di: Srivastava, Archita, et al.
Pubblicazione: (2025)
di: Srivastava, Archita, et al.
Pubblicazione: (2025)
Documenti analoghi
-
What Causes Knowledge Loss in Multilingual Language Models?
di: Khelli, Maria, et al.
Pubblicazione: (2025) -
Vision Language Models are Confused Tourists
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025) -
LinguAlchemy: Fusing Typological and Geographical Elements for Unseen Language Generalization
di: Adilazuarda, Muhammad Farid, et al.
Pubblicazione: (2024) -
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
di: Anugraha, David, et al.
Pubblicazione: (2025) -
Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations
di: Merin, Adril Putra, et al.
Pubblicazione: (2026)