Text-VQA Aug: Pipelined Harnessing of Large Multimodal Models for Automated Synthesis
Fuente:
arXiv
Salvato in:
| Autori principali: | Joshi, Soham, Mishra, Shwet Kamal, Gopalakrishnan, Viswanath |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
di: Ge, Qihang, et al.
Pubblicazione: (2024)
di: Ge, Qihang, et al.
Pubblicazione: (2024)
Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA
di: Karim, A H M Rezaul, et al.
Pubblicazione: (2025)
di: Karim, A H M Rezaul, et al.
Pubblicazione: (2025)
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
di: Fan, Yue, et al.
Pubblicazione: (2024)
di: Fan, Yue, et al.
Pubblicazione: (2024)
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
di: Duan, Zhongjie, et al.
Pubblicazione: (2024)
di: Duan, Zhongjie, et al.
Pubblicazione: (2024)
Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models
di: Bazi, Yakoub, et al.
Pubblicazione: (2026)
di: Bazi, Yakoub, et al.
Pubblicazione: (2026)
Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines
di: Kim, Junwan, et al.
Pubblicazione: (2026)
di: Kim, Junwan, et al.
Pubblicazione: (2026)
Harnessing PDF Data for Improving Japanese Large Multimodal Models
di: Baek, Jeonghun, et al.
Pubblicazione: (2025)
di: Baek, Jeonghun, et al.
Pubblicazione: (2025)
Understanding and Harnessing Sparsity in Unified Multimodal Models
di: He, Shwai, et al.
Pubblicazione: (2025)
di: He, Shwai, et al.
Pubblicazione: (2025)
Kvasir-VQA: A Text-Image Pair GI Tract Dataset
di: Gautam, Sushant, et al.
Pubblicazione: (2024)
di: Gautam, Sushant, et al.
Pubblicazione: (2024)
Evaluating the Impact of Post-Training Quantization on Reliable VQA with Multimodal LLMs
di: Kurz, Paul Jonas, et al.
Pubblicazione: (2026)
di: Kurz, Paul Jonas, et al.
Pubblicazione: (2026)
Beyond CLIP: Knowledge-Enhanced Multimodal Transformers for Cross-Modal Alignment in Diabetic Retinopathy Diagnosis
di: Samanta, Argha Kamal, et al.
Pubblicazione: (2025)
di: Samanta, Argha Kamal, et al.
Pubblicazione: (2025)
HARIVO: Harnessing Text-to-Image Models for Video Generation
di: Kwon, Mingi, et al.
Pubblicazione: (2024)
di: Kwon, Mingi, et al.
Pubblicazione: (2024)
PatentLMM: Large Multimodal Model for Generating Descriptions for Patent Figures
di: Shukla, Shreya, et al.
Pubblicazione: (2025)
di: Shukla, Shreya, et al.
Pubblicazione: (2025)
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
di: Zhang, Yan, et al.
Pubblicazione: (2025)
di: Zhang, Yan, et al.
Pubblicazione: (2025)
MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding
di: Kou, Qian, et al.
Pubblicazione: (2026)
di: Kou, Qian, et al.
Pubblicazione: (2026)
Visual Text Matters: Improving Text-KVQA with Visual Text Entity Knowledge-aware Large Multimodal Assistant
di: Penamakuri, Abhirama Subramanyam, et al.
Pubblicazione: (2024)
di: Penamakuri, Abhirama Subramanyam, et al.
Pubblicazione: (2024)
MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding
di: Baek, Jeonghun, et al.
Pubblicazione: (2025)
di: Baek, Jeonghun, et al.
Pubblicazione: (2025)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
di: Zhang, Yan, et al.
Pubblicazione: (2025)
di: Zhang, Yan, et al.
Pubblicazione: (2025)
Automated Prompt Generation for Creative and Counterfactual Text-to-image Synthesis
di: Jelaca, Aleksa, et al.
Pubblicazione: (2025)
di: Jelaca, Aleksa, et al.
Pubblicazione: (2025)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
di: Xu, Quanxing, et al.
Pubblicazione: (2025)
di: Xu, Quanxing, et al.
Pubblicazione: (2025)
ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models
di: Rawte, Vipula, et al.
Pubblicazione: (2024)
di: Rawte, Vipula, et al.
Pubblicazione: (2024)
Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models
di: Im, Eun Woo, et al.
Pubblicazione: (2025)
di: Im, Eun Woo, et al.
Pubblicazione: (2025)
Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models
di: Jiao, Qirui, et al.
Pubblicazione: (2024)
di: Jiao, Qirui, et al.
Pubblicazione: (2024)
Policy Optimized Text-to-Image Pipeline Design
di: Gadot, Uri, et al.
Pubblicazione: (2025)
di: Gadot, Uri, et al.
Pubblicazione: (2025)
Automated Floodwater Depth Estimation Using Large Multimodal Model for Rapid Flood Mapping
di: Akinboyewa, Temitope, et al.
Pubblicazione: (2024)
di: Akinboyewa, Temitope, et al.
Pubblicazione: (2024)
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
di: Liu, Bo, et al.
Pubblicazione: (2025)
di: Liu, Bo, et al.
Pubblicazione: (2025)
mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA
di: Yuan, Xu, et al.
Pubblicazione: (2025)
di: Yuan, Xu, et al.
Pubblicazione: (2025)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
di: Ma, Jiatong, et al.
Pubblicazione: (2026)
di: Ma, Jiatong, et al.
Pubblicazione: (2026)
Auto-Comp: An Automated Pipeline for Scalable Compositional Probing of Contrastive Vision-Language Models
di: Sbrolli, Cristian, et al.
Pubblicazione: (2026)
di: Sbrolli, Cristian, et al.
Pubblicazione: (2026)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
Harnessing Shared Relations via Multimodal Mixup Contrastive Learning for Multimodal Classification
di: Kumar, Raja, et al.
Pubblicazione: (2024)
di: Kumar, Raja, et al.
Pubblicazione: (2024)
Harnessing Large Vision and Language Models in Agriculture: A Review
di: Zhu, Hongyan, et al.
Pubblicazione: (2024)
di: Zhu, Hongyan, et al.
Pubblicazione: (2024)
Generative Animations: A Multi-Model Pipeline for Prompt-Driven Motion Synthesis
di: Khurana, Mannat, et al.
Pubblicazione: (2026)
di: Khurana, Mannat, et al.
Pubblicazione: (2026)
CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal Learning
di: Cao, Qingqing, et al.
Pubblicazione: (2024)
di: Cao, Qingqing, et al.
Pubblicazione: (2024)
Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling
di: Zou, Hongjian, et al.
Pubblicazione: (2026)
di: Zou, Hongjian, et al.
Pubblicazione: (2026)
Is ChatGPT-5 Ready for Mammogram VQA?
di: Li, Qiang, et al.
Pubblicazione: (2025)
di: Li, Qiang, et al.
Pubblicazione: (2025)
Advancing Surgical VQA with Scene Graph Knowledge
di: Yuan, Kun, et al.
Pubblicazione: (2023)
di: Yuan, Kun, et al.
Pubblicazione: (2023)
PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding
di: Erregue, Iñaki, et al.
Pubblicazione: (2026)
di: Erregue, Iñaki, et al.
Pubblicazione: (2026)
MTabVQA: Evaluating Multi-Tabular Reasoning of Language Models in Visual Space
di: Singh, Anshul, et al.
Pubblicazione: (2025)
di: Singh, Anshul, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
di: Ge, Qihang, et al.
Pubblicazione: (2024) -
Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA
di: Karim, A H M Rezaul, et al.
Pubblicazione: (2025) -
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
di: Fan, Yue, et al.
Pubblicazione: (2024) -
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
di: Duan, Zhongjie, et al.
Pubblicazione: (2024) -
Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models
di: Bazi, Yakoub, et al.
Pubblicazione: (2026)