A Simple Data Augmentation Strategy for Text-in-Image Scientific VQA
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shoer, Belal, Kementchedjhieva, Yova |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EFSA: Episodic Few-Shot Adaptation for Text-to-Image Retrieval
par: Huzaifa, Muhammad, et autres
Publié: (2024)
par: Huzaifa, Muhammad, et autres
Publié: (2024)
The Devil is in the EOS: Sequence Training for Detailed Image Captioning
par: Mohamed, Abdelrahman, et autres
Publié: (2025)
par: Mohamed, Abdelrahman, et autres
Publié: (2025)
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
par: Chen, Xiaofu, et autres
Publié: (2025)
par: Chen, Xiaofu, et autres
Publié: (2025)
Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs
par: Salazar, Israfel, et autres
Publié: (2025)
par: Salazar, Israfel, et autres
Publié: (2025)
Do Vision and Language Models Share Concepts? A Vector Space Alignment Study
par: Li, Jiaang, et autres
Publié: (2023)
par: Li, Jiaang, et autres
Publié: (2023)
LLMs Can Compensate for Deficiencies in Visual Representations
par: Takishita, Sho, et autres
Publié: (2025)
par: Takishita, Sho, et autres
Publié: (2025)
Noise is an Efficient Learner for Zero-Shot Vision-Language Models
par: Imam, Raza, et autres
Publié: (2025)
par: Imam, Raza, et autres
Publié: (2025)
Learning Annotation Consensus for Continuous Emotion Recognition
par: Shoer, Ibrahim, et autres
Publié: (2025)
par: Shoer, Ibrahim, et autres
Publié: (2025)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
par: Shahgir, Haz Sameen, et autres
Publié: (2026)
par: Shahgir, Haz Sameen, et autres
Publié: (2026)
Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues
par: Zhang, Yan, et autres
Publié: (2024)
par: Zhang, Yan, et autres
Publié: (2024)
Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text Representations
par: Nguyen, Khoi Anh, et autres
Publié: (2025)
par: Nguyen, Khoi Anh, et autres
Publié: (2025)
Kvasir-VQA: A Text-Image Pair GI Tract Dataset
par: Gautam, Sushant, et autres
Publié: (2024)
par: Gautam, Sushant, et autres
Publié: (2024)
PitVQA: Image-grounded Text Embedding LLM for Visual Question Answering in Pituitary Surgery
par: He, Runlong, et autres
Publié: (2024)
par: He, Runlong, et autres
Publié: (2024)
Enhancing Document VQA Models via Retrieval-Augmented Generation
par: López, Eric, et autres
Publié: (2025)
par: López, Eric, et autres
Publié: (2025)
Simple In-place Data Augmentation for Surveillance Object Detection
par: Otgonbold, Munkh-Erdene, et autres
Publié: (2024)
par: Otgonbold, Munkh-Erdene, et autres
Publié: (2024)
TokenFocus-VQA: Enhancing Text-to-Image Alignment with Position-Aware Focus and Multi-Perspective Aggregations on LVLMs
par: Zhang, Zijian, et autres
Publié: (2025)
par: Zhang, Zijian, et autres
Publié: (2025)
A Review on Generative AI For Text-To-Image and Image-To-Image Generation and Implications To Scientific Images
par: Sordo, Zineb, et autres
Publié: (2025)
par: Sordo, Zineb, et autres
Publié: (2025)
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
par: He, Haibin, et autres
Publié: (2026)
par: He, Haibin, et autres
Publié: (2026)
Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
An Effective Data Augmentation Method by Asking Questions about Scene Text Images
par: Yao, Xu, et autres
Publié: (2026)
par: Yao, Xu, et autres
Publié: (2026)
VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous Driving
par: Liu, Yibo, et autres
Publié: (2024)
par: Liu, Yibo, et autres
Publié: (2024)
A Simple Strategy for Body Estimation from Partial-View Images
par: Mao, Yafei, et autres
Publié: (2024)
par: Mao, Yafei, et autres
Publié: (2024)
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
par: Feng, Xuelu, et autres
Publié: (2025)
par: Feng, Xuelu, et autres
Publié: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025)
par: Zhou, Sheng, et autres
Publié: (2025)
SimInversion: A Simple Framework for Inversion-Based Text-to-Image Editing
par: Qian, Qi, et autres
Publié: (2024)
par: Qian, Qi, et autres
Publié: (2024)
Not Just Pretty Pictures: Toward Interventional Data Augmentation Using Text-to-Image Generators
par: Yuan, Jianhao, et autres
Publié: (2022)
par: Yuan, Jianhao, et autres
Publié: (2022)
Fine-Tuning Cycle-GAN for Domain Adaptation of MRI Images
par: Usama, Mohd, et autres
Publié: (2026)
par: Usama, Mohd, et autres
Publié: (2026)
SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA
par: He, Haibin, et autres
Publié: (2025)
par: He, Haibin, et autres
Publié: (2025)
Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry
par: Hou, Wenjun, et autres
Publié: (2024)
par: Hou, Wenjun, et autres
Publié: (2024)
MDS-VQA: Model-Informed Data Selection for Video Quality Assessment
par: Zou, Jian, et autres
Publié: (2026)
par: Zou, Jian, et autres
Publié: (2026)
SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs
par: Su, Xin, et autres
Publié: (2024)
par: Su, Xin, et autres
Publié: (2024)
A Text-Image Fusion Method with Data Augmentation Capabilities for Referring Medical Image Segmentation
par: Chai, Shurong, et autres
Publié: (2025)
par: Chai, Shurong, et autres
Publié: (2025)
On the Role of Visual Grounding in VQA
par: Reich, Daniel, et autres
Publié: (2024)
par: Reich, Daniel, et autres
Publié: (2024)
Enhancing Image Classification with Augmentation: Data Augmentation Techniques for Improved Image Classification
par: Kumar, Saorj, et autres
Publié: (2025)
par: Kumar, Saorj, et autres
Publié: (2025)
DVLTA-VQA: Decoupled Vision-Language Modeling with Text-Guided Adaptation for Blind Video Quality Assessment
par: Yu, Li, et autres
Publié: (2025)
par: Yu, Li, et autres
Publié: (2025)
GLIMPSE : Real-Time Text Recognition and Contextual Understanding for VQA in Wearables
par: Ramachandran, Akhil, et autres
Publié: (2026)
par: Ramachandran, Akhil, et autres
Publié: (2026)
Diffusion-Enhanced Test-time Adaptation with Text and Image Augmentation
par: Feng, Chun-Mei, et autres
Publié: (2024)
par: Feng, Chun-Mei, et autres
Publié: (2024)
Prompt Augmentation for Self-supervised Text-guided Image Manipulation
par: Bodur, Rumeysa, et autres
Publié: (2024)
par: Bodur, Rumeysa, et autres
Publié: (2024)
SimTxtSeg: Weakly-Supervised Medical Image Segmentation with Simple Text Cues
par: Xie, Yuxin, et autres
Publié: (2024)
par: Xie, Yuxin, et autres
Publié: (2024)
Documents similaires
-
EFSA: Episodic Few-Shot Adaptation for Text-to-Image Retrieval
par: Huzaifa, Muhammad, et autres
Publié: (2024) -
The Devil is in the EOS: Sequence Training for Detailed Image Captioning
par: Mohamed, Abdelrahman, et autres
Publié: (2025) -
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
par: Chen, Xiaofu, et autres
Publié: (2025) -
Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs
par: Salazar, Israfel, et autres
Publié: (2025) -
Do Vision and Language Models Share Concepts? A Vector Space Alignment Study
par: Li, Jiaang, et autres
Publié: (2023)