Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text Representations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nguyen, Khoi Anh, Vu, Linh Yen, Duong, Thang Dinh, Duong, Thuan Nguyen, Nguyen, Huy Thanh, Dinh, Vinh Quang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Describe Anything Model for Visual Question Answering on Text-rich Images
par: Vu, Yen-Linh, et autres
Publié: (2025)
par: Vu, Yen-Linh, et autres
Publié: (2025)
Beyond Traditional Approaches: Multi-Task Network for Breast Ultrasound Diagnosis
par: Chung, Dat T., et autres
Publié: (2024)
par: Chung, Dat T., et autres
Publié: (2024)
Semi-Supervised Semantic Segmentation using Redesigned Self-Training for White Blood Cells
par: Luu, Vinh Quoc, et autres
Publié: (2024)
par: Luu, Vinh Quoc, et autres
Publié: (2024)
Hybrid, Unified and Iterative: A Novel Framework for Text-based Person Anomaly Retrieval
par: Nguyen, Tien-Huy, et autres
Publié: (2025)
par: Nguyen, Tien-Huy, et autres
Publié: (2025)
ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)
ViOCRVQA: Novel Benchmark Dataset and Vision Reader for Visual Question Answering by Understanding Vietnamese Text in Images
par: Pham, Huy Quang, et autres
Publié: (2024)
par: Pham, Huy Quang, et autres
Publié: (2024)
SwiftPie: Lightning-fast Subject-driven Image Personalization via One step Diffusion
par: Duong, Huy, et autres
Publié: (2026)
par: Duong, Huy, et autres
Publié: (2026)
SwiftTry: Fast and Consistent Video Virtual Try-On with Diffusion Models
par: Nguyen, Hung, et autres
Publié: (2024)
par: Nguyen, Hung, et autres
Publié: (2024)
Morphological Variation of the Fiddler Crab Tubuca paradussumieri (Decapoda: Ocypodidae) Among Provinces in the Vietnamese Mekong Delta and a Classification Key for Genus Tubuca
par: Anh Ngoc Tran, et autres
Publié: (2025)
par: Anh Ngoc Tran, et autres
Publié: (2025)
Stable Messenger: Steganography for Message-Concealed Image Generation
par: Nguyen, Quang, et autres
Publié: (2023)
par: Nguyen, Quang, et autres
Publié: (2023)
ChronoSC: Task-Oriented Semantic Communication via Temporal-to-Color Encoding
par: Nguyen, Phuc H., et autres
Publié: (2026)
par: Nguyen, Phuc H., et autres
Publié: (2026)
V-Math: An Agentic Approach to the Vietnamese National High School Graduation Mathematics Exams
par: Nguyen, Duong Q., et autres
Publié: (2025)
par: Nguyen, Duong Q., et autres
Publié: (2025)
SwiftEdit: Lightning Fast Text-Guided Image Editing via One-Step Diffusion
par: Nguyen, Trong-Tung, et autres
Publié: (2024)
par: Nguyen, Trong-Tung, et autres
Publié: (2024)
ViTextVQA: A Large-Scale Visual Question Answering Dataset and a Novel Multimodal Feature Fusion Method for Vietnamese Text Comprehension in Images
par: Van Nguyen, Quan, et autres
Publié: (2024)
par: Van Nguyen, Quan, et autres
Publié: (2024)
SwiftBrush v2: Make Your One-step Diffusion Model Better Than Its Teacher
par: Dao, Trung, et autres
Publié: (2024)
par: Dao, Trung, et autres
Publié: (2024)
SHREC 2025: Retrieval of Optimal Objects for Multi-modal Enhanced Language and Spatial Assistance (ROOMELSA)
par: Nguyen, Trong-Thuan, et autres
Publié: (2025)
par: Nguyen, Trong-Thuan, et autres
Publié: (2025)
TUG and Six‐Minute Walk Test in Vietnamese Community‐Dwelling Elderly
par: Luc Viet Tran, et autres
Publié: (2025)
par: Luc Viet Tran, et autres
Publié: (2025)
Cycle Training with Semi-Supervised Domain Adaptation: Bridging Accuracy and Efficiency for Real-Time Mobile Scene Detection
par: Phan-Nguyen, Huu-Phong, et autres
Publié: (2025)
par: Phan-Nguyen, Huu-Phong, et autres
Publié: (2025)
Zero-Shot Text-to-Speech for Vietnamese
par: Vu, Thi, et autres
Publié: (2025)
par: Vu, Thi, et autres
Publié: (2025)
Advancing Vietnamese Information Retrieval with Learning Objective and Benchmark
par: Nguyen, Phu-Vinh, et autres
Publié: (2025)
par: Nguyen, Phu-Vinh, et autres
Publié: (2025)
CSD-VAR: Content-Style Decomposition in Visual Autoregressive Models
par: Nguyen, Quang-Binh, et autres
Publié: (2025)
par: Nguyen, Quang-Binh, et autres
Publié: (2025)
Enhancing Alzheimer's Detection through Late Fusion of Multi-Modal EEG Features
par: Vinh, Nguyen Thanh, et autres
Publié: (2025)
par: Vinh, Nguyen Thanh, et autres
Publié: (2025)
Vietnamese AI Generated Text Detection
par: Tran, Quang-Dan, et autres
Publié: (2024)
par: Tran, Quang-Dan, et autres
Publié: (2024)
PAT: Pixel-wise Adaptive Training for Long-tailed Segmentation
par: Do, Khoi, et autres
Publié: (2024)
par: Do, Khoi, et autres
Publié: (2024)
Multi-Perspective Data Augmentation for Few-shot Object Detection
par: Vu, Anh-Khoa Nguyen, et autres
Publié: (2025)
par: Vu, Anh-Khoa Nguyen, et autres
Publié: (2025)
IGL-DT: Iterative Global-Local Feature Learning with Dual-Teacher Semantic Segmentation Framework under Limited Annotation Scheme
par: Tran, Dinh Dai Quan, et autres
Publié: (2025)
par: Tran, Dinh Dai Quan, et autres
Publié: (2025)
Fourier-Attentive Representation Learning: A Fourier-Guided Framework for Few-Shot Generalization in Vision-Language Models
par: Pham, Hieu Dinh Trung, et autres
Publié: (2025)
par: Pham, Hieu Dinh Trung, et autres
Publié: (2025)
Label-Efficient Cross-Modality Generalization for Liver Segmentation in Multi-Phase MRI
par: Bui-Tran, Quang-Khai, et autres
Publié: (2025)
par: Bui-Tran, Quang-Khai, et autres
Publié: (2025)
VietMed-MCQ: A Consistency-Filtered Data Synthesis Framework for Vietnamese Traditional Medicine Evaluation
par: Kiet, Huynh Trung, et autres
Publié: (2026)
par: Kiet, Huynh Trung, et autres
Publié: (2026)
Towards Efficient and Robust Moment Retrieval System: A Unified Framework for Multi-Granularity Models and Temporal Reranking
par: Tran, Huu-Loc, et autres
Publié: (2025)
par: Tran, Huu-Loc, et autres
Publié: (2025)
Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention
par: Nguyen, Nhi Ngoc-Yen, et autres
Publié: (2026)
par: Nguyen, Nhi Ngoc-Yen, et autres
Publié: (2026)
SwiftBrush: One-Step Text-to-Image Diffusion Model with Variational Score Distillation
par: Nguyen, Thuan Hoang, et autres
Publié: (2023)
par: Nguyen, Thuan Hoang, et autres
Publié: (2023)
Investigating Market Strength Prediction with CNNs on Candlestick Chart Images
par: Duong, Thanh Nam, et autres
Publié: (2025)
par: Duong, Thanh Nam, et autres
Publié: (2025)
Dual-Path Enhancements in Event-Based Eye Tracking: Augmented Robustness and Adaptive Temporal Modeling
par: Truong, Hoang M., et autres
Publié: (2025)
par: Truong, Hoang M., et autres
Publié: (2025)
A Survey on Vietnamese Document Analysis and Recognition: Challenges and Future Directions
par: Le, Anh, et autres
Publié: (2025)
par: Le, Anh, et autres
Publié: (2025)
Vietnamese. London Oriental and African Language Library.
par: Nguyen, Dinh-Hoa
Publié: (1997)
par: Nguyen, Dinh-Hoa
Publié: (1997)
Spectrum of WAS gene mutations in Vietnamese patients with Wiskott–Aldrich syndrome
par: Ho Quoc Chuong, et autres
Publié: (2024)
par: Ho Quoc Chuong, et autres
Publié: (2024)
Towards Comprehensive Vietnamese Retrieval-Augmented Generation and Large Language Models
par: Duc, Nguyen Quang, et autres
Publié: (2024)
par: Duc, Nguyen Quang, et autres
Publié: (2024)
Multi-Dialect Vietnamese: Task, Dataset, Baseline Models and Challenges
par: Van Dinh, Nguyen, et autres
Publié: (2024)
par: Van Dinh, Nguyen, et autres
Publié: (2024)
SuoiAI: Building a Dataset for Aquatic Invertebrates in Vietnam
par: Vo, Tue, et autres
Publié: (2025)
par: Vo, Tue, et autres
Publié: (2025)
Documents similaires
-
Describe Anything Model for Visual Question Answering on Text-rich Images
par: Vu, Yen-Linh, et autres
Publié: (2025) -
Beyond Traditional Approaches: Multi-Task Network for Breast Ultrasound Diagnosis
par: Chung, Dat T., et autres
Publié: (2024) -
Semi-Supervised Semantic Segmentation using Redesigned Self-Training for White Blood Cells
par: Luu, Vinh Quoc, et autres
Publié: (2024) -
Hybrid, Unified and Iterative: A Novel Framework for Text-based Person Anomaly Retrieval
par: Nguyen, Tien-Huy, et autres
Publié: (2025) -
ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)