Describe Anything Model for Visual Question Answering on Text-rich Images
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Vu, Yen-Linh, Duong, Dinh-Thang, Duong, Truong-Binh, Nguyen, Anh-Khoi, Nguyen, Thanh-Huy, Nguyen, Le Thien Phuc, Xing, Jianhua, Li, Xingjian, Wang, Tianyang, Bagci, Ulas, Xu, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text Representations
par: Nguyen, Khoi Anh, et autres
Publié: (2025)
par: Nguyen, Khoi Anh, et autres
Publié: (2025)
GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification
par: Quang, Ngoc Bui Lam, et autres
Publié: (2025)
par: Quang, Ngoc Bui Lam, et autres
Publié: (2025)
DuetMatch: Harmonizing Semi-Supervised Brain MRI Segmentation via Decoupled Branch Optimization
par: Nguyen, Thanh-Huy, et autres
Publié: (2025)
par: Nguyen, Thanh-Huy, et autres
Publié: (2025)
Improved Segmentation of Polyps and Visual Explainability Analysis
par: Asare, Akwasi, et autres
Publié: (2025)
par: Asare, Akwasi, et autres
Publié: (2025)
ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)
Seeing Through the Tool: A Controlled Benchmark for Occlusion Robustness in Foundation Segmentation Models
par: Ho, Nhan, et autres
Publié: (2026)
par: Ho, Nhan, et autres
Publié: (2026)
Semi-MoE: Mixture-of-Experts meets Semi-Supervised Histopathology Segmentation
par: Vu, Nguyen Lan Vi, et autres
Publié: (2025)
par: Vu, Nguyen Lan Vi, et autres
Publié: (2025)
Revisiting the Disequilibrium Issues in Tackling Heart Disease Classification Tasks
par: Hoang, Thao, et autres
Publié: (2024)
par: Hoang, Thao, et autres
Publié: (2024)
Describe Anything in Medical Images
par: Xiao, Xi, et autres
Publié: (2025)
par: Xiao, Xi, et autres
Publié: (2025)
Adaptive Collaboration of Arena-Based Argumentative LLMs for Explainable and Contestable Legal Reasoning
par: Cao, Hoang-Loc, et autres
Publié: (2026)
par: Cao, Hoang-Loc, et autres
Publié: (2026)
SwiftPie: Lightning-fast Subject-driven Image Personalization via One step Diffusion
par: Duong, Huy, et autres
Publié: (2026)
par: Duong, Huy, et autres
Publié: (2026)
ChronoSC: Task-Oriented Semantic Communication via Temporal-to-Color Encoding
par: Nguyen, Phuc H., et autres
Publié: (2026)
par: Nguyen, Phuc H., et autres
Publié: (2026)
Adaptive Knowledge Transferring with Switching Dual-Student Framework for Semi-Supervised Medical Image Segmentation
par: Nguyen, Hoang-Thien, et autres
Publié: (2025)
par: Nguyen, Hoang-Thien, et autres
Publié: (2025)
Label-Efficient Cross-Modality Generalization for Liver Segmentation in Multi-Phase MRI
par: Bui-Tran, Quang-Khai, et autres
Publié: (2025)
par: Bui-Tran, Quang-Khai, et autres
Publié: (2025)
SemViQA: A Semantic Question Answering System for Vietnamese Information Fact-Checking
par: Tran, Dien X., et autres
Publié: (2025)
par: Tran, Dien X., et autres
Publié: (2025)
An Euroheart‐Based Percutaneous Coronary Intervention Registry in Vietnam: Design, Rationale, and Preliminary Results
par: Vu Hoang Vu, et autres
Publié: (2025)
par: Vu Hoang Vu, et autres
Publié: (2025)
Out-of-distribution generalization of deep-learning surrogates for 2D PDE-generated dynamics in the small-data regime
par: Nguyen, Binh Duong, et autres
Publié: (2026)
par: Nguyen, Binh Duong, et autres
Publié: (2026)
From Specialist to Generalist: Unlocking SAM's Learning Potential on Unlabeled Medical Images
par: Vu, Vi, et autres
Publié: (2026)
par: Vu, Vi, et autres
Publié: (2026)
Fusionista2.0: Efficiency Retrieval System for Large-Scale Datasets
par: Le, Huy M., et autres
Publié: (2025)
par: Le, Huy M., et autres
Publié: (2025)
Stable Messenger: Steganography for Message-Concealed Image Generation
par: Nguyen, Quang, et autres
Publié: (2023)
par: Nguyen, Quang, et autres
Publié: (2023)
Cost‐Effective Approach for Fabrication of High‐Quality Expanded Vermiculite for Alizarin Red S Removal From Aqueous Media
par: Hoai Phuong Nguyen Thi, et autres
Publié: (2024)
par: Hoai Phuong Nguyen Thi, et autres
Publié: (2024)
More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering
par: Vu, Duc Anh, et autres
Publié: (2025)
par: Vu, Duc Anh, et autres
Publié: (2025)
A DPLL(T) Framework for Verifying Deep Neural Networks
par: Duong, Hai, et autres
Publié: (2023)
par: Duong, Hai, et autres
Publié: (2023)
Scribble-Supervised Medical Image Segmentation with Dynamic Teacher Switching and Hierarchical Consistency
par: Nguyen, Thanh-Huy, et autres
Publié: (2026)
par: Nguyen, Thanh-Huy, et autres
Publié: (2026)
Two-Stage Distributionally Robust Edge Node Placement Under Endogenous Demand Uncertainty
par: Cheng, Jiaming, et autres
Publié: (2024)
par: Cheng, Jiaming, et autres
Publié: (2024)
Robust Dynamic Edge Service Placement Under Spatio-Temporal Correlated Demand Uncertainty
par: Cheng, Jiaming, et autres
Publié: (2024)
par: Cheng, Jiaming, et autres
Publié: (2024)
Distributed Nash Equilibrium Seeking over Time-Varying Directed Communication Networks
par: Nguyen, Duong Thuy Anh, et autres
Publié: (2022)
par: Nguyen, Duong Thuy Anh, et autres
Publié: (2022)
MIPIC: Matryoshka Representation Learning via Self-Distilled Intra-Relational and Progressive Information Chaining
par: Huy, Phung Gia, et autres
Publié: (2026)
par: Huy, Phung Gia, et autres
Publié: (2026)
VLQA: The First Comprehensive, Large, and High-Quality Vietnamese Dataset for Legal Question Answering
par: Nguyen, Tan-Minh, et autres
Publié: (2025)
par: Nguyen, Tan-Minh, et autres
Publié: (2025)
ViMQ: A Vietnamese Medical Question Dataset for Healthcare Dialogue System Development
par: Huy, Ta Duc, et autres
Publié: (2023)
par: Huy, Ta Duc, et autres
Publié: (2023)
EVJVQA Challenge: Multilingual Visual Question Answering
par: Nguyen, Ngan Luu-Thuy, et autres
Publié: (2023)
par: Nguyen, Ngan Luu-Thuy, et autres
Publié: (2023)
A Hybrid Model Reference Adaptive and Regressive‐Form Sliding Mode Control in Discrete Domain: Robustness Under System Uncertainty
par: Nhut Thang Le, et autres
Publié: (2025)
par: Nhut Thang Le, et autres
Publié: (2025)
Stock Splits Puzzle: An Additional Answer From Pre‐Split Earnings Announcements
par: Hoang Huy Nguyen, et autres
Publié: (2024)
par: Hoang Huy Nguyen, et autres
Publié: (2024)
PAT: Pixel-wise Adaptive Training for Long-tailed Segmentation
par: Do, Khoi, et autres
Publié: (2024)
par: Do, Khoi, et autres
Publié: (2024)
SAM-EG: Segment Anything Model with Egde Guidance framework for efficient Polyp Segmentation
par: Trinh, Quoc-Huy, et autres
Publié: (2024)
par: Trinh, Quoc-Huy, et autres
Publié: (2024)
Few-shot Continual Relation Extraction via Open Information Extraction
par: Nguyen, Thiem, et autres
Publié: (2025)
par: Nguyen, Thiem, et autres
Publié: (2025)
Aligning What You Separate: Denoised Patch Mixing for Source-Free Domain Adaptation in Medical Image Segmentation
par: Bui-Tran, Quang-Khai, et autres
Publié: (2025)
par: Bui-Tran, Quang-Khai, et autres
Publié: (2025)
Domain-invariant Mixed-domain Semi-supervised Medical Image Segmentation with Clustered Maximum Mean Discrepancy Alignment
par: Lam, Ba-Thinh, et autres
Publié: (2026)
par: Lam, Ba-Thinh, et autres
Publié: (2026)
LP-OVOD: Open-Vocabulary Object Detection by Linear Probing
par: Pham, Chau, et autres
Publié: (2023)
par: Pham, Chau, et autres
Publié: (2023)
PhoWhisper: Automatic Speech Recognition for Vietnamese
par: Le, Thanh-Thien, et autres
Publié: (2024)
par: Le, Thanh-Thien, et autres
Publié: (2024)
Documents similaires
-
Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text Representations
par: Nguyen, Khoi Anh, et autres
Publié: (2025) -
GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification
par: Quang, Ngoc Bui Lam, et autres
Publié: (2025) -
DuetMatch: Harmonizing Semi-Supervised Brain MRI Segmentation via Decoupled Branch Optimization
par: Nguyen, Thanh-Huy, et autres
Publié: (2025) -
Improved Segmentation of Polyps and Visual Explainability Analysis
par: Asare, Akwasi, et autres
Publié: (2025) -
ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)