LiteGPT: Large Vision-Language Model for Joint Chest X-ray Localization and Classification Task
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Le-Duc, Khai, Zhang, Ryan, Nguyen, Ngoc Son, Pham, Tan-Hanh, Dao, Anh, Ngo, Ba Hung, Nguyen, Anh Totti, Hy, Truong-Son |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
par: Nguyen, Ngoc-Son, et autres
Publié: (2026)
par: Nguyen, Ngoc-Son, et autres
Publié: (2026)
wav2graph: A Framework for Supervised Learning Knowledge Graph from Speech
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
Conversation Understanding using Relational Temporal Graph Neural Networks with Auxiliary Cross-Modality Interaction
par: Nguyen, Cam-Van Thi, et autres
Publié: (2023)
par: Nguyen, Cam-Van Thi, et autres
Publié: (2023)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
par: Nguyen, Phu-Vinh, et autres
Publié: (2025)
par: Nguyen, Phu-Vinh, et autres
Publié: (2025)
Fact-Checking at Scale: Multimodal AI for Authenticity and Context Verification in Online Media
par: Phan, Van-Hoang, et autres
Publié: (2025)
par: Phan, Van-Hoang, et autres
Publié: (2025)
Ada2I: Enhancing Modality Balance for Multimodal Conversational Emotion Recognition
par: Nguyen, Cam-Van Thi, et autres
Publié: (2024)
par: Nguyen, Cam-Van Thi, et autres
Publié: (2024)
RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
par: Dang, Quy-Anh, et autres
Publié: (2026)
par: Dang, Quy-Anh, et autres
Publié: (2026)
RainbowPlus: Enhancing Adversarial Prompt Generation via Evolutionary Quality-Diversity Search
par: Dang, Quy-Anh, et autres
Publié: (2025)
par: Dang, Quy-Anh, et autres
Publié: (2025)
Sampling Foundational Transformer: A Theoretical Perspective
par: Nguyen, Viet Anh, et autres
Publié: (2024)
par: Nguyen, Viet Anh, et autres
Publié: (2024)
MOB-GCN: A Novel Multiscale Object-Based Graph Neural Network for Hyperspectral Image Classification
par: Yang, Tuan-Anh, et autres
Publié: (2025)
par: Yang, Tuan-Anh, et autres
Publié: (2025)
Real-time Speech Summarization for Medical Conversations
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
par: Pham, Tan-Hanh, et autres
Publié: (2024)
par: Pham, Tan-Hanh, et autres
Publié: (2024)
MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
E-FreeM2: Efficient Training-Free Multi-Scale and Cross-Modal News Verification via MLLMs
par: Phan, Van-Hoang, et autres
Publié: (2025)
par: Phan, Van-Hoang, et autres
Publié: (2025)
KAN-Based Fusion of Dual-Domain for Audio-Driven Facial Landmarks Generation
par: Vo-Thanh, Hoang-Son, et autres
Publié: (2024)
par: Vo-Thanh, Hoang-Son, et autres
Publié: (2024)
Short-Form Video Viewing Behavior Analysis and Multi-Step Viewing Time Prediction
par: Yen, Vu Thi Hai, et autres
Publié: (2026)
par: Yen, Vu Thi Hai, et autres
Publié: (2026)
SimInterview: Transforming Business Education through Large Language Model-Based Simulated Multilingual Interview Training System
par: Nguyen, Truong Thanh Hung, et autres
Publié: (2025)
par: Nguyen, Truong Thanh Hung, et autres
Publié: (2025)
Vidmento: Creating Video Stories Through Context-Aware Expansion With Generative Video
par: Yeh, Catherine, et autres
Publié: (2026)
par: Yeh, Catherine, et autres
Publié: (2026)
CONSTANT: Towards High-Quality One-Shot Handwriting Generation with Patch Contrastive Enhancement and Style-Aware Quantization
par: Le, Anh-Duy, et autres
Publié: (2026)
par: Le, Anh-Duy, et autres
Publié: (2026)
DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Factorized Discrete Flow Matching
par: Nguyen, Ngoc-Son, et autres
Publié: (2025)
par: Nguyen, Ngoc-Son, et autres
Publié: (2025)
Quizzard@INOVA Challenge 2025 -- Track A: Plug-and-Play Technique in Interleaved Multi-Image Model
par: Cuong, Dinh Viet, et autres
Publié: (2025)
par: Cuong, Dinh Viet, et autres
Publié: (2025)
IQBench: How "Smart'' Are Vision-Language Models? A Study with Human IQ Tests
par: Pham, Tan-Hanh, et autres
Publié: (2025)
par: Pham, Tan-Hanh, et autres
Publié: (2025)
Subjective Quality Assessment of Dynamic 3D Meshes in Virtual Reality Environment
par: Nguyen, Duc V., et autres
Publié: (2026)
par: Nguyen, Duc V., et autres
Publié: (2026)
Range-aware Positional Encoding via High-order Pretraining: Theory and Practice
par: Nguyen, Viet Anh, et autres
Publié: (2024)
par: Nguyen, Viet Anh, et autres
Publié: (2024)
Medical Spoken Named Entity Recognition
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
A Subjective Quality Evaluation of 3D Mesh with Dynamic Level of Detail in Virtual Reality
par: Nguyen, Duc, et autres
Publié: (2024)
par: Nguyen, Duc, et autres
Publié: (2024)
KeyNode-Driven Geometry Coding for Real-World Scanned Human Dynamic Mesh Compression
par: Hoang, Huong, et autres
Publié: (2025)
par: Hoang, Huong, et autres
Publié: (2025)
Sentiment Reasoning for Healthcare
par: Nguyen, Khai-Nguyen, et autres
Publié: (2024)
par: Nguyen, Khai-Nguyen, et autres
Publié: (2024)
An Efficient Approach for Machine Translation on Low-resource Languages: A Case Study in Vietnamese-Chinese
par: Son, Tran Ngoc, et autres
Publié: (2025)
par: Son, Tran Ngoc, et autres
Publié: (2025)
Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
par: Nguyen, Truong Thanh Hung, et autres
Publié: (2026)
par: Nguyen, Truong Thanh Hung, et autres
Publié: (2026)
Schrodinger AI: A Unified Spectral-Dynamical Framework for Classification, Reasoning, and Operator-Based Generalization
par: Nguyen, Truong Son
Publié: (2025)
par: Nguyen, Truong Son
Publié: (2025)
TwinLiteNet+: An Enhanced Multi-Task Segmentation Model for Autonomous Driving
par: Che, Quang-Huy, et autres
Publié: (2024)
par: Che, Quang-Huy, et autres
Publié: (2024)
SAMSA: Efficient Transformer for Many Data Modalities
par: Lenhat, Minh, et autres
Publié: (2024)
par: Lenhat, Minh, et autres
Publié: (2024)
A Dual-Module Denoising Approach with Curriculum Learning for Enhancing Multimodal Aspect-Based Sentiment Analysis
par: Van Doan, Nguyen, et autres
Publié: (2024)
par: Van Doan, Nguyen, et autres
Publié: (2024)
Integrated Semantic and Temporal Alignment for Interactive Video Retrieval
par: Luu, Thanh-Danh, et autres
Publié: (2025)
par: Luu, Thanh-Danh, et autres
Publié: (2025)
ESGNN: Towards Equivariant Scene Graph Neural Network for 3D Scene Understanding
par: Pham, Quang P. M., et autres
Publié: (2024)
par: Pham, Quang P. M., et autres
Publié: (2024)
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
par: Zi, Xing, et autres
Publié: (2025)
par: Zi, Xing, et autres
Publié: (2025)
Instruction-Guided Editing Controls for Images and Multimedia: A Survey in LLM era
par: Nguyen, Thanh Tam, et autres
Publié: (2024)
par: Nguyen, Thanh Tam, et autres
Publié: (2024)
PCNN: Probable-Class Nearest-Neighbor Explanations Improve Fine-Grained Image Classification Accuracy for AIs and Humans
par: Giang, et autres
Publié: (2023)
par: Giang, et autres
Publié: (2023)
SilVar-Med: A Speech-Driven Visual Language Model for Explainable Abnormality Detection in Medical Imaging
par: Pham, Tan-Hanh, et autres
Publié: (2025)
par: Pham, Tan-Hanh, et autres
Publié: (2025)
Documents similaires
-
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
par: Nguyen, Ngoc-Son, et autres
Publié: (2026) -
wav2graph: A Framework for Supervised Learning Knowledge Graph from Speech
par: Le-Duc, Khai, et autres
Publié: (2024) -
Conversation Understanding using Relational Temporal Graph Neural Networks with Auxiliary Cross-Modality Interaction
par: Nguyen, Cam-Van Thi, et autres
Publié: (2023) -
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
par: Nguyen, Phu-Vinh, et autres
Publié: (2025) -
Fact-Checking at Scale: Multimodal AI for Authenticity and Context Verification in Online Media
par: Phan, Van-Hoang, et autres
Publié: (2025)