SEMT: Static-Expansion-Mesh Transformer Network Architecture for Remote Sensing Image Captioning
Fuente:
arXiv
Saved in:
| Main Authors: | Truong, Khang, Pham, Lam, Tang, Hieu, Lampert, Jasmin, Boyer, Martin, Phan, Son, Nguyen, Truong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RMAU-NET: A Residual-Multihead-Attention U-Net Architecture for Landslide Segmentation and Detection from Remote Sensing Images
by: Pham, Lam, et al.
Published: (2025)
by: Pham, Lam, et al.
Published: (2025)
A Deep-Learning Framework for Land-Sliding Classification from Remote Sensing Image
by: Tang, Hieu, et al.
Published: (2025)
by: Tang, Hieu, et al.
Published: (2025)
Schrodinger AI: A Unified Spectral-Dynamical Framework for Classification, Reasoning, and Operator-Based Generalization
by: Nguyen, Truong Son
Published: (2025)
by: Nguyen, Truong Son
Published: (2025)
Efficient and Concise Explanations for Object Detection with Gaussian-Class Activation Mapping Explainer
by: Nguyen, Quoc Khanh, et al.
Published: (2024)
by: Nguyen, Quoc Khanh, et al.
Published: (2024)
ESGNN: Towards Equivariant Scene Graph Neural Network for 3D Scene Understanding
by: Pham, Quang P. M., et al.
Published: (2024)
by: Pham, Quang P. M., et al.
Published: (2024)
Sampling Foundational Transformer: A Theoretical Perspective
by: Nguyen, Viet Anh, et al.
Published: (2024)
by: Nguyen, Viet Anh, et al.
Published: (2024)
DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Factorized Discrete Flow Matching
by: Nguyen, Ngoc-Son, et al.
Published: (2025)
by: Nguyen, Ngoc-Son, et al.
Published: (2025)
LGCA: Enhancing Semantic Representation via Progressive Expansion
by: Cao, Thanh Hieu, et al.
Published: (2025)
by: Cao, Thanh Hieu, et al.
Published: (2025)
TESGNN: Temporal Equivariant Scene Graph Neural Networks for Efficient and Robust Multi-View 3D Scene Understanding
by: Pham, Quang P. M., et al.
Published: (2024)
by: Pham, Quang P. M., et al.
Published: (2024)
A Lightweight Sparse Focus Transformer for Remote Sensing Image Change Captioning
by: Sun, Dongwei, et al.
Published: (2024)
by: Sun, Dongwei, et al.
Published: (2024)
LP-OVOD: Open-Vocabulary Object Detection by Linear Probing
by: Pham, Chau, et al.
Published: (2023)
by: Pham, Chau, et al.
Published: (2023)
Stable Messenger: Steganography for Message-Concealed Image Generation
by: Nguyen, Quang, et al.
Published: (2023)
by: Nguyen, Quang, et al.
Published: (2023)
KeyNode-Driven Geometry Coding for Real-World Scanned Human Dynamic Mesh Compression
by: Hoang, Huong, et al.
Published: (2025)
by: Hoang, Huong, et al.
Published: (2025)
ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport
by: Tran, Quoc-Khang, et al.
Published: (2026)
by: Tran, Quoc-Khang, et al.
Published: (2026)
FedBlock: A Blockchain Approach to Federated Learning against Backdoor Attacks
by: Nguyen, Duong H., et al.
Published: (2024)
by: Nguyen, Duong H., et al.
Published: (2024)
Distortion-Aware Adversarial Attacks on Bounding Boxes of Object Detectors
by: Phuc, Pham, et al.
Published: (2024)
by: Phuc, Pham, et al.
Published: (2024)
Multilingual Training-Free Remote Sensing Image Captioning
by: Rebelo, Carlos, et al.
Published: (2025)
by: Rebelo, Carlos, et al.
Published: (2025)
Leveraging Model Soups to Classify Intangible Cultural Heritage Images from the Mekong Delta
by: Tran, Quoc-Khang, et al.
Published: (2026)
by: Tran, Quoc-Khang, et al.
Published: (2026)
UIT-DarkCow team at ImageCLEFmedical Caption 2024: Diagnostic Captioning for Radiology Images Efficiency with Transformer Models
by: Van Nguyen, Quan, et al.
Published: (2024)
by: Van Nguyen, Quan, et al.
Published: (2024)
A Novel Lightweight Transformer with Edge-Aware Fusion for Remote Sensing Image Captioning
by: Das, Swadhin, et al.
Published: (2025)
by: Das, Swadhin, et al.
Published: (2025)
Learning to Produce Semi-dense Correspondences for Visual Localization
by: Giang, Khang Truong, et al.
Published: (2024)
by: Giang, Khang Truong, et al.
Published: (2024)
TopicFM+: Boosting Accuracy and Efficiency of Topic-Assisted Feature Matching
by: Giang, Khang Truong, et al.
Published: (2023)
by: Giang, Khang Truong, et al.
Published: (2023)
CLEAR: Causal Learning Framework For Robust Histopathology Tumor Detection Under Out-Of-Distribution Shifts
by: Thi, Kieu-Anh Truong, et al.
Published: (2025)
by: Thi, Kieu-Anh Truong, et al.
Published: (2025)
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
by: Nguyen, Ngoc-Son, et al.
Published: (2026)
by: Nguyen, Ngoc-Son, et al.
Published: (2026)
Structural Attention: Rethinking Transformer for Unpaired Medical Image Synthesis
by: Phan, Vu Minh Hieu, et al.
Published: (2024)
by: Phan, Vu Minh Hieu, et al.
Published: (2024)
Learnable Multi-level Discrete Wavelet Transforms for 3D Gaussian Splatting Frequency Modulation
by: Nguyen, Hung, et al.
Published: (2026)
by: Nguyen, Hung, et al.
Published: (2026)
LangXAI: Integrating Large Vision Models for Generating Textual Explanations to Enhance Explainability in Visual Perception Tasks
by: Nguyen, Truong Thanh Hung, et al.
Published: (2024)
by: Nguyen, Truong Thanh Hung, et al.
Published: (2024)
Good Representation, Better Explanation: Role of Convolutional Neural Networks in Transformer-Based Remote Sensing Image Captioning
by: Das, Swadhin, et al.
Published: (2025)
by: Das, Swadhin, et al.
Published: (2025)
Large Language Models for Captioning and Retrieving Remote Sensing Images
by: Silva, João Daniel, et al.
Published: (2024)
by: Silva, João Daniel, et al.
Published: (2024)
Evaluating Remote Sensing Image Captions Beyond Metric Biases
by: Chen, Ziyun, et al.
Published: (2026)
by: Chen, Ziyun, et al.
Published: (2026)
E(3)-Equivariant Mesh Neural Networks
by: Trang, Thuan, et al.
Published: (2024)
by: Trang, Thuan, et al.
Published: (2024)
Surveillance Video-Based Traffic Accident Detection Using Transformer Architecture
by: Singh, Tanu, et al.
Published: (2025)
by: Singh, Tanu, et al.
Published: (2025)
Enhancing the Fairness and Performance of Edge Cameras with Explainable AI
by: Nguyen, Truong Thanh Hung, et al.
Published: (2024)
by: Nguyen, Truong Thanh Hung, et al.
Published: (2024)
From Coarse to Fine: Learnable Discrete Wavelet Transforms for Efficient 3D Gaussian Splatting
by: Nguyen, Hung, et al.
Published: (2025)
by: Nguyen, Hung, et al.
Published: (2025)
DWTNeRF: Boosting Few-shot Neural Radiance Fields via Discrete Wavelet Transform
by: Nguyen, Hung, et al.
Published: (2025)
by: Nguyen, Hung, et al.
Published: (2025)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
by: Nguyen, Phu-Vinh, et al.
Published: (2025)
by: Nguyen, Phu-Vinh, et al.
Published: (2025)
MOB-GCN: A Novel Multiscale Object-Based Graph Neural Network for Hyperspectral Image Classification
by: Yang, Tuan-Anh, et al.
Published: (2025)
by: Yang, Tuan-Anh, et al.
Published: (2025)
Enhancing Perception of Key Changes in Remote Sensing Image Change Captioning
by: Yang, Cong, et al.
Published: (2024)
by: Yang, Cong, et al.
Published: (2024)
Semantic Alignment in Hyperbolic Space for Open-Vocabulary Semantic Segmentation
by: Truong, Hoang M., et al.
Published: (2026)
by: Truong, Hoang M., et al.
Published: (2026)
SOS: A Shuffle Order Strategy for Data Augmentation in Industrial Human Activity Recognition
by: Ha, Anh Tuan, et al.
Published: (2025)
by: Ha, Anh Tuan, et al.
Published: (2025)
Similar Items
-
RMAU-NET: A Residual-Multihead-Attention U-Net Architecture for Landslide Segmentation and Detection from Remote Sensing Images
by: Pham, Lam, et al.
Published: (2025) -
A Deep-Learning Framework for Land-Sliding Classification from Remote Sensing Image
by: Tang, Hieu, et al.
Published: (2025) -
Schrodinger AI: A Unified Spectral-Dynamical Framework for Classification, Reasoning, and Operator-Based Generalization
by: Nguyen, Truong Son
Published: (2025) -
Efficient and Concise Explanations for Object Detection with Gaussian-Class Activation Mapping Explainer
by: Nguyen, Quoc Khanh, et al.
Published: (2024) -
ESGNN: Towards Equivariant Scene Graph Neural Network for 3D Scene Understanding
by: Pham, Quang P. M., et al.
Published: (2024)