Guardado en:
| Autores principales: | Le, Cuong, Le, Huy-Phuong, Le, Duc, Duong, Minh-Thien, Nguyen, Van-Binh, Le, My-Ha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2507.01340 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Optimal-state Dynamics Estimation for Physics-based Human Motion Capture from Videos
por: Le, Cuong, et al.
Publicado: (2024)
por: Le, Cuong, et al.
Publicado: (2024)
Vision-based Perception for Autonomous Vehicles in Obstacle Avoidance Scenarios
por: Phan, Van-Hoang-Anh, et al.
Publicado: (2025)
por: Phan, Van-Hoang-Anh, et al.
Publicado: (2025)
Fusionista2.0: Efficiency Retrieval System for Large-Scale Datasets
por: Le, Huy M., et al.
Publicado: (2025)
por: Le, Huy M., et al.
Publicado: (2025)
GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification
por: Quang, Ngoc Bui Lam, et al.
Publicado: (2025)
por: Quang, Ngoc Bui Lam, et al.
Publicado: (2025)
QuaMo: Quaternion Motions for Vision-based 3D Human Kinematics Capture
por: Le, Cuong, et al.
Publicado: (2026)
por: Le, Cuong, et al.
Publicado: (2026)
Dual Strategies for Test-Time Adaptation
por: Phuong, Nam Nguyen, et al.
Publicado: (2026)
por: Phuong, Nam Nguyen, et al.
Publicado: (2026)
Learning Human Motion with Temporally Conditional Mamba
por: Nguyen, Quang, et al.
Publicado: (2025)
por: Nguyen, Quang, et al.
Publicado: (2025)
EgoMusic-driven Human Dance Motion Estimation with Skeleton Mamba
por: Nguyen, Quang, et al.
Publicado: (2025)
por: Nguyen, Quang, et al.
Publicado: (2025)
ConstStyle: Robust Domain Generalization with Unified Style Transformation
por: Tran, Nam Duong, et al.
Publicado: (2025)
por: Tran, Nam Duong, et al.
Publicado: (2025)
DS@BioMed at ImageCLEFmedical Caption 2024: Enhanced Attention Mechanisms in Medical Caption Generation through Concept Detection Integration
por: Nguyen, Nhi Ngoc-Yen, et al.
Publicado: (2024)
por: Nguyen, Nhi Ngoc-Yen, et al.
Publicado: (2024)
Exploring the Practicality of Federated Learning: A Survey Towards the Communication Perspective
por: Le, Khiem, et al.
Publicado: (2024)
por: Le, Khiem, et al.
Publicado: (2024)
Time-series Meets Complex Motion Modeling: Robust and Computational-effective Motion Predictor for Multi-object Tracking
por: Do, Nhat-Tan, et al.
Publicado: (2026)
por: Do, Nhat-Tan, et al.
Publicado: (2026)
BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing Rates
por: Nguyen, Phuong-Anh, et al.
Publicado: (2026)
por: Nguyen, Phuong-Anh, et al.
Publicado: (2026)
MissBench: Benchmarking Multimodal Affective Analysis under Imbalanced Missing Modalities
por: Pham, Tien Anh, et al.
Publicado: (2026)
por: Pham, Tien Anh, et al.
Publicado: (2026)
TwinLiteNet+: An Enhanced Multi-Task Segmentation Model for Autonomous Driving
por: Che, Quang-Huy, et al.
Publicado: (2024)
por: Che, Quang-Huy, et al.
Publicado: (2024)
OpenEvents V1: Large-Scale Benchmark Dataset for Multimodal Event Grounding
por: Nguyen, Hieu, et al.
Publicado: (2025)
por: Nguyen, Hieu, et al.
Publicado: (2025)
Multimodal Contextualized Support for Enhancing Video Retrieval System
por: Nguyen-Le, Quoc-Bao, et al.
Publicado: (2024)
por: Nguyen-Le, Quoc-Bao, et al.
Publicado: (2024)
U-CESE: Unified Clip-based Event Search Engine for AI Challenge HCMC 2025
por: Le, Duc-Nhuan, et al.
Publicado: (2026)
por: Le, Duc-Nhuan, et al.
Publicado: (2026)
Virtual Fusion with Contrastive Learning for Single Sensor-based Activity Recognition
por: Nguyen, Duc-Anh, et al.
Publicado: (2023)
por: Nguyen, Duc-Anh, et al.
Publicado: (2023)
SADL: An Effective In-Context Learning Method for Compositional Visual QA
por: Dang, Long Hoang, et al.
Publicado: (2024)
por: Dang, Long Hoang, et al.
Publicado: (2024)
Adaptive Fusion Network with Temporal-Ranked and Motion-Intensity Dynamic Images for Micro-expression Recognition
por: Man, Thi Bich Phuong, et al.
Publicado: (2025)
por: Man, Thi Bich Phuong, et al.
Publicado: (2025)
Seeing Through the Tool: A Controlled Benchmark for Occlusion Robustness in Foundation Segmentation Models
por: Ho, Nhan, et al.
Publicado: (2026)
por: Ho, Nhan, et al.
Publicado: (2026)
Deep Learning for Automated Identification of Vietnamese Timber Species: A Tool for Ecological Monitoring and Conservation
por: Song, Tianyu, et al.
Publicado: (2025)
por: Song, Tianyu, et al.
Publicado: (2025)
GeoSearch: Augmenting Worldwide Geolocalization with Web-Scale Reverse Image Search and Image Matching
por: Le-Duc, Tung-Duong, et al.
Publicado: (2026)
por: Le-Duc, Tung-Duong, et al.
Publicado: (2026)
WAVER: Writing-style Agnostic Text-Video Retrieval via Distilling Vision-Language Models Through Open-Vocabulary Knowledge
por: Le, Huy, et al.
Publicado: (2023)
por: Le, Huy, et al.
Publicado: (2023)
From Visual Explanations to Counterfactual Explanations with Latent Diffusion
por: Luu, Tung, et al.
Publicado: (2025)
por: Luu, Tung, et al.
Publicado: (2025)
VietMEAgent: Culturally-Aware Few-Shot Multimodal Explanation for Vietnamese Visual Question Answering
por: Nguyen, Hai-Dang, et al.
Publicado: (2025)
por: Nguyen, Hai-Dang, et al.
Publicado: (2025)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
por: Nguyen, Hai-Dang, et al.
Publicado: (2025)
por: Nguyen, Hai-Dang, et al.
Publicado: (2025)
Region in Context: Text-condition Image editing with Human-like semantic reasoning
por: Vu, Thuy Phuong, et al.
Publicado: (2025)
por: Vu, Thuy Phuong, et al.
Publicado: (2025)
Spatiotemporal Graph Convolutional Recurrent Neural Network Model for Citywide Air Pollution Forecasting
por: Le, Van-Duc, et al.
Publicado: (2023)
por: Le, Van-Duc, et al.
Publicado: (2023)
Ensemble Learning for Vietnamese Scene Text Spotting in Urban Environments
por: Nguyen, Hieu, et al.
Publicado: (2024)
por: Nguyen, Hieu, et al.
Publicado: (2024)
Enhancing person re-identification via Uncertainty Feature Fusion Method and Auto-weighted Measure Combination
por: Che, Quang-Huy, et al.
Publicado: (2024)
por: Che, Quang-Huy, et al.
Publicado: (2024)
SwiftPie: Lightning-fast Subject-driven Image Personalization via One step Diffusion
por: Duong, Huy, et al.
Publicado: (2026)
por: Duong, Huy, et al.
Publicado: (2026)
FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation
por: Le, Minh Khoa, et al.
Publicado: (2026)
por: Le, Minh Khoa, et al.
Publicado: (2026)
Robust Deepfake Detection: Mitigating Spatial Attention Drift via Calibrated Complementary Ensembles
por: Le-Phan, Minh-Khoa, et al.
Publicado: (2026)
por: Le-Phan, Minh-Khoa, et al.
Publicado: (2026)
EDGER: EDge-Guided with HEatmap Refinement for Generalizable Image Forgery Localization
por: Le-Phan, Minh-Khoa, et al.
Publicado: (2026)
por: Le-Phan, Minh-Khoa, et al.
Publicado: (2026)
SHREC 2025: Retrieval of Optimal Objects for Multi-modal Enhanced Language and Spatial Assistance (ROOMELSA)
por: Nguyen, Trong-Thuan, et al.
Publicado: (2025)
por: Nguyen, Trong-Thuan, et al.
Publicado: (2025)
Leveraging feature communication in federated learning for remote sensing image classification
por: Duong, Anh-Kiet, et al.
Publicado: (2024)
por: Duong, Anh-Kiet, et al.
Publicado: (2024)
Describe Anything Model for Visual Question Answering on Text-rich Images
por: Vu, Yen-Linh, et al.
Publicado: (2025)
por: Vu, Yen-Linh, et al.
Publicado: (2025)
Gradient Alignment for Cross-Domain Face Anti-Spoofing
por: Le, Binh M., et al.
Publicado: (2024)
por: Le, Binh M., et al.
Publicado: (2024)
Ejemplares similares
-
Optimal-state Dynamics Estimation for Physics-based Human Motion Capture from Videos
por: Le, Cuong, et al.
Publicado: (2024) -
Vision-based Perception for Autonomous Vehicles in Obstacle Avoidance Scenarios
por: Phan, Van-Hoang-Anh, et al.
Publicado: (2025) -
Fusionista2.0: Efficiency Retrieval System for Large-Scale Datasets
por: Le, Huy M., et al.
Publicado: (2025) -
GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification
por: Quang, Ngoc Bui Lam, et al.
Publicado: (2025) -
QuaMo: Quaternion Motions for Vision-based 3D Human Kinematics Capture
por: Le, Cuong, et al.
Publicado: (2026)