Enregistré dans:
| Auteurs principaux: | Anh, Duy Le Dinh, Irawan, Patrick Amadeus, Van Vo, Tuan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.10039 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Shape2Animal: Creative Animal Generation from Natural Silhouettes
par: Tran, Quoc-Duy, et autres
Publié: (2025)
par: Tran, Quoc-Duy, et autres
Publié: (2025)
CONSTANT: Towards High-Quality One-Shot Handwriting Generation with Patch Contrastive Enhancement and Style-Aware Quantization
par: Le, Anh-Duy, et autres
Publié: (2026)
par: Le, Anh-Duy, et autres
Publié: (2026)
Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models
par: Irawan, Patrick Amadeus, et autres
Publié: (2024)
par: Irawan, Patrick Amadeus, et autres
Publié: (2024)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
TP-GMOT: Tracking Generic Multiple Object by Textual Prompt with Motion-Appearance Cost (MAC) SORT
par: Anh, Duy Le Dinh, et autres
Publié: (2024)
par: Anh, Duy Le Dinh, et autres
Publié: (2024)
DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving
par: Vo, Hao, et autres
Publié: (2026)
par: Vo, Hao, et autres
Publié: (2026)
Language-driven Grasp Detection with Mask-guided Attention
par: Van Vo, Tuan, et autres
Publié: (2024)
par: Van Vo, Tuan, et autres
Publié: (2024)
More Reliable Pseudo-labels, Better Performance: A Generalized Approach to Single Positive Multi-label Learning
par: Tran, Luong, et autres
Publié: (2025)
par: Tran, Luong, et autres
Publié: (2025)
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
par: Anugraha, David, et autres
Publié: (2025)
par: Anugraha, David, et autres
Publié: (2025)
iCONTRA: Toward Thematic Collection Design Via Interactive Concept Transfer
par: Vo, Dinh-Khoi, et autres
Publié: (2024)
par: Vo, Dinh-Khoi, et autres
Publié: (2024)
A Hybrid Vision Transformer Approach for Mathematical Expression Recognition
par: Le, Anh Duy, et autres
Publié: (2026)
par: Le, Anh Duy, et autres
Publié: (2026)
Diversity-Aware Agnostic Ensemble of Sharpness Minimizers
par: Bui, Anh, et autres
Publié: (2024)
par: Bui, Anh, et autres
Publié: (2024)
ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning
par: Van Vo, Tuan, et autres
Publié: (2026)
par: Van Vo, Tuan, et autres
Publié: (2026)
Vision Language Models are Confused Tourists
par: Irawan, Patrick Amadeus, et autres
Publié: (2025)
par: Irawan, Patrick Amadeus, et autres
Publié: (2025)
UniSemAlign: Text-Prototype Alignment with a Foundation Encoder for Semi-Supervised Histopathology Segmentation
par: Thai, Le-Van, et autres
Publié: (2026)
par: Thai, Le-Van, et autres
Publié: (2026)
SAMURAI: Shape-Aware Multimodal Retrieval for 3D Object Identification
par: Vo, Dinh-Khoi, et autres
Publié: (2025)
par: Vo, Dinh-Khoi, et autres
Publié: (2025)
EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions
par: Vo, Dinh-Khoi, et autres
Publié: (2025)
par: Vo, Dinh-Khoi, et autres
Publié: (2025)
Language-driven Grasp Detection
par: Vuong, An Dinh, et autres
Publié: (2024)
par: Vuong, An Dinh, et autres
Publié: (2024)
Adaptive Subspace Projection for Generative Personalization
par: Nguyen, Van-Anh, et autres
Publié: (2026)
par: Nguyen, Van-Anh, et autres
Publié: (2026)
[De|Re]constructing VLMs' Reasoning in Counting
par: Alghisi, Simone, et autres
Publié: (2025)
par: Alghisi, Simone, et autres
Publié: (2025)
Preserving Clusters in Prompt Learning for Unsupervised Domain Adaptation
par: Vuong, Tung-Long, et autres
Publié: (2025)
par: Vuong, Tung-Long, et autres
Publié: (2025)
AlertTrap: A study on object detection in remote insects trap monitoring system using on-the-edge deep learning platform
par: Le, An D., et autres
Publié: (2021)
par: Le, An D., et autres
Publié: (2021)
CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base
par: Nguyen, Cong-Duy, et autres
Publié: (2025)
par: Nguyen, Cong-Duy, et autres
Publié: (2025)
Passive Deepfake Detection Across Multi-modalities: A Comprehensive Survey
par: Nguyen-Le, Hong-Hanh, et autres
Publié: (2024)
par: Nguyen-Le, Hong-Hanh, et autres
Publié: (2024)
PANDORA: Pixel-wise Attention Dissolution and Latent Guidance for Zero-Shot Object Removal
par: Vo, Dinh-Khoi, et autres
Publié: (2026)
par: Vo, Dinh-Khoi, et autres
Publié: (2026)
World2Act: Latent Action Post-Training from World Model Dynamics
par: Vuong, An Dinh, et autres
Publié: (2026)
par: Vuong, An Dinh, et autres
Publié: (2026)
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
par: Cao, Tri, et autres
Publié: (2026)
par: Cao, Tri, et autres
Publié: (2026)
Cooperative Students: Navigating Unsupervised Domain Adaptation in Nighttime Object Detection
par: Yuan, Jicheng, et autres
Publié: (2024)
par: Yuan, Jicheng, et autres
Publié: (2024)
ScriptHOI: Learning Scripted State Transitions for Open-Vocabulary Human-Object Interaction Detection
par: Nguyen, Minh Anh, et autres
Publié: (2026)
par: Nguyen, Minh Anh, et autres
Publié: (2026)
Frequency Attention for Knowledge Distillation
par: Pham, Cuong, et autres
Publié: (2024)
par: Pham, Cuong, et autres
Publié: (2024)
Enhanced Kalman with Adaptive Appearance Motion SORT for Grounded Generic Multiple Object Tracking
par: Anh, Duy Le Dinh, et autres
Publié: (2024)
par: Anh, Duy Le Dinh, et autres
Publié: (2024)
Enhancing Multimodal Entity Linking with Jaccard Distance-based Conditional Contrastive Learning and Contextual Visual Augmentation
par: Nguyen, Cong-Duy, et autres
Publié: (2025)
par: Nguyen, Cong-Duy, et autres
Publié: (2025)
SuoiAI: Building a Dataset for Aquatic Invertebrates in Vietnam
par: Vo, Tue, et autres
Publié: (2025)
par: Vo, Tue, et autres
Publié: (2025)
DualProtoSeg: Simple and Efficient Design with Text- and Image-Guided Prototype Learning for Weakly Supervised Histopathology Image Segmentation
par: Vu, Anh M., et autres
Publié: (2025)
par: Vu, Anh M., et autres
Publié: (2025)
Enhancing Dataset Distillation via Non-Critical Region Refinement
par: Tran, Minh-Tuan, et autres
Publié: (2025)
par: Tran, Minh-Tuan, et autres
Publié: (2025)
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
par: Nguyen, Thong, et autres
Publié: (2025)
par: Nguyen, Thong, et autres
Publié: (2025)
Z-GMOT: Zero-shot Generic Multiple Object Tracking
par: Tran, Kim Hoang, et autres
Publié: (2023)
par: Tran, Kim Hoang, et autres
Publié: (2023)
Think Twice before Adaptation: Improving Adaptability of DeepFake Detection via Online Test-Time Adaptation
par: Nguyen-Le, Hong-Hanh, et autres
Publié: (2025)
par: Nguyen-Le, Hong-Hanh, et autres
Publié: (2025)
VietMEAgent: Culturally-Aware Few-Shot Multimodal Explanation for Vietnamese Visual Question Answering
par: Nguyen, Hai-Dang, et autres
Publié: (2025)
par: Nguyen, Hai-Dang, et autres
Publié: (2025)
Co-Learning: Towards Semi-Supervised Object Detection with Road-side Cameras
par: Yuan, Jicheng, et autres
Publié: (2024)
par: Yuan, Jicheng, et autres
Publié: (2024)
Documents similaires
-
Shape2Animal: Creative Animal Generation from Natural Silhouettes
par: Tran, Quoc-Duy, et autres
Publié: (2025) -
CONSTANT: Towards High-Quality One-Shot Handwriting Generation with Patch Contrastive Enhancement and Style-Aware Quantization
par: Le, Anh-Duy, et autres
Publié: (2026) -
Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models
par: Irawan, Patrick Amadeus, et autres
Publié: (2024) -
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
par: Irawan, Patrick Amadeus, et autres
Publié: (2026) -
TP-GMOT: Tracking Generic Multiple Object by Textual Prompt with Motion-Appearance Cost (MAC) SORT
par: Anh, Duy Le Dinh, et autres
Publié: (2024)