IDSelect: A RL-Based Cost-Aware Selection Agent for Video-based Multi-Modal Person Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Yuyang, Shen, Yixuan, Nguyen, Kien, Zhou, Lifeng, Liu, Feng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Person Recognition in Aerial Surveillance: A Decade Survey
par: Nguyen, Kien, et autres
Publié: (2025)
par: Nguyen, Kien, et autres
Publié: (2025)
AG-VPReID: A Challenging Large-Scale Benchmark for Aerial-Ground Video-based Person Re-Identification
par: Nguyen, Huy, et autres
Publié: (2025)
par: Nguyen, Huy, et autres
Publié: (2025)
AG-VPReID.VIR: Bridging Aerial and Ground Platforms for Video-based Visible-Infrared Person Re-ID
par: Nguyen, Huy, et autres
Publié: (2025)
par: Nguyen, Huy, et autres
Publié: (2025)
From 3D Pose to Prose: Biomechanics-Grounded Vision--Language Coaching
par: Ji, Yuyang, et autres
Publié: (2026)
par: Ji, Yuyang, et autres
Publié: (2026)
Non-Colliding Biometric Identities for Digital Entities: Geometry, Capacity, and Million-Scale Virtual Identity Provisioning
par: Ji, Yuyang, et autres
Publié: (2026)
par: Ji, Yuyang, et autres
Publié: (2026)
SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
par: Zhou, Xingcheng, et autres
Publié: (2026)
par: Zhou, Xingcheng, et autres
Publié: (2026)
AG-ReID.v2: Bridging Aerial and Ground Views for Person Re-identification
par: Nguyen, Huy, et autres
Publié: (2024)
par: Nguyen, Huy, et autres
Publié: (2024)
Revisiting the Role of Texture in 3D Person Re-identification
par: Nguyen, Huy, et autres
Publié: (2024)
par: Nguyen, Huy, et autres
Publié: (2024)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
par: Huang, Jiehui, et autres
Publié: (2025)
par: Huang, Jiehui, et autres
Publié: (2025)
OmniGCD: Abstracting Generalized Category Discovery for Modality Agnosticism
par: Shipard, Jordan, et autres
Publié: (2026)
par: Shipard, Jordan, et autres
Publié: (2026)
h-Edit: Effective and Flexible Diffusion-Based Editing via Doob's h-Transform
par: Nguyen, Toan, et autres
Publié: (2025)
par: Nguyen, Toan, et autres
Publié: (2025)
Socratic Chart: Cooperating Multiple Agents for Robust SVG Chart Understanding
par: Ji, Yuyang, et autres
Publié: (2025)
par: Ji, Yuyang, et autres
Publié: (2025)
FlexiReID: Adaptive Mixture of Expert for Multi-Modal Person Re-Identification
par: Sun, Zhen, et autres
Publié: (2025)
par: Sun, Zhen, et autres
Publié: (2025)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
par: Li, Liyang, et autres
Publié: (2026)
par: Li, Liyang, et autres
Publié: (2026)
CoSTA$\ast$: Cost-Sensitive Toolpath Agent for Multi-turn Image Editing
par: Gupta, Advait, et autres
Publié: (2025)
par: Gupta, Advait, et autres
Publié: (2025)
Filling the Gaps: A Multitask Hybrid Multiscale Generative Framework for Missing Modality in Remote Sensing Semantic Segmentation
par: Kieu, Nhi, et autres
Publié: (2025)
par: Kieu, Nhi, et autres
Publié: (2025)
DIS2: Disentanglement Meets Distillation with Classwise Attention for Robust Remote Sensing Segmentation under Missing Modalities
par: Kieu, Nhi, et autres
Publié: (2026)
par: Kieu, Nhi, et autres
Publié: (2026)
Modality-Aware Bias Mitigation and Invariance Learning for Unsupervised Visible-Infrared Person Re-Identification
par: Wang, Menglin, et autres
Publié: (2025)
par: Wang, Menglin, et autres
Publié: (2025)
Action Selection Learning for Multi-label Multi-view Action Recognition
par: Nguyen, Trung Thanh, et autres
Publié: (2024)
par: Nguyen, Trung Thanh, et autres
Publié: (2024)
Recognition of Daily Activities through Multi-Modal Deep Learning: A Video, Pose, and Object-Aware Approach for Ambient Assisted Living
par: Hashemifard, Kooshan, et autres
Publié: (2026)
par: Hashemifard, Kooshan, et autres
Publié: (2026)
FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation
par: Le, Minh Khoa, et autres
Publié: (2026)
par: Le, Minh Khoa, et autres
Publié: (2026)
Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition
par: Cong, Kaixuan, et autres
Publié: (2025)
par: Cong, Kaixuan, et autres
Publié: (2025)
MultiCOIN: Multi-Modal COntrollable Video INbetweening
par: Tanveer, Maham, et autres
Publié: (2025)
par: Tanveer, Maham, et autres
Publié: (2025)
BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration
par: Gao, Bo, et autres
Publié: (2026)
par: Gao, Bo, et autres
Publié: (2026)
VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT
par: Zhi, Zhuo, et autres
Publié: (2025)
par: Zhi, Zhuo, et autres
Publié: (2025)
UniSOT: A Unified Framework for Multi-Modality Single Object Tracking
par: Ma, Yinchao, et autres
Publié: (2025)
par: Ma, Yinchao, et autres
Publié: (2025)
Event-based Video Person Re-identification via Cross-Modality and Temporal Collaboration
par: Li, Renkai, et autres
Publié: (2025)
par: Li, Renkai, et autres
Publié: (2025)
AG-VPReID 2025: Aerial-Ground Video-based Person Re-identification Challenge Results
par: Nguyen, Kien, et autres
Publié: (2025)
par: Nguyen, Kien, et autres
Publié: (2025)
Multi-Modality Co-Learning for Efficient Skeleton-based Action Recognition
par: Liu, Jinfu, et autres
Publié: (2024)
par: Liu, Jinfu, et autres
Publié: (2024)
LLandMark: A Multi-Agent Framework for Landmark-Aware Multimodal Interactive Video Retrieval
par: Phung, Minh-Chi, et autres
Publié: (2026)
par: Phung, Minh-Chi, et autres
Publié: (2026)
Learning Language-Driven Sequence-Level Modal-Invariant Representations for Video-Based Visible-Infrared Person Re-Identification
par: Yang, Xiaomei, et autres
Publié: (2026)
par: Yang, Xiaomei, et autres
Publié: (2026)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
par: Wang, Junyang, et autres
Publié: (2024)
par: Wang, Junyang, et autres
Publié: (2024)
End-to-End Multi-Person Pose Estimation with Pose-Aware Video Transformer
par: Yu, Yonghui, et autres
Publié: (2025)
par: Yu, Yonghui, et autres
Publié: (2025)
MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
par: Wu, Peiran, et autres
Publié: (2025)
par: Wu, Peiran, et autres
Publié: (2025)
Multi-modal Speech Emotion Recognition via Feature Distribution Adaptation Network
par: Li, Shaokai, et autres
Publié: (2024)
par: Li, Shaokai, et autres
Publié: (2024)
ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
par: Pan, Panwang, et autres
Publié: (2025)
par: Pan, Panwang, et autres
Publié: (2025)
Mono3DV: Monocular 3D Object Detection with 3D-Aware Bipartite Matching and Variational Query DeNoising
par: Vu, Kiet Dang, et autres
Publié: (2026)
par: Vu, Kiet Dang, et autres
Publié: (2026)
MMGait: Towards Multi-Modal Gait Recognition
par: Wang, Chenye, et autres
Publié: (2026)
par: Wang, Chenye, et autres
Publié: (2026)
SuMa: A Subspace Mapping Approach for Robust and Effective Concept Erasure in Text-to-Image Diffusion Models
par: Nguyen, Kien, et autres
Publié: (2025)
par: Nguyen, Kien, et autres
Publié: (2025)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
Documents similaires
-
Person Recognition in Aerial Surveillance: A Decade Survey
par: Nguyen, Kien, et autres
Publié: (2025) -
AG-VPReID: A Challenging Large-Scale Benchmark for Aerial-Ground Video-based Person Re-Identification
par: Nguyen, Huy, et autres
Publié: (2025) -
AG-VPReID.VIR: Bridging Aerial and Ground Platforms for Video-based Visible-Infrared Person Re-ID
par: Nguyen, Huy, et autres
Publié: (2025) -
From 3D Pose to Prose: Biomechanics-Grounded Vision--Language Coaching
par: Ji, Yuyang, et autres
Publié: (2026) -
Non-Colliding Biometric Identities for Digital Entities: Geometry, Capacity, and Million-Scale Virtual Identity Provisioning
par: Ji, Yuyang, et autres
Publié: (2026)