Omni Survey for Multimodality Analysis in Visual Object Tracking
Fuente:
arXiv
Saved in:
| Main Authors: | Tang, Zhangyong, Xu, Tianyang, Zhu, Xuefeng, Li, Hui, Zhao, Shaochuan, Zhou, Tao, Cheng, Chunyang, Wu, Xiaojun, Kittler, Josef |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Serial Over Parallel: Learning Continual Unification for Multi-Modal Visual Object Tracking and Benchmarking
by: Tang, Zhangyong, et al.
Published: (2025)
by: Tang, Zhangyong, et al.
Published: (2025)
Revisiting RGBT Tracking Benchmarks from the Perspective of Modality Validity: A New Benchmark, Problem, and Solution
by: Tang, Zhangyong, et al.
Published: (2024)
by: Tang, Zhangyong, et al.
Published: (2024)
UASTrack: A Unified Adaptive Selection Framework with Modality-Customization in Single Object Tracking
by: Wang, He, et al.
Published: (2025)
by: Wang, He, et al.
Published: (2025)
EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment
by: Cheng, Chunyang, et al.
Published: (2026)
by: Cheng, Chunyang, et al.
Published: (2026)
Dynamic Subframe Splitting and Spatio-Temporal Motion Entangled Sparse Attention for RGB-E Tracking
by: Shao, Pengcheng, et al.
Published: (2024)
by: Shao, Pengcheng, et al.
Published: (2024)
Learning Progressive Adaptation for Multi-Modal Tracking
by: Wang, He, et al.
Published: (2026)
by: Wang, He, et al.
Published: (2026)
TENet: Targetness Entanglement Incorporating with Multi-Scale Pooling and Mutually-Guided Fusion for RGB-E Object Tracking
by: Shao, Pengcheng, et al.
Published: (2024)
by: Shao, Pengcheng, et al.
Published: (2024)
TextFusion: Unveiling the Power of Textual Semantics for Controllable Image Fusion
by: Cheng, Chunyang, et al.
Published: (2023)
by: Cheng, Chunyang, et al.
Published: (2023)
One Model for ALL: Low-Level Task Interaction Is a Key to Task-Agnostic Image Fusion
by: Cheng, Chunyang, et al.
Published: (2025)
by: Cheng, Chunyang, et al.
Published: (2025)
A Tri-Modal Dataset and a Baseline System for Tracking Unmanned Aerial Vehicles
by: Xu, Tianyang, et al.
Published: (2025)
by: Xu, Tianyang, et al.
Published: (2025)
MMDRFuse: Distilled Mini-Model with Dynamic Refresh for Multi-Modality Image Fusion
by: Deng, Yanglin, et al.
Published: (2024)
by: Deng, Yanglin, et al.
Published: (2024)
BusReF: Infrared-Visible images registration and fusion focus on reconstructible area using one set of features
by: Zhang, Zeyang, et al.
Published: (2023)
by: Zhang, Zeyang, et al.
Published: (2023)
Beyond Strict Pairing: Arbitrarily Paired Training for High-Performance Infrared and Visible Image Fusion
by: Deng, Yanglin, et al.
Published: (2026)
by: Deng, Yanglin, et al.
Published: (2026)
Adaptive Hyper-Graph Convolution Network for Skeleton-based Human Action Recognition with Virtual Connections
by: Zhou, Youwei, et al.
Published: (2024)
by: Zhou, Youwei, et al.
Published: (2024)
FusionBooster: A Unified Image Fusion Boosting Paradigm
by: Cheng, Chunyang, et al.
Published: (2023)
by: Cheng, Chunyang, et al.
Published: (2023)
SMLNet: A SPD Manifold Learning Network for Infrared and Visible Image Fusion
by: Kang, Huan, et al.
Published: (2024)
by: Kang, Huan, et al.
Published: (2024)
GrFormer: A Novel Transformer on Grassmann Manifold for Infrared and Visible Image Fusion
by: Kang, Huan, et al.
Published: (2025)
by: Kang, Huan, et al.
Published: (2025)
An Improved Graph Pooling Network for Skeleton-Based Action Recognition
by: Wu, Cong, et al.
Published: (2024)
by: Wu, Cong, et al.
Published: (2024)
Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models
by: Li, Yuanbo, et al.
Published: (2026)
by: Li, Yuanbo, et al.
Published: (2026)
Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction
by: Li, Yuanbo, et al.
Published: (2026)
by: Li, Yuanbo, et al.
Published: (2026)
Visual Object Tracking on Multi-modal RGB-D Videos: A Review
by: Zhu, Xue-Feng, et al.
Published: (2022)
by: Zhu, Xue-Feng, et al.
Published: (2022)
Hybrid Batch Normalisation: Resolving the Dilemma of Batch Normalisation in Federated Learning
by: Chen, Hongyao, et al.
Published: (2025)
by: Chen, Hongyao, et al.
Published: (2025)
Collaborating Vision, Depth, and Thermal Signals for Multi-Modal Tracking: Dataset and Algorithm
by: Zhu, Xue-Feng, et al.
Published: (2025)
by: Zhu, Xue-Feng, et al.
Published: (2025)
OmniTracker: Unifying Object Tracking by Tracking-with-Detection
by: Wang, Junke, et al.
Published: (2023)
by: Wang, Junke, et al.
Published: (2023)
OmniVaT: Single Domain Generalization for Multimodal Visual-Tactile Learning
by: Qiu, Liuxiang, et al.
Published: (2026)
by: Qiu, Liuxiang, et al.
Published: (2026)
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
by: Wang, Zehan, et al.
Published: (2024)
by: Wang, Zehan, et al.
Published: (2024)
Single Image, Any Face: Generalisable 3D Face Generation
by: Wang, Wenqing, et al.
Published: (2024)
by: Wang, Wenqing, et al.
Published: (2024)
MERGETUNE: Continued Fine-Tuning of Vision-Language Models
by: Wang, Wenqing, et al.
Published: (2026)
by: Wang, Wenqing, et al.
Published: (2026)
Dynamic Avatar-Scene Rendering from Human-centric Context
by: Wang, Wenqing, et al.
Published: (2025)
by: Wang, Wenqing, et al.
Published: (2025)
C2C: Component-to-Composition Learning for Zero-Shot Compositional Action Recognition
by: Li, Rongchang, et al.
Published: (2024)
by: Li, Rongchang, et al.
Published: (2024)
SAMITE: Position Prompted SAM2 with Calibrated Memory for Visual Object Tracking
by: Xu, Qianxiong, et al.
Published: (2025)
by: Xu, Qianxiong, et al.
Published: (2025)
Omni6DPose: A Benchmark and Model for Universal 6D Object Pose Estimation and Tracking
by: Zhang, Jiyao, et al.
Published: (2024)
by: Zhang, Jiyao, et al.
Published: (2024)
T-Rex-Omni: Integrating Negative Visual Prompt in Generic Object Detection
by: Zhou, Jiazhou, et al.
Published: (2025)
by: Zhou, Jiazhou, et al.
Published: (2025)
S4Fusion: Saliency-aware Selective State Space Model for Infrared Visible Image Fusion
by: Ma, Haolong, et al.
Published: (2024)
by: Ma, Haolong, et al.
Published: (2024)
OmniTrack++: Omnidirectional Multi-Object Tracking by Learning Large-FoV Trajectory Feedback
by: Luo, Kai, et al.
Published: (2025)
by: Luo, Kai, et al.
Published: (2025)
Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking
by: Zhu, Deyi, et al.
Published: (2026)
by: Zhu, Deyi, et al.
Published: (2026)
Paving the Way for Point Cloud Video Representation Learning Using A PDE Model
by: Huang, Zhuoxu, et al.
Published: (2026)
by: Huang, Zhuoxu, et al.
Published: (2026)
Exploiting Multimodal Spatial-temporal Patterns for Video Object Tracking
by: Hu, Xiantao, et al.
Published: (2024)
by: Hu, Xiantao, et al.
Published: (2024)
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
by: Zhou, Donghao, et al.
Published: (2026)
by: Zhou, Donghao, et al.
Published: (2026)
SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking
by: Hou, Xiaojun, et al.
Published: (2024)
by: Hou, Xiaojun, et al.
Published: (2024)
Similar Items
-
Serial Over Parallel: Learning Continual Unification for Multi-Modal Visual Object Tracking and Benchmarking
by: Tang, Zhangyong, et al.
Published: (2025) -
Revisiting RGBT Tracking Benchmarks from the Perspective of Modality Validity: A New Benchmark, Problem, and Solution
by: Tang, Zhangyong, et al.
Published: (2024) -
UASTrack: A Unified Adaptive Selection Framework with Modality-Customization in Single Object Tracking
by: Wang, He, et al.
Published: (2025) -
EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment
by: Cheng, Chunyang, et al.
Published: (2026) -
Dynamic Subframe Splitting and Spatio-Temporal Motion Entangled Sparse Attention for RGB-E Tracking
by: Shao, Pengcheng, et al.
Published: (2024)