All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Chunhui, Sun, Xin, Yang, Yiqian, Liu, Li, Liu, Qiong, Zhou, Xi, Wang, Yanfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking
par: Zhang, Chunhui, et autres
Publié: (2025)
par: Zhang, Chunhui, et autres
Publié: (2025)
Awesome Multi-modal Object Tracking
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
Underwater Camouflaged Object Tracking Meets Vision-Language SAM2
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
WebUOT-1M: Advancing Deep Underwater Object Tracking with A Million-Scale Benchmark
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
UniSOT: A Unified Framework for Multi-Modality Single Object Tracking
par: Ma, Yinchao, et autres
Publié: (2025)
par: Ma, Yinchao, et autres
Publié: (2025)
FusionFM: All-in-One Multi-Modal Image Fusion with Flow Matching
par: Zhu, Huayi, et autres
Publié: (2025)
par: Zhu, Huayi, et autres
Publié: (2025)
TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification
par: Liu, Qinying, et autres
Publié: (2023)
par: Liu, Qinying, et autres
Publié: (2023)
Tuning Vision-Language Models with Candidate Labels by Prompt Alignment
par: Zhang, Zhifang, et autres
Publié: (2024)
par: Zhang, Zhifang, et autres
Publié: (2024)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
par: Yan, Hanqi, et autres
Publié: (2025)
par: Yan, Hanqi, et autres
Publié: (2025)
All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation
par: Wang, Xudong, et autres
Publié: (2026)
par: Wang, Xudong, et autres
Publié: (2026)
UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection
par: Sun, Fuxiang, et autres
Publié: (2026)
par: Sun, Fuxiang, et autres
Publié: (2026)
MM-Mixing: Multi-Modal Mixing Alignment for 3D Understanding
par: Wang, Jiaze, et autres
Publié: (2024)
par: Wang, Jiaze, et autres
Publié: (2024)
Cross-Modal Bidirectional Interaction Model for Referring Remote Sensing Image Segmentation
par: Dong, Zhe, et autres
Publié: (2024)
par: Dong, Zhe, et autres
Publié: (2024)
VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning
par: Jia, Zi-Yi, et autres
Publié: (2026)
par: Jia, Zi-Yi, et autres
Publié: (2026)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
par: Zheng, Yuze, et autres
Publié: (2024)
par: Zheng, Yuze, et autres
Publié: (2024)
On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
par: Guo, Jianing, et autres
Publié: (2025)
par: Guo, Jianing, et autres
Publié: (2025)
A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks
par: Jung, Hoin, et autres
Publié: (2024)
par: Jung, Hoin, et autres
Publié: (2024)
Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
par: Qian, Jiaye, et autres
Publié: (2025)
par: Qian, Jiaye, et autres
Publié: (2025)
When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models
par: Saini, Harshvardhan, et autres
Publié: (2026)
par: Saini, Harshvardhan, et autres
Publié: (2026)
Safety Alignment for Vision Language Models
par: Liu, Zhendong, et autres
Publié: (2024)
par: Liu, Zhendong, et autres
Publié: (2024)
MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding
par: Zhu, Zhiyi, et autres
Publié: (2025)
par: Zhu, Zhiyi, et autres
Publié: (2025)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
par: Feng, Qianhan, et autres
Publié: (2024)
par: Feng, Qianhan, et autres
Publié: (2024)
MambaTrack: Exploiting Dual-Enhancement for Night UAV Tracking
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
Everything Can Be Described in Words: A Simple Unified Multi-Modal Framework with Semantic and Temporal Alignment
par: Bi, Xiaowei, et autres
Publié: (2025)
par: Bi, Xiaowei, et autres
Publié: (2025)
TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks
par: Hu, Yuanze, et autres
Publié: (2025)
par: Hu, Yuanze, et autres
Publié: (2025)
IOSVLM: A 3D Vision-Language Model for Unified Dental Diagnosis from Intraoral Scans
par: Xiong, Huimin, et autres
Publié: (2026)
par: Xiong, Huimin, et autres
Publié: (2026)
Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation
par: Yang, Yang, et autres
Publié: (2024)
par: Yang, Yang, et autres
Publié: (2024)
Time Series, Vision, and Language: Exploring the Limits of Alignment in Contrastive Representation Spaces
par: Yashwante, Pratham, et autres
Publié: (2026)
par: Yashwante, Pratham, et autres
Publié: (2026)
MPT: A Large-scale Multi-Phytoplankton Tracking Benchmark
par: Yu, Yang, et autres
Publié: (2024)
par: Yu, Yang, et autres
Publié: (2024)
Learning Progressive Adaptation for Multi-Modal Tracking
par: Wang, He, et autres
Publié: (2026)
par: Wang, He, et autres
Publié: (2026)
PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation
par: Fan, Zehua, et autres
Publié: (2026)
par: Fan, Zehua, et autres
Publié: (2026)
InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing
par: Lin, Kun-Hsiang, et autres
Publié: (2025)
par: Lin, Kun-Hsiang, et autres
Publié: (2025)
Geometry-Aware Cross Modal Alignment for Light Field-LiDAR Semantic Segmentation
par: Luo, Jie, et autres
Publié: (2025)
par: Luo, Jie, et autres
Publié: (2025)
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
par: Li, Shiyao, et autres
Publié: (2024)
par: Li, Shiyao, et autres
Publié: (2024)
ROSA: Harnessing Robot States for Vision-Language and Action Alignment
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection
par: Zhu, Haowen, et autres
Publié: (2026)
par: Zhu, Haowen, et autres
Publié: (2026)
All in One: Visual-Description-Guided Unified Point Cloud Segmentation
par: Han, Zongyan, et autres
Publié: (2025)
par: Han, Zongyan, et autres
Publié: (2025)
MedMAP: Promoting Incomplete Multi-modal Brain Tumor Segmentation with Alignment
par: Liu, Tianyi, et autres
Publié: (2024)
par: Liu, Tianyi, et autres
Publié: (2024)
ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models
par: Sun, Guoheng, et autres
Publié: (2026)
par: Sun, Guoheng, et autres
Publié: (2026)
Visual Object Tracking across Diverse Data Modalities: A Review
par: Wang, Mengmeng, et autres
Publié: (2024)
par: Wang, Mengmeng, et autres
Publié: (2024)
Documents similaires
-
COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking
par: Zhang, Chunhui, et autres
Publié: (2025) -
Awesome Multi-modal Object Tracking
par: Zhang, Chunhui, et autres
Publié: (2024) -
Underwater Camouflaged Object Tracking Meets Vision-Language SAM2
par: Zhang, Chunhui, et autres
Publié: (2024) -
WebUOT-1M: Advancing Deep Underwater Object Tracking with A Million-Scale Benchmark
par: Zhang, Chunhui, et autres
Publié: (2024) -
UniSOT: A Unified Framework for Multi-Modality Single Object Tracking
par: Ma, Yinchao, et autres
Publié: (2025)