Context-Aware Integration of Language and Visual References for Natural Language Tracking
Fuente:
arXiv
Guardado en:
| Autores principales: | Shao, Yanyan, He, Shuting, Ye, Qi, Feng, Yuchao, Luo, Wenhan, Chen, Jiming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SAM-PD: How Far Can SAM Take Us in Tracking and Segmenting Anything in Videos by Prompt Denoising
por: Zhou, Tao, et al.
Publicado: (2024)
por: Zhou, Tao, et al.
Publicado: (2024)
RefMask3D: Language-Guided Transformer for 3D Referring Segmentation
por: He, Shuting, et al.
Publicado: (2024)
por: He, Shuting, et al.
Publicado: (2024)
REMOTE: Real-time Ego-motion Tracking for Various Endoscopes via Multimodal Visual Feature Learning
por: Shao, Liangjing, et al.
Publicado: (2025)
por: Shao, Liangjing, et al.
Publicado: (2025)
Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation
por: He, Shuting, et al.
Publicado: (2024)
por: He, Shuting, et al.
Publicado: (2024)
Improving Local Feature Matching by Entropy-inspired Scale Adaptability and Flow-endowed Local Consistency
por: Jin, Ke, et al.
Publicado: (2026)
por: Jin, Ke, et al.
Publicado: (2026)
Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
por: Ye, Zixuan, et al.
Publicado: (2025)
por: Ye, Zixuan, et al.
Publicado: (2025)
Coordinate-Aware Thermal Infrared Tracking Via Natural Language Modeling
por: Yan, Miao, et al.
Publicado: (2024)
por: Yan, Miao, et al.
Publicado: (2024)
GazeXplain: Learning to Predict Natural Language Explanations of Visual Scanpaths
por: Chen, Xianyu, et al.
Publicado: (2024)
por: Chen, Xianyu, et al.
Publicado: (2024)
Radar and Camera Fusion for Object Detection and Tracking: A Comprehensive Survey
por: Shi, Kun, et al.
Publicado: (2024)
por: Shi, Kun, et al.
Publicado: (2024)
Calibration & Reconstruction: Deep Integrated Language for Referring Image Segmentation
por: Yan, Yichen, et al.
Publicado: (2024)
por: Yan, Yichen, et al.
Publicado: (2024)
Bridging Vision and Language for Robust Context-Aware Surgical Point Tracking: The VL-SurgPT Dataset and Benchmark
por: Zhou, Rulin, et al.
Publicado: (2025)
por: Zhou, Rulin, et al.
Publicado: (2025)
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
por: Liang, Chen, et al.
Publicado: (2022)
por: Liang, Chen, et al.
Publicado: (2022)
Dynamic Updates for Language Adaptation in Visual-Language Tracking
por: Li, Xiaohai, et al.
Publicado: (2025)
por: Li, Xiaohai, et al.
Publicado: (2025)
Edit Transfer: Learning Image Editing via Vision In-Context Relations
por: Chen, Lan, et al.
Publicado: (2025)
por: Chen, Lan, et al.
Publicado: (2025)
Attribute-based Visual Reprogramming for Vision-Language Models
por: Cai, Chengyi, et al.
Publicado: (2025)
por: Cai, Chengyi, et al.
Publicado: (2025)
GLAD: Generative Language-Assisted Visual Tracking for Low-Semantic Templates
por: Luo, Xingyu, et al.
Publicado: (2026)
por: Luo, Xingyu, et al.
Publicado: (2026)
UNIC: Unified In-Context Video Editing
por: Ye, Zixuan, et al.
Publicado: (2025)
por: Ye, Zixuan, et al.
Publicado: (2025)
Where am I? Cross-View Geo-localization with Natural Language Descriptions
por: Ye, Junyan, et al.
Publicado: (2024)
por: Ye, Junyan, et al.
Publicado: (2024)
ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking
por: Feng, X., et al.
Publicado: (2025)
por: Feng, X., et al.
Publicado: (2025)
Tell Me What to Track: Infusing Robust Language Guidance for Enhanced Referring Multi-Object Tracking
por: Huang, Wenjun, et al.
Publicado: (2024)
por: Huang, Wenjun, et al.
Publicado: (2024)
SegPoint: Segment Any Point Cloud via Large Language Model
por: He, Shuting, et al.
Publicado: (2024)
por: He, Shuting, et al.
Publicado: (2024)
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
por: Liu, Xu, et al.
Publicado: (2026)
por: Liu, Xu, et al.
Publicado: (2026)
Task-Aware Resolution Optimization for Visual Large Language Models
por: Luo, Weiqing, et al.
Publicado: (2025)
por: Luo, Weiqing, et al.
Publicado: (2025)
RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning
por: Huang, Shiqi, et al.
Publicado: (2026)
por: Huang, Shiqi, et al.
Publicado: (2026)
Referring Video Object Segmentation via Language-aligned Track Selection
por: Kim, Seongchan, et al.
Publicado: (2024)
por: Kim, Seongchan, et al.
Publicado: (2024)
Geometry-Aware 3D Salient Object Detection Network
por: Wang, Chen, et al.
Publicado: (2025)
por: Wang, Chen, et al.
Publicado: (2025)
ReferSplat: Referring Segmentation in 3D Gaussian Splatting
por: He, Shuting, et al.
Publicado: (2025)
por: He, Shuting, et al.
Publicado: (2025)
VTAO-BiManip: Masked Visual-Tactile-Action Pre-training with Object Understanding for Bimanual Dexterous Manipulation
por: Sun, Zhengnan, et al.
Publicado: (2025)
por: Sun, Zhengnan, et al.
Publicado: (2025)
DTLLM-VLT: Diverse Text Generation for Visual Language Tracking Based on LLM
por: Li, Xuchen, et al.
Publicado: (2024)
por: Li, Xuchen, et al.
Publicado: (2024)
Instance-level Visual Active Tracking with Occlusion-Aware Planning
por: Sun, Haowei, et al.
Publicado: (2026)
por: Sun, Haowei, et al.
Publicado: (2026)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
por: Feng, X., et al.
Publicado: (2024)
por: Feng, X., et al.
Publicado: (2024)
EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing
por: Chen, Lan, et al.
Publicado: (2026)
por: Chen, Lan, et al.
Publicado: (2026)
VL-UniTrack: A Unified Framework with Visual-Language Prompts for UAV-Ground Visual Tracking
por: Xu, Boyue, et al.
Publicado: (2026)
por: Xu, Boyue, et al.
Publicado: (2026)
GREx: Generalized Referring Expression Segmentation, Comprehension, and Generation
por: Ding, Henghui, et al.
Publicado: (2026)
por: Ding, Henghui, et al.
Publicado: (2026)
Learning to Track Instance from Single Nature Language Description
por: Zheng, Yaozong, et al.
Publicado: (2026)
por: Zheng, Yaozong, et al.
Publicado: (2026)
SCORE: Scene Context Matters in Open-Vocabulary Remote Sensing Instance Segmentation
por: Huang, Shiqi, et al.
Publicado: (2025)
por: Huang, Shiqi, et al.
Publicado: (2025)
Explicit Context Reasoning with Supervision for Visual Tracking
por: Zeng, Fansheng, et al.
Publicado: (2025)
por: Zeng, Fansheng, et al.
Publicado: (2025)
Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning
por: Fu, Rao, et al.
Publicado: (2024)
por: Fu, Rao, et al.
Publicado: (2024)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
por: Li, Xuchen, et al.
Publicado: (2024)
por: Li, Xuchen, et al.
Publicado: (2024)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
por: Zhou, Zikun, et al.
Publicado: (2024)
por: Zhou, Zikun, et al.
Publicado: (2024)
Ejemplares similares
-
SAM-PD: How Far Can SAM Take Us in Tracking and Segmenting Anything in Videos by Prompt Denoising
por: Zhou, Tao, et al.
Publicado: (2024) -
RefMask3D: Language-Guided Transformer for 3D Referring Segmentation
por: He, Shuting, et al.
Publicado: (2024) -
REMOTE: Real-time Ego-motion Tracking for Various Endoscopes via Multimodal Visual Feature Learning
por: Shao, Liangjing, et al.
Publicado: (2025) -
Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation
por: He, Shuting, et al.
Publicado: (2024) -
Improving Local Feature Matching by Entropy-inspired Scale Adaptability and Flow-endowed Local Consistency
por: Jin, Ke, et al.
Publicado: (2026)