DTLLM-VLT: Diverse Text Generation for Visual Language Tracking Based on LLM
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Xuchen, Feng, Xiaokun, Hu, Shiyu, Wu, Meiqi, Zhang, Dailing, Zhang, Jing, Huang, Kaiqi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
von: Li, Xuchen, et al.
Veröffentlicht: (2024)
von: Li, Xuchen, et al.
Veröffentlicht: (2024)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
von: Li, Xuchen, et al.
Veröffentlicht: (2024)
von: Li, Xuchen, et al.
Veröffentlicht: (2024)
How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking
von: Li, Xuchen, et al.
Veröffentlicht: (2024)
von: Li, Xuchen, et al.
Veröffentlicht: (2024)
VS-LLM: Visual-Semantic Depression Assessment based on LLM for Drawing Projection Test
von: Wu, Meiqi, et al.
Veröffentlicht: (2025)
von: Wu, Meiqi, et al.
Veröffentlicht: (2025)
Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning
von: Li, Xuchen, et al.
Veröffentlicht: (2025)
von: Li, Xuchen, et al.
Veröffentlicht: (2025)
CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos
von: Li, Xuchen, et al.
Veröffentlicht: (2025)
von: Li, Xuchen, et al.
Veröffentlicht: (2025)
Latent Temporal Discrepancy as Motion Prior: A Loss-Weighting Strategy for Dynamic Fidelity in T2V
von: Wu, Meiqi, et al.
Veröffentlicht: (2026)
von: Wu, Meiqi, et al.
Veröffentlicht: (2026)
DARTer: Dynamic Adaptive Representation Tracker for Nighttime UAV Tracking
von: Li, Xuzhao, et al.
Veröffentlicht: (2025)
von: Li, Xuzhao, et al.
Veröffentlicht: (2025)
ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints
von: Wu, Meiqi, et al.
Veröffentlicht: (2025)
von: Wu, Meiqi, et al.
Veröffentlicht: (2025)
Finger in Camera Speaks Everything: Unconstrained Air-Writing for Real-World
von: Wu, Meiqi, et al.
Veröffentlicht: (2024)
von: Wu, Meiqi, et al.
Veröffentlicht: (2024)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
von: Chen, Honghao, et al.
Veröffentlicht: (2025)
von: Chen, Honghao, et al.
Veröffentlicht: (2025)
Revealing the Dark Secrets of Extremely Large Kernel ConvNets on Robustness
von: Chen, Honghao, et al.
Veröffentlicht: (2024)
von: Chen, Honghao, et al.
Veröffentlicht: (2024)
MATrack: Efficient Multiscale Adaptive Tracker for Real-Time Nighttime UAV Operations
von: Li, Xuzhao, et al.
Veröffentlicht: (2025)
von: Li, Xuzhao, et al.
Veröffentlicht: (2025)
Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images
von: Li, Xuchen, et al.
Veröffentlicht: (2026)
von: Li, Xuchen, et al.
Veröffentlicht: (2026)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
von: Feng, X., et al.
Veröffentlicht: (2024)
von: Feng, X., et al.
Veröffentlicht: (2024)
VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis
von: Wu, Shiyu, et al.
Veröffentlicht: (2025)
von: Wu, Shiyu, et al.
Veröffentlicht: (2025)
Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
von: Mao, Fangyuan, et al.
Veröffentlicht: (2025)
von: Mao, Fangyuan, et al.
Veröffentlicht: (2025)
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
von: Liu, Xinqi, et al.
Veröffentlicht: (2024)
von: Liu, Xinqi, et al.
Veröffentlicht: (2024)
FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning
von: Hu, Shiyu, et al.
Veröffentlicht: (2024)
von: Hu, Shiyu, et al.
Veröffentlicht: (2024)
Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking
von: Xuan, Shiyu, et al.
Veröffentlicht: (2025)
von: Xuan, Shiyu, et al.
Veröffentlicht: (2025)
VMBench: A Benchmark for Perception-Aligned Video Motion Generation
von: Ling, Xinran, et al.
Veröffentlicht: (2025)
von: Ling, Xinran, et al.
Veröffentlicht: (2025)
Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models
von: Wu, Meiqi, et al.
Veröffentlicht: (2026)
von: Wu, Meiqi, et al.
Veröffentlicht: (2026)
Text2Interact: High-Fidelity and Diverse Text-to-Two-Person Interaction Generation
von: Wu, Qingxuan, et al.
Veröffentlicht: (2025)
von: Wu, Qingxuan, et al.
Veröffentlicht: (2025)
UNIV: Unified Foundation Model for Infrared and Visible Modalities
von: Mao, Fangyuan, et al.
Veröffentlicht: (2025)
von: Mao, Fangyuan, et al.
Veröffentlicht: (2025)
Harmonizing Visual Text Comprehension and Generation
von: Zhao, Zhen, et al.
Veröffentlicht: (2024)
von: Zhao, Zhen, et al.
Veröffentlicht: (2024)
ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking
von: Feng, X., et al.
Veröffentlicht: (2025)
von: Feng, X., et al.
Veröffentlicht: (2025)
Tracking by Detection and Query: An Efficient End-to-End Framework for Multi-Object Tracking
von: Jia, Shukun, et al.
Veröffentlicht: (2024)
von: Jia, Shukun, et al.
Veröffentlicht: (2024)
LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model
von: Wang, Dongkai, et al.
Veröffentlicht: (2024)
von: Wang, Dongkai, et al.
Veröffentlicht: (2024)
Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation
von: Zhao, Chenxi, et al.
Veröffentlicht: (2026)
von: Zhao, Chenxi, et al.
Veröffentlicht: (2026)
Few-Shot Learner Generalizes Across AI-Generated Image Detection
von: Wu, Shiyu, et al.
Veröffentlicht: (2025)
von: Wu, Shiyu, et al.
Veröffentlicht: (2025)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
von: Chen, Chubin, et al.
Veröffentlicht: (2025)
von: Chen, Chubin, et al.
Veröffentlicht: (2025)
Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning
von: Li, Xuchen, et al.
Veröffentlicht: (2025)
von: Li, Xuchen, et al.
Veröffentlicht: (2025)
LLM-Enabled Style and Content Regularization for Personalized Text-to-Image Generation
von: Yu, Anran, et al.
Veröffentlicht: (2025)
von: Yu, Anran, et al.
Veröffentlicht: (2025)
GLAD: Generative Language-Assisted Visual Tracking for Low-Semantic Templates
von: Luo, Xingyu, et al.
Veröffentlicht: (2026)
von: Luo, Xingyu, et al.
Veröffentlicht: (2026)
Leveraging Text-to-Image Diffusion Models for Unsupervised Visual Object Tracking
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)
VPTracker: Global Vision-Language Tracking via Visual Prompt
von: Wang, Jingchao, et al.
Veröffentlicht: (2025)
von: Wang, Jingchao, et al.
Veröffentlicht: (2025)
Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation
von: He, Yiguo, et al.
Veröffentlicht: (2025)
von: He, Yiguo, et al.
Veröffentlicht: (2025)
Unifying Visual and Vision-Language Tracking via Contrastive Learning
von: Ma, Yinchao, et al.
Veröffentlicht: (2024)
von: Ma, Yinchao, et al.
Veröffentlicht: (2024)
VL-UniTrack: A Unified Framework with Visual-Language Prompts for UAV-Ground Visual Tracking
von: Xu, Boyue, et al.
Veröffentlicht: (2026)
von: Xu, Boyue, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
von: Li, Xuchen, et al.
Veröffentlicht: (2024) -
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
von: Li, Xuchen, et al.
Veröffentlicht: (2024) -
How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking
von: Li, Xuchen, et al.
Veröffentlicht: (2024) -
VS-LLM: Visual-Semantic Depression Assessment based on LLM for Drawing Projection Test
von: Wu, Meiqi, et al.
Veröffentlicht: (2025) -
Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning
von: Li, Xuchen, et al.
Veröffentlicht: (2025)