LoSh: Long-Short Text Joint Prediction Network for Referring Video Object Segmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Linfeng, Shi, Miaojing, Yue, Zijie, Chen, Qijun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Weakly-Supervised Referring Video Object Segmentation through Text Supervision
di: Shi, Miaojing, et al.
Pubblicazione: (2026)
di: Shi, Miaojing, et al.
Pubblicazione: (2026)
Enhancing Space-time Video Super-resolution via Spatial-temporal Feature Interaction
di: Yue, Zijie, et al.
Pubblicazione: (2022)
di: Yue, Zijie, et al.
Pubblicazione: (2022)
Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting
di: Zhang, Xiaowen, et al.
Pubblicazione: (2026)
di: Zhang, Xiaowen, et al.
Pubblicazione: (2026)
Text-promptable Object Counting via Quantity Awareness Enhancement
di: Shi, Miaojing, et al.
Pubblicazione: (2025)
di: Shi, Miaojing, et al.
Pubblicazione: (2025)
Bootstrapping Vision-language Models for Self-supervised Remote Physiological Measurement
di: Yue, Zijie, et al.
Pubblicazione: (2024)
di: Yue, Zijie, et al.
Pubblicazione: (2024)
Memory-guided Network with Uncertainty-based Feature Augmentation for Few-shot Semantic Segmentation
di: Chen, Xinyue, et al.
Pubblicazione: (2024)
di: Chen, Xinyue, et al.
Pubblicazione: (2024)
Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation
di: Zhu, Zixin, et al.
Pubblicazione: (2024)
di: Zhu, Zixin, et al.
Pubblicazione: (2024)
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation
di: Liang, Tianming, et al.
Pubblicazione: (2025)
di: Liang, Tianming, et al.
Pubblicazione: (2025)
Text Promptable Surgical Instrument Segmentation with Vision-Language Models
di: Zhou, Zijian, et al.
Pubblicazione: (2023)
di: Zhou, Zijian, et al.
Pubblicazione: (2023)
Boosting Object Detection with Zero-Shot Day-Night Domain Adaptation
di: Du, Zhipeng, et al.
Pubblicazione: (2023)
di: Du, Zhipeng, et al.
Pubblicazione: (2023)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
di: Liang, Tianming, et al.
Pubblicazione: (2025)
di: Liang, Tianming, et al.
Pubblicazione: (2025)
Large Model driven Radiology Report Generation with Clinical Quality Reinforcement Learning
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model
di: Zhang, Ruixin, et al.
Pubblicazione: (2025)
di: Zhang, Ruixin, et al.
Pubblicazione: (2025)
LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation
di: Yan, Cilin, et al.
Pubblicazione: (2025)
di: Yan, Cilin, et al.
Pubblicazione: (2025)
Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation
di: Jiang, Haichao, et al.
Pubblicazione: (2026)
di: Jiang, Haichao, et al.
Pubblicazione: (2026)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025)
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025)
Enhancing Generalized Few-Shot Semantic Segmentation via Effective Knowledge Transfer
di: Chen, Xinyue, et al.
Pubblicazione: (2024)
di: Chen, Xinyue, et al.
Pubblicazione: (2024)
EventRR: Event Referential Reasoning for Referring Video Object Segmentation
di: Xu, Huihui, et al.
Pubblicazione: (2025)
di: Xu, Huihui, et al.
Pubblicazione: (2025)
Unsupervised Integrated-Circuit Defect Segmentation via Image-Intrinsic Normality
di: Zhao, Botong, et al.
Pubblicazione: (2025)
di: Zhao, Botong, et al.
Pubblicazione: (2025)
DAPL: Integration of Positive and Negative Descriptions in Text-Based Person Search
di: Deng, Yuchuan, et al.
Pubblicazione: (2024)
di: Deng, Yuchuan, et al.
Pubblicazione: (2024)
InterRVOS: Interaction-aware Referring Video Object Segmentation
di: Jin, Woojeong, et al.
Pubblicazione: (2025)
di: Jin, Woojeong, et al.
Pubblicazione: (2025)
Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
di: Miao, Bo, et al.
Pubblicazione: (2024)
di: Miao, Bo, et al.
Pubblicazione: (2024)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
di: Sun, Baoli, et al.
Pubblicazione: (2025)
di: Sun, Baoli, et al.
Pubblicazione: (2025)
Optimizing Dense Visual Predictions Through Multi-Task Coherence and Prioritization
di: Fontana, Maxime, et al.
Pubblicazione: (2024)
di: Fontana, Maxime, et al.
Pubblicazione: (2024)
Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA
di: Wu, Zexi, et al.
Pubblicazione: (2026)
di: Wu, Zexi, et al.
Pubblicazione: (2026)
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
di: Lin, Ci-Siang, et al.
Pubblicazione: (2024)
di: Lin, Ci-Siang, et al.
Pubblicazione: (2024)
SALI: Short-term Alignment and Long-term Interaction Network for Colonoscopy Video Polyp Segmentation
di: Hu, Qiang, et al.
Pubblicazione: (2024)
di: Hu, Qiang, et al.
Pubblicazione: (2024)
Temporal Grounding as a Learning Signal for Referring Video Object Segmentation
di: Lee, Seunghun, et al.
Pubblicazione: (2025)
di: Lee, Seunghun, et al.
Pubblicazione: (2025)
SVAC: Scaling Is All You Need For Referring Video Object Segmentation
di: Zhang, Li, et al.
Pubblicazione: (2025)
di: Zhang, Li, et al.
Pubblicazione: (2025)
Referring Video Object Segmentation via Language-aligned Track Selection
di: Kim, Seongchan, et al.
Pubblicazione: (2024)
di: Kim, Seongchan, et al.
Pubblicazione: (2024)
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
di: Choi, Sun-Hyuk, et al.
Pubblicazione: (2025)
di: Choi, Sun-Hyuk, et al.
Pubblicazione: (2025)
Mamba-based Spatio-Frequency Motion Perception for Video Camouflaged Object Detection
di: Li, Xin, et al.
Pubblicazione: (2025)
di: Li, Xin, et al.
Pubblicazione: (2025)
AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation
di: Jin, Woojeong, et al.
Pubblicazione: (2026)
di: Jin, Woojeong, et al.
Pubblicazione: (2026)
Grounding Surgical Action Triplets with Instrument Instance Segmentation: A Dataset and Target-Aware Fusion Approach
di: Alabi, Oluwatosin, et al.
Pubblicazione: (2025)
di: Alabi, Oluwatosin, et al.
Pubblicazione: (2025)
Event-assisted Low-Light Video Object Segmentation
di: Li, Hebei, et al.
Pubblicazione: (2024)
di: Li, Hebei, et al.
Pubblicazione: (2024)
SurgPIS: Surgical-instrument-level Instances and Part-level Semantics for Weakly-supervised Part-aware Instance Segmentation
di: Wei, Meng, et al.
Pubblicazione: (2025)
di: Wei, Meng, et al.
Pubblicazione: (2025)
LoCoNet: Long-Short Context Network for Active Speaker Detection
di: Wang, Xizi, et al.
Pubblicazione: (2023)
di: Wang, Xizi, et al.
Pubblicazione: (2023)
Show Me When and Where: Towards Referring Video Object Segmentation in the Wild
di: Gao, Mingqi, et al.
Pubblicazione: (2026)
di: Gao, Mingqi, et al.
Pubblicazione: (2026)
VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation
di: Zhou, Zijian, et al.
Pubblicazione: (2023)
di: Zhou, Zijian, et al.
Pubblicazione: (2023)
FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selection
di: Fontana, Maxime, et al.
Pubblicazione: (2026)
di: Fontana, Maxime, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Weakly-Supervised Referring Video Object Segmentation through Text Supervision
di: Shi, Miaojing, et al.
Pubblicazione: (2026) -
Enhancing Space-time Video Super-resolution via Spatial-temporal Feature Interaction
di: Yue, Zijie, et al.
Pubblicazione: (2022) -
Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting
di: Zhang, Xiaowen, et al.
Pubblicazione: (2026) -
Text-promptable Object Counting via Quantity Awareness Enhancement
di: Shi, Miaojing, et al.
Pubblicazione: (2025) -
Bootstrapping Vision-language Models for Self-supervised Remote Physiological Measurement
di: Yue, Zijie, et al.
Pubblicazione: (2024)