AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Jin, Woojeong, Lee, Jaeho, Shin, Heeseong, Jang, Seungho, Heo, Junhwan, Kim, Seungryong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
InterRVOS: Interaction-aware Referring Video Object Segmentation
por: Jin, Woojeong, et al.
Publicado: (2025)
por: Jin, Woojeong, et al.
Publicado: (2025)
Referring Video Object Segmentation via Language-aligned Track Selection
por: Kim, Seongchan, et al.
Publicado: (2024)
por: Kim, Seongchan, et al.
Publicado: (2024)
AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method
por: Miao, Deshui, et al.
Publicado: (2026)
por: Miao, Deshui, et al.
Publicado: (2026)
DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation
por: Hong, Susung, et al.
Publicado: (2023)
por: Hong, Susung, et al.
Publicado: (2023)
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation
por: Liang, Tianming, et al.
Publicado: (2025)
por: Liang, Tianming, et al.
Publicado: (2025)
Exploring Conditions for Diffusion models in Robotic Control
por: Shin, Heeseong, et al.
Publicado: (2025)
por: Shin, Heeseong, et al.
Publicado: (2025)
Enhancing Sa2VA for Referent Video Object Segmentation: 2nd Solution for 7th LSVOS RVOS Track
por: Hong, Ran, et al.
Publicado: (2025)
por: Hong, Ran, et al.
Publicado: (2025)
Multi-Granularity Video Object Segmentation
por: Lim, Sangbeom, et al.
Publicado: (2024)
por: Lim, Sangbeom, et al.
Publicado: (2024)
PLOT: Pseudo-Labeling via Video Object Tracking for Scalable Monocular 3D Object Detection
por: Lee, Seokyeong, et al.
Publicado: (2025)
por: Lee, Seokyeong, et al.
Publicado: (2025)
Track Anything Behind Everything: Zero-Shot Amodal Video Object Segmentation
por: Hudson, Finlay G. C., et al.
Publicado: (2024)
por: Hudson, Finlay G. C., et al.
Publicado: (2024)
ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking
por: Chamiti, Tzoulio, et al.
Publicado: (2025)
por: Chamiti, Tzoulio, et al.
Publicado: (2025)
MATRIX: Mask Track Alignment for Interaction-aware Video Generation
por: Jin, Siyoon, et al.
Publicado: (2025)
por: Jin, Siyoon, et al.
Publicado: (2025)
CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation
por: Cho, Seokju, et al.
Publicado: (2023)
por: Cho, Seokju, et al.
Publicado: (2023)
Find First, Track Next: Decoupling Identification and Propagation in Referring Video Object Segmentation
por: Cho, Suhwan, et al.
Publicado: (2025)
por: Cho, Suhwan, et al.
Publicado: (2025)
Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation
por: Jiang, Haichao, et al.
Publicado: (2026)
por: Jiang, Haichao, et al.
Publicado: (2026)
S^4M: Boosting Semi-Supervised Instance Segmentation with SAM
por: Yoon, Heeji, et al.
Publicado: (2025)
por: Yoon, Heeji, et al.
Publicado: (2025)
Towards Open-Vocabulary Semantic Segmentation Without Semantic Labels
por: Shin, Heeseong, et al.
Publicado: (2024)
por: Shin, Heeseong, et al.
Publicado: (2024)
VLCounter: Text-aware Visual Representation for Zero-Shot Object Counting
por: Kang, Seunggu, et al.
Publicado: (2023)
por: Kang, Seunggu, et al.
Publicado: (2023)
ILV: Iterative Latent Volumes for Fast and Accurate Sparse-View CT Reconstruction
por: Lee, Seungryong, et al.
Publicado: (2026)
por: Lee, Seungryong, et al.
Publicado: (2026)
Studying Image Diffusion Features for Zero-Shot Video Object Segmentation
por: Delatolas, Thanos, et al.
Publicado: (2025)
por: Delatolas, Thanos, et al.
Publicado: (2025)
Moiré Zero: An Efficient and High-Performance Neural Architecture for Moiré Removal
por: Lee, Seungryong, et al.
Publicado: (2025)
por: Lee, Seungryong, et al.
Publicado: (2025)
MaskRIS: Semantic Distortion-aware Data Augmentation for Referring Image Segmentation
por: Lee, Minhyun, et al.
Publicado: (2024)
por: Lee, Minhyun, et al.
Publicado: (2024)
Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
por: Kim, Chaehyun, et al.
Publicado: (2025)
por: Kim, Chaehyun, et al.
Publicado: (2025)
EventRR: Event Referential Reasoning for Referring Video Object Segmentation
por: Xu, Huihui, et al.
Publicado: (2025)
por: Xu, Huihui, et al.
Publicado: (2025)
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
por: Kim, Joowon, et al.
Publicado: (2026)
por: Kim, Joowon, et al.
Publicado: (2026)
Unifying Correspondence, Pose and NeRF for Pose-Free Novel View Synthesis from Stereo Pairs
por: Hong, Sunghwan, et al.
Publicado: (2023)
por: Hong, Sunghwan, et al.
Publicado: (2023)
ZS-VCOS: Zero-Shot Video Camouflaged Object Segmentation By Optical Flow and Open Vocabulary Object Detection
por: Guo, Wenqi, et al.
Publicado: (2025)
por: Guo, Wenqi, et al.
Publicado: (2025)
Mutually-Aware Feature Learning for Few-Shot Object Counting
por: Jeon, Yerim, et al.
Publicado: (2024)
por: Jeon, Yerim, et al.
Publicado: (2024)
Temporal Grounding as a Learning Signal for Referring Video Object Segmentation
por: Lee, Seunghun, et al.
Publicado: (2025)
por: Lee, Seunghun, et al.
Publicado: (2025)
A Simple Video Segmenter by Tracking Objects Along Axial Trajectories
por: He, Ju, et al.
Publicado: (2023)
por: He, Ju, et al.
Publicado: (2023)
Treating Motion as Option with Output Selection for Unsupervised Video Object Segmentation
por: Cho, Suhwan, et al.
Publicado: (2023)
por: Cho, Suhwan, et al.
Publicado: (2023)
Online Reasoning Video Object Segmentation
por: Liu, Jinyuan, et al.
Publicado: (2026)
por: Liu, Jinyuan, et al.
Publicado: (2026)
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
por: Choi, Sun-Hyuk, et al.
Publicado: (2025)
por: Choi, Sun-Hyuk, et al.
Publicado: (2025)
Segmentation-before-Staining Improves Structural Fidelity in Virtual IHC-to-Multiplex IF Translation
por: Lee, Junhyeok, et al.
Publicado: (2026)
por: Lee, Junhyeok, et al.
Publicado: (2026)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
por: Liang, Tianming, et al.
Publicado: (2025)
por: Liang, Tianming, et al.
Publicado: (2025)
Putting the Object Back into Video Object Segmentation
por: Cheng, Ho Kei, et al.
Publicado: (2023)
por: Cheng, Ho Kei, et al.
Publicado: (2023)
PF3plat: Pose-Free Feed-Forward 3D Gaussian Splatting
por: Hong, Sunghwan, et al.
Publicado: (2024)
por: Hong, Sunghwan, et al.
Publicado: (2024)
Dual Prototype Attention for Unsupervised Video Object Segmentation
por: Cho, Suhwan, et al.
Publicado: (2022)
por: Cho, Suhwan, et al.
Publicado: (2022)
Temporal-Enhanced Multimodal Transformer for Referring Multi-Object Tracking and Segmentation
por: Xiao, Changcheng, et al.
Publicado: (2024)
por: Xiao, Changcheng, et al.
Publicado: (2024)
STORM: End-to-End Referring Multi-Object Tracking in Videos
por: Lu, Zijia, et al.
Publicado: (2026)
por: Lu, Zijia, et al.
Publicado: (2026)
Ejemplares similares
-
InterRVOS: Interaction-aware Referring Video Object Segmentation
por: Jin, Woojeong, et al.
Publicado: (2025) -
Referring Video Object Segmentation via Language-aligned Track Selection
por: Kim, Seongchan, et al.
Publicado: (2024) -
AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method
por: Miao, Deshui, et al.
Publicado: (2026) -
DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation
por: Hong, Susung, et al.
Publicado: (2023) -
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation
por: Liang, Tianming, et al.
Publicado: (2025)