Live Interactive Training for Video Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Xinyu, Yu, Haozheng, Sun, Yihong, Hariharan, Bharath, Sun, Jennifer J. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MOD-UV: Learning Mobile Object Detectors from Unlabeled Videos
por: Sun, Yihong, et al.
Publicado: (2024)
por: Sun, Yihong, et al.
Publicado: (2024)
Tracking and Understanding Object Transformations
por: Sun, Yihong, et al.
Publicado: (2025)
por: Sun, Yihong, et al.
Publicado: (2025)
Video Creation by Demonstration
por: Sun, Yihong, et al.
Publicado: (2024)
por: Sun, Yihong, et al.
Publicado: (2024)
Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes
por: Peng, Wenxuan, et al.
Publicado: (2026)
por: Peng, Wenxuan, et al.
Publicado: (2026)
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
por: Shaar, Shaden, et al.
Publicado: (2026)
por: Shaar, Shaden, et al.
Publicado: (2026)
FlashDepth: Real-time Streaming Video Depth Estimation at 2K Resolution
por: Chou, Gene, et al.
Publicado: (2025)
por: Chou, Gene, et al.
Publicado: (2025)
Learning Feature Descriptors using Camera Pose Supervision
por: Wang, Qianqian, et al.
Publicado: (2020)
por: Wang, Qianqian, et al.
Publicado: (2020)
Training-Free Robust Interactive Video Object Segmentation
por: Wei, Xiaoli, et al.
Publicado: (2024)
por: Wei, Xiaoli, et al.
Publicado: (2024)
Learning 3D Perception from Others' Predictions
por: Yoo, Jinsu, et al.
Publicado: (2024)
por: Yoo, Jinsu, et al.
Publicado: (2024)
C3Po: Cross-View Cross-Modality Correspondence by Pointmap Prediction
por: Huang, Kuan Wei, et al.
Publicado: (2025)
por: Huang, Kuan Wei, et al.
Publicado: (2025)
Sports Re-ID: Improving Re-Identification Of Players In Broadcast Videos Of Team Sports
por: Comandur, Bharath
Publicado: (2022)
por: Comandur, Bharath
Publicado: (2022)
Color Bind: Exploring Color Perception in Text-to-Image Models
por: Shomer-Chai, Shay, et al.
Publicado: (2025)
por: Shomer-Chai, Shay, et al.
Publicado: (2025)
KFC-W: Generating 3D-Consistent Videos from Unposed Internet Photos
por: Chou, Gene, et al.
Publicado: (2024)
por: Chou, Gene, et al.
Publicado: (2024)
MONITRS: Multimodal Observations of Natural Incidents Through Remote Sensing
por: Revankar, Shreelekha, et al.
Publicado: (2025)
por: Revankar, Shreelekha, et al.
Publicado: (2025)
Scale-Aware Recognition in Satellite Images under Resource Constraints
por: Revankar, Shreelekha, et al.
Publicado: (2024)
por: Revankar, Shreelekha, et al.
Publicado: (2024)
CityRAG: Stepping Into a City via Spatially-Grounded Video Generation
por: Chou, Gene, et al.
Publicado: (2026)
por: Chou, Gene, et al.
Publicado: (2026)
$Δ$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos
por: Kao, Chia-Hsiang, et al.
Publicado: (2026)
por: Kao, Chia-Hsiang, et al.
Publicado: (2026)
LongLive: Real-time Interactive Long Video Generation
por: Yang, Shuai, et al.
Publicado: (2025)
por: Yang, Shuai, et al.
Publicado: (2025)
SPT: Sequence Prompt Transformer for Interactive Image Segmentation
por: Cheng, Senlin, et al.
Publicado: (2024)
por: Cheng, Senlin, et al.
Publicado: (2024)
Unsupervised Modality-Transferable Video Highlight Detection with Representation Activation Sequence Learning
por: Li, Tingtian, et al.
Publicado: (2024)
por: Li, Tingtian, et al.
Publicado: (2024)
Clink! Chop! Thud! -- Learning Object Sounds from Real-World Interactions
por: Yang, Mengyu, et al.
Publicado: (2025)
por: Yang, Mengyu, et al.
Publicado: (2025)
One-shot Training for Video Object Segmentation
por: Chen, Baiyu, et al.
Publicado: (2024)
por: Chen, Baiyu, et al.
Publicado: (2024)
MegaScenes: Scene-Level View Synthesis at Scale
por: Tung, Joseph, et al.
Publicado: (2024)
por: Tung, Joseph, et al.
Publicado: (2024)
Refining Segmentation On-the-Fly: An Interactive Framework for Point Cloud Semantic Segmentation
por: Zhang, Peng, et al.
Publicado: (2024)
por: Zhang, Peng, et al.
Publicado: (2024)
Evaluating SAM2 for Video Semantic Segmentation
por: Ariff, Syed Hesham Syed, et al.
Publicado: (2025)
por: Ariff, Syed Hesham Syed, et al.
Publicado: (2025)
ObjectCarver: Semi-automatic segmentation, reconstruction and separation of 3D objects
por: Hassena, Gemmechu, et al.
Publicado: (2024)
por: Hassena, Gemmechu, et al.
Publicado: (2024)
Rethinking Cross-modal Interaction from a Top-down Perspective for Referring Video Object Segmentation
por: Liang, Chen, et al.
Publicado: (2021)
por: Liang, Chen, et al.
Publicado: (2021)
IDPro: Flexible Interactive Video Object Segmentation by ID-queried Concurrent Propagation
por: Li, Kexin, et al.
Publicado: (2024)
por: Li, Kexin, et al.
Publicado: (2024)
HOpenCls: Training Hyperspectral Image Open-Set Classifiers in Their Living Environments
por: Zhao, Hengwei, et al.
Publicado: (2025)
por: Zhao, Hengwei, et al.
Publicado: (2025)
Live Video Captioning
por: Blanco-Fernández, Eduardo, et al.
Publicado: (2024)
por: Blanco-Fernández, Eduardo, et al.
Publicado: (2024)
SegTTA: Training-Free Test-Time Augmentation for Zero-Shot Medical Imaging Segmentation
por: Yao, Yihong, et al.
Publicado: (2026)
por: Yao, Yihong, et al.
Publicado: (2026)
Motion Segmentation for Neuromorphic Aerial Surveillance
por: Arja, Sami, et al.
Publicado: (2024)
por: Arja, Sami, et al.
Publicado: (2024)
LiDAR-Camera Fusion for Video Panoptic Segmentation without Video Training
por: Ayar, Fardin, et al.
Publicado: (2024)
por: Ayar, Fardin, et al.
Publicado: (2024)
A Temporal Modeling Framework for Video Pre-Training on Video Instance Segmentation
por: Zhong, Qing, et al.
Publicado: (2025)
por: Zhong, Qing, et al.
Publicado: (2025)
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
por: Choi, Sun-Hyuk, et al.
Publicado: (2025)
por: Choi, Sun-Hyuk, et al.
Publicado: (2025)
Training-Free Semantic Segmentation via LLM-Supervision
por: Sun, Wenfang, et al.
Publicado: (2024)
por: Sun, Wenfang, et al.
Publicado: (2024)
Biomedical SAM 2: Segment Anything in Biomedical Images and Videos
por: Yan, Zhiling, et al.
Publicado: (2024)
por: Yan, Zhiling, et al.
Publicado: (2024)
Vivim: a Video Vision Mamba for Medical Video Segmentation
por: Yang, Yijun, et al.
Publicado: (2024)
por: Yang, Yijun, et al.
Publicado: (2024)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
por: Sun, Baoli, et al.
Publicado: (2025)
por: Sun, Baoli, et al.
Publicado: (2025)
Accurate Differential Operators for Hybrid Neural Fields
por: Chetan, Aditya, et al.
Publicado: (2023)
por: Chetan, Aditya, et al.
Publicado: (2023)
Ejemplares similares
-
MOD-UV: Learning Mobile Object Detectors from Unlabeled Videos
por: Sun, Yihong, et al.
Publicado: (2024) -
Tracking and Understanding Object Transformations
por: Sun, Yihong, et al.
Publicado: (2025) -
Video Creation by Demonstration
por: Sun, Yihong, et al.
Publicado: (2024) -
Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes
por: Peng, Wenxuan, et al.
Publicado: (2026) -
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
por: Shaar, Shaden, et al.
Publicado: (2026)