ReferEverything: Towards Segmenting Everything We Can Speak of in Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Bagchi, Anurag, Bao, Zhipeng, Wang, Yu-Xiong, Tokmakov, Pavel, Hebert, Martial |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Walk through Paintings: Egocentric World Models from Internet Priors
por: Bagchi, Anurag, et al.
Publicado: (2026)
por: Bagchi, Anurag, et al.
Publicado: (2026)
MESA: Matching Everything by Segmenting Anything
por: Zhang, Yesheng, et al.
Publicado: (2024)
por: Zhang, Yesheng, et al.
Publicado: (2024)
Finger in Camera Speaks Everything: Unconstrained Air-Writing for Real-World
por: Wu, Meiqi, et al.
Publicado: (2024)
por: Wu, Meiqi, et al.
Publicado: (2024)
Track Anything Behind Everything: Zero-Shot Amodal Video Object Segmentation
por: Hudson, Finlay G. C., et al.
Publicado: (2024)
por: Hudson, Finlay G. C., et al.
Publicado: (2024)
Lite-SAM Is Actually What You Need for Segment Everything
por: Fu, Jianhai, et al.
Publicado: (2024)
por: Fu, Jianhai, et al.
Publicado: (2024)
Diff-2-in-1: Bridging Generation and Dense Perception with Diffusion Models
por: Zheng, Shuhong, et al.
Publicado: (2024)
por: Zheng, Shuhong, et al.
Publicado: (2024)
Detect Everything with Few Examples
por: Zhang, Xinyu, et al.
Publicado: (2023)
por: Zhang, Xinyu, et al.
Publicado: (2023)
Separate-and-Enhance: Compositional Finetuning for Text2Image Diffusion Models
por: Bao, Zhipeng, et al.
Publicado: (2023)
por: Bao, Zhipeng, et al.
Publicado: (2023)
PixelWorld: How Far Are We from Perceiving Everything as Pixels?
por: Lyu, Zhiheng, et al.
Publicado: (2025)
por: Lyu, Zhiheng, et al.
Publicado: (2025)
Track Everything Everywhere Fast and Robustly
por: Song, Yunzhou, et al.
Publicado: (2024)
por: Song, Yunzhou, et al.
Publicado: (2024)
Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models
por: Wang, Zengbin, et al.
Publicado: (2026)
por: Wang, Zengbin, et al.
Publicado: (2026)
Tracking Everything in Robotic-Assisted Surgery
por: Zhan, Bohan, et al.
Publicado: (2024)
por: Zhan, Bohan, et al.
Publicado: (2024)
Decomposition Betters Tracking Everything Everywhere
por: Li, Rui, et al.
Publicado: (2024)
por: Li, Rui, et al.
Publicado: (2024)
Attention Is not Everything: Efficient Alternatives for Vision
por: Kazi, Nur Mohammad, et al.
Publicado: (2026)
por: Kazi, Nur Mohammad, et al.
Publicado: (2026)
Pruning Everything, Everywhere, All at Once
por: Nascimento, Gustavo Henrique do, et al.
Publicado: (2025)
por: Nascimento, Gustavo Henrique do, et al.
Publicado: (2025)
Grounding Everything in Tokens for Multimodal Large Language Models
por: Ren, Xiangxuan, et al.
Publicado: (2025)
por: Ren, Xiangxuan, et al.
Publicado: (2025)
Vehicle-to-Everything Cooperative Perception for Autonomous Driving
por: Huang, Tao, et al.
Publicado: (2023)
por: Huang, Tao, et al.
Publicado: (2023)
Associate Everything Detected: Facilitating Tracking-by-Detection to the Unknown
por: Fang, Zimeng, et al.
Publicado: (2024)
por: Fang, Zimeng, et al.
Publicado: (2024)
Remote SAMsing: From Segment Anything to Segment Everything
por: de Carvalho, Osmar Luiz Ferreira, et al.
Publicado: (2026)
por: de Carvalho, Osmar Luiz Ferreira, et al.
Publicado: (2026)
Everything is a Video: Unifying Modalities through Next-Frame Prediction
por: Hudson, G. Thomas, et al.
Publicado: (2024)
por: Hudson, G. Thomas, et al.
Publicado: (2024)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
por: Wang, Ao, et al.
Publicado: (2024)
por: Wang, Ao, et al.
Publicado: (2024)
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
por: Man, Yunze, et al.
Publicado: (2024)
por: Man, Yunze, et al.
Publicado: (2024)
V2X-DG: Domain Generalization for Vehicle-to-Everything Cooperative Perception
por: Li, Baolu, et al.
Publicado: (2025)
por: Li, Baolu, et al.
Publicado: (2025)
3EED: Ground Everything Everywhere in 3D
por: Li, Rong, et al.
Publicado: (2025)
por: Li, Rong, et al.
Publicado: (2025)
Capsule Networks Do Not Need to Model Everything
por: Renzulli, Riccardo, et al.
Publicado: (2022)
por: Renzulli, Riccardo, et al.
Publicado: (2022)
Binding Touch to Everything: Learning Unified Multimodal Tactile Representations
por: Yang, Fengyu, et al.
Publicado: (2024)
por: Yang, Fengyu, et al.
Publicado: (2024)
Make the Most of Everything: Further Considerations on Disrupting Diffusion-based Customization
por: Tang, Long, et al.
Publicado: (2025)
por: Tang, Long, et al.
Publicado: (2025)
Everything to the Synthetic: Diffusion-driven Test-time Adaptation via Synthetic-Domain Alignment
por: Guo, Jiayi, et al.
Publicado: (2024)
por: Guo, Jiayi, et al.
Publicado: (2024)
Universal Neural Architecture Space: Covering ConvNets, Transformers and Everything in Between
por: Týbl, Ondřej, et al.
Publicado: (2025)
por: Týbl, Ondřej, et al.
Publicado: (2025)
Everything Can Be Described in Words: A Simple Unified Multi-Modal Framework with Semantic and Temporal Alignment
por: Bi, Xiaowei, et al.
Publicado: (2025)
por: Bi, Xiaowei, et al.
Publicado: (2025)
SEE: See Everything Every Time -- Adaptive Brightness Adjustment for Broad Light Range Images via Events
por: Lu, Yunfan, et al.
Publicado: (2025)
por: Lu, Yunfan, et al.
Publicado: (2025)
V2X-Real: a Large-Scale Dataset for Vehicle-to-Everything Cooperative Perception
por: Xiang, Hao, et al.
Publicado: (2024)
por: Xiang, Hao, et al.
Publicado: (2024)
Timing Is Everything: Finding the Optimal Fusion Points in Multimodal Medical Imaging
por: Guarrasi, Valerio, et al.
Publicado: (2025)
por: Guarrasi, Valerio, et al.
Publicado: (2025)
V2XPnP: Vehicle-to-Everything Spatio-Temporal Fusion for Multi-Agent Perception and Prediction
por: Zhou, Zewei, et al.
Publicado: (2024)
por: Zhou, Zewei, et al.
Publicado: (2024)
UltraLED: Learning to See Everything in Ultra-High Dynamic Range Scenes
por: Meng, Yuang, et al.
Publicado: (2025)
por: Meng, Yuang, et al.
Publicado: (2025)
pix2gestalt: Amodal Segmentation by Synthesizing Wholes
por: Ozguroglu, Ege, et al.
Publicado: (2024)
por: Ozguroglu, Ege, et al.
Publicado: (2024)
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
por: Wang, Zanyi, et al.
Publicado: (2025)
por: Wang, Zanyi, et al.
Publicado: (2025)
AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis
por: Ye, Junjie, et al.
Publicado: (2025)
por: Ye, Junjie, et al.
Publicado: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
por: Liang, Tianming, et al.
Publicado: (2025)
por: Liang, Tianming, et al.
Publicado: (2025)
AirV2X: Unified Air-Ground Vehicle-to-Everything Collaboration
por: Gao, Xiangbo, et al.
Publicado: (2025)
por: Gao, Xiangbo, et al.
Publicado: (2025)
Ejemplares similares
-
Walk through Paintings: Egocentric World Models from Internet Priors
por: Bagchi, Anurag, et al.
Publicado: (2026) -
MESA: Matching Everything by Segmenting Anything
por: Zhang, Yesheng, et al.
Publicado: (2024) -
Finger in Camera Speaks Everything: Unconstrained Air-Writing for Real-World
por: Wu, Meiqi, et al.
Publicado: (2024) -
Track Anything Behind Everything: Zero-Shot Amodal Video Object Segmentation
por: Hudson, Finlay G. C., et al.
Publicado: (2024) -
Lite-SAM Is Actually What You Need for Segment Everything
por: Fu, Jianhai, et al.
Publicado: (2024)