The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Xusheng, Wu, Canyang, Zhang, Jinrong, Guan, Weili, Wu, Jianlong, Nie, Liqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge
di: Zhang, Jinrong, et al.
Pubblicazione: (2026)
di: Zhang, Jinrong, et al.
Pubblicazione: (2026)
APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track
di: Miao, Deshui, et al.
Pubblicazione: (2026)
di: Miao, Deshui, et al.
Pubblicazione: (2026)
The 1st Solution for 4th PVUW MeViS Challenge: Unleashing the Potential of Large Multimodal Models for Referring Video Segmentation
di: Fang, Hao, et al.
Pubblicazione: (2025)
di: Fang, Hao, et al.
Pubblicazione: (2025)
AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method
di: Miao, Deshui, et al.
Pubblicazione: (2026)
di: Miao, Deshui, et al.
Pubblicazione: (2026)
ReferDINO-Plus: 2nd Solution for 4th PVUW MeViS Challenge at CVPR 2025
di: Liang, Tianming, et al.
Pubblicazione: (2025)
di: Liang, Tianming, et al.
Pubblicazione: (2025)
4th PVUW MeViS 3rd Place Report: Sa2VA
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
3rd Place of MeViS-Audio Track of the 5th PVUW: VIRST-Audio
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
SaSaSaSa2VA: 2nd Place of the 5th PVUW MeViS-Text Track
di: Gong, Dengxian, et al.
Pubblicazione: (2026)
di: Gong, Dengxian, et al.
Pubblicazione: (2026)
1st Place Solution for MeViS Track in CVPR 2024 PVUW Workshop: Motion Expression guided Video Segmentation
di: Gao, Mingqi, et al.
Pubblicazione: (2024)
di: Gao, Mingqi, et al.
Pubblicazione: (2024)
2nd of the 5th PVUW MeViS-Audio Track: ASR-SaSaSa2VA
di: Wang, Zhiyu, et al.
Pubblicazione: (2026)
di: Wang, Zhiyu, et al.
Pubblicazione: (2026)
3rd Place Solution for MeViS Track in CVPR 2024 PVUW workshop: Motion Expression guided Video Segmentation
di: Pan, Feiyu, et al.
Pubblicazione: (2024)
di: Pan, Feiyu, et al.
Pubblicazione: (2024)
2nd Place Solution for MeViS Track in CVPR 2024 PVUW Workshop: Motion Expression guided Video Segmentation
di: Cao, Bin, et al.
Pubblicazione: (2024)
di: Cao, Bin, et al.
Pubblicazione: (2024)
TimeLogic Challenge @ CVPR 2026: Strong MLLMs Meet Evidence-Seeking Agents for Temporal-Logic Video Question Answering
di: Xu, Zhaoyang, et al.
Pubblicazione: (2026)
di: Xu, Zhaoyang, et al.
Pubblicazione: (2026)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
di: Ding, Henghui, et al.
Pubblicazione: (2025)
di: Ding, Henghui, et al.
Pubblicazione: (2025)
Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
STSeg-Complex Video Object Segmentation: The 1st Solution for 4th PVUW MOSE Challenge
di: Song, Kehuan, et al.
Pubblicazione: (2025)
di: Song, Kehuan, et al.
Pubblicazione: (2025)
StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
di: Wang, Shaokun, et al.
Pubblicazione: (2026)
di: Wang, Shaokun, et al.
Pubblicazione: (2026)
Self-Training Boosted Multi-Factor Matching Network for Composed Image Retrieval
di: Wen, Haokun, et al.
Pubblicazione: (2023)
di: Wen, Haokun, et al.
Pubblicazione: (2023)
MegaSR: Mining Customized Semantics and Expressive Guidance for Real-World Image Super-Resolution
di: Li, Xinrui, et al.
Pubblicazione: (2025)
di: Li, Xinrui, et al.
Pubblicazione: (2025)
1st Place Solution for 5th LSVOS Challenge: Referring Video Object Segmentation
di: Luo, Zhuoyan, et al.
Pubblicazione: (2024)
di: Luo, Zhuoyan, et al.
Pubblicazione: (2024)
Re-Prompting SAM 3 via Object Retrieval: 3rd of the 5th PVUW MOSE Track
di: Gao, Mingqi, et al.
Pubblicazione: (2026)
di: Gao, Mingqi, et al.
Pubblicazione: (2026)
1st Place Winner of the 2024 Pixel-level Video Understanding in the Wild (CVPR'24 PVUW) Challenge in Video Panoptic Segmentation and Best Long Video Consistency of Video Semantic Segmentation
di: Liu, Qingfeng, et al.
Pubblicazione: (2024)
di: Liu, Qingfeng, et al.
Pubblicazione: (2024)
OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026
di: Li, Zixu, et al.
Pubblicazione: (2026)
di: Li, Zixu, et al.
Pubblicazione: (2026)
Object-Shot Enhanced Grounding Network for Egocentric Video
di: Feng, Yisen, et al.
Pubblicazione: (2025)
di: Feng, Yisen, et al.
Pubblicazione: (2025)
3rd Place Solution for PVUW Challenge 2024: Video Panoptic Segmentation
di: Wu, Ruipu, et al.
Pubblicazione: (2024)
di: Wu, Ruipu, et al.
Pubblicazione: (2024)
1st Place Solution for MOSE Track in CVPR 2024 PVUW Workshop: Complex Video Object Segmentation
di: Miao, Deshui, et al.
Pubblicazione: (2024)
di: Miao, Deshui, et al.
Pubblicazione: (2024)
2nd Place Solution for PVUW Challenge 2024: Video Panoptic Segmentation
di: Wu, Biao, et al.
Pubblicazione: (2024)
di: Wu, Biao, et al.
Pubblicazione: (2024)
Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
ViRefSAM: Visual Reference-Guided Segment Anything Model for Remote Sensing Segmentation
di: Bi, Hanbo, et al.
Pubblicazione: (2025)
di: Bi, Hanbo, et al.
Pubblicazione: (2025)
2nd Place Solution for MOSE Track in CVPR 2024 PVUW workshop: Complex Video Object Segmentation
di: Xu, Zhensong, et al.
Pubblicazione: (2024)
di: Xu, Zhensong, et al.
Pubblicazione: (2024)
FVOS for MOSE Track of 4th PVUW Challenge: 3rd Place Solution
di: Wang, Mengjiao, et al.
Pubblicazione: (2025)
di: Wang, Mengjiao, et al.
Pubblicazione: (2025)
Video Object Segmentation via SAM 2: The 4th Solution for LSVOS Challenge VOS Track
di: Pan, Feiyu, et al.
Pubblicazione: (2024)
di: Pan, Feiyu, et al.
Pubblicazione: (2024)
MARS: Technical Report for the CASTLE Challenge at EgoVis 2026
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
OSGNet @ Ego4D Episodic Memory Challenge 2025
di: Feng, Yisen, et al.
Pubblicazione: (2025)
di: Feng, Yisen, et al.
Pubblicazione: (2025)
HCQA-1.5 @ Ego4D EgoSchema Challenge 2025
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
ViSAGE @ NTIRE 2026 Challenge on Video Saliency Prediction
di: Wang, Kun, et al.
Pubblicazione: (2026)
di: Wang, Kun, et al.
Pubblicazione: (2026)
Technical Report for Ego4D Long-Term Action Anticipation Challenge 2025
di: Chu, Qiaohui, et al.
Pubblicazione: (2025)
di: Chu, Qiaohui, et al.
Pubblicazione: (2025)
VISTA: Technical Report for the Ego4D Short-Term Object Interaction Anticipation at EgoVis 2026
di: Chu, Qiaohui, et al.
Pubblicazione: (2026)
di: Chu, Qiaohui, et al.
Pubblicazione: (2026)
Continuous Knowledge-Preserving Decomposition with Adaptive Layer Selection for Few-Shot Class-Incremental Learning
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
JFAA: Technical Report for the EPIC-KITCHENS-100 Action Anticipation Challenge at EgoVis 2026
di: Chu, Qiaohui, et al.
Pubblicazione: (2026)
di: Chu, Qiaohui, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge
di: Zhang, Jinrong, et al.
Pubblicazione: (2026) -
APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track
di: Miao, Deshui, et al.
Pubblicazione: (2026) -
The 1st Solution for 4th PVUW MeViS Challenge: Unleashing the Potential of Large Multimodal Models for Referring Video Segmentation
di: Fang, Hao, et al.
Pubblicazione: (2025) -
AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method
di: Miao, Deshui, et al.
Pubblicazione: (2026) -
ReferDINO-Plus: 2nd Solution for 4th PVUW MeViS Challenge at CVPR 2025
di: Liang, Tianming, et al.
Pubblicazione: (2025)