2nd of the 5th PVUW MeViS-Audio Track: ASR-SaSaSa2VA
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zhiyu, Kang, Xudong, Li, Shutao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SaSaSaSa2VA: 2nd Place of the 5th PVUW MeViS-Text Track
di: Gong, Dengxian, et al.
Pubblicazione: (2026)
di: Gong, Dengxian, et al.
Pubblicazione: (2026)
4th PVUW MeViS 3rd Place Report: Sa2VA
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA
di: Niu, Quanzhu, et al.
Pubblicazione: (2025)
di: Niu, Quanzhu, et al.
Pubblicazione: (2025)
3rd Place of MeViS-Audio Track of the 5th PVUW: VIRST-Audio
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
ReferDINO-Plus: 2nd Solution for 4th PVUW MeViS Challenge at CVPR 2025
di: Liang, Tianming, et al.
Pubblicazione: (2025)
di: Liang, Tianming, et al.
Pubblicazione: (2025)
AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method
di: Miao, Deshui, et al.
Pubblicazione: (2026)
di: Miao, Deshui, et al.
Pubblicazione: (2026)
2nd Place Solution for MeViS Track in CVPR 2024 PVUW Workshop: Motion Expression guided Video Segmentation
di: Cao, Bin, et al.
Pubblicazione: (2024)
di: Cao, Bin, et al.
Pubblicazione: (2024)
Sa2VA-i: Improving Sa2VA Results with Consistent Training and Inference
di: Nekrasov, Alexey, et al.
Pubblicazione: (2025)
di: Nekrasov, Alexey, et al.
Pubblicazione: (2025)
Enhancing Sa2VA for Referent Video Object Segmentation: 2nd Solution for 7th LSVOS RVOS Track
di: Hong, Ran, et al.
Pubblicazione: (2025)
di: Hong, Ran, et al.
Pubblicazione: (2025)
3rd Place Solution for MeViS Track in CVPR 2024 PVUW workshop: Motion Expression guided Video Segmentation
di: Pan, Feiyu, et al.
Pubblicazione: (2024)
di: Pan, Feiyu, et al.
Pubblicazione: (2024)
1st Place Solution for MeViS Track in CVPR 2024 PVUW Workshop: Motion Expression guided Video Segmentation
di: Gao, Mingqi, et al.
Pubblicazione: (2024)
di: Gao, Mingqi, et al.
Pubblicazione: (2024)
The 1st Solution for 4th PVUW MeViS Challenge: Unleashing the Potential of Large Multimodal Models for Referring Video Segmentation
di: Fang, Hao, et al.
Pubblicazione: (2025)
di: Fang, Hao, et al.
Pubblicazione: (2025)
The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation
di: He, Xusheng, et al.
Pubblicazione: (2026)
di: He, Xusheng, et al.
Pubblicazione: (2026)
OAMVOS:2nd Report for 5th PVUW MOSE Track
di: Miao, Deshui, et al.
Pubblicazione: (2026)
di: Miao, Deshui, et al.
Pubblicazione: (2026)
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
MoSa: Motion Generation with Scalable Autoregressive Modeling
di: Liu, Mengyuan, et al.
Pubblicazione: (2025)
di: Liu, Mengyuan, et al.
Pubblicazione: (2025)
MASSeg : 2nd Technical Report for 4th PVUW MOSE Track
di: Cao, Xuqiang, et al.
Pubblicazione: (2025)
di: Cao, Xuqiang, et al.
Pubblicazione: (2025)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
di: Ding, Henghui, et al.
Pubblicazione: (2025)
di: Ding, Henghui, et al.
Pubblicazione: (2025)
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
di: Yang, Tianyu, et al.
Pubblicazione: (2024)
di: Yang, Tianyu, et al.
Pubblicazione: (2024)
SaENeRF: Suppressing Artifacts in Event-based Neural Radiance Fields
di: Wang, Yuanjian, et al.
Pubblicazione: (2025)
di: Wang, Yuanjian, et al.
Pubblicazione: (2025)
SaMam: Style-aware State Space Model for Arbitrary Image Style Transfer
di: Liu, Hongda, et al.
Pubblicazione: (2025)
di: Liu, Hongda, et al.
Pubblicazione: (2025)
SaLF: Sparse Local Fields for Multi-Sensor Rendering in Real-Time
di: Chen, Yun, et al.
Pubblicazione: (2025)
di: Chen, Yun, et al.
Pubblicazione: (2025)
SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models
di: Yi, Huahui, et al.
Pubblicazione: (2025)
di: Yi, Huahui, et al.
Pubblicazione: (2025)
MegaSaM: Accurate, Fast, and Robust Structure and Motion from Casual Dynamic Videos
di: Li, Zhengqi, et al.
Pubblicazione: (2024)
di: Li, Zhengqi, et al.
Pubblicazione: (2024)
DiSa: Saliency-Aware Foreground-Background Disentangled Framework for Open-Vocabulary Semantic Segmentation
di: Yao, Zhen, et al.
Pubblicazione: (2026)
di: Yao, Zhen, et al.
Pubblicazione: (2026)
DiSa: Directional Saliency-Aware Prompt Learning for Generalizable Vision-Language Models
di: Talemi, Niloufar Alipour, et al.
Pubblicazione: (2025)
di: Talemi, Niloufar Alipour, et al.
Pubblicazione: (2025)
SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
di: Mao, Zhenjie, et al.
Pubblicazione: (2025)
di: Mao, Zhenjie, et al.
Pubblicazione: (2025)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
di: Liu, Mengzhen, et al.
Pubblicazione: (2026)
di: Liu, Mengzhen, et al.
Pubblicazione: (2026)
SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation
di: Hu, Teng, et al.
Pubblicazione: (2024)
di: Hu, Teng, et al.
Pubblicazione: (2024)
APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track
di: Miao, Deshui, et al.
Pubblicazione: (2026)
di: Miao, Deshui, et al.
Pubblicazione: (2026)
Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
2nd Place Solution for PVUW Challenge 2024: Video Panoptic Segmentation
di: Wu, Biao, et al.
Pubblicazione: (2024)
di: Wu, Biao, et al.
Pubblicazione: (2024)
SaFL: Sybil-aware Federated Learning with Application to Face Recognition
di: Ghafourian, Mahdi, et al.
Pubblicazione: (2023)
di: Ghafourian, Mahdi, et al.
Pubblicazione: (2023)
2nd Place Solution for MOSE Track in CVPR 2024 PVUW workshop: Complex Video Object Segmentation
di: Xu, Zhensong, et al.
Pubblicazione: (2024)
di: Xu, Zhensong, et al.
Pubblicazione: (2024)
SHaSaM: Submodular Hard Sample Mining for Fair Facial Attribute Recognition
di: Majee, Anay, et al.
Pubblicazione: (2026)
di: Majee, Anay, et al.
Pubblicazione: (2026)
Agriculture-Vision Challenge 2024 -- The Runner-Up Solution for Agricultural Pattern Recognition via Class Balancing and Model Ensemble
di: Liu, Wang, et al.
Pubblicazione: (2024)
di: Liu, Wang, et al.
Pubblicazione: (2024)
SaLon3R: Structure-aware Long-term Generalizable 3D Reconstruction from Unposed Images
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
SaRPFF: A Self-Attention with Register-based Pyramid Feature Fusion module for enhanced RLD detection
di: Haruna, Yunusa, et al.
Pubblicazione: (2024)
di: Haruna, Yunusa, et al.
Pubblicazione: (2024)
Re-Prompting SAM 3 via Object Retrieval: 3rd of the 5th PVUW MOSE Track
di: Gao, Mingqi, et al.
Pubblicazione: (2026)
di: Gao, Mingqi, et al.
Pubblicazione: (2026)
FVOS for MOSE Track of 4th PVUW Challenge: 3rd Place Solution
di: Wang, Mengjiao, et al.
Pubblicazione: (2025)
di: Wang, Mengjiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SaSaSaSa2VA: 2nd Place of the 5th PVUW MeViS-Text Track
di: Gong, Dengxian, et al.
Pubblicazione: (2026) -
4th PVUW MeViS 3rd Place Report: Sa2VA
di: Yuan, Haobo, et al.
Pubblicazione: (2025) -
The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA
di: Niu, Quanzhu, et al.
Pubblicazione: (2025) -
3rd Place of MeViS-Audio Track of the 5th PVUW: VIRST-Audio
di: Hong, Jihwan, et al.
Pubblicazione: (2026) -
ReferDINO-Plus: 2nd Solution for 4th PVUW MeViS Challenge at CVPR 2025
di: Liang, Tianming, et al.
Pubblicazione: (2025)