ViSS-R1: Self-Supervised Reinforcement Video Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Bo, Song, Yuxin, Wu, Qiangqiang, Sun, Haoyuan, Wu, Wenhao, Chan, Antoni B. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders
di: Fang, Bo, et al.
Pubblicazione: (2025)
di: Fang, Bo, et al.
Pubblicazione: (2025)
DistinctAD: Distinctive Audio Description Generation in Contexts
di: Fang, Bo, et al.
Pubblicazione: (2024)
di: Fang, Bo, et al.
Pubblicazione: (2024)
Learning Tracking Representations from Single Point Annotations
di: Wu, Qiangqiang, et al.
Pubblicazione: (2024)
di: Wu, Qiangqiang, et al.
Pubblicazione: (2024)
M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking
di: Wu, Qiangqiang, et al.
Pubblicazione: (2026)
di: Wu, Qiangqiang, et al.
Pubblicazione: (2026)
Robust Zero-Shot Crowd Counting and Localization With Adaptive Resolution SAM
di: Wan, Jia, et al.
Pubblicazione: (2024)
di: Wan, Jia, et al.
Pubblicazione: (2024)
ViTCN: Vision Transformer Contrastive Network For Reasoning
di: Song, Bo, et al.
Pubblicazione: (2024)
di: Song, Bo, et al.
Pubblicazione: (2024)
DropMAE: Learning Representations via Masked Autoencoders with Spatial-Attention Dropout for Temporal Matching Tasks
di: Wu, Qiangqiang, et al.
Pubblicazione: (2023)
di: Wu, Qiangqiang, et al.
Pubblicazione: (2023)
Video-R1: Reinforcing Video Reasoning in MLLMs
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
di: Ouyang, Kun, et al.
Pubblicazione: (2025)
di: Ouyang, Kun, et al.
Pubblicazione: (2025)
VideoSSR: Video Self-Supervised Reinforcement Learning
di: He, Zefeng, et al.
Pubblicazione: (2025)
di: He, Zefeng, et al.
Pubblicazione: (2025)
Point-to-Region Loss for Semi-Supervised Point-Based Crowd Counting
di: Lin, Wei, et al.
Pubblicazione: (2025)
di: Lin, Wei, et al.
Pubblicazione: (2025)
Temporal Unlearnable Examples: Preventing Personal Video Data from Unauthorized Exploitation by Object Tracking
di: Wu, Qiangqiang, et al.
Pubblicazione: (2025)
di: Wu, Qiangqiang, et al.
Pubblicazione: (2025)
SS3D: End2End Self-Supervised 3D from Web Videos
di: Hariat, Marwane, et al.
Pubblicazione: (2026)
di: Hariat, Marwane, et al.
Pubblicazione: (2026)
Leveraging Motion Information for Better Self-Supervised Video Correspondence Learning
di: Zhou, Zihan, et al.
Pubblicazione: (2025)
di: Zhou, Zihan, et al.
Pubblicazione: (2025)
SelfHVD: Self-Supervised Handheld Video Deblurring
di: Xu, Honglei, et al.
Pubblicazione: (2025)
di: Xu, Honglei, et al.
Pubblicazione: (2025)
ViViD: Video Virtual Try-on using Diffusion Models
di: Fang, Zixun, et al.
Pubblicazione: (2024)
di: Fang, Zixun, et al.
Pubblicazione: (2024)
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
di: Wang, Lihong, et al.
Pubblicazione: (2025)
di: Wang, Lihong, et al.
Pubblicazione: (2025)
Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning
di: Liu, Ming, et al.
Pubblicazione: (2026)
di: Liu, Ming, et al.
Pubblicazione: (2026)
ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders
di: Hernandez, Jefferson, et al.
Pubblicazione: (2023)
di: Hernandez, Jefferson, et al.
Pubblicazione: (2023)
AggSS: An Aggregated Self-Supervised Approach for Class-Incremental Learning
di: Kalla, Jayateja, et al.
Pubblicazione: (2024)
di: Kalla, Jayateja, et al.
Pubblicazione: (2024)
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
di: Zhang, Xingjian, et al.
Pubblicazione: (2025)
di: Zhang, Xingjian, et al.
Pubblicazione: (2025)
Self-Supervised Animal Identification for Long Videos
di: Fang, Xuyang, et al.
Pubblicazione: (2026)
di: Fang, Xuyang, et al.
Pubblicazione: (2026)
Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology
di: Wu, Kaiyu, et al.
Pubblicazione: (2026)
di: Wu, Kaiyu, et al.
Pubblicazione: (2026)
VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning
di: Xu, Zishan, et al.
Pubblicazione: (2025)
di: Xu, Zishan, et al.
Pubblicazione: (2025)
Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping
di: Sun, Haoyuan, et al.
Pubblicazione: (2026)
di: Sun, Haoyuan, et al.
Pubblicazione: (2026)
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
di: Wu, Bin, et al.
Pubblicazione: (2026)
di: Wu, Bin, et al.
Pubblicazione: (2026)
Semi-Supervised Transfer Boosting (SS-TrBoosting)
di: Deng, Lingfei, et al.
Pubblicazione: (2024)
di: Deng, Lingfei, et al.
Pubblicazione: (2024)
Self-Supervised Video Desmoking for Laparoscopic Surgery
di: Wu, Renlong, et al.
Pubblicazione: (2024)
di: Wu, Renlong, et al.
Pubblicazione: (2024)
Advancing Video Self-Supervised Learning via Image Foundation Models
di: Wu, Jingwei, et al.
Pubblicazione: (2025)
di: Wu, Jingwei, et al.
Pubblicazione: (2025)
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
ViSTec: Video Modeling for Sports Technique Recognition and Tactical Analysis
di: He, Yuchen, et al.
Pubblicazione: (2024)
di: He, Yuchen, et al.
Pubblicazione: (2024)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
FreeVA: Offline MLLM as Training-Free Video Assistant
di: Wu, Wenhao
Pubblicazione: (2024)
di: Wu, Wenhao
Pubblicazione: (2024)
ViLLa: Video Reasoning Segmentation with Large Language Model
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior
di: Bai, Weimin, et al.
Pubblicazione: (2025)
di: Bai, Weimin, et al.
Pubblicazione: (2025)
Reinforcing Video Reasoning with Focused Thinking
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
Dense Point-to-Mask Optimization with Reinforced Point Selection for Crowd Instance Segmentation
di: Chen, Hongru, et al.
Pubblicazione: (2026)
di: Chen, Hongru, et al.
Pubblicazione: (2026)
Exclusivity-Guided Mask Learning for Semi-Supervised Crowd Instance Segmentation and Counting
di: Huang, Jiyang, et al.
Pubblicazione: (2026)
di: Huang, Jiyang, et al.
Pubblicazione: (2026)
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders
di: Fang, Bo, et al.
Pubblicazione: (2025) -
DistinctAD: Distinctive Audio Description Generation in Contexts
di: Fang, Bo, et al.
Pubblicazione: (2024) -
Learning Tracking Representations from Single Point Annotations
di: Wu, Qiangqiang, et al.
Pubblicazione: (2024) -
M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking
di: Wu, Qiangqiang, et al.
Pubblicazione: (2026) -
Robust Zero-Shot Crowd Counting and Localization With Adaptive Resolution SAM
di: Wan, Jia, et al.
Pubblicazione: (2024)