The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Gong, Sitong, Zhuge, Yunzhi, Zhang, Lu, Yang, Zongxin, Zhang, Pingping, Lu, Huchuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reinforcing Video Reasoning Segmentation to Think Before It Segments
por: Gong, Sitong, et al.
Publicado: (2025)
por: Gong, Sitong, et al.
Publicado: (2025)
Complementary and Contrastive Learning for Audio-Visual Segmentation
por: Gong, Sitong, et al.
Publicado: (2025)
por: Gong, Sitong, et al.
Publicado: (2025)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
por: Xiong, Haomiao, et al.
Publicado: (2025)
por: Xiong, Haomiao, et al.
Publicado: (2025)
AVS-Mamba: Exploring Temporal and Multi-modal Mamba for Audio-Visual Segmentation
por: Gong, Sitong, et al.
Publicado: (2025)
por: Gong, Sitong, et al.
Publicado: (2025)
Parameter Aware Mamba Model for Multi-task Dense Prediction
por: Yu, Xinzhuo, et al.
Publicado: (2025)
por: Yu, Xinzhuo, et al.
Publicado: (2025)
Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation
por: Zhuge, Yunzhi, et al.
Publicado: (2025)
por: Zhuge, Yunzhi, et al.
Publicado: (2025)
Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions
por: Zhang, Kecheng, et al.
Publicado: (2026)
por: Zhang, Kecheng, et al.
Publicado: (2026)
Referring Remote Sensing Image Segmentation with Cross-view Semantics Interaction Network
por: Yang, Jiaxing, et al.
Publicado: (2025)
por: Yang, Jiaxing, et al.
Publicado: (2025)
FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
por: Zhang, Lu, et al.
Publicado: (2025)
por: Zhang, Lu, et al.
Publicado: (2025)
Towards Open-Vocabulary Remote Sensing Image Semantic Segmentation
por: Ye, Chengyang, et al.
Publicado: (2024)
por: Ye, Chengyang, et al.
Publicado: (2024)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
por: Yu, Jiazuo, et al.
Publicado: (2024)
por: Yu, Jiazuo, et al.
Publicado: (2024)
3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding
por: Xiong, Haomiao, et al.
Publicado: (2025)
por: Xiong, Haomiao, et al.
Publicado: (2025)
Regularizing Subspace Redundancy of Low-Rank Adaptation
por: Zhu, Yue, et al.
Publicado: (2025)
por: Zhu, Yue, et al.
Publicado: (2025)
Learning Spatial-Semantic Features for Robust Video Object Segmentation
por: Li, Xin, et al.
Publicado: (2024)
por: Li, Xin, et al.
Publicado: (2024)
Towards Cross-Platform Generalization: Domain Adaptive 3D Detection with Augmentation and Pseudo-Labeling
por: Feng, Xiyan, et al.
Publicado: (2026)
por: Feng, Xiyan, et al.
Publicado: (2026)
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
por: Bai, Zechen, et al.
Publicado: (2024)
por: Bai, Zechen, et al.
Publicado: (2024)
High Quality Segmentation for Ultra High-resolution Images
por: Shen, Tiancheng, et al.
Publicado: (2021)
por: Shen, Tiancheng, et al.
Publicado: (2021)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
por: Ding, Yang, et al.
Publicado: (2025)
por: Ding, Yang, et al.
Publicado: (2025)
Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder
por: Jisheng, Dang, et al.
Publicado: (2025)
por: Jisheng, Dang, et al.
Publicado: (2025)
Bootstraping Clustering of Gaussians for View-consistent 3D Scene Understanding
por: Zhang, Wenbo, et al.
Publicado: (2024)
por: Zhang, Wenbo, et al.
Publicado: (2024)
Fantastic Animals and Where to Find Them: Segment Any Marine Animal with Dual SAM
por: Zhang, Pingping, et al.
Publicado: (2024)
por: Zhang, Pingping, et al.
Publicado: (2024)
Other Tokens Matter: Exploring Global and Local Features of Vision Transformers for Object Re-Identification
por: Wang, Yingquan, et al.
Publicado: (2024)
por: Wang, Yingquan, et al.
Publicado: (2024)
Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
por: Kang, Caixin, et al.
Publicado: (2026)
por: Kang, Caixin, et al.
Publicado: (2026)
Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
por: Qin, Jialong, et al.
Publicado: (2025)
por: Qin, Jialong, et al.
Publicado: (2025)
Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters
por: Yu, Jiazuo, et al.
Publicado: (2024)
por: Yu, Jiazuo, et al.
Publicado: (2024)
SurgBench: A Unified Large-Scale Benchmark for Surgical Video Analysis
por: Wei, Jianhui, et al.
Publicado: (2025)
por: Wei, Jianhui, et al.
Publicado: (2025)
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
por: Zheng, Zirui, et al.
Publicado: (2025)
por: Zheng, Zirui, et al.
Publicado: (2025)
X-ReID: Multi-granularity Information Interaction for Video-Based Visible-Infrared Person Re-Identification
por: Yu, Chenyang, et al.
Publicado: (2025)
por: Yu, Chenyang, et al.
Publicado: (2025)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
por: Zhang, Pingping, et al.
Publicado: (2024)
por: Zhang, Pingping, et al.
Publicado: (2024)
SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
Multi-Scale and Detail-Enhanced Segment Anything Model for Salient Object Detection
por: Gao, Shixuan, et al.
Publicado: (2024)
por: Gao, Shixuan, et al.
Publicado: (2024)
Ctrl-VI: Controllable Video Synthesis via Variational Inference
por: Duan, Haoyi, et al.
Publicado: (2025)
por: Duan, Haoyi, et al.
Publicado: (2025)
The Devil is in Low-Level Features for Cross-Domain Few-Shot Segmentation
por: Liu, Yuhan, et al.
Publicado: (2025)
por: Liu, Yuhan, et al.
Publicado: (2025)
Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation
por: Zhao, Bingrui, et al.
Publicado: (2025)
por: Zhao, Bingrui, et al.
Publicado: (2025)
Learning Universal Features for Generalizable Image Forgery Localization
por: Zhao, Hengrun, et al.
Publicado: (2025)
por: Zhao, Hengrun, et al.
Publicado: (2025)
TTF: Temporal Token Fusion for Efficient Video-Language Model
por: Huo, Simin, et al.
Publicado: (2026)
por: Huo, Simin, et al.
Publicado: (2026)
DropletVideo: A Dataset and Approach to Explore Integral Spatio-Temporal Consistent Video Generation
por: Zhang, Runze, et al.
Publicado: (2025)
por: Zhang, Runze, et al.
Publicado: (2025)
Factorized-Dreamer: Training A High-Quality Video Generator with Limited and Low-Quality Data
por: Yang, Tao, et al.
Publicado: (2024)
por: Yang, Tao, et al.
Publicado: (2024)
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
por: Zhang, Jianrui, et al.
Publicado: (2026)
por: Zhang, Jianrui, et al.
Publicado: (2026)
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
por: Ju, Shaobo, et al.
Publicado: (2026)
por: Ju, Shaobo, et al.
Publicado: (2026)
Ejemplares similares
-
Reinforcing Video Reasoning Segmentation to Think Before It Segments
por: Gong, Sitong, et al.
Publicado: (2025) -
Complementary and Contrastive Learning for Audio-Visual Segmentation
por: Gong, Sitong, et al.
Publicado: (2025) -
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
por: Xiong, Haomiao, et al.
Publicado: (2025) -
AVS-Mamba: Exploring Temporal and Multi-modal Mamba for Audio-Visual Segmentation
por: Gong, Sitong, et al.
Publicado: (2025) -
Parameter Aware Mamba Model for Multi-task Dense Prediction
por: Yu, Xinzhuo, et al.
Publicado: (2025)