Temporally-Constrained Video Reasoning Segmentation and Automated Benchmark Construction
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Yiqing, Li, Chenjia, Fan, Chenxiao, Unberath, Mathias |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RVTBench: A Benchmark for Visual Reasoning Tasks
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
Text-Driven Reasoning Video Editing via Reinforcement Learning on Digital Twin Representations
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
Fast Reasoning Segmentation for Images and Videos
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
Online Reasoning Video Segmentation with Just-in-Time Digital Twins
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
Constructing and Interpreting Digital Twin Representations for Visual Reasoning via Reinforcement Learning
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
Counterfactual World Models via Digital Twin-conditioned Video Diffusion
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
Reasoning Segmentation for Images and Videos: A Survey
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
Operating Room Workflow Analysis via Reasoning Segmentation over Digital Twins
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
Memorizing SAM: 3D Medical Segment Anything Model with Memorizing Transformer
por: Shao, Xinyuan, et al.
Publicado: (2024)
por: Shao, Xinyuan, et al.
Publicado: (2024)
MoSFormer: Augmenting Temporal Context with Memory of Surgery for Surgical Phase Recognition
por: Ding, Hao, et al.
Publicado: (2025)
por: Ding, Hao, et al.
Publicado: (2025)
FastSAM3D: An Efficient Segment Anything Model for 3D Volumetric Medical Images
por: Shen, Yiqing, et al.
Publicado: (2024)
por: Shen, Yiqing, et al.
Publicado: (2024)
A Causal Framework for Aligning Image Quality Metrics and Deep Neural Network Robustness
por: Drenkow, Nathan, et al.
Publicado: (2025)
por: Drenkow, Nathan, et al.
Publicado: (2025)
Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations
por: Li, Yizhen, et al.
Publicado: (2025)
por: Li, Yizhen, et al.
Publicado: (2025)
From Generalization to Precision: Exploring SAM for Tool Segmentation in Surgical Environments
por: Oguine, Kanyifeechukwu J., et al.
Publicado: (2024)
por: Oguine, Kanyifeechukwu J., et al.
Publicado: (2024)
Hyperspectral Image Recovery Constrained by Multi-Granularity Non-Local Self-Similarity Priors
por: Peng, Zhuoran, et al.
Publicado: (2025)
por: Peng, Zhuoran, et al.
Publicado: (2025)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
por: Cheng, Zixu, et al.
Publicado: (2025)
por: Cheng, Zixu, et al.
Publicado: (2025)
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation
por: Hong, Jihwan, et al.
Publicado: (2026)
por: Hong, Jihwan, et al.
Publicado: (2026)
Spatio-Temporal Attention for Consistent Video Semantic Segmentation in Automated Driving
por: Varghese, Serin, et al.
Publicado: (2026)
por: Varghese, Serin, et al.
Publicado: (2026)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model
por: Zhang, Ruixin, et al.
Publicado: (2025)
por: Zhang, Ruixin, et al.
Publicado: (2025)
TwinOR: Photorealistic Digital Twins of Dynamic Operating Rooms for Embodied AI Research
por: Zhang, Han, et al.
Publicado: (2025)
por: Zhang, Han, et al.
Publicado: (2025)
TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos
por: Fateh, Fawad Javed, et al.
Publicado: (2024)
por: Fateh, Fawad Javed, et al.
Publicado: (2024)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
por: Tao, Sicheng, et al.
Publicado: (2025)
por: Tao, Sicheng, et al.
Publicado: (2025)
Online Reasoning Video Object Segmentation
por: Liu, Jinyuan, et al.
Publicado: (2026)
por: Liu, Jinyuan, et al.
Publicado: (2026)
Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory
por: Zhu, Zhengtong, et al.
Publicado: (2026)
por: Zhu, Zhengtong, et al.
Publicado: (2026)
An Intrinsically Explainable Approach to Detecting Vertebral Compression Fractures in CT Scans via Neurosymbolic Modeling
por: Inigo, Blanca, et al.
Publicado: (2024)
por: Inigo, Blanca, et al.
Publicado: (2024)
The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
por: Gong, Sitong, et al.
Publicado: (2025)
por: Gong, Sitong, et al.
Publicado: (2025)
Calisthenics Skills Temporal Video Segmentation
por: Finocchiaro, Antonio, et al.
Publicado: (2025)
por: Finocchiaro, Antonio, et al.
Publicado: (2025)
Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs
por: Zhu, Rui, et al.
Publicado: (2026)
por: Zhu, Rui, et al.
Publicado: (2026)
HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
por: Yang, Yiqing, et al.
Publicado: (2025)
por: Yang, Yiqing, et al.
Publicado: (2025)
Video-based Sign Language Recognition without Temporal Segmentation
por: Huang, Jie, et al.
Publicado: (2018)
por: Huang, Jie, et al.
Publicado: (2018)
Benchmarking the Robustness of Panoptic Segmentation for Automated Driving
por: Wang, Yiting, et al.
Publicado: (2024)
por: Wang, Yiting, et al.
Publicado: (2024)
Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation
por: Huang, Shaofei, et al.
Publicado: (2024)
por: Huang, Shaofei, et al.
Publicado: (2024)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
por: Gong, Sitong, et al.
Publicado: (2025)
por: Gong, Sitong, et al.
Publicado: (2025)
Automated Video Segmentation Machine Learning Pipeline
por: Merz, Johannes, et al.
Publicado: (2025)
por: Merz, Johannes, et al.
Publicado: (2025)
Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
por: Wang, Yijia, et al.
Publicado: (2025)
por: Wang, Yijia, et al.
Publicado: (2025)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
por: Zhang, Mingfang, et al.
Publicado: (2026)
por: Zhang, Mingfang, et al.
Publicado: (2026)
End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning
por: Zhang, Jinrong, et al.
Publicado: (2023)
por: Zhang, Jinrong, et al.
Publicado: (2023)
TAR-TVG: Enhancing VLMs with Timestamp Anchor-Constrained Reasoning for Temporal Video Grounding
por: Guo, Chaohong, et al.
Publicado: (2025)
por: Guo, Chaohong, et al.
Publicado: (2025)
Ejemplares similares
-
RVTBench: A Benchmark for Visual Reasoning Tasks
por: Shen, Yiqing, et al.
Publicado: (2025) -
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
por: Shen, Yiqing, et al.
Publicado: (2025) -
Text-Driven Reasoning Video Editing via Reinforcement Learning on Digital Twin Representations
por: Shen, Yiqing, et al.
Publicado: (2025) -
Fast Reasoning Segmentation for Images and Videos
por: Shen, Yiqing, et al.
Publicado: (2025) -
Online Reasoning Video Segmentation with Just-in-Time Digital Twins
por: Shen, Yiqing, et al.
Publicado: (2025)