GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
Fuente:
arXiv
Salvato in:
| Autori principali: | Cheng, Zixu, Li, Da, Hu, Jian, Zang, Yuhang, Liu, Ziquan, Gong, Shaogang, Li, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
Grounding Video Reasoning in Physical Signals
di: Osmanli, Alibay, et al.
Pubblicazione: (2026)
di: Osmanli, Alibay, et al.
Pubblicazione: (2026)
CoS: Chain-of-Shot Prompting for Long Video Understanding
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
INT: Instance-Specific Negative Mining for Task-Generic Promptable Segmentation
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding
di: Cheng, Zixu, et al.
Pubblicazione: (2024)
di: Cheng, Zixu, et al.
Pubblicazione: (2024)
Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning
di: Wang, Shijian, et al.
Pubblicazione: (2025)
di: Wang, Shijian, et al.
Pubblicazione: (2025)
Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning
di: Li, Xueheng, et al.
Pubblicazione: (2026)
di: Li, Xueheng, et al.
Pubblicazione: (2026)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
di: Wang, Qunzhong, et al.
Pubblicazione: (2025)
di: Wang, Qunzhong, et al.
Pubblicazione: (2025)
VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
di: Zhang, Jinglei, et al.
Pubblicazione: (2025)
di: Zhang, Jinglei, et al.
Pubblicazione: (2025)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
di: He, Zefeng, et al.
Pubblicazione: (2025)
di: He, Zefeng, et al.
Pubblicazione: (2025)
ViSMaP: Unsupervised Hour-long Video Summarisation by Meta-Prompting
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
di: Li, Chenglin, et al.
Pubblicazione: (2026)
di: Li, Chenglin, et al.
Pubblicazione: (2026)
Static and Dynamic Graph Alignment Network for Temporal Video Grounding
di: Hu, Zhanjie, et al.
Pubblicazione: (2026)
di: Hu, Zhanjie, et al.
Pubblicazione: (2026)
LION-FS: Fast & Slow Video-Language Thinker as Online Video Assistant
di: Li, Wei, et al.
Pubblicazione: (2025)
di: Li, Wei, et al.
Pubblicazione: (2025)
V-Thinker: Interactive Thinking with Images
di: Qiao, Runqi, et al.
Pubblicazione: (2025)
di: Qiao, Runqi, et al.
Pubblicazione: (2025)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
di: Gong, Sitong, et al.
Pubblicazione: (2025)
di: Gong, Sitong, et al.
Pubblicazione: (2025)
Reinforcing Video Reasoning with Focused Thinking
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
OneThinker: All-in-one Reasoning Model for Image and Video
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
Neuro-Symbolic Spatial Reasoning in Segmentation
di: Lin, Jiayi, et al.
Pubblicazione: (2025)
di: Lin, Jiayi, et al.
Pubblicazione: (2025)
LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion
di: Zhao, Zengqun, et al.
Pubblicazione: (2026)
di: Zhao, Zengqun, et al.
Pubblicazione: (2026)
AIM-Fair: Advancing Algorithmic Fairness via Selectively Fine-Tuning Biased Models with Contextual Synthetic Data
di: Zhao, Zengqun, et al.
Pubblicazione: (2025)
di: Zhao, Zengqun, et al.
Pubblicazione: (2025)
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
di: Gu, Xin, et al.
Pubblicazione: (2025)
di: Gu, Xin, et al.
Pubblicazione: (2025)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
di: Jiang, Qing, et al.
Pubblicazione: (2025)
di: Jiang, Qing, et al.
Pubblicazione: (2025)
Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation
di: Hu, Jian, et al.
Pubblicazione: (2024)
di: Hu, Jian, et al.
Pubblicazione: (2024)
InvSeg: Test-Time Prompt Inversion for Semantic Segmentation
di: Lin, Jiayi, et al.
Pubblicazione: (2024)
di: Lin, Jiayi, et al.
Pubblicazione: (2024)
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
di: He, Zefeng, et al.
Pubblicazione: (2025)
di: He, Zefeng, et al.
Pubblicazione: (2025)
TRACE: Temporal Grounding Video LLM via Causal Event Modeling
di: Guo, Yongxin, et al.
Pubblicazione: (2024)
di: Guo, Yongxin, et al.
Pubblicazione: (2024)
Temporal Score Analysis for Understanding and Correcting Diffusion Artifacts
di: Cao, Yu, et al.
Pubblicazione: (2025)
di: Cao, Yu, et al.
Pubblicazione: (2025)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
di: Tao, Sicheng, et al.
Pubblicazione: (2025)
di: Tao, Sicheng, et al.
Pubblicazione: (2025)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
di: Zhang, Haoji, et al.
Pubblicazione: (2025)
di: Zhang, Haoji, et al.
Pubblicazione: (2025)
MECD+: Unlocking Event-Level Causal Graph Discovery for Video Reasoning
di: Chen, Tieyuan, et al.
Pubblicazione: (2025)
di: Chen, Tieyuan, et al.
Pubblicazione: (2025)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
di: Cheng, Zixu, et al.
Pubblicazione: (2025) -
Grounding Video Reasoning in Physical Signals
di: Osmanli, Alibay, et al.
Pubblicazione: (2026) -
CoS: Chain-of-Shot Prompting for Long Video Understanding
di: Hu, Jian, et al.
Pubblicazione: (2025) -
INT: Instance-Specific Negative Mining for Task-Generic Promptable Segmentation
di: Hu, Jian, et al.
Pubblicazione: (2025) -
SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding
di: Cheng, Zixu, et al.
Pubblicazione: (2024)