Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Ruizhe, Fan, Zhiting, Luo, Tianze, Zou, Heqing, Feng, Zhaopeng, Xie, Guiyang, Zhang, Hansheng, Wang, Zhuochen, Liu, Zuozhu, Zhang, Huaijian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
von: Zou, Heqing, et al.
Veröffentlicht: (2024)
von: Zou, Heqing, et al.
Veröffentlicht: (2024)
HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding
von: Zou, Heqing, et al.
Veröffentlicht: (2025)
von: Zou, Heqing, et al.
Veröffentlicht: (2025)
Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph
von: Wang, Wentao, et al.
Veröffentlicht: (2025)
von: Wang, Wentao, et al.
Veröffentlicht: (2025)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
von: Fan, Zhiting, et al.
Veröffentlicht: (2025)
von: Fan, Zhiting, et al.
Veröffentlicht: (2025)
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
von: Jiang, Songtao, et al.
Veröffentlicht: (2026)
von: Jiang, Songtao, et al.
Veröffentlicht: (2026)
Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs
von: Ma, Wen, et al.
Veröffentlicht: (2026)
von: Ma, Wen, et al.
Veröffentlicht: (2026)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
von: Gu, Xin, et al.
Veröffentlicht: (2025)
von: Gu, Xin, et al.
Veröffentlicht: (2025)
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
von: Fan, Zhiting, et al.
Veröffentlicht: (2024)
von: Fan, Zhiting, et al.
Veröffentlicht: (2024)
BiasAlert: A Plug-and-play Tool for Social Bias Detection in LLMs
von: Fan, Zhiting, et al.
Veröffentlicht: (2024)
von: Fan, Zhiting, et al.
Veröffentlicht: (2024)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
von: Yue, Feng, et al.
Veröffentlicht: (2025)
von: Yue, Feng, et al.
Veröffentlicht: (2025)
Context-Guided Spatio-Temporal Video Grounding
von: Gu, Xin, et al.
Veröffentlicht: (2024)
von: Gu, Xin, et al.
Veröffentlicht: (2024)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
von: Meng, Jiahao, et al.
Veröffentlicht: (2025)
von: Meng, Jiahao, et al.
Veröffentlicht: (2025)
FAIntbench: A Holistic and Precise Benchmark for Bias Evaluation in Text-to-Image Models
von: Luo, Hanjun, et al.
Veröffentlicht: (2024)
von: Luo, Hanjun, et al.
Veröffentlicht: (2024)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
von: Dong, Lu, et al.
Veröffentlicht: (2025)
von: Dong, Lu, et al.
Veröffentlicht: (2025)
Ladder: A Model-Agnostic Framework Boosting LLM-based Machine Translation to the Next Level
von: Feng, Zhaopeng, et al.
Veröffentlicht: (2024)
von: Feng, Zhaopeng, et al.
Veröffentlicht: (2024)
Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2025)
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2025)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
von: Luo, Fuwen, et al.
Veröffentlicht: (2025)
von: Luo, Fuwen, et al.
Veröffentlicht: (2025)
Towards Long-Form Spatio-Temporal Video Grounding
von: Gu, Xin, et al.
Veröffentlicht: (2026)
von: Gu, Xin, et al.
Veröffentlicht: (2026)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
von: Xu, Ziqiang, et al.
Veröffentlicht: (2025)
von: Xu, Ziqiang, et al.
Veröffentlicht: (2025)
CAPO: Reinforcing Consistent Reasoning in Medical Decision-Making
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding
von: Jung, Minjoon, et al.
Veröffentlicht: (2026)
von: Jung, Minjoon, et al.
Veröffentlicht: (2026)
VersusDebias: Universal Zero-Shot Debiasing for Text-to-Image Models via SLM-Based Prompt Engineering and Generative Adversary
von: Luo, Hanjun, et al.
Veröffentlicht: (2024)
von: Luo, Hanjun, et al.
Veröffentlicht: (2024)
Towards Temporal Compositional Reasoning in Long-Form Sports Videos
von: Cao, Siyu, et al.
Veröffentlicht: (2026)
von: Cao, Siyu, et al.
Veröffentlicht: (2026)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
von: Yao, Jiali, et al.
Veröffentlicht: (2025)
von: Yao, Jiali, et al.
Veröffentlicht: (2025)
End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning
von: Zhang, Jinrong, et al.
Veröffentlicht: (2023)
von: Zhang, Jinrong, et al.
Veröffentlicht: (2023)
Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding
von: Gu, Xin, et al.
Veröffentlicht: (2025)
von: Gu, Xin, et al.
Veröffentlicht: (2025)
Temporally Grounding Instructional Diagrams in Unconstrained Videos
von: Zhang, Jiahao, et al.
Veröffentlicht: (2024)
von: Zhang, Jiahao, et al.
Veröffentlicht: (2024)
MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning
von: Feng, Zhaopeng, et al.
Veröffentlicht: (2025)
von: Feng, Zhaopeng, et al.
Veröffentlicht: (2025)
STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
von: Zhang, Xiaowen, et al.
Veröffentlicht: (2026)
von: Zhang, Xiaowen, et al.
Veröffentlicht: (2026)
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
von: Tu, Xuezhen, et al.
Veröffentlicht: (2026)
von: Tu, Xuezhen, et al.
Veröffentlicht: (2026)
On Occlusions in Video Action Detection: Benchmark Datasets And Training Recipes
von: Modi, Rajat, et al.
Veröffentlicht: (2024)
von: Modi, Rajat, et al.
Veröffentlicht: (2024)
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
von: Nguyen, Thong, et al.
Veröffentlicht: (2025)
von: Nguyen, Thong, et al.
Veröffentlicht: (2025)
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
von: Deng, Ziye, et al.
Veröffentlicht: (2025)
von: Deng, Ziye, et al.
Veröffentlicht: (2025)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
von: Ding, Yang, et al.
Veröffentlicht: (2025)
von: Ding, Yang, et al.
Veröffentlicht: (2025)
Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning
von: Zhang, Shaojie, et al.
Veröffentlicht: (2025)
von: Zhang, Shaojie, et al.
Veröffentlicht: (2025)
RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation
von: Zhang, Ruoxuan, et al.
Veröffentlicht: (2025)
von: Zhang, Ruoxuan, et al.
Veröffentlicht: (2025)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
von: Wang, Jiankang, et al.
Veröffentlicht: (2025)
von: Wang, Jiankang, et al.
Veröffentlicht: (2025)
Text-based Talking Video Editing with Cascaded Conditional Diffusion
von: Han, Bo, et al.
Veröffentlicht: (2024)
von: Han, Bo, et al.
Veröffentlicht: (2024)
Decoupling Dark Knowledge via Block-wise Logit Distillation for Feature-level Alignment
von: Yu, Chengting, et al.
Veröffentlicht: (2024)
von: Yu, Chengting, et al.
Veröffentlicht: (2024)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
von: Li, Yichen, et al.
Veröffentlicht: (2025)
von: Li, Yichen, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
von: Zou, Heqing, et al.
Veröffentlicht: (2024) -
HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding
von: Zou, Heqing, et al.
Veröffentlicht: (2025) -
Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph
von: Wang, Wentao, et al.
Veröffentlicht: (2025) -
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
von: Fan, Zhiting, et al.
Veröffentlicht: (2025) -
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
von: Jiang, Songtao, et al.
Veröffentlicht: (2026)