Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Songtao, Song, Sibo, Zhou, Chenyi, Wang, Yuan, Chen, Ruizhe, Guan, Tongkun, Luo, Ruilin, Zhang, Yan, Tang, Zhihang, Sun, Yuchong, Zhang, Hang, Yang, Zhibo, Bai, Shuai, Lin, Junyang, Liu, Zuozhu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
par: Luo, Ruilin, et autres
Publié: (2026)
par: Luo, Ruilin, et autres
Publié: (2026)
CAPO: Reinforcing Consistent Reasoning in Medical Decision-Making
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
par: Chen, Ruizhe, et autres
Publié: (2025)
par: Chen, Ruizhe, et autres
Publié: (2025)
Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
par: Guan, Tongkun, et autres
Publié: (2026)
par: Guan, Tongkun, et autres
Publié: (2026)
Towards Temporal Compositional Reasoning in Long-Form Sports Videos
par: Cao, Siyu, et autres
Publié: (2026)
par: Cao, Siyu, et autres
Publié: (2026)
How Far Are Video Models from True Multimodal Reasoning?
par: Zhang, Xiaotian, et autres
Publié: (2026)
par: Zhang, Xiaotian, et autres
Publié: (2026)
Temporal Reasoning Transfer from Text to Video
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
par: Fan, Zhiting, et autres
Publié: (2025)
par: Fan, Zhiting, et autres
Publié: (2025)
UniVBench: Towards Unified Evaluation for Video Foundation Models
par: Wei, Jianhui, et autres
Publié: (2026)
par: Wei, Jianhui, et autres
Publié: (2026)
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
Knowing or Guessing? Robust Medical Visual Question Answering via Joint Consistency and Contrastive Learning
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
par: Li, Chenglin, et autres
Publié: (2025)
par: Li, Chenglin, et autres
Publié: (2025)
Joint Visual and Text Prompting for Improved Object-Centric Perception with Multimodal Large Language Models
par: Jiang, Songtao, et autres
Publié: (2024)
par: Jiang, Songtao, et autres
Publié: (2024)
VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
par: Zhang, Jinglei, et autres
Publié: (2025)
par: Zhang, Jinglei, et autres
Publié: (2025)
OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer
par: Zhang, Pengze, et autres
Publié: (2026)
par: Zhang, Pengze, et autres
Publié: (2026)
PAD: Personalized Alignment of LLMs at Decoding-Time
par: Chen, Ruizhe, et autres
Publié: (2024)
par: Chen, Ruizhe, et autres
Publié: (2024)
Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph
par: Wang, Wentao, et autres
Publié: (2025)
par: Wang, Wentao, et autres
Publié: (2025)
FAIntbench: A Holistic and Precise Benchmark for Bias Evaluation in Text-to-Image Models
par: Luo, Hanjun, et autres
Publié: (2024)
par: Luo, Hanjun, et autres
Publié: (2024)
Preparing Quantum Backflow States by Large Momentum Transfer
par: Chen, Yuchong, et autres
Publié: (2026)
par: Chen, Yuchong, et autres
Publié: (2026)
OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
Persona-judge: Personalized Alignment of Large Language Models via Token-level Self-judgment
par: Zhang, Xiaotian, et autres
Publié: (2025)
par: Zhang, Xiaotian, et autres
Publié: (2025)
Are Synthetic Videos Useful? A Benchmark for Retrieval-Centric Evaluation of Synthetic Videos
par: Zhao, Zecheng, et autres
Publié: (2025)
par: Zhao, Zecheng, et autres
Publié: (2025)
Revisiting Multimodal Positional Encoding in Vision-Language Models
par: Huang, Jie, et autres
Publié: (2025)
par: Huang, Jie, et autres
Publié: (2025)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
par: Li, Chenglin, et autres
Publié: (2026)
par: Li, Chenglin, et autres
Publié: (2026)
Bridging Synthetic and Real Worlds for Pre-training Scene Text Detectors
par: Guan, Tongkun, et autres
Publié: (2023)
par: Guan, Tongkun, et autres
Publié: (2023)
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
par: Li, Mingxin, et autres
Publié: (2026)
par: Li, Mingxin, et autres
Publié: (2026)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
par: Guan, Kaisi, et autres
Publié: (2025)
par: Guan, Kaisi, et autres
Publié: (2025)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
par: Ding, Yang, et autres
Publié: (2025)
par: Ding, Yang, et autres
Publié: (2025)
TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos
par: Fateh, Fawad Javed, et autres
Publié: (2024)
par: Fateh, Fawad Javed, et autres
Publié: (2024)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
par: Zhang, Haoji, et autres
Publié: (2025)
par: Zhang, Haoji, et autres
Publié: (2025)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding
par: Yang, Zuhao, et autres
Publié: (2025)
par: Yang, Zuhao, et autres
Publié: (2025)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
par: Liu, Xiaolin, et autres
Publié: (2026)
par: Liu, Xiaolin, et autres
Publié: (2026)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
par: Wang, Jiankang, et autres
Publié: (2025)
par: Wang, Jiankang, et autres
Publié: (2025)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
par: Tao, Sicheng, et autres
Publié: (2025)
par: Tao, Sicheng, et autres
Publié: (2025)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
par: Cheng, Zesen, et autres
Publié: (2024)
par: Cheng, Zesen, et autres
Publié: (2024)
The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
par: Gong, Sitong, et autres
Publié: (2025)
par: Gong, Sitong, et autres
Publié: (2025)
Modality-Fair Preference Optimization for Trustworthy MLLM Alignment
par: Jiang, Songtao, et autres
Publié: (2024)
par: Jiang, Songtao, et autres
Publié: (2024)
Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding
par: Zhao, Xinkui, et autres
Publié: (2025)
par: Zhao, Xinkui, et autres
Publié: (2025)
Documents similaires
-
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
par: Luo, Ruilin, et autres
Publié: (2026) -
CAPO: Reinforcing Consistent Reasoning in Medical Decision-Making
par: Jiang, Songtao, et autres
Publié: (2025) -
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
par: Chen, Ruizhe, et autres
Publié: (2025) -
Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering
par: Jiang, Songtao, et autres
Publié: (2025) -
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
par: Guan, Tongkun, et autres
Publié: (2026)