Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Souza, Rafael, Lim, Jia-Hao, Davis, Alexander |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Knowledge-Augmented Language Models Interpreting Structured Chest X-Ray Findings
por: Davis, Alexander, et al.
Publicado: (2025)
por: Davis, Alexander, et al.
Publicado: (2025)
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
por: Qian, Long, et al.
Publicado: (2024)
por: Qian, Long, et al.
Publicado: (2024)
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
por: Nguyen, Thong, et al.
Publicado: (2025)
por: Nguyen, Thong, et al.
Publicado: (2025)
Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives
por: Park, Ji-jun, et al.
Publicado: (2024)
por: Park, Ji-jun, et al.
Publicado: (2024)
Multi-Scale Contrastive Learning for Video Temporal Grounding
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
On the Consistency of Video Large Language Models in Temporal Comprehension
por: Jung, Minjoon, et al.
Publicado: (2024)
por: Jung, Minjoon, et al.
Publicado: (2024)
TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos
por: Fateh, Fawad Javed, et al.
Publicado: (2024)
por: Fateh, Fawad Javed, et al.
Publicado: (2024)
An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models
por: Maack, Lennart, et al.
Publicado: (2026)
por: Maack, Lennart, et al.
Publicado: (2026)
SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation
por: Du, Hao, et al.
Publicado: (2025)
por: Du, Hao, et al.
Publicado: (2025)
GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models
por: Xie, Qinghongbing, et al.
Publicado: (2025)
por: Xie, Qinghongbing, et al.
Publicado: (2025)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
por: Zhang, Junyi, et al.
Publicado: (2025)
por: Zhang, Junyi, et al.
Publicado: (2025)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
por: Liang, Yiming, et al.
Publicado: (2026)
por: Liang, Yiming, et al.
Publicado: (2026)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
Temporal In-Context Fine-Tuning with Temporal Reasoning for Versatile Control of Video Diffusion Models
por: Kim, Kinam, et al.
Publicado: (2025)
por: Kim, Kinam, et al.
Publicado: (2025)
On the Cultural Anachronism and Temporal Reasoning in Vision Language Models
por: Ranjan, Mukul, et al.
Publicado: (2026)
por: Ranjan, Mukul, et al.
Publicado: (2026)
Contrastive Learning under Noisy Temporal Self-Supervision for Colonoscopy Videos
por: Parolari, Luca, et al.
Publicado: (2026)
por: Parolari, Luca, et al.
Publicado: (2026)
Probabilistic Vision-Language Representation for Weakly Supervised Temporal Action Localization
por: Lim, Geuntaek, et al.
Publicado: (2024)
por: Lim, Geuntaek, et al.
Publicado: (2024)
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
por: Jiang, Songtao, et al.
Publicado: (2026)
por: Jiang, Songtao, et al.
Publicado: (2026)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
por: Wu, Jianlong, et al.
Publicado: (2025)
por: Wu, Jianlong, et al.
Publicado: (2025)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
por: Shi, Jiapeng, et al.
Publicado: (2026)
por: Shi, Jiapeng, et al.
Publicado: (2026)
ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models
por: Ko, Dohwan, et al.
Publicado: (2025)
por: Ko, Dohwan, et al.
Publicado: (2025)
EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models
por: Huang, Shiqi, et al.
Publicado: (2026)
por: Huang, Shiqi, et al.
Publicado: (2026)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025)
por: Li, Zeqian, et al.
Publicado: (2025)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
por: Gao, Shida, et al.
Publicado: (2025)
por: Gao, Shida, et al.
Publicado: (2025)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
por: Hannan, Tanveer, et al.
Publicado: (2024)
por: Hannan, Tanveer, et al.
Publicado: (2024)
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
por: Li, Jiaze, et al.
Publicado: (2026)
por: Li, Jiaze, et al.
Publicado: (2026)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
por: Zhao, Fufangchen, et al.
Publicado: (2025)
por: Zhao, Fufangchen, et al.
Publicado: (2025)
Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging
por: Fu, Zihang, et al.
Publicado: (2026)
por: Fu, Zihang, et al.
Publicado: (2026)
VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos
por: Li, Kaining, et al.
Publicado: (2025)
por: Li, Kaining, et al.
Publicado: (2025)
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
por: Wu, Xiyang, et al.
Publicado: (2025)
por: Wu, Xiyang, et al.
Publicado: (2025)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
por: Zhou, Zikun, et al.
Publicado: (2024)
por: Zhou, Zikun, et al.
Publicado: (2024)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
por: Tao, Sicheng, et al.
Publicado: (2025)
por: Tao, Sicheng, et al.
Publicado: (2025)
VideoCoF: Unified Video Editing with Temporal Reasoner
por: Yang, Xiangpeng, et al.
Publicado: (2025)
por: Yang, Xiangpeng, et al.
Publicado: (2025)
Enhancing Temporal Understanding in Video-LLMs through Stacked Temporal Attention in Vision Encoders
por: Rasekh, Ali, et al.
Publicado: (2025)
por: Rasekh, Ali, et al.
Publicado: (2025)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
por: Lin, Xinying, et al.
Publicado: (2026)
por: Lin, Xinying, et al.
Publicado: (2026)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
por: Wang, Ye, et al.
Publicado: (2025)
por: Wang, Ye, et al.
Publicado: (2025)
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding
por: Li, Chaoyu, et al.
Publicado: (2024)
por: Li, Chaoyu, et al.
Publicado: (2024)
TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models
por: Chen, Junzhe, et al.
Publicado: (2026)
por: Chen, Junzhe, et al.
Publicado: (2026)
CoCa-CXR: Contrastive Captioners Learn Strong Temporal Structures for Chest X-Ray Vision-Language Understanding
por: Chen, Yixiong, et al.
Publicado: (2025)
por: Chen, Yixiong, et al.
Publicado: (2025)
Ejemplares similares
-
Knowledge-Augmented Language Models Interpreting Structured Chest X-Ray Findings
por: Davis, Alexander, et al.
Publicado: (2025) -
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
por: Qian, Long, et al.
Publicado: (2024) -
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
por: Nguyen, Thong, et al.
Publicado: (2025) -
Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives
por: Park, Ji-jun, et al.
Publicado: (2024) -
Multi-Scale Contrastive Learning for Video Temporal Grounding
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)