Lost in Time: A New Temporal Benchmark for VideoLLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Cores, Daniel, Dorkenwald, Michael, Mucientes, Manuel, Snoek, Cees G. M., Asano, Yuki M. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs
por: Dorkenwald, Michael, et al.
Publicado: (2024)
por: Dorkenwald, Michael, et al.
Publicado: (2024)
Elastic ViTs from Pretrained Models without Retraining
por: Simoncini, Walter, et al.
Publicado: (2025)
por: Simoncini, Walter, et al.
Publicado: (2025)
SIGMA: Sinkhorn-Guided Masked Video Modeling
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
Segment Any 3D-Part in a Scene from a Sentence
por: Wu, Hongyu, et al.
Publicado: (2025)
por: Wu, Hongyu, et al.
Publicado: (2025)
Redefining Normal: A Novel Object-Level Approach for Multi-Object Novelty Detection
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
GeneralAD: Anomaly Detection Across Domains by Attending to Distorted Features
por: Sträter, Luc P. J., et al.
Publicado: (2024)
por: Sträter, Luc P. J., et al.
Publicado: (2024)
MoSiC: Optimal-Transport Motion Trajectory for Dense Self-Supervised Learning
por: Salehi, Mohammadreza, et al.
Publicado: (2025)
por: Salehi, Mohammadreza, et al.
Publicado: (2025)
EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs
por: Li, Jiameng, et al.
Publicado: (2026)
por: Li, Jiameng, et al.
Publicado: (2026)
Mitigating Hallucination in VideoLLMs via Temporal-Aware Activation Engineering
por: Cai, Jianfeng, et al.
Publicado: (2025)
por: Cai, Jianfeng, et al.
Publicado: (2025)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
por: Liu, Huabin, et al.
Publicado: (2025)
por: Liu, Huabin, et al.
Publicado: (2025)
SelEx: Self-Expertise in Fine-Grained Generalized Category Discovery
por: Rastegar, Sarah, et al.
Publicado: (2024)
por: Rastegar, Sarah, et al.
Publicado: (2024)
TWIST & SCOUT: Grounding Multimodal LLM-Experts by Forget-Free Tuning
por: Bhowmik, Aritra, et al.
Publicado: (2024)
por: Bhowmik, Aritra, et al.
Publicado: (2024)
TULIP: Token-length Upgraded CLIP
por: Najdenkoska, Ivona, et al.
Publicado: (2024)
por: Najdenkoska, Ivona, et al.
Publicado: (2024)
LocoMotion: Learning Motion-Focused Video-Language Representations
por: Doughty, Hazel, et al.
Publicado: (2024)
por: Doughty, Hazel, et al.
Publicado: (2024)
WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs
por: Zhang, Yulin, et al.
Publicado: (2026)
por: Zhang, Yulin, et al.
Publicado: (2026)
VideoLLM Benchmarks and Evaluation: A Survey
por: Kumar, Yogesh
Publicado: (2025)
por: Kumar, Yogesh
Publicado: (2025)
SEVERE++: Evaluating Benchmark Sensitivity in Generalization of Video Representation Learning
por: Thoker, Fida Mohammad, et al.
Publicado: (2025)
por: Thoker, Fida Mohammad, et al.
Publicado: (2025)
Low-Resource Vision Challenges for Foundation Models
por: Zhang, Yunhua, et al.
Publicado: (2024)
por: Zhang, Yunhua, et al.
Publicado: (2024)
Lost and Found: Overcoming Detector Failures in Online Multi-Object Tracking
por: Vaquero, Lorenzo, et al.
Publicado: (2024)
por: Vaquero, Lorenzo, et al.
Publicado: (2024)
Beyond Coarse-Grained Matching in Video-Text Retrieval
por: Chen, Aozhu, et al.
Publicado: (2024)
por: Chen, Aozhu, et al.
Publicado: (2024)
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
por: Guan, Yiran, et al.
Publicado: (2026)
por: Guan, Yiran, et al.
Publicado: (2026)
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
por: Bhowmik, Aritra, et al.
Publicado: (2025)
por: Bhowmik, Aritra, et al.
Publicado: (2025)
Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs
por: Kim, Minji, et al.
Publicado: (2025)
por: Kim, Minji, et al.
Publicado: (2025)
Memory-efficient Streaming VideoLLMs for Real-time Procedural Video Understanding
por: Chatterjee, Dibyadip, et al.
Publicado: (2025)
por: Chatterjee, Dibyadip, et al.
Publicado: (2025)
Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing
por: Kumar, Yogesh
Publicado: (2025)
por: Kumar, Yogesh
Publicado: (2025)
Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency
por: Li, Hongyu, et al.
Publicado: (2025)
por: Li, Hongyu, et al.
Publicado: (2025)
SimPLR: A Simple and Plain Transformer for Efficient Object Detection and Segmentation
por: Nguyen, Duy-Kien, et al.
Publicado: (2023)
por: Nguyen, Duy-Kien, et al.
Publicado: (2023)
Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
por: Qin, Jialong, et al.
Publicado: (2025)
por: Qin, Jialong, et al.
Publicado: (2025)
Geometry-Guided Camera Motion Understanding in VideoLLMs
por: Feng, Haoan, et al.
Publicado: (2026)
por: Feng, Haoan, et al.
Publicado: (2026)
Superpowering Open-Vocabulary Object Detectors for X-ray Vision
por: Garcia-Fernandez, Pablo, et al.
Publicado: (2025)
por: Garcia-Fernandez, Pablo, et al.
Publicado: (2025)
Dual Guidance Semi-Supervised Action Detection
por: Singh, Ankit, et al.
Publicado: (2025)
por: Singh, Ankit, et al.
Publicado: (2025)
SuperDisco: Super-Class Discovery Improves Visual Recognition for the Long-Tail
por: Du, Yingjun, et al.
Publicado: (2023)
por: Du, Yingjun, et al.
Publicado: (2023)
Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs
por: Chung, Hyungjin, et al.
Publicado: (2025)
por: Chung, Hyungjin, et al.
Publicado: (2025)
IPO: Interpretable Prompt Optimization for Vision-Language Models
por: Du, Yingjun, et al.
Publicado: (2024)
por: Du, Yingjun, et al.
Publicado: (2024)
Proact-VL: A Proactive VideoLLM for Real-Time AI Companions
por: Yan, Weicai, et al.
Publicado: (2026)
por: Yan, Weicai, et al.
Publicado: (2026)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
por: Li, Chenglin, et al.
Publicado: (2026)
por: Li, Chenglin, et al.
Publicado: (2026)
RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
por: Sun, Wenfang, et al.
Publicado: (2026)
por: Sun, Wenfang, et al.
Publicado: (2026)
Training-Free Semantic Segmentation via LLM-Supervision
por: Sun, Wenfang, et al.
Publicado: (2024)
por: Sun, Wenfang, et al.
Publicado: (2024)
VideoLLM-online: Online Video Large Language Model for Streaming Video
por: Chen, Joya, et al.
Publicado: (2024)
por: Chen, Joya, et al.
Publicado: (2024)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
por: Wang, Haibo, et al.
Publicado: (2024)
por: Wang, Haibo, et al.
Publicado: (2024)
Ejemplares similares
-
PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs
por: Dorkenwald, Michael, et al.
Publicado: (2024) -
Elastic ViTs from Pretrained Models without Retraining
por: Simoncini, Walter, et al.
Publicado: (2025) -
SIGMA: Sinkhorn-Guided Masked Video Modeling
por: Salehi, Mohammadreza, et al.
Publicado: (2024) -
Segment Any 3D-Part in a Scene from a Sentence
por: Wu, Hongyu, et al.
Publicado: (2025) -
Redefining Normal: A Novel Object-Level Approach for Multi-Object Novelty Detection
por: Salehi, Mohammadreza, et al.
Publicado: (2024)