Neptune: The Long Orbit to Benchmarking Long Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Nagrani, Arsha, Zhang, Mingda, Mehran, Ramin, Hornung, Rachel, Gundavarapu, Nitesh Bharadwaj, Jha, Nilpa, Myers, Austin, Zhou, Xingyi, Gong, Boqing, Schmid, Cordelia, Sirotenko, Mikhail, Zhu, Yukun, Weyand, Tobias |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MINERVA: Evaluating Complex Video Reasoning
di: Nagrani, Arsha, et al.
Pubblicazione: (2025)
di: Nagrani, Arsha, et al.
Pubblicazione: (2025)
CAViAR: Critic-Augmented Video Agentic Reasoning
di: Menon, Sachit, et al.
Pubblicazione: (2025)
di: Menon, Sachit, et al.
Pubblicazione: (2025)
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
di: Nagrani, Arsha, et al.
Pubblicazione: (2026)
di: Nagrani, Arsha, et al.
Pubblicazione: (2026)
MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning
di: Singh, Darshan, et al.
Pubblicazione: (2026)
di: Singh, Darshan, et al.
Pubblicazione: (2026)
Extending Video Masked Autoencoders to 128 frames
di: Gundavarapu, Nitesh Bharadwaj, et al.
Pubblicazione: (2024)
di: Gundavarapu, Nitesh Bharadwaj, et al.
Pubblicazione: (2024)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
di: Min, Juhong, et al.
Pubblicazione: (2024)
di: Min, Juhong, et al.
Pubblicazione: (2024)
VoCap: Video Object Captioning and Segmentation from Any Prompt
di: Uijlings, Jasper, et al.
Pubblicazione: (2025)
di: Uijlings, Jasper, et al.
Pubblicazione: (2025)
VideoGLUE: Video General Understanding Evaluation of Foundation Models
di: Yuan, Liangzhe, et al.
Pubblicazione: (2023)
di: Yuan, Liangzhe, et al.
Pubblicazione: (2023)
VideoPrism: A Foundational Visual Encoder for Video Understanding
di: Zhao, Long, et al.
Pubblicazione: (2024)
di: Zhao, Long, et al.
Pubblicazione: (2024)
VicTR: Video-conditioned Text Representations for Activity Recognition
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2023)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2023)
Dense Video Object Captioning from Disjoint Supervision
di: Zhou, Xingyi, et al.
Pubblicazione: (2023)
di: Zhou, Xingyi, et al.
Pubblicazione: (2023)
Chapter-Llama: Efficient Chaptering in Hour-Long Videos with LLMs
di: Ventura, Lucas, et al.
Pubblicazione: (2025)
di: Ventura, Lucas, et al.
Pubblicazione: (2025)
Video Summarization: Towards Entity-Aware Captions
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
di: Wysoczańska, Monika, et al.
Pubblicazione: (2025)
di: Wysoczańska, Monika, et al.
Pubblicazione: (2025)
Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks
di: Shvetsova, Nina, et al.
Pubblicazione: (2025)
di: Shvetsova, Nina, et al.
Pubblicazione: (2025)
Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames
di: Arnab, Anurag, et al.
Pubblicazione: (2025)
di: Arnab, Anurag, et al.
Pubblicazione: (2025)
AutoAD III: The Prequel -- Back to the Pixels
di: Han, Tengda, et al.
Pubblicazione: (2024)
di: Han, Tengda, et al.
Pubblicazione: (2024)
CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning
di: Sung, Junyoung, et al.
Pubblicazione: (2026)
di: Sung, Junyoung, et al.
Pubblicazione: (2026)
Visual Lexicon: Rich Image Features in Language Space
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
BrickNet: Graph-Backed Generative Brick Assembly
di: Kulits, Peter, et al.
Pubblicazione: (2026)
di: Kulits, Peter, et al.
Pubblicazione: (2026)
Towards Zero-Shot Multimodal Machine Translation
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
di: Xie, Junyu, et al.
Pubblicazione: (2024)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
The Hottest Neptunes Orbit Metal-Rich Stars
di: Vissapragada, Shreyas, et al.
Pubblicazione: (2024)
di: Vissapragada, Shreyas, et al.
Pubblicazione: (2024)
Sobre la realidad de la vida cotidiana de los jóvenes en poblaciones en el nuevo orden democrático: «ni tan protagonista ni tan víctima»
di: Michaela Weyand
Pubblicazione: (1993)
di: Michaela Weyand
Pubblicazione: (1993)
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
di: Xie, Junyu, et al.
Pubblicazione: (2025)
di: Xie, Junyu, et al.
Pubblicazione: (2025)
Mixture of Nested Experts: Adaptive Processing of Visual Tokens
di: Jain, Gagan, et al.
Pubblicazione: (2024)
di: Jain, Gagan, et al.
Pubblicazione: (2024)
More than a Moment: Towards Coherent Sequences of Audio Descriptions
di: Khandelwal, Eshika, et al.
Pubblicazione: (2025)
di: Khandelwal, Eshika, et al.
Pubblicazione: (2025)
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
di: Chen, Shizhe, et al.
Pubblicazione: (2026)
di: Chen, Shizhe, et al.
Pubblicazione: (2026)
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
di: Bousselham, Walid, et al.
Pubblicazione: (2025)
di: Bousselham, Walid, et al.
Pubblicazione: (2025)
CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects
di: Fiastre, Gabriel, et al.
Pubblicazione: (2025)
di: Fiastre, Gabriel, et al.
Pubblicazione: (2025)
Learning text-to-video retrieval from image captioning
di: Ventura, Lucas, et al.
Pubblicazione: (2024)
di: Ventura, Lucas, et al.
Pubblicazione: (2024)
Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
di: Garcia, Ricardo, et al.
Pubblicazione: (2024)
di: Garcia, Ricardo, et al.
Pubblicazione: (2024)
ComposeAnything: Composite Object Priors for Text-to-Image Generation
di: Khan, Zeeshan, et al.
Pubblicazione: (2025)
di: Khan, Zeeshan, et al.
Pubblicazione: (2025)
Large-scale Pre-training for Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
The VoxCeleb Speaker Recognition Challenge: A Retrospective
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
Cryptocurrency forensics: Forensic analysis of the Electrum wallet to uncover artifacts
di: Saloni Jain, et al.
Pubblicazione: (2026)
di: Saloni Jain, et al.
Pubblicazione: (2026)
Dense Optical Tracking: Connecting the Dots
di: Moing, Guillaume Le, et al.
Pubblicazione: (2023)
di: Moing, Guillaume Le, et al.
Pubblicazione: (2023)
Video-Infinity: Distributed Long Video Generation
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MINERVA: Evaluating Complex Video Reasoning
di: Nagrani, Arsha, et al.
Pubblicazione: (2025) -
CAViAR: Critic-Augmented Video Agentic Reasoning
di: Menon, Sachit, et al.
Pubblicazione: (2025) -
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024) -
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
di: Nagrani, Arsha, et al.
Pubblicazione: (2026) -
MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning
di: Singh, Darshan, et al.
Pubblicazione: (2026)