VoCap: Video Object Captioning and Segmentation from Any Prompt
Fuente:
arXiv
Salvato in:
| Autori principali: | Uijlings, Jasper, Zhou, Xingyi, Gu, Xiuye, Nagrani, Arsha, Arnab, Anurag, Fathi, Alireza, Ross, David, Schmid, Cordelia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
Dense Video Object Captioning from Disjoint Supervision
di: Zhou, Xingyi, et al.
Pubblicazione: (2023)
di: Zhou, Xingyi, et al.
Pubblicazione: (2023)
VicTR: Video-conditioned Text Representations for Activity Recognition
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2023)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2023)
Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames
di: Arnab, Anurag, et al.
Pubblicazione: (2025)
di: Arnab, Anurag, et al.
Pubblicazione: (2025)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
di: Min, Juhong, et al.
Pubblicazione: (2024)
di: Min, Juhong, et al.
Pubblicazione: (2024)
Language-Guided Image Tokenization for Generation
di: Zha, Kaiwen, et al.
Pubblicazione: (2024)
di: Zha, Kaiwen, et al.
Pubblicazione: (2024)
CAViAR: Critic-Augmented Video Agentic Reasoning
di: Menon, Sachit, et al.
Pubblicazione: (2025)
di: Menon, Sachit, et al.
Pubblicazione: (2025)
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
di: Nagrani, Arsha, et al.
Pubblicazione: (2026)
di: Nagrani, Arsha, et al.
Pubblicazione: (2026)
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
di: Wysoczańska, Monika, et al.
Pubblicazione: (2025)
di: Wysoczańska, Monika, et al.
Pubblicazione: (2025)
CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects
di: Fiastre, Gabriel, et al.
Pubblicazione: (2025)
di: Fiastre, Gabriel, et al.
Pubblicazione: (2025)
Video Summarization: Towards Entity-Aware Captions
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
Visual Lexicon: Rich Image Features in Language Space
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning
di: Singh, Darshan, et al.
Pubblicazione: (2026)
di: Singh, Darshan, et al.
Pubblicazione: (2026)
Neptune: The Long Orbit to Benchmarking Long Video Understanding
di: Nagrani, Arsha, et al.
Pubblicazione: (2024)
di: Nagrani, Arsha, et al.
Pubblicazione: (2024)
Large-scale Pre-training for Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
Web-Scale Visual Entity Recognition: An LLM-Driven Data Approach
di: Caron, Mathilde, et al.
Pubblicazione: (2024)
di: Caron, Mathilde, et al.
Pubblicazione: (2024)
Retrieval-Enhanced Contrastive Vision-Text Models
di: Iscen, Ahmet, et al.
Pubblicazione: (2023)
di: Iscen, Ahmet, et al.
Pubblicazione: (2023)
A Generative Approach for Wikipedia-Scale Visual Entity Recognition
di: Caron, Mathilde, et al.
Pubblicazione: (2024)
di: Caron, Mathilde, et al.
Pubblicazione: (2024)
What Are You Doing? A Closer Look at Controllable Human Video Generation
di: Bugliarello, Emanuele, et al.
Pubblicazione: (2025)
di: Bugliarello, Emanuele, et al.
Pubblicazione: (2025)
Time-, Memory- and Parameter-Efficient Visual Adaptation
di: Mercea, Otniel-Bogdan, et al.
Pubblicazione: (2024)
di: Mercea, Otniel-Bogdan, et al.
Pubblicazione: (2024)
FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object Placement
di: Huang, Ian, et al.
Pubblicazione: (2025)
di: Huang, Ian, et al.
Pubblicazione: (2025)
Mixture of Nested Experts: Adaptive Processing of Visual Tokens
di: Jain, Gagan, et al.
Pubblicazione: (2024)
di: Jain, Gagan, et al.
Pubblicazione: (2024)
Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks
di: Shvetsova, Nina, et al.
Pubblicazione: (2025)
di: Shvetsova, Nina, et al.
Pubblicazione: (2025)
MINERVA: Evaluating Complex Video Reasoning
di: Nagrani, Arsha, et al.
Pubblicazione: (2025)
di: Nagrani, Arsha, et al.
Pubblicazione: (2025)
RECODE: Reasoning Through Code Generation for Visual Question Answering
di: Shen, Junhong, et al.
Pubblicazione: (2025)
di: Shen, Junhong, et al.
Pubblicazione: (2025)
SceneCraft: An LLM Agent for Synthesizing 3D Scene as Blender Code
di: Hu, Ziniu, et al.
Pubblicazione: (2024)
di: Hu, Ziniu, et al.
Pubblicazione: (2024)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Audiovisual Masked Autoencoders
di: Georgescu, Mariana-Iuliana, et al.
Pubblicazione: (2022)
di: Georgescu, Mariana-Iuliana, et al.
Pubblicazione: (2022)
Continual Learning in Vision-Language Models via Aligned Model Merging
di: Sokar, Ghada, et al.
Pubblicazione: (2025)
di: Sokar, Ghada, et al.
Pubblicazione: (2025)
ComposeAnything: Composite Object Priors for Text-to-Image Generation
di: Khan, Zeeshan, et al.
Pubblicazione: (2025)
di: Khan, Zeeshan, et al.
Pubblicazione: (2025)
FOM-Nav: Frontier-Object Maps for Object Goal Navigation
di: Chabal, Thomas, et al.
Pubblicazione: (2025)
di: Chabal, Thomas, et al.
Pubblicazione: (2025)
Video ReCap: Recursive Captioning of Hour-Long Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
VQA Training Sets are Self-play Environments for Generating Few-shot Pools
di: Misiunas, Tautvydas, et al.
Pubblicazione: (2024)
di: Misiunas, Tautvydas, et al.
Pubblicazione: (2024)
IF-VidCap: Can Video Caption Models Follow Instructions?
di: Li, Shihao, et al.
Pubblicazione: (2025)
di: Li, Shihao, et al.
Pubblicazione: (2025)
AutoAD III: The Prequel -- Back to the Pixels
di: Han, Tengda, et al.
Pubblicazione: (2024)
di: Han, Tengda, et al.
Pubblicazione: (2024)
CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning
di: Sung, Junyoung, et al.
Pubblicazione: (2026)
di: Sung, Junyoung, et al.
Pubblicazione: (2026)
HAMMR: HierArchical MultiModal React agents for generic VQA
di: Castrejon, Lluis, et al.
Pubblicazione: (2024)
di: Castrejon, Lluis, et al.
Pubblicazione: (2024)
SnapCap: Efficient Snapshot Compressive Video Captioning
di: Sun, Jianqiao, et al.
Pubblicazione: (2024)
di: Sun, Jianqiao, et al.
Pubblicazione: (2024)
AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning
di: Ren, Yiming, et al.
Pubblicazione: (2025)
di: Ren, Yiming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024) -
Dense Video Object Captioning from Disjoint Supervision
di: Zhou, Xingyi, et al.
Pubblicazione: (2023) -
VicTR: Video-conditioned Text Representations for Activity Recognition
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2023) -
Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames
di: Arnab, Anurag, et al.
Pubblicazione: (2025) -
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
di: Min, Juhong, et al.
Pubblicazione: (2024)