Object-centric Video Question Answering with Visual Grounding and Referring
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Haochen, Chen, Qirui, Yan, Cilin, Cai, Jiayin, Jiang, Xiaolong, Hu, Yao, Xie, Weidi, Gavves, Stratis |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VISA: Reasoning Video Object Segmentation via Large Language Models
par: Yan, Cilin, et autres
Publié: (2024)
par: Yan, Cilin, et autres
Publié: (2024)
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023)
par: Di, Shangzhe, et autres
Publié: (2023)
Mining Open Semantics from CLIP: A Relation Transition Perspective for Few-Shot Learning
par: Yan, Cilin, et autres
Publié: (2024)
par: Yan, Cilin, et autres
Publié: (2024)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
par: Shi, Yudi, et autres
Publié: (2026)
par: Shi, Yudi, et autres
Publié: (2026)
PiClick: Picking the desired mask from multiple candidates in click-based interactive segmentation
par: Yan, Cilin, et autres
Publié: (2023)
par: Yan, Cilin, et autres
Publié: (2023)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
par: Chen, Qirui, et autres
Publié: (2024)
par: Chen, Qirui, et autres
Publié: (2024)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
par: Li, Jingyao, et autres
Publié: (2025)
par: Li, Jingyao, et autres
Publié: (2025)
AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning
par: Qiu, Yilun, et autres
Publié: (2026)
par: Qiu, Yilun, et autres
Publié: (2026)
LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation
par: Yan, Cilin, et autres
Publié: (2025)
par: Yan, Cilin, et autres
Publié: (2025)
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
par: Hong, Jack, et autres
Publié: (2025)
par: Hong, Jack, et autres
Publié: (2025)
Progressive Scaling Visual Object Tracking
par: Hong, Jack, et autres
Publié: (2025)
par: Hong, Jack, et autres
Publié: (2025)
A Sanity Check for AI-generated Image Detection
par: Yan, Shilin, et autres
Publié: (2024)
par: Yan, Shilin, et autres
Publié: (2024)
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
par: Liu, Yikun, et autres
Publié: (2024)
par: Liu, Yikun, et autres
Publié: (2024)
Multi-Sentence Grounding for Long-term Instructional Video
par: Li, Zeqian, et autres
Publié: (2023)
par: Li, Zeqian, et autres
Publié: (2023)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
par: Zhang, Xiaoman, et autres
Publié: (2023)
par: Zhang, Xiaoman, et autres
Publié: (2023)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
par: Liang, Tianming, et autres
Publié: (2025)
par: Liang, Tianming, et autres
Publié: (2025)
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
par: Shi, Yudi, et autres
Publié: (2024)
par: Shi, Yudi, et autres
Publié: (2024)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
par: Zhang, Bob, et autres
Publié: (2025)
par: Zhang, Bob, et autres
Publié: (2025)
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
par: Ge, Mingji, et autres
Publié: (2026)
par: Ge, Mingji, et autres
Publié: (2026)
EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
par: Xu, Jilan, et autres
Publié: (2025)
par: Xu, Jilan, et autres
Publié: (2025)
Can I Trust Your Answer? Visually Grounded Video Question Answering
par: Xiao, Junbin, et autres
Publié: (2023)
par: Xiao, Junbin, et autres
Publié: (2023)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
par: Xie, Junyu, et autres
Publié: (2026)
par: Xie, Junyu, et autres
Publié: (2026)
EchoSight: Advancing Visual-Language Models with Wiki Knowledge
par: Yan, Yibin, et autres
Publié: (2024)
par: Yan, Yibin, et autres
Publié: (2024)
Object Attribute Matters in Visual Question Answering
par: Li, Peize, et autres
Publié: (2023)
par: Li, Peize, et autres
Publié: (2023)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
par: Xiao, Junbin, et autres
Publié: (2026)
par: Xiao, Junbin, et autres
Publié: (2026)
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024)
par: Zhou, Sheng, et autres
Publié: (2024)
Object Retrieval for Visual Question Answering with Outside Knowledge
par: Kan, Shichao, et autres
Publié: (2024)
par: Kan, Shichao, et autres
Publié: (2024)
KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering
par: Li, Zhiyang, et autres
Publié: (2026)
par: Li, Zhiyang, et autres
Publié: (2026)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
Improving Synthetic Image Detection Towards Generalization: An Image Transformation Perspective
par: Li, Ouxiang, et autres
Publié: (2024)
par: Li, Ouxiang, et autres
Publié: (2024)
Appearance-Based Refinement for Object-Centric Motion Segmentation
par: Xie, Junyu, et autres
Publié: (2023)
par: Xie, Junyu, et autres
Publié: (2023)
AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
par: Hu, Rongsheng, et autres
Publié: (2026)
par: Hu, Rongsheng, et autres
Publié: (2026)
Learning Streaming Video Representation via Multitask Training
par: Yan, Yibin, et autres
Publié: (2025)
par: Yan, Yibin, et autres
Publié: (2025)
ConFoThinking: Consolidated Focused Attention Driven Thinking for Visual Question Answering
par: Wu, Zhaodong, et autres
Publié: (2026)
par: Wu, Zhaodong, et autres
Publié: (2026)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
par: Liu, Huabin, et autres
Publié: (2025)
par: Liu, Huabin, et autres
Publié: (2025)
VQ-VA World: Towards High-Quality Visual Question-Visual Answering
par: Gou, Chenhui, et autres
Publié: (2025)
par: Gou, Chenhui, et autres
Publié: (2025)
Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering
par: Chen, Yixiong, et autres
Publié: (2025)
par: Chen, Yixiong, et autres
Publié: (2025)
RSBuilding: Towards General Remote Sensing Image Building Extraction and Change Detection with Foundation Model
par: Wang, Mingze, et autres
Publié: (2024)
par: Wang, Mingze, et autres
Publié: (2024)
Question-Answering Dense Video Events
par: Qin, Hangyu, et autres
Publié: (2024)
par: Qin, Hangyu, et autres
Publié: (2024)
Documents similaires
-
VISA: Reasoning Video Object Segmentation via Large Language Models
par: Yan, Cilin, et autres
Publié: (2024) -
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023) -
Mining Open Semantics from CLIP: A Relation Transition Perspective for Few-Shot Learning
par: Yan, Cilin, et autres
Publié: (2024) -
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
par: Shi, Yudi, et autres
Publié: (2026) -
PiClick: Picking the desired mask from multiple candidates in click-based interactive segmentation
par: Yan, Cilin, et autres
Publié: (2023)