Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Sharma, Shivam, Nagaonkar, Sankalp, Choithani, Ashish, Trivedi, Ashutosh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments
por: Nagaonkar, Sankalp, et al.
Publicado: (2025)
por: Nagaonkar, Sankalp, et al.
Publicado: (2025)
BadScan: An Architectural Backdoor Attack on Visual State Space Models
por: Deshmukh, Om Suhas, et al.
Publicado: (2024)
por: Deshmukh, Om Suhas, et al.
Publicado: (2024)
SceneGPT: A Language Model for 3D Scene Understanding
por: Chandhok, Shivam
Publicado: (2024)
por: Chandhok, Shivam
Publicado: (2024)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
por: Rajkhowa, Tonmoy, et al.
Publicado: (2024)
por: Rajkhowa, Tonmoy, et al.
Publicado: (2024)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
por: Zhang, Jialiang, et al.
Publicado: (2026)
por: Zhang, Jialiang, et al.
Publicado: (2026)
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
por: Kang, Hyolim, et al.
Publicado: (2025)
por: Kang, Hyolim, et al.
Publicado: (2025)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
por: Qi, Zhangyang, et al.
Publicado: (2025)
por: Qi, Zhangyang, et al.
Publicado: (2025)
Do Vision-Language Foundational models show Robust Visual Perception?
por: Chandhok, Shivam, et al.
Publicado: (2024)
por: Chandhok, Shivam, et al.
Publicado: (2024)
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
por: Chen, Seng Nam, et al.
Publicado: (2026)
por: Chen, Seng Nam, et al.
Publicado: (2026)
Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models
por: Lee, Jonathan, et al.
Publicado: (2025)
por: Lee, Jonathan, et al.
Publicado: (2025)
Streaming Long Video Understanding with Large Language Models
por: Qian, Rui, et al.
Publicado: (2024)
por: Qian, Rui, et al.
Publicado: (2024)
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
por: Hu, Yuhang, et al.
Publicado: (2025)
por: Hu, Yuhang, et al.
Publicado: (2025)
Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
por: Berman, Nimrod, et al.
Publicado: (2025)
por: Berman, Nimrod, et al.
Publicado: (2025)
Do Vision--Language Models Understand 3D Scenes or Just Catalogue Objects?
por: Maheshwari, Animesh, et al.
Publicado: (2026)
por: Maheshwari, Animesh, et al.
Publicado: (2026)
Vision-Language Models Do Not Understand Negation
por: Alhamoud, Kumail, et al.
Publicado: (2025)
por: Alhamoud, Kumail, et al.
Publicado: (2025)
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
por: Bharadwaj, Siddhant, et al.
Publicado: (2026)
por: Bharadwaj, Siddhant, et al.
Publicado: (2026)
IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering
por: Liu, Parker, et al.
Publicado: (2025)
por: Liu, Parker, et al.
Publicado: (2025)
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
por: Darabi, Nastaran, et al.
Publicado: (2026)
por: Darabi, Nastaran, et al.
Publicado: (2026)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
por: Pham, Tan-Hanh, et al.
Publicado: (2025)
por: Pham, Tan-Hanh, et al.
Publicado: (2025)
RLM: A Vision-Language Model Approach for Radar Scene Understanding
por: Mishra, Pushkal, et al.
Publicado: (2025)
por: Mishra, Pushkal, et al.
Publicado: (2025)
Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning
por: Liang, Dayong, et al.
Publicado: (2025)
por: Liang, Dayong, et al.
Publicado: (2025)
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models
por: Makarov, Vladislav, et al.
Publicado: (2026)
por: Makarov, Vladislav, et al.
Publicado: (2026)
Do Vision-Language Models Really Understand Visual Language?
por: Hou, Yifan, et al.
Publicado: (2024)
por: Hou, Yifan, et al.
Publicado: (2024)
Do Vision-Language Models Understand Compound Nouns?
por: Kumar, Sonal, et al.
Publicado: (2024)
por: Kumar, Sonal, et al.
Publicado: (2024)
Do Vision-Language Models Understand Visual Persuasiveness?
por: Park, Gyuwon
Publicado: (2025)
por: Park, Gyuwon
Publicado: (2025)
SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining
por: Li, Yue, et al.
Publicado: (2025)
por: Li, Yue, et al.
Publicado: (2025)
Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
por: Ma, Ke, et al.
Publicado: (2026)
por: Ma, Ke, et al.
Publicado: (2026)
Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification
por: Addepalli, Sravanti, et al.
Publicado: (2023)
por: Addepalli, Sravanti, et al.
Publicado: (2023)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
por: Gholami, Mohsen, et al.
Publicado: (2025)
por: Gholami, Mohsen, et al.
Publicado: (2025)
Embodied Scene Understanding for Vision Language Models via MetaVQA
por: Wang, Weizhen, et al.
Publicado: (2025)
por: Wang, Weizhen, et al.
Publicado: (2025)
VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding
por: Kim, Younggun, et al.
Publicado: (2025)
por: Kim, Younggun, et al.
Publicado: (2025)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
por: Kim, Geewook, et al.
Publicado: (2024)
por: Kim, Geewook, et al.
Publicado: (2024)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
por: Jeon, Yerim, et al.
Publicado: (2025)
por: Jeon, Yerim, et al.
Publicado: (2025)
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
por: Kim, Joowon, et al.
Publicado: (2026)
por: Kim, Joowon, et al.
Publicado: (2026)
The Limits of Learning from Pictures and Text: Vision-Language Models and Embodied Scene Understanding
por: Rosenberg, Gillian, et al.
Publicado: (2026)
por: Rosenberg, Gillian, et al.
Publicado: (2026)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
FineQuest: Adaptive Knowledge-Assisted Sports Video Understanding via Agent-of-Thoughts Reasoning
por: Chen, Haodong, et al.
Publicado: (2025)
por: Chen, Haodong, et al.
Publicado: (2025)
StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding
por: Tang, Guowei, et al.
Publicado: (2026)
por: Tang, Guowei, et al.
Publicado: (2026)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
por: Feng, Zhiyuan, et al.
Publicado: (2025)
por: Feng, Zhiyuan, et al.
Publicado: (2025)
Ejemplares similares
-
Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments
por: Nagaonkar, Sankalp, et al.
Publicado: (2025) -
BadScan: An Architectural Backdoor Attack on Visual State Space Models
por: Deshmukh, Om Suhas, et al.
Publicado: (2024) -
SceneGPT: A Language Model for 3D Scene Understanding
por: Chandhok, Shivam
Publicado: (2024) -
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
por: Rajkhowa, Tonmoy, et al.
Publicado: (2024) -
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
por: Zhang, Jialiang, et al.
Publicado: (2026)