Understanding Depth and Height Perception in Large Visual-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Azad, Shehreen, Jain, Yash, Garg, Rishit, Rawat, Yogesh S, Vineet, Vibhav |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding
di: Azad, Shehreen, et al.
Pubblicazione: (2025)
di: Azad, Shehreen, et al.
Pubblicazione: (2025)
StreamReady: Learning What to Answer and When in Long Streaming Videos
di: Azad, Shehreen, et al.
Pubblicazione: (2026)
di: Azad, Shehreen, et al.
Pubblicazione: (2026)
DisenQ: Disentangling Q-Former for Activity-Biometrics
di: Azad, Shehreen, et al.
Pubblicazione: (2025)
di: Azad, Shehreen, et al.
Pubblicazione: (2025)
Activity-Biometrics: Person Identification from Daily Activities
di: Azad, Shehreen, et al.
Pubblicazione: (2024)
di: Azad, Shehreen, et al.
Pubblicazione: (2024)
Probing Conceptual Understanding of Large Visual-Language Models
di: Schiappa, Madeline, et al.
Pubblicazione: (2023)
di: Schiappa, Madeline, et al.
Pubblicazione: (2023)
Robustness Analysis on Foundational Segmentation Models
di: Schiappa, Madeline Chantry, et al.
Pubblicazione: (2023)
di: Schiappa, Madeline Chantry, et al.
Pubblicazione: (2023)
Navigating Hallucinations for Reasoning of Unintentional Activities
di: Grover, Shresth, et al.
Pubblicazione: (2024)
di: Grover, Shresth, et al.
Pubblicazione: (2024)
A Large-Scale Analysis on Contextual Self-Supervised Video Representation Learning
di: Kumar, Akash, et al.
Pubblicazione: (2025)
di: Kumar, Akash, et al.
Pubblicazione: (2025)
OmViD: Omni-supervised active learning for video action detection
di: Rana, Aayush, et al.
Pubblicazione: (2025)
di: Rana, Aayush, et al.
Pubblicazione: (2025)
On Occlusions in Video Action Detection: Benchmark Datasets And Training Recipes
di: Modi, Rajat, et al.
Pubblicazione: (2024)
di: Modi, Rajat, et al.
Pubblicazione: (2024)
CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates
di: Grover, Shresth, et al.
Pubblicazione: (2025)
di: Grover, Shresth, et al.
Pubblicazione: (2025)
PEEKABOO: Interactive Video Generation via Masked-Diffusion
di: Jain, Yash, et al.
Pubblicazione: (2023)
di: Jain, Yash, et al.
Pubblicazione: (2023)
Physics Knowledge in Frontier Models: A Diagnostic Study of Failure Modes
di: Bagdonaviciute, Ieva, et al.
Pubblicazione: (2025)
di: Bagdonaviciute, Ieva, et al.
Pubblicazione: (2025)
STPro: Spatial and Temporal Progressive Learning for Weakly Supervised Spatio-Temporal Grounding
di: Garg, Aaryan, et al.
Pubblicazione: (2025)
di: Garg, Aaryan, et al.
Pubblicazione: (2025)
Asynchronous Perception Machine For Efficient Test-Time-Training
di: Modi, Rajat, et al.
Pubblicazione: (2024)
di: Modi, Rajat, et al.
Pubblicazione: (2024)
MolVision: Molecular Property Prediction with Vision Language Models
di: Adak, Deepan, et al.
Pubblicazione: (2025)
di: Adak, Deepan, et al.
Pubblicazione: (2025)
Foundation Models for Video Understanding: A Survey
di: Madan, Neelu, et al.
Pubblicazione: (2024)
di: Madan, Neelu, et al.
Pubblicazione: (2024)
ProDiG: Progressive Diffusion-Guided Gaussian Splatting for Aerial to Ground Reconstruction
di: Mitra, Sirshapan, et al.
Pubblicazione: (2026)
di: Mitra, Sirshapan, et al.
Pubblicazione: (2026)
Colors See Colors Ignore: Clothes Changing ReID with Color Disentanglement
di: Pathak, Priyank, et al.
Pubblicazione: (2025)
di: Pathak, Priyank, et al.
Pubblicazione: (2025)
DIFFER: Disentangling Identity Features via Semantic Cues for Clothes-Changing Person Re-ID
di: Liang, Xin, et al.
Pubblicazione: (2025)
di: Liang, Xin, et al.
Pubblicazione: (2025)
Coarse Attribute Prediction with Task Agnostic Distillation for Real World Clothes Changing ReID
di: Pathak, Priyank, et al.
Pubblicazione: (2025)
di: Pathak, Priyank, et al.
Pubblicazione: (2025)
GaitCrafter: Diffusion Model for Biometric Preserving Gait Synthesis
di: Mitra, Sirshapan, et al.
Pubblicazione: (2025)
di: Mitra, Sirshapan, et al.
Pubblicazione: (2025)
Maximally Useful and Minimally Redundant: The Key to Self Supervised Learning for Imbalanced Data
di: Sharma, Yash Kumar, et al.
Pubblicazione: (2025)
di: Sharma, Yash Kumar, et al.
Pubblicazione: (2025)
Visual Perception by Large Language Model's Weights
di: Ma, Feipeng, et al.
Pubblicazione: (2024)
di: Ma, Feipeng, et al.
Pubblicazione: (2024)
Depth Any Canopy: Leveraging Depth Foundation Models for Canopy Height Estimation
di: Cambrin, Daniele Rege, et al.
Pubblicazione: (2024)
di: Cambrin, Daniele Rege, et al.
Pubblicazione: (2024)
Scaling Open-Vocabulary Action Detection
di: Sia, Zhen Hao, et al.
Pubblicazione: (2025)
di: Sia, Zhen Hao, et al.
Pubblicazione: (2025)
DENSER: Depth-Guided Ensemble with Staged EFA-GS Reconstruction for Soccer Novel View Synthesis
di: Rawat, Parthsarthi
Pubblicazione: (2026)
di: Rawat, Parthsarthi
Pubblicazione: (2026)
DepthCues: Evaluating Monocular Depth Perception in Large Vision Models
di: Danier, Duolikun, et al.
Pubblicazione: (2024)
di: Danier, Duolikun, et al.
Pubblicazione: (2024)
LR0.FM: Low-Res Benchmark and Improving Robustness for Zero-Shot Classification in Foundation Models
di: Pathak, Priyank, et al.
Pubblicazione: (2025)
di: Pathak, Priyank, et al.
Pubblicazione: (2025)
Stable Mean Teacher for Semi-supervised Video Action Detection
di: Kumar, Akash, et al.
Pubblicazione: (2024)
di: Kumar, Akash, et al.
Pubblicazione: (2024)
iSafetyBench: A video-language benchmark for safety in industrial environment
di: Abdullah, Raiyaan, et al.
Pubblicazione: (2025)
di: Abdullah, Raiyaan, et al.
Pubblicazione: (2025)
Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding
di: Kumar, Akash, et al.
Pubblicazione: (2025)
di: Kumar, Akash, et al.
Pubblicazione: (2025)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
di: Wang, Jiayu, et al.
Pubblicazione: (2024)
di: Wang, Jiayu, et al.
Pubblicazione: (2024)
Eureka: Evaluating and Understanding Large Foundation Models
di: Balachandran, Vidhisha, et al.
Pubblicazione: (2024)
di: Balachandran, Vidhisha, et al.
Pubblicazione: (2024)
Grounding Task Assistance with Multimodal Cues from a Single Demonstration
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Frames
di: Ravi, Sahithya, et al.
Pubblicazione: (2025)
di: Ravi, Sahithya, et al.
Pubblicazione: (2025)
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
di: Li, Xin, et al.
Pubblicazione: (2024)
di: Li, Xin, et al.
Pubblicazione: (2024)
Sky2Ground: A Benchmark for Site Modeling under Varying Altitude
di: Wang, Zengyan, et al.
Pubblicazione: (2026)
di: Wang, Zengyan, et al.
Pubblicazione: (2026)
Do Large Language Models Understand Data Visualization Rules?
di: Sinnona, Martin, et al.
Pubblicazione: (2026)
di: Sinnona, Martin, et al.
Pubblicazione: (2026)
Do Large Language Models Understand Data Visualization Principles?
di: Sinnona, Martin, et al.
Pubblicazione: (2026)
di: Sinnona, Martin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding
di: Azad, Shehreen, et al.
Pubblicazione: (2025) -
StreamReady: Learning What to Answer and When in Long Streaming Videos
di: Azad, Shehreen, et al.
Pubblicazione: (2026) -
DisenQ: Disentangling Q-Former for Activity-Biometrics
di: Azad, Shehreen, et al.
Pubblicazione: (2025) -
Activity-Biometrics: Person Identification from Daily Activities
di: Azad, Shehreen, et al.
Pubblicazione: (2024) -
Probing Conceptual Understanding of Large Visual-Language Models
di: Schiappa, Madeline, et al.
Pubblicazione: (2023)