Dynamic Context-Aware Scene Reasoning Using Vision-Language Alignment in Zero-Shot Real-World Scenarios
Fuente:
arXiv
Guardado en:
| Autores principales: | Rajiv, Manjunath Prasad Holenarasipura, Vidyavathi, B. M. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Vision-Language Integration for Zero-Shot Scene Understanding in Real-World Environments
por: Rajiv, Manjunath Prasad Holenarasipura, et al.
Publicado: (2025)
por: Rajiv, Manjunath Prasad Holenarasipura, et al.
Publicado: (2025)
Zero-Shot Head Swapping in Real-World Scenarios
por: Kang, Taewoong, et al.
Publicado: (2025)
por: Kang, Taewoong, et al.
Publicado: (2025)
Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models
por: Ranasinghe, Yasiru, et al.
Publicado: (2025)
por: Ranasinghe, Yasiru, et al.
Publicado: (2025)
MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning
por: Liu, Chenghao, et al.
Publicado: (2025)
por: Liu, Chenghao, et al.
Publicado: (2025)
Enhancing Remote Sensing Vision-Language Models for Zero-Shot Scene Classification
por: Khoury, Karim El, et al.
Publicado: (2024)
por: Khoury, Karim El, et al.
Publicado: (2024)
ContextVLM: Zero-Shot and Few-Shot Context Understanding for Autonomous Driving using Vision Language Models
por: Sural, Shounak, et al.
Publicado: (2024)
por: Sural, Shounak, et al.
Publicado: (2024)
Efficient and Context-Aware Label Propagation for Zero-/Few-Shot Training-Free Adaptation of Vision-Language Model
por: Li, Yushu, et al.
Publicado: (2024)
por: Li, Yushu, et al.
Publicado: (2024)
PVLM: Parsing-Aware Vision Language Model with Dynamic Contrastive Learning for Zero-Shot Deepfake Attribution
por: Zhang, Yaning, et al.
Publicado: (2025)
por: Zhang, Yaning, et al.
Publicado: (2025)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
por: Li, Yunheng, et al.
Publicado: (2024)
por: Li, Yunheng, et al.
Publicado: (2024)
Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly Localization
por: Deng, Hanqiu, et al.
Publicado: (2023)
por: Deng, Hanqiu, et al.
Publicado: (2023)
Zero-Shot Robustness of Vision Language Models Via Confidence-Aware Weighting
por: Naghavian, Nikoo, et al.
Publicado: (2025)
por: Naghavian, Nikoo, et al.
Publicado: (2025)
VIZOR: Viewpoint-Invariant Zero-Shot Scene Graph Generation for 3D Scene Reasoning
por: Madhavaram, Vivek, et al.
Publicado: (2026)
por: Madhavaram, Vivek, et al.
Publicado: (2026)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
por: Li, Zhangpu, et al.
Publicado: (2024)
por: Li, Zhangpu, et al.
Publicado: (2024)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
por: Chen, Kehan, et al.
Publicado: (2024)
por: Chen, Kehan, et al.
Publicado: (2024)
DDS: Decoupled Dynamic Scene-Graph Generation Network
por: Iftekhar, A S M, et al.
Publicado: (2023)
por: Iftekhar, A S M, et al.
Publicado: (2023)
Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning
por: Li, Rongjie, et al.
Publicado: (2024)
por: Li, Rongjie, et al.
Publicado: (2024)
Zero-Shot Scene Change Detection
por: Cho, Kyusik, et al.
Publicado: (2024)
por: Cho, Kyusik, et al.
Publicado: (2024)
From the Laboratory to Real-World Application: Evaluating Zero-Shot Scene Interpretation on Edge Devices for Mobile Robotics
por: Schuler, Nicolas, et al.
Publicado: (2025)
por: Schuler, Nicolas, et al.
Publicado: (2025)
TSegAgent: Zero-Shot Tooth Segmentation via Geometry-Aware Vision-Language Agents
por: Zhuang, Shaojie, et al.
Publicado: (2026)
por: Zhuang, Shaojie, et al.
Publicado: (2026)
BADAS: Context Aware Collision Prediction Using Real-World Dashcam Data
por: Goldshmidt, Roni, et al.
Publicado: (2025)
por: Goldshmidt, Roni, et al.
Publicado: (2025)
Subject-Aware Multi-Granularity Alignment for Zero-Shot EEG-to-Image Retrieval
por: Jiang, Lin, et al.
Publicado: (2026)
por: Jiang, Lin, et al.
Publicado: (2026)
Zero-Shot Fine-Grained Image Classification Using Large Vision-Language Models
por: Atabuzzaman, Md., et al.
Publicado: (2025)
por: Atabuzzaman, Md., et al.
Publicado: (2025)
ZDySS -- Zero-Shot Dynamic Scene Stylization using Gaussian Splatting
por: Saroha, Abhishek, et al.
Publicado: (2025)
por: Saroha, Abhishek, et al.
Publicado: (2025)
CPAM: Context-Preserving Adaptive Manipulation for Zero-Shot Real Image Editing
por: Vo, Dinh-Khoi, et al.
Publicado: (2025)
por: Vo, Dinh-Khoi, et al.
Publicado: (2025)
Zero-Shot Multi-Object Scene Completion
por: Iwase, Shun, et al.
Publicado: (2024)
por: Iwase, Shun, et al.
Publicado: (2024)
SAW-Bench: Learning Situated Awareness in the Real World
por: Li, Chuhan, et al.
Publicado: (2026)
por: Li, Chuhan, et al.
Publicado: (2026)
PACA: Perspective-Aware Cross-Attention Representation for Zero-Shot Scene Rearrangement
por: Jin, Shutong, et al.
Publicado: (2024)
por: Jin, Shutong, et al.
Publicado: (2024)
GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval
por: Jeon, Mingyu, et al.
Publicado: (2026)
por: Jeon, Mingyu, et al.
Publicado: (2026)
ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
por: Zhang, Pu, et al.
Publicado: (2025)
por: Zhang, Pu, et al.
Publicado: (2025)
Copy-Trasform-Paste: Zero-Shot Object-Object Alignment Guided by Vision-Language and Geometric Constraints
por: Gatenyo, Rotem, et al.
Publicado: (2026)
por: Gatenyo, Rotem, et al.
Publicado: (2026)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
por: Zhang, Jiwen, et al.
Publicado: (2026)
por: Zhang, Jiwen, et al.
Publicado: (2026)
Noise is an Efficient Learner for Zero-Shot Vision-Language Models
por: Imam, Raza, et al.
Publicado: (2025)
por: Imam, Raza, et al.
Publicado: (2025)
View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs
por: Liu, Yuanyuan, et al.
Publicado: (2025)
por: Liu, Yuanyuan, et al.
Publicado: (2025)
ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment
por: Dong, Mingyu, et al.
Publicado: (2026)
por: Dong, Mingyu, et al.
Publicado: (2026)
Neuron: Learning Context-Aware Evolving Representations for Zero-Shot Skeleton Action Recognition
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
Zero-Shot Monocular Scene Flow Estimation in the Wild
por: Liang, Yiqing, et al.
Publicado: (2025)
por: Liang, Yiqing, et al.
Publicado: (2025)
Deep Semantic-Visual Alignment for Zero-Shot Remote Sensing Image Scene Classification
por: Xu, Wenjia, et al.
Publicado: (2024)
por: Xu, Wenjia, et al.
Publicado: (2024)
ZeroSCD: Zero-Shot Street Scene Change Detection
por: Kannan, Shyam Sundar, et al.
Publicado: (2024)
por: Kannan, Shyam Sundar, et al.
Publicado: (2024)
Context-Aware Zero-Shot Anomaly Detection in Surveillance Using Contrastive and Predictive Spatiotemporal Modeling
por: Khan, Md. Rashid Shahriar, et al.
Publicado: (2025)
por: Khan, Md. Rashid Shahriar, et al.
Publicado: (2025)
Leveraging Vision-Language Embeddings for Zero-Shot Learning in Histopathology Images
por: Rahaman, Md Mamunur, et al.
Publicado: (2025)
por: Rahaman, Md Mamunur, et al.
Publicado: (2025)
Ejemplares similares
-
Vision-Language Integration for Zero-Shot Scene Understanding in Real-World Environments
por: Rajiv, Manjunath Prasad Holenarasipura, et al.
Publicado: (2025) -
Zero-Shot Head Swapping in Real-World Scenarios
por: Kang, Taewoong, et al.
Publicado: (2025) -
Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models
por: Ranasinghe, Yasiru, et al.
Publicado: (2025) -
MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning
por: Liu, Chenghao, et al.
Publicado: (2025) -
Enhancing Remote Sensing Vision-Language Models for Zero-Shot Scene Classification
por: Khoury, Karim El, et al.
Publicado: (2024)