Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Bin, Yang, Yiwei, Caspi, Anat, Howe, Bill |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reliable, Routable, and Reproducible: Collection of Pedestrian Pathways at Statewide Scale
par: Zhang, Yuxiang, et autres
Publié: (2024)
par: Zhang, Yuxiang, et autres
Publié: (2024)
PathwayBench: Assessing Routability of Pedestrian Pathway Networks Inferred from Multi-City Imagery
par: Zhang, Yuxiang, et autres
Publié: (2024)
par: Zhang, Yuxiang, et autres
Publié: (2024)
Few-Shot Adversarial Prompt Learning on Vision-Language Models
par: Zhou, Yiwei, et autres
Publié: (2024)
par: Zhou, Yiwei, et autres
Publié: (2024)
Can Large Language Models Integrate Spatial Data? Empirical Insights into Reasoning Strengths and Computational Weaknesses
par: Han, Bin, et autres
Publié: (2025)
par: Han, Bin, et autres
Publié: (2025)
Open-Source Image Editing Models Are Zero-Shot Vision Learners
par: Liu, Wei, et autres
Publié: (2026)
par: Liu, Wei, et autres
Publié: (2026)
Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification
par: Weng, Charles, et autres
Publié: (2026)
par: Weng, Charles, et autres
Publié: (2026)
Dataset Scale and Societal Consistency Mediate Facial Impression Bias in Vision-Language AI
par: Wolfe, Robert, et autres
Publié: (2024)
par: Wolfe, Robert, et autres
Publié: (2024)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
par: Zhang, Jianshu, et autres
Publié: (2026)
par: Zhang, Jianshu, et autres
Publié: (2026)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
par: Lu, Yujie, et autres
Publié: (2024)
par: Lu, Yujie, et autres
Publié: (2024)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
par: Li, Zhangpu, et autres
Publié: (2024)
par: Li, Zhangpu, et autres
Publié: (2024)
Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models
par: Wang, Dongdong, et autres
Publié: (2026)
par: Wang, Dongdong, et autres
Publié: (2026)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
par: Liang, Xiwen, et autres
Publié: (2023)
par: Liang, Xiwen, et autres
Publié: (2023)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
par: Cai, Hengxing, et autres
Publié: (2025)
par: Cai, Hengxing, et autres
Publié: (2025)
Texture or Semantics? Vision-Language Models Get Lost in Font Recognition
par: Li, Zhecheng, et autres
Publié: (2025)
par: Li, Zhecheng, et autres
Publié: (2025)
Exploring the Limits of Zero Shot Vision Language Models for Hate Meme Detection: The Vulnerabilities and their Interpretations
par: Rizwan, Naquee, et autres
Publié: (2024)
par: Rizwan, Naquee, et autres
Publié: (2024)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
par: Nagar, Aishik, et autres
Publié: (2024)
par: Nagar, Aishik, et autres
Publié: (2024)
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
par: Xu, Jiacong, et autres
Publié: (2025)
par: Xu, Jiacong, et autres
Publié: (2025)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
par: Kang, Jialiang, et autres
Publié: (2025)
par: Kang, Jialiang, et autres
Publié: (2025)
Enhancing Vision-Language Few-Shot Adaptation with Negative Learning
par: Zhang, Ce, et autres
Publié: (2024)
par: Zhang, Ce, et autres
Publié: (2024)
Benchmarking Deflection and Hallucination in Large Vision-Language Models
par: Moratelli, Nicholas, et autres
Publié: (2026)
par: Moratelli, Nicholas, et autres
Publié: (2026)
Toward Interactive Regional Understanding in Vision-Large Language Models
par: Lee, Jungbeom, et autres
Publié: (2024)
par: Lee, Jungbeom, et autres
Publié: (2024)
Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
par: Li, Sifan, et autres
Publié: (2025)
par: Li, Sifan, et autres
Publié: (2025)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
par: Liu, Zheng, et autres
Publié: (2024)
par: Liu, Zheng, et autres
Publié: (2024)
Intriguing Properties of Large Language and Vision Models
par: Lee, Young-Jun, et autres
Publié: (2024)
par: Lee, Young-Jun, et autres
Publié: (2024)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
par: Li, Bin, et autres
Publié: (2025)
par: Li, Bin, et autres
Publié: (2025)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
par: Mitra, Chancharik, et autres
Publié: (2025)
par: Mitra, Chancharik, et autres
Publié: (2025)
ERVQA: A Dataset to Benchmark the Readiness of Large Vision Language Models in Hospital Environments
par: Ray, Sourjyadip, et autres
Publié: (2024)
par: Ray, Sourjyadip, et autres
Publié: (2024)
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
par: Byun, Sanghyun, et autres
Publié: (2025)
par: Byun, Sanghyun, et autres
Publié: (2025)
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
par: Lee, Seongyun, et autres
Publié: (2024)
par: Lee, Seongyun, et autres
Publié: (2024)
DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images
par: Baral, Sami, et autres
Publié: (2025)
par: Baral, Sami, et autres
Publié: (2025)
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
par: Hu, Jinyi, et autres
Publié: (2023)
par: Hu, Jinyi, et autres
Publié: (2023)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
par: Zha, Yuheng, et autres
Publié: (2025)
par: Zha, Yuheng, et autres
Publié: (2025)
Vision-Language Integration for Zero-Shot Scene Understanding in Real-World Environments
par: Rajiv, Manjunath Prasad Holenarasipura, et autres
Publié: (2025)
par: Rajiv, Manjunath Prasad Holenarasipura, et autres
Publié: (2025)
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
par: Zhu, Yingjie, et autres
Publié: (2025)
par: Zhu, Yingjie, et autres
Publié: (2025)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
par: Agrawal, Aakriti, et autres
Publié: (2025)
par: Agrawal, Aakriti, et autres
Publié: (2025)
Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies
par: Pathak, Surendra, et autres
Publié: (2026)
par: Pathak, Surendra, et autres
Publié: (2026)
Natural Language Inference Improves Compositionality in Vision-Language Models
par: Cascante-Bonilla, Paola, et autres
Publié: (2024)
par: Cascante-Bonilla, Paola, et autres
Publié: (2024)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
par: Chen, Kehan, et autres
Publié: (2024)
par: Chen, Kehan, et autres
Publié: (2024)
Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models
par: Han, Chaolei, et autres
Publié: (2025)
par: Han, Chaolei, et autres
Publié: (2025)
Documents similaires
-
Reliable, Routable, and Reproducible: Collection of Pedestrian Pathways at Statewide Scale
par: Zhang, Yuxiang, et autres
Publié: (2024) -
PathwayBench: Assessing Routability of Pedestrian Pathway Networks Inferred from Multi-City Imagery
par: Zhang, Yuxiang, et autres
Publié: (2024) -
Few-Shot Adversarial Prompt Learning on Vision-Language Models
par: Zhou, Yiwei, et autres
Publié: (2024) -
Can Large Language Models Integrate Spatial Data? Empirical Insights into Reasoning Strengths and Computational Weaknesses
par: Han, Bin, et autres
Publié: (2025) -
Open-Source Image Editing Models Are Zero-Shot Vision Learners
par: Liu, Wei, et autres
Publié: (2026)