Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies
Fuente:
arXiv
Guardado en:
| Autores principales: | Sarkar, Ayushman, Idris, Mohd Yamani Idna, Yu, Zhenyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DeCorStory: Gram-Schmidt Prompt Embedding Decorrelation for Consistent Storytelling
por: Sarkar, Ayushman, et al.
Publicado: (2026)
por: Sarkar, Ayushman, et al.
Publicado: (2026)
SatelliteCalculator: A Multi-Task Vision Foundation Model for Quantitative Remote Sensing Inversion
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
StoryState: Agent-Based State Control for Consistent and Editable Storybooks
por: Sarkar, Ayushman, et al.
Publicado: (2026)
por: Sarkar, Ayushman, et al.
Publicado: (2026)
ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation
por: Sarkar, Ayushman, et al.
Publicado: (2026)
por: Sarkar, Ayushman, et al.
Publicado: (2026)
DC4CR: When Cloud Removal Meets Diffusion Control in Remote Sensing
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
Improved implicit diffusion model with knowledge distillation to estimate the spatial distribution density of carbon stock in remote sensing imagery
por: Yu, Zhenyu, et al.
Publicado: (2024)
por: Yu, Zhenyu, et al.
Publicado: (2024)
Rainy: Unlocking Satellite Calibration for Deep Learning in Precipitation
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
From Physics to Foundation Models: A Review of AI-Driven Quantitative Remote Sensing Inversion
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
SatelliteFormula: Multi-Modal Symbolic Regression from Remote Sensing Imagery for Physics Discovery
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
ForgetMe: Evaluating Selective Forgetting in Generative Models
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
A Diffusion-Based Framework for Terrain-Aware Remote Sensing Image Reconstruction
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
DanceText: A Training-Free Layered Framework for Controllable Multilingual Text Transformation in Images
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
A Layered Self-Supervised Knowledge Distillation Framework for Efficient Multimodal Learning on the Edge
por: Dahri, Tarique, et al.
Publicado: (2025)
por: Dahri, Tarique, et al.
Publicado: (2025)
Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models
por: Lee, Jonathan, et al.
Publicado: (2025)
por: Lee, Jonathan, et al.
Publicado: (2025)
Taxonomy-Aware Evaluation of Vision-Language Models
por: Snæbjarnarson, Vésteinn, et al.
Publicado: (2025)
por: Snæbjarnarson, Vésteinn, et al.
Publicado: (2025)
Road Rage Reasoning with Vision-language Models (VLMs): Task Definition and Evaluation Dataset
por: Weng, Yibing, et al.
Publicado: (2025)
por: Weng, Yibing, et al.
Publicado: (2025)
Characterizing Disparity Between Edge Models and High-Accuracy Base Models for Vision Tasks
por: Wang, Zhenyu, et al.
Publicado: (2024)
por: Wang, Zhenyu, et al.
Publicado: (2024)
Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning
por: Li, Rongjie, et al.
Publicado: (2024)
por: Li, Rongjie, et al.
Publicado: (2024)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
por: Diao, Muxi, et al.
Publicado: (2025)
por: Diao, Muxi, et al.
Publicado: (2025)
Text-to-Image Representativity Fairness Evaluation Framework
por: Yamani, Asma, et al.
Publicado: (2024)
por: Yamani, Asma, et al.
Publicado: (2024)
MicarVLMoE: A Modern Gated Cross-Aligned Vision-Language Mixture of Experts Model for Medical Image Captioning and Report Generation
por: Izhar, Amaan, et al.
Publicado: (2025)
por: Izhar, Amaan, et al.
Publicado: (2025)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
por: Liu, Jiaming, et al.
Publicado: (2024)
por: Liu, Jiaming, et al.
Publicado: (2024)
A Weighted Vision Transformer-Based Multi-Task Learning Framework for Predicting ADAS-Cog Scores
por: Hamid, Nur Amirah Abd, et al.
Publicado: (2025)
por: Hamid, Nur Amirah Abd, et al.
Publicado: (2025)
MVT: Mask-Grounded Vision-Language Models for Taxonomy-Aligned Land-Cover Tagging
por: Chen, Siyi, et al.
Publicado: (2025)
por: Chen, Siyi, et al.
Publicado: (2025)
CapsuleNet: A Deep Learning Model To Classify GI Diseases Using EfficientNet-b7
por: Das, Aniket, et al.
Publicado: (2024)
por: Das, Aniket, et al.
Publicado: (2024)
Vision-Language Models for Vision Tasks: A Survey
por: Zhang, Jingyi, et al.
Publicado: (2023)
por: Zhang, Jingyi, et al.
Publicado: (2023)
VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models
por: Sarkar, Pritam, et al.
Publicado: (2025)
por: Sarkar, Pritam, et al.
Publicado: (2025)
DISK: Dynamic Inference SKipping for World Models
por: Naman, Anugunj, et al.
Publicado: (2026)
por: Naman, Anugunj, et al.
Publicado: (2026)
Self-Rewarding Vision-Language Model via Reasoning Decomposition
por: Li, Zongxia, et al.
Publicado: (2025)
por: Li, Zongxia, et al.
Publicado: (2025)
Synthetic Designed Experiments for Diagnosing Vision Model Failure
por: Sarkar, Krisanu
Publicado: (2026)
por: Sarkar, Krisanu
Publicado: (2026)
A Review of Transformer-Based Models for Computer Vision Tasks: Capturing Global Context and Spatial Relationships
por: Pereira, Gracile Astlin, et al.
Publicado: (2024)
por: Pereira, Gracile Astlin, et al.
Publicado: (2024)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
por: Yan, Ziang, et al.
Publicado: (2024)
por: Yan, Ziang, et al.
Publicado: (2024)
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
por: Yu, Haiyang, et al.
Publicado: (2025)
por: Yu, Haiyang, et al.
Publicado: (2025)
Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model
por: Wang, Chenfeng, et al.
Publicado: (2026)
por: Wang, Chenfeng, et al.
Publicado: (2026)
Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and Opportunities
por: Yan, Xu, et al.
Publicado: (2024)
por: Yan, Xu, et al.
Publicado: (2024)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
por: Yu, Youngjoon, et al.
Publicado: (2024)
por: Yu, Youngjoon, et al.
Publicado: (2024)
Leveraging Vision Language Models for Specialized Agricultural Tasks
por: Arshad, Muhammad Arbab, et al.
Publicado: (2024)
por: Arshad, Muhammad Arbab, et al.
Publicado: (2024)
TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life
por: Khurana, Mridul, et al.
Publicado: (2026)
por: Khurana, Mridul, et al.
Publicado: (2026)
Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos
por: Yokoi, Shingo, et al.
Publicado: (2025)
por: Yokoi, Shingo, et al.
Publicado: (2025)
Bridging the Dimensionality Gap: A Taxonomy and Survey of 2D Vision Model Adaptation for 3D Analysis
por: Pandya, Akshat, et al.
Publicado: (2026)
por: Pandya, Akshat, et al.
Publicado: (2026)
Ejemplares similares
-
DeCorStory: Gram-Schmidt Prompt Embedding Decorrelation for Consistent Storytelling
por: Sarkar, Ayushman, et al.
Publicado: (2026) -
SatelliteCalculator: A Multi-Task Vision Foundation Model for Quantitative Remote Sensing Inversion
por: Yu, Zhenyu, et al.
Publicado: (2025) -
StoryState: Agent-Based State Control for Consistent and Editable Storybooks
por: Sarkar, Ayushman, et al.
Publicado: (2026) -
ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation
por: Sarkar, Ayushman, et al.
Publicado: (2026) -
DC4CR: When Cloud Removal Meets Diffusion Control in Remote Sensing
por: Yu, Zhenyu, et al.
Publicado: (2025)