Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Yue, Feng, Litong, Lan, Mengcheng, Yang, Xue, Li, Qingyun, Ke, Yiping, Jiang, Xue, Zhang, Wayne |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
by: Zhou, Yue, et al.
Published: (2024)
by: Zhou, Yue, et al.
Published: (2024)
ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation
by: Lan, Mengcheng, et al.
Published: (2024)
by: Lan, Mengcheng, et al.
Published: (2024)
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
by: Lan, Mengcheng, et al.
Published: (2024)
by: Lan, Mengcheng, et al.
Published: (2024)
Text4Seg: Reimagining Image Segmentation as Text Generation
by: Lan, Mengcheng, et al.
Published: (2024)
by: Lan, Mengcheng, et al.
Published: (2024)
AirSpatialBot: A Spatially-Aware Aerial Agent for Fine-Grained Vehicle Attribute Recognization and Retrieval
by: Zhou, Yue, et al.
Published: (2026)
by: Zhou, Yue, et al.
Published: (2026)
A Simple Aerial Detection Baseline of Multimodal Language Models
by: Li, Qingyun, et al.
Published: (2025)
by: Li, Qingyun, et al.
Published: (2025)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
by: Zhou, Yue, et al.
Published: (2026)
by: Zhou, Yue, et al.
Published: (2026)
BrainPrompt: Multi-Level Brain Prompt Enhancement for Neurological Condition Identification
by: Xu, Jiaxing, et al.
Published: (2025)
by: Xu, Jiaxing, et al.
Published: (2025)
ARS-DETR: Aspect Ratio-Sensitive Detection Transformer for Aerial Oriented Object Detection
by: Zeng, Ying, et al.
Published: (2023)
by: Zeng, Ying, et al.
Published: (2023)
Adapting Vehicle Detectors for Aerial Imagery to Unseen Domains with Weak Supervision
by: Fang, Xiao, et al.
Published: (2025)
by: Fang, Xiao, et al.
Published: (2025)
BirdNeRF: Fast Neural Reconstruction of Large-Scale Scenes From Aerial Imagery
by: Zhang, Huiqing, et al.
Published: (2024)
by: Zhang, Huiqing, et al.
Published: (2024)
An Efficient Additive Kolmogorov-Arnold Transformer for Point-Level Maize Localization in Unmanned Aerial Vehicle Imagery
by: Li, Fei, et al.
Published: (2026)
by: Li, Fei, et al.
Published: (2026)
Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
by: Lan, Mengcheng, et al.
Published: (2025)
by: Lan, Mengcheng, et al.
Published: (2025)
Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
by: Wang, Zhikai, et al.
Published: (2025)
by: Wang, Zhikai, et al.
Published: (2025)
UAV-DETR: Efficient End-to-End Object Detection for Unmanned Aerial Vehicle Imagery
by: Zhang, Huaxiang, et al.
Published: (2025)
by: Zhang, Huaxiang, et al.
Published: (2025)
UAVLight: A Benchmark for Illumination-Robust 3D Reconstruction in Unmanned Aerial Vehicle (UAV) Scenes
by: Du, Kang, et al.
Published: (2025)
by: Du, Kang, et al.
Published: (2025)
AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning
by: Xue, Junxiao, et al.
Published: (2026)
by: Xue, Junxiao, et al.
Published: (2026)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
by: Xu, Zelin, et al.
Published: (2026)
by: Xu, Zelin, et al.
Published: (2026)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
by: Rasheed, Hanoona, et al.
Published: (2025)
by: Rasheed, Hanoona, et al.
Published: (2025)
Multi-Atlas Brain Network Classification through Consistency Distillation and Complementary Information Fusion
by: Xu, Jiaxing, et al.
Published: (2024)
by: Xu, Jiaxing, et al.
Published: (2024)
SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
by: Cao, Meng, et al.
Published: (2025)
by: Cao, Meng, et al.
Published: (2025)
From UAV Imagery to Agronomic Reasoning: A Multimodal LLM Benchmark for Plant Phenotyping
by: Wu, Yu, et al.
Published: (2026)
by: Wu, Yu, et al.
Published: (2026)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
by: Liu, Chunxu, et al.
Published: (2025)
by: Liu, Chunxu, et al.
Published: (2025)
UAV-Rain1k: A Benchmark for Raindrop Removal from UAV Aerial Imagery
by: Chang, Wenhui, et al.
Published: (2024)
by: Chang, Wenhui, et al.
Published: (2024)
Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
by: Jiang, Haonan, et al.
Published: (2026)
by: Jiang, Haonan, et al.
Published: (2026)
RareSpot+: A Benchmark, Model, and Active Learning Framework for Small and Rare Wildlife in Aerial Imagery
by: Zhang, Bowen, et al.
Published: (2026)
by: Zhang, Bowen, et al.
Published: (2026)
Aerial Lifting: Neural Urban Semantic and Building Instance Lifting from Aerial Imagery
by: Zhang, Yuqi, et al.
Published: (2024)
by: Zhang, Yuqi, et al.
Published: (2024)
VME: A Satellite Imagery Dataset and Benchmark for Detecting Vehicles in the Middle East and Beyond
by: Al-Emadi, Noora, et al.
Published: (2025)
by: Al-Emadi, Noora, et al.
Published: (2025)
Open-Vocabulary Object Detection in UAV Imagery: A Review and Future Perspectives
by: Zhou, Yang, et al.
Published: (2025)
by: Zhou, Yang, et al.
Published: (2025)
MuSc-V2: Zero-Shot Multimodal Industrial Anomaly Classification and Segmentation with Mutual Scoring of Unlabeled Samples
by: Li, Xurui, et al.
Published: (2025)
by: Li, Xurui, et al.
Published: (2025)
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
by: Yang, Zeyuan, et al.
Published: (2025)
by: Yang, Zeyuan, et al.
Published: (2025)
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
by: Tsujimoto, Mai, et al.
Published: (2025)
by: Tsujimoto, Mai, et al.
Published: (2025)
SCAR: Satellite Imagery-Based Calibration for Aerial Recordings
by: Hölzemann, Henry, et al.
Published: (2026)
by: Hölzemann, Henry, et al.
Published: (2026)
MVLLaVA: An Intelligent Agent for Unified and Flexible Novel View Synthesis
by: Jiang, Hanyu, et al.
Published: (2024)
by: Jiang, Hanyu, et al.
Published: (2024)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
by: Xue, Kaiwen, et al.
Published: (2026)
by: Xue, Kaiwen, et al.
Published: (2026)
Cross-View Open-Vocabulary Object Detection in Aerial Imagery
by: Kini, Jyoti, et al.
Published: (2025)
by: Kini, Jyoti, et al.
Published: (2025)
UAV-MM3D: A Large-Scale Synthetic Benchmark for 3D Perception of Unmanned Aerial Vehicles with Multi-Modal Data
by: Zou, Longkun, et al.
Published: (2025)
by: Zou, Longkun, et al.
Published: (2025)
MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
by: Jiang, Yue, et al.
Published: (2026)
by: Jiang, Yue, et al.
Published: (2026)
The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights
by: Liu, Yufang, et al.
Published: (2025)
by: Liu, Yufang, et al.
Published: (2025)
SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning
by: Kong, Fanqi, et al.
Published: (2025)
by: Kong, Fanqi, et al.
Published: (2025)
Similar Items
-
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
by: Zhou, Yue, et al.
Published: (2024) -
ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation
by: Lan, Mengcheng, et al.
Published: (2024) -
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
by: Lan, Mengcheng, et al.
Published: (2024) -
Text4Seg: Reimagining Image Segmentation as Text Generation
by: Lan, Mengcheng, et al.
Published: (2024) -
AirSpatialBot: A Spatially-Aware Aerial Agent for Fine-Grained Vehicle Attribute Recognization and Retrieval
by: Zhou, Yue, et al.
Published: (2026)