A Simple Aerial Detection Baseline of Multimodal Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Qingyun, Chen, Yushi, Shu, Xinya, Chen, Dong, He, Xin, Yu, Yi, Yang, Xue |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ARS-DETR: Aspect Ratio-Sensitive Detection Transformer for Aerial Oriented Object Detection
von: Zeng, Ying, et al.
Veröffentlicht: (2023)
von: Zeng, Ying, et al.
Veröffentlicht: (2023)
Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
von: Xu, Wanting, et al.
Veröffentlicht: (2024)
von: Xu, Wanting, et al.
Veröffentlicht: (2024)
Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
von: Zhou, Yue, et al.
Veröffentlicht: (2025)
von: Zhou, Yue, et al.
Veröffentlicht: (2025)
A Simple Background Augmentation Method for Object Detection with Diffusion Model
von: Li, Yuhang, et al.
Veröffentlicht: (2024)
von: Li, Yuhang, et al.
Veröffentlicht: (2024)
MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline
von: Yao, Huanjin, et al.
Veröffentlicht: (2026)
von: Yao, Huanjin, et al.
Veröffentlicht: (2026)
SimpleMatch: A Simple and Strong Baseline for Semantic Correspondence
von: Jin, Hailing, et al.
Veröffentlicht: (2026)
von: Jin, Hailing, et al.
Veröffentlicht: (2026)
Point2RBox: Combine Knowledge from Synthetic Visual Patterns for End-to-end Oriented Object Detection with Single Point Supervision
von: Yu, Yi, et al.
Veröffentlicht: (2023)
von: Yu, Yi, et al.
Veröffentlicht: (2023)
Freeze and Cluster: A Simple Baseline for Rehearsal-Free Continual Category Discovery
von: Zhang, Chuyu, et al.
Veröffentlicht: (2025)
von: Zhang, Chuyu, et al.
Veröffentlicht: (2025)
SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker
von: Su, Junbin, et al.
Veröffentlicht: (2026)
von: Su, Junbin, et al.
Veröffentlicht: (2026)
Contextual Object Detection with Multimodal Large Language Models
von: Zang, Yuhang, et al.
Veröffentlicht: (2023)
von: Zang, Yuhang, et al.
Veröffentlicht: (2023)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
von: Chen, Junkai, et al.
Veröffentlicht: (2026)
von: Chen, Junkai, et al.
Veröffentlicht: (2026)
Multimodal Language Models See Better When They Look Shallower
von: Chen, Haoran, et al.
Veröffentlicht: (2025)
von: Chen, Haoran, et al.
Veröffentlicht: (2025)
DeepAAT: Deep Automated Aerial Triangulation for Fast UAV-based Mapping
von: Chen, Zequan, et al.
Veröffentlicht: (2024)
von: Chen, Zequan, et al.
Veröffentlicht: (2024)
PointOBB-v3: Expanding Performance Boundaries of Single Point-Supervised Oriented Object Detection
von: Zhang, Peiyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Peiyuan, et al.
Veröffentlicht: (2025)
The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection
von: Ai, Wei, et al.
Veröffentlicht: (2026)
von: Ai, Wei, et al.
Veröffentlicht: (2026)
Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline
von: Li, Haiyang, et al.
Veröffentlicht: (2025)
von: Li, Haiyang, et al.
Veröffentlicht: (2025)
Aerial Monocular 3D Object Detection
von: Hu, Yue, et al.
Veröffentlicht: (2022)
von: Hu, Yue, et al.
Veröffentlicht: (2022)
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2026)
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2026)
Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery
von: Chen, Hao, et al.
Veröffentlicht: (2026)
von: Chen, Hao, et al.
Veröffentlicht: (2026)
An Embarrassingly Simple Baseline for Imbalanced Semi-Supervised Learning
von: Chen, Hao, et al.
Veröffentlicht: (2022)
von: Chen, Hao, et al.
Veröffentlicht: (2022)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
von: Yu, JiangYong, et al.
Veröffentlicht: (2025)
von: Yu, JiangYong, et al.
Veröffentlicht: (2025)
EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning
von: Sun, Haoran, et al.
Veröffentlicht: (2025)
von: Sun, Haoran, et al.
Veröffentlicht: (2025)
AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations
von: Liu, Junli, et al.
Veröffentlicht: (2025)
von: Liu, Junli, et al.
Veröffentlicht: (2025)
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
von: Li, Yinghui, et al.
Veröffentlicht: (2026)
von: Li, Yinghui, et al.
Veröffentlicht: (2026)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
von: Yin, Jianghao, et al.
Veröffentlicht: (2026)
von: Yin, Jianghao, et al.
Veröffentlicht: (2026)
COMO: Cross-Mamba Interaction and Offset-Guided Fusion for Multimodal Object Detection
von: Liu, Chang, et al.
Veröffentlicht: (2024)
von: Liu, Chang, et al.
Veröffentlicht: (2024)
Strong Baseline: Multi-UAV Tracking via YOLOv12 with BoT-SORT-ReID
von: Chen, Yu-Hsi
Veröffentlicht: (2025)
von: Chen, Yu-Hsi
Veröffentlicht: (2025)
BEVTrack: A Simple and Strong Baseline for 3D Single Object Tracking in Bird's-Eye View
von: Yang, Yuxiang, et al.
Veröffentlicht: (2023)
von: Yang, Yuxiang, et al.
Veröffentlicht: (2023)
HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
von: Chen, Junwen, et al.
Veröffentlicht: (2025)
von: Chen, Junwen, et al.
Veröffentlicht: (2025)
MobileVLM V2: Faster and Stronger Baseline for Vision Language Model
von: Chu, Xiangxiang, et al.
Veröffentlicht: (2024)
von: Chu, Xiangxiang, et al.
Veröffentlicht: (2024)
Frequency-Adaptive Low-Latency Object Detection Using Events and Frames
von: Zhang, Haitian, et al.
Veröffentlicht: (2024)
von: Zhang, Haitian, et al.
Veröffentlicht: (2024)
Textured 3D Regenerative Morphing with 3D Diffusion Prior
von: Yang, Songlin, et al.
Veröffentlicht: (2025)
von: Yang, Songlin, et al.
Veröffentlicht: (2025)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
von: Tong, Haoyu, et al.
Veröffentlicht: (2026)
von: Tong, Haoyu, et al.
Veröffentlicht: (2026)
PP-DocBee2: Improved Baselines with Efficient Data for Multimodal Document Understanding
von: Huang, Kui, et al.
Veröffentlicht: (2025)
von: Huang, Kui, et al.
Veröffentlicht: (2025)
BLINK: Multimodal Large Language Models Can See but Not Perceive
von: Fu, Xingyu, et al.
Veröffentlicht: (2024)
von: Fu, Xingyu, et al.
Veröffentlicht: (2024)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
von: Diao, Haiwen, et al.
Veröffentlicht: (2025)
von: Diao, Haiwen, et al.
Veröffentlicht: (2025)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
von: Zhang, Jieyu, et al.
Veröffentlicht: (2024)
von: Zhang, Jieyu, et al.
Veröffentlicht: (2024)
SCT: A Simple Baseline for Parameter-Efficient Fine-Tuning via Salient Channels
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2023)
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2023)
BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset
von: Chen, Jiuhai, et al.
Veröffentlicht: (2025)
von: Chen, Jiuhai, et al.
Veröffentlicht: (2025)
Semantic Generative Tuning for Unified Multimodal Models
von: Yu, Songsong, et al.
Veröffentlicht: (2026)
von: Yu, Songsong, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
ARS-DETR: Aspect Ratio-Sensitive Detection Transformer for Aerial Oriented Object Detection
von: Zeng, Ying, et al.
Veröffentlicht: (2023) -
Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
von: Xu, Wanting, et al.
Veröffentlicht: (2024) -
Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
von: Zhou, Yue, et al.
Veröffentlicht: (2025) -
A Simple Background Augmentation Method for Object Detection with Diffusion Model
von: Li, Yuhang, et al.
Veröffentlicht: (2024) -
MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline
von: Yao, Huanjin, et al.
Veröffentlicht: (2026)