Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Wentao, Li, Chenglong, Wang, Xiao, Luo, Bin, Liu, Qi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Vehicle-centric Perception via Multimodal Structured Pre-training
by: Wu, Wentao, et al.
Published: (2025)
by: Wu, Wentao, et al.
Published: (2025)
CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework
by: Wu, Wentao, et al.
Published: (2025)
by: Wu, Wentao, et al.
Published: (2025)
Contextual Object Detection with Multimodal Large Language Models
by: Zang, Yuhang, et al.
Published: (2023)
by: Zang, Yuhang, et al.
Published: (2023)
VFM-Det: Towards High-Performance Vehicle Detection via Large Foundation Models
by: Wu, Wentao, et al.
Published: (2024)
by: Wu, Wentao, et al.
Published: (2024)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
by: Jiang, Wen, et al.
Published: (2026)
by: Jiang, Wen, et al.
Published: (2026)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
by: Li, Shicheng, et al.
Published: (2025)
by: Li, Shicheng, et al.
Published: (2025)
Unsupervised Multi-View Visual Anomaly Detection via Progressive Homography-Guided Alignment
by: Chen, Xintao, et al.
Published: (2025)
by: Chen, Xintao, et al.
Published: (2025)
MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection
by: Jiang, Xi, et al.
Published: (2024)
by: Jiang, Xi, et al.
Published: (2024)
DEPFusion: Dual-Domain Enhancement and Priority-Guided Mamba Fusion for UAV Multispectral Object Detection
by: Li, Shucong, et al.
Published: (2025)
by: Li, Shucong, et al.
Published: (2025)
Alignment-Free RGB-T Salient Object Detection: A Large-scale Dataset and Progressive Correlation Network
by: Wang, Kunpeng, et al.
Published: (2024)
by: Wang, Kunpeng, et al.
Published: (2024)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
by: Chen, Junkai, et al.
Published: (2026)
by: Chen, Junkai, et al.
Published: (2026)
Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
RSOD: Reliability-Guided Sonar Image Object Detection with Extremely Limited Labels
by: Li, Chengzhou, et al.
Published: (2026)
by: Li, Chengzhou, et al.
Published: (2026)
Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models
by: Liang, Yuxuan, et al.
Published: (2025)
by: Liang, Yuxuan, et al.
Published: (2025)
Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts
by: Guo, Mingning, et al.
Published: (2025)
by: Guo, Mingning, et al.
Published: (2025)
Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models
by: Hua, Chunliang, et al.
Published: (2026)
by: Hua, Chunliang, et al.
Published: (2026)
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
by: Li, Jiansheng, et al.
Published: (2025)
by: Li, Jiansheng, et al.
Published: (2025)
COMO: Cross-Mamba Interaction and Offset-Guided Fusion for Multimodal Object Detection
by: Liu, Chang, et al.
Published: (2024)
by: Liu, Chang, et al.
Published: (2024)
HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
by: Chen, Junwen, et al.
Published: (2025)
by: Chen, Junwen, et al.
Published: (2025)
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
by: Sapkota, Ranjan, et al.
Published: (2025)
by: Sapkota, Ranjan, et al.
Published: (2025)
UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark
by: Zhang, Yu, et al.
Published: (2026)
by: Zhang, Yu, et al.
Published: (2026)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
by: Luo, Junwei, et al.
Published: (2025)
by: Luo, Junwei, et al.
Published: (2025)
MuDD: A Multimodal Deception Detection Dataset and GSR-Guided Progressive Distillation for Non-Contact Deception Detection
by: Jiang, Peiyuan, et al.
Published: (2026)
by: Jiang, Peiyuan, et al.
Published: (2026)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
by: Li, Hengzhuang, et al.
Published: (2025)
by: Li, Hengzhuang, et al.
Published: (2025)
Can Multimodal Large Language Models Truly Understand Small Objects?
by: Han, Fujun, et al.
Published: (2026)
by: Han, Fujun, et al.
Published: (2026)
Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models
by: Halder, Sourav, et al.
Published: (2025)
by: Halder, Sourav, et al.
Published: (2025)
NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models
by: Wu, Kai, et al.
Published: (2024)
by: Wu, Kai, et al.
Published: (2024)
Progressive Boundary Guided Anomaly Synthesis for Industrial Anomaly Detection
by: Chen, Qiyu, et al.
Published: (2024)
by: Chen, Qiyu, et al.
Published: (2024)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
by: Tang, Jianting, et al.
Published: (2025)
by: Tang, Jianting, et al.
Published: (2025)
Multimodal Prompt Alignment for Facial Expression Recognition
by: Ma, Fuyan, et al.
Published: (2025)
by: Ma, Fuyan, et al.
Published: (2025)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
by: Lu, Shiyin, et al.
Published: (2024)
by: Lu, Shiyin, et al.
Published: (2024)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
by: Yu, Xiaomin, et al.
Published: (2026)
by: Yu, Xiaomin, et al.
Published: (2026)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
by: Miao, Yanting, et al.
Published: (2026)
by: Miao, Yanting, et al.
Published: (2026)
Single Image Unlearning: Efficient Machine Unlearning in Multimodal Large Language Models
by: Li, Jiaqi, et al.
Published: (2024)
by: Li, Jiaqi, et al.
Published: (2024)
StarVid: Enhancing Semantic Alignment in Video Diffusion Models via Spatial and SynTactic Guided Attention Refocusing
by: Li, Yuanhang, et al.
Published: (2024)
by: Li, Yuanhang, et al.
Published: (2024)
Language-Guided Structure-Aware Network for Camouflaged Object Detection
by: Zhang, Min
Published: (2026)
by: Zhang, Min
Published: (2026)
Efficient Multimodal Large Language Models: A Survey
by: Jin, Yizhang, et al.
Published: (2024)
by: Jin, Yizhang, et al.
Published: (2024)
TGBFormer: Transformer-GraphFormer Blender Network for Video Object Detection
by: Qi, Qiang, et al.
Published: (2025)
by: Qi, Qiang, et al.
Published: (2025)
Dual-Stream Spectral Decoupling Distillation for Remote Sensing Object Detection
by: Gao, Xiangyi, et al.
Published: (2025)
by: Gao, Xiangyi, et al.
Published: (2025)
Toward Cognitive Supersensing in Multimodal Large Language Model
by: Li, Boyi, et al.
Published: (2026)
by: Li, Boyi, et al.
Published: (2026)
Similar Items
-
Vehicle-centric Perception via Multimodal Structured Pre-training
by: Wu, Wentao, et al.
Published: (2025) -
CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework
by: Wu, Wentao, et al.
Published: (2025) -
Contextual Object Detection with Multimodal Large Language Models
by: Zang, Yuhang, et al.
Published: (2023) -
VFM-Det: Towards High-Performance Vehicle Detection via Large Foundation Models
by: Wu, Wentao, et al.
Published: (2024) -
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
by: Jiang, Wen, et al.
Published: (2026)