AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
Fuente:
arXiv
Salvato in:
| Autori principali: | Zi, Xing, Ni, Tengjun, Fan, Xianjing, Tao, Xian, Li, Jun, Braytee, Ali, Prasad, Mukesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visual and Text Prompt Segmentation: A Novel Multi-Model Framework for Remote Sensing
di: Zi, Xing, et al.
Pubblicazione: (2025)
di: Zi, Xing, et al.
Pubblicazione: (2025)
AeroLite-MDNet: Lightweight Multi-task Deviation Detection Network for UAV Landing
di: Yang, Haiping, et al.
Pubblicazione: (2025)
di: Yang, Haiping, et al.
Pubblicazione: (2025)
DualPrompt-MedCap: A Dual-Prompt Enhanced Approach for Medical Image Captioning
di: Zhao, Yining, et al.
Pubblicazione: (2025)
di: Zhao, Yining, et al.
Pubblicazione: (2025)
RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering
di: Zi, Xing, et al.
Pubblicazione: (2025)
di: Zi, Xing, et al.
Pubblicazione: (2025)
Mitigating Image Captioning Hallucinations in Vision-Language Models
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
OneDiff: A Generalist Model for Image Difference Captioning
di: Hu, Erdong, et al.
Pubblicazione: (2024)
di: Hu, Erdong, et al.
Pubblicazione: (2024)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
di: Song, Zijie, et al.
Pubblicazione: (2023)
di: Song, Zijie, et al.
Pubblicazione: (2023)
Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
PetalView: Fine-grained Location and Orientation Extraction of Street-view Images via Cross-view Local Search with Supplementary Materials
di: Hu, Wenmiao, et al.
Pubblicazione: (2024)
di: Hu, Wenmiao, et al.
Pubblicazione: (2024)
See or Guess: Counterfactually Regularized Image Captioning
di: Cao, Qian, et al.
Pubblicazione: (2024)
di: Cao, Qian, et al.
Pubblicazione: (2024)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
di: Mao, Qingyang, et al.
Pubblicazione: (2025)
di: Mao, Qingyang, et al.
Pubblicazione: (2025)
LAPIG: Language Guided Projector Image Generation with Surface Adaptation and Stylization
di: Deng, Yuchen, et al.
Pubblicazione: (2025)
di: Deng, Yuchen, et al.
Pubblicazione: (2025)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
Cross Modification Attention Based Deliberation Model for Image Captioning
di: Lian, Zheng, et al.
Pubblicazione: (2021)
di: Lian, Zheng, et al.
Pubblicazione: (2021)
DIP: Diffusion Learning of Inconsistency Pattern for General DeepFake Detection
di: Nie, Fan, et al.
Pubblicazione: (2024)
di: Nie, Fan, et al.
Pubblicazione: (2024)
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
di: Xu, Le, et al.
Pubblicazione: (2025)
di: Xu, Le, et al.
Pubblicazione: (2025)
IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers
di: Yang, Chenglin, et al.
Pubblicazione: (2023)
di: Yang, Chenglin, et al.
Pubblicazione: (2023)
T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low Bitrates
di: Wang, Zhitao, et al.
Pubblicazione: (2025)
di: Wang, Zhitao, et al.
Pubblicazione: (2025)
Visual Lifelog Retrieval through Captioning-Enhanced Interpretation
di: Shih, Yu-Fei, et al.
Pubblicazione: (2025)
di: Shih, Yu-Fei, et al.
Pubblicazione: (2025)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
EchoSR: Efficient Context Harnessing for Lightweight Image Super-Resolution
di: Zhao, Hanli, et al.
Pubblicazione: (2026)
di: Zhao, Hanli, et al.
Pubblicazione: (2026)
ProCap: Projection-Aware Captioning for Spatial Augmented Reality
di: Cao, Zimo, et al.
Pubblicazione: (2026)
di: Cao, Zimo, et al.
Pubblicazione: (2026)
MSPT: A Lightweight Face Image Quality Assessment Method with Multi-stage Progressive Training
di: Xiao, Xiongwei, et al.
Pubblicazione: (2025)
di: Xiao, Xiongwei, et al.
Pubblicazione: (2025)
Towards Retrieval-Augmented Architectures for Image Captioning
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
SFFNet: Synergistic Feature Fusion Network With Dual-Domain Edge Enhancement for UAV Image Object Detection
di: Zhang, Wenfeng, et al.
Pubblicazione: (2026)
di: Zhang, Wenfeng, et al.
Pubblicazione: (2026)
MVPbev: Multi-view Perspective Image Generation from BEV with Test-time Controllability and Generalizability
di: Liu, Buyu, et al.
Pubblicazione: (2024)
di: Liu, Buyu, et al.
Pubblicazione: (2024)
Vision Transformers with Autoencoders and Explainable AI for Cancer Patient Risk Stratification Using Whole Slide Imaging
di: Hussein, Ahmad, et al.
Pubblicazione: (2025)
di: Hussein, Ahmad, et al.
Pubblicazione: (2025)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026)
di: Wang, Xinran, et al.
Pubblicazione: (2026)
Multi Agents Semantic Emotion Aligned Music to Image Generation with Music Derived Captions
di: Shi, Junchang, et al.
Pubblicazione: (2025)
di: Shi, Junchang, et al.
Pubblicazione: (2025)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
di: Yao, Linli, et al.
Pubblicazione: (2023)
di: Yao, Linli, et al.
Pubblicazione: (2023)
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
di: Luo, Jianjie, et al.
Pubblicazione: (2024)
di: Luo, Jianjie, et al.
Pubblicazione: (2024)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
3D Gaussian Editing with A Single Image
di: Luo, Guan, et al.
Pubblicazione: (2024)
di: Luo, Guan, et al.
Pubblicazione: (2024)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
Learning Efficient Unsupervised Satellite Image-based Building Damage Detection
di: Zhang, Yiyun, et al.
Pubblicazione: (2023)
di: Zhang, Yiyun, et al.
Pubblicazione: (2023)
Pseudo-triplet Guided Few-shot Composed Image Retrieval
di: Hou, Bohan, et al.
Pubblicazione: (2024)
di: Hou, Bohan, et al.
Pubblicazione: (2024)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
di: Li, Huilai, et al.
Pubblicazione: (2025)
di: Li, Huilai, et al.
Pubblicazione: (2025)
Surveillance Facial Image Quality Assessment: A Multi-dimensional Dataset and Lightweight Model
di: Jiang, Yanwei, et al.
Pubblicazione: (2026)
di: Jiang, Yanwei, et al.
Pubblicazione: (2026)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
di: Yang, Haibo, et al.
Pubblicazione: (2024)
di: Yang, Haibo, et al.
Pubblicazione: (2024)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Visual and Text Prompt Segmentation: A Novel Multi-Model Framework for Remote Sensing
di: Zi, Xing, et al.
Pubblicazione: (2025) -
AeroLite-MDNet: Lightweight Multi-task Deviation Detection Network for UAV Landing
di: Yang, Haiping, et al.
Pubblicazione: (2025) -
DualPrompt-MedCap: A Dual-Prompt Enhanced Approach for Medical Image Captioning
di: Zhao, Yining, et al.
Pubblicazione: (2025) -
RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering
di: Zi, Xing, et al.
Pubblicazione: (2025) -
Mitigating Image Captioning Hallucinations in Vision-Language Models
di: Zhao, Fei, et al.
Pubblicazione: (2025)