Hierarchical Dual-Change Collaborative Learning for UAV Scene Change Captioning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Fuhai, Huang, Pengpeng, Wu, Junwen, Zhang, Hehong, Wang, Shiping, Ma, Xiaoguang, Ge, Xuri |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SAM Guided Semantic and Motion Changed Region Mining for Remote Sensing Change Captioning
von: Wang, Futian, et al.
Veröffentlicht: (2025)
von: Wang, Futian, et al.
Veröffentlicht: (2025)
Leveraging Textual Compositional Reasoning for Robust Change Captioning
von: Park, Kyu Ri, et al.
Veröffentlicht: (2025)
von: Park, Kyu Ri, et al.
Veröffentlicht: (2025)
Imagine How To Change: Explicit Procedure Modeling for Change Captioning
von: Sun, Jiayang, et al.
Veröffentlicht: (2026)
von: Sun, Jiayang, et al.
Veröffentlicht: (2026)
DualCap: Enhancing Lightweight Image Captioning via Dual Retrieval with Similar Scenes Visual Prompts
von: Li, Binbin, et al.
Veröffentlicht: (2025)
von: Li, Binbin, et al.
Veröffentlicht: (2025)
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
von: Ge, Shiping, et al.
Veröffentlicht: (2024)
von: Ge, Shiping, et al.
Veröffentlicht: (2024)
Towards Generalizable Scene Change Detection
von: Kim, Jaewoo, et al.
Veröffentlicht: (2024)
von: Kim, Jaewoo, et al.
Veröffentlicht: (2024)
CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning
von: Tang, Zhijiang, et al.
Veröffentlicht: (2026)
von: Tang, Zhijiang, et al.
Veröffentlicht: (2026)
SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language Models
von: Dong, Xiangyu, et al.
Veröffentlicht: (2025)
von: Dong, Xiangyu, et al.
Veröffentlicht: (2025)
ObjChangeVR: Object State Change Reasoning from Continuous Egocentric Views in VR Environments
von: Ding, Shiyi, et al.
Veröffentlicht: (2026)
von: Ding, Shiyi, et al.
Veröffentlicht: (2026)
Mask Approximation Net: A Novel Diffusion Model Approach for Remote Sensing Change Captioning
von: Sun, Dongwei, et al.
Veröffentlicht: (2024)
von: Sun, Dongwei, et al.
Veröffentlicht: (2024)
NoisyNN: Exploring the Impact of Information Entropy Change in Learning Systems
von: Yu, Xiaowei, et al.
Veröffentlicht: (2023)
von: Yu, Xiaowei, et al.
Veröffentlicht: (2023)
CFIR: Fast and Effective Long-Text To Image Retrieval for Large Corpora
von: Long, Zijun, et al.
Veröffentlicht: (2024)
von: Long, Zijun, et al.
Veröffentlicht: (2024)
LVD-GS: Gaussian Splatting SLAM for Dynamic Scenes via Hierarchical Explicit-Implicit Representation Collaboration Rendering
von: Zhu, Wenkai, et al.
Veröffentlicht: (2025)
von: Zhu, Wenkai, et al.
Veröffentlicht: (2025)
Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning
von: Ge, Xuri, et al.
Veröffentlicht: (2024)
von: Ge, Xuri, et al.
Veröffentlicht: (2024)
NeuroMoCo: A Neuromorphic Momentum Contrast Learning Method for Spiking Neural Networks
von: Ma, Yuqi, et al.
Veröffentlicht: (2024)
von: Ma, Yuqi, et al.
Veröffentlicht: (2024)
MoColl: Agent-Based Specific and General Model Collaboration for Image Captioning
von: Yang, Pu, et al.
Veröffentlicht: (2025)
von: Yang, Pu, et al.
Veröffentlicht: (2025)
Global2Local: A Joint-Hierarchical Attention for Video Captioning
von: Dai, Chengpeng, et al.
Veröffentlicht: (2022)
von: Dai, Chengpeng, et al.
Veröffentlicht: (2022)
Dual-View Alignment Learning with Hierarchical-Prompt for Class-Imbalance Multi-Label Classification
von: Huang, Sheng, et al.
Veröffentlicht: (2025)
von: Huang, Sheng, et al.
Veröffentlicht: (2025)
OSCaR: Object State Captioning and State Change Representation
von: Nguyen, Nguyen, et al.
Veröffentlicht: (2024)
von: Nguyen, Nguyen, et al.
Veröffentlicht: (2024)
Deep Change Monitoring: A Hyperbolic Representative Learning Framework and a Dataset for Long-term Fine-grained Tree Change Detection
von: Li, Yante, et al.
Veröffentlicht: (2025)
von: Li, Yante, et al.
Veröffentlicht: (2025)
TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding
von: Pan, Junwen, et al.
Veröffentlicht: (2025)
von: Pan, Junwen, et al.
Veröffentlicht: (2025)
Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding
von: He, Ziyao, et al.
Veröffentlicht: (2026)
von: He, Ziyao, et al.
Veröffentlicht: (2026)
PathM3: A Multimodal Multi-Task Multiple Instance Learning Framework for Whole Slide Image Classification and Captioning
von: Zhou, Qifeng, et al.
Veröffentlicht: (2024)
von: Zhou, Qifeng, et al.
Veröffentlicht: (2024)
TreeGaussian: Tree-Guided Cascaded Contrastive Learning for Hierarchical Consistent 3D Gaussian Scene Segmentation and Understanding
von: You, Jingbin, et al.
Veröffentlicht: (2026)
von: You, Jingbin, et al.
Veröffentlicht: (2026)
HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
von: Chen, Junwen, et al.
Veröffentlicht: (2025)
von: Chen, Junwen, et al.
Veröffentlicht: (2025)
ChangeQuery: Advancing Remote Sensing Change Analysis for Natural and Human-Induced Disasters from Visual Detection to Semantic Understanding
von: Sun, Dongwei, et al.
Veröffentlicht: (2026)
von: Sun, Dongwei, et al.
Veröffentlicht: (2026)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
von: Wu, Shengqiong, et al.
Veröffentlicht: (2025)
von: Wu, Shengqiong, et al.
Veröffentlicht: (2025)
Robust Change Captioning in Remote Sensing: SECOND-CC Dataset and MModalCC Framework
von: Karaca, Ali Can, et al.
Veröffentlicht: (2025)
von: Karaca, Ali Can, et al.
Veröffentlicht: (2025)
Self-Explainable Affordance Learning with Embodied Caption
von: Zhang, Zhipeng, et al.
Veröffentlicht: (2024)
von: Zhang, Zhipeng, et al.
Veröffentlicht: (2024)
SeFi-CD: A Semantic First Change Detection Paradigm That Can Detect Any Change You Want
von: Zhao, Ling, et al.
Veröffentlicht: (2024)
von: Zhao, Ling, et al.
Veröffentlicht: (2024)
CaptionFool: Universal Image Captioning Model Attacks
von: Parekh, Swapnil
Veröffentlicht: (2026)
von: Parekh, Swapnil
Veröffentlicht: (2026)
Changes in Gaza: DINOv3-Powered Multi-Class Change Detection for Damage Assessment in Conflict Zones
von: Zheng, Kai, et al.
Veröffentlicht: (2025)
von: Zheng, Kai, et al.
Veröffentlicht: (2025)
Real-Time Monocular Scene Analysis for UAV in Outdoor Environments
von: AlaaEldin, Yara
Veröffentlicht: (2026)
von: AlaaEldin, Yara
Veröffentlicht: (2026)
Dual Prompt-Driven Feature Encoding for Nighttime UAV Tracking
von: Wang, Yiheng, et al.
Veröffentlicht: (2026)
von: Wang, Yiheng, et al.
Veröffentlicht: (2026)
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
von: Kim, Ye-Chan, et al.
Veröffentlicht: (2026)
von: Kim, Ye-Chan, et al.
Veröffentlicht: (2026)
ChangeFlow -- Latent Rectified Flow for Change Detection in Remote Sensing
von: Rolih, Blaž, et al.
Veröffentlicht: (2026)
von: Rolih, Blaž, et al.
Veröffentlicht: (2026)
Consistency Change Detection Framework for Unsupervised Remote Sensing Change Detection
von: Liu, Yating, et al.
Veröffentlicht: (2025)
von: Liu, Yating, et al.
Veröffentlicht: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
AGIC: Attention-Guided Image Captioning to Improve Caption Relevance
von: Teja, L. D. M. S. Sai, et al.
Veröffentlicht: (2025)
von: Teja, L. D. M. S. Sai, et al.
Veröffentlicht: (2025)
Describe Anything: Detailed Localized Image and Video Captioning
von: Lian, Long, et al.
Veröffentlicht: (2025)
von: Lian, Long, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SAM Guided Semantic and Motion Changed Region Mining for Remote Sensing Change Captioning
von: Wang, Futian, et al.
Veröffentlicht: (2025) -
Leveraging Textual Compositional Reasoning for Robust Change Captioning
von: Park, Kyu Ri, et al.
Veröffentlicht: (2025) -
Imagine How To Change: Explicit Procedure Modeling for Change Captioning
von: Sun, Jiayang, et al.
Veröffentlicht: (2026) -
DualCap: Enhancing Lightweight Image Captioning via Dual Retrieval with Similar Scenes Visual Prompts
von: Li, Binbin, et al.
Veröffentlicht: (2025) -
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
von: Ge, Shiping, et al.
Veröffentlicht: (2024)