Hierarchical Dual-Change Collaborative Learning for UAV Scene Change Captioning
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Fuhai, Huang, Pengpeng, Wu, Junwen, Zhang, Hehong, Wang, Shiping, Ma, Xiaoguang, Ge, Xuri |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SAM Guided Semantic and Motion Changed Region Mining for Remote Sensing Change Captioning
por: Wang, Futian, et al.
Publicado: (2025)
por: Wang, Futian, et al.
Publicado: (2025)
Leveraging Textual Compositional Reasoning for Robust Change Captioning
por: Park, Kyu Ri, et al.
Publicado: (2025)
por: Park, Kyu Ri, et al.
Publicado: (2025)
Imagine How To Change: Explicit Procedure Modeling for Change Captioning
por: Sun, Jiayang, et al.
Publicado: (2026)
por: Sun, Jiayang, et al.
Publicado: (2026)
DualCap: Enhancing Lightweight Image Captioning via Dual Retrieval with Similar Scenes Visual Prompts
por: Li, Binbin, et al.
Publicado: (2025)
por: Li, Binbin, et al.
Publicado: (2025)
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
por: Ge, Shiping, et al.
Publicado: (2024)
por: Ge, Shiping, et al.
Publicado: (2024)
Towards Generalizable Scene Change Detection
por: Kim, Jaewoo, et al.
Publicado: (2024)
por: Kim, Jaewoo, et al.
Publicado: (2024)
CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning
por: Tang, Zhijiang, et al.
Publicado: (2026)
por: Tang, Zhijiang, et al.
Publicado: (2026)
SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language Models
por: Dong, Xiangyu, et al.
Publicado: (2025)
por: Dong, Xiangyu, et al.
Publicado: (2025)
ObjChangeVR: Object State Change Reasoning from Continuous Egocentric Views in VR Environments
por: Ding, Shiyi, et al.
Publicado: (2026)
por: Ding, Shiyi, et al.
Publicado: (2026)
Mask Approximation Net: A Novel Diffusion Model Approach for Remote Sensing Change Captioning
por: Sun, Dongwei, et al.
Publicado: (2024)
por: Sun, Dongwei, et al.
Publicado: (2024)
NoisyNN: Exploring the Impact of Information Entropy Change in Learning Systems
por: Yu, Xiaowei, et al.
Publicado: (2023)
por: Yu, Xiaowei, et al.
Publicado: (2023)
CFIR: Fast and Effective Long-Text To Image Retrieval for Large Corpora
por: Long, Zijun, et al.
Publicado: (2024)
por: Long, Zijun, et al.
Publicado: (2024)
LVD-GS: Gaussian Splatting SLAM for Dynamic Scenes via Hierarchical Explicit-Implicit Representation Collaboration Rendering
por: Zhu, Wenkai, et al.
Publicado: (2025)
por: Zhu, Wenkai, et al.
Publicado: (2025)
Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning
por: Ge, Xuri, et al.
Publicado: (2024)
por: Ge, Xuri, et al.
Publicado: (2024)
NeuroMoCo: A Neuromorphic Momentum Contrast Learning Method for Spiking Neural Networks
por: Ma, Yuqi, et al.
Publicado: (2024)
por: Ma, Yuqi, et al.
Publicado: (2024)
MoColl: Agent-Based Specific and General Model Collaboration for Image Captioning
por: Yang, Pu, et al.
Publicado: (2025)
por: Yang, Pu, et al.
Publicado: (2025)
Global2Local: A Joint-Hierarchical Attention for Video Captioning
por: Dai, Chengpeng, et al.
Publicado: (2022)
por: Dai, Chengpeng, et al.
Publicado: (2022)
Dual-View Alignment Learning with Hierarchical-Prompt for Class-Imbalance Multi-Label Classification
por: Huang, Sheng, et al.
Publicado: (2025)
por: Huang, Sheng, et al.
Publicado: (2025)
OSCaR: Object State Captioning and State Change Representation
por: Nguyen, Nguyen, et al.
Publicado: (2024)
por: Nguyen, Nguyen, et al.
Publicado: (2024)
Deep Change Monitoring: A Hyperbolic Representative Learning Framework and a Dataset for Long-term Fine-grained Tree Change Detection
por: Li, Yante, et al.
Publicado: (2025)
por: Li, Yante, et al.
Publicado: (2025)
TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding
por: Pan, Junwen, et al.
Publicado: (2025)
por: Pan, Junwen, et al.
Publicado: (2025)
Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding
por: He, Ziyao, et al.
Publicado: (2026)
por: He, Ziyao, et al.
Publicado: (2026)
PathM3: A Multimodal Multi-Task Multiple Instance Learning Framework for Whole Slide Image Classification and Captioning
por: Zhou, Qifeng, et al.
Publicado: (2024)
por: Zhou, Qifeng, et al.
Publicado: (2024)
TreeGaussian: Tree-Guided Cascaded Contrastive Learning for Hierarchical Consistent 3D Gaussian Scene Segmentation and Understanding
por: You, Jingbin, et al.
Publicado: (2026)
por: You, Jingbin, et al.
Publicado: (2026)
HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
por: Chen, Junwen, et al.
Publicado: (2025)
por: Chen, Junwen, et al.
Publicado: (2025)
ChangeQuery: Advancing Remote Sensing Change Analysis for Natural and Human-Induced Disasters from Visual Detection to Semantic Understanding
por: Sun, Dongwei, et al.
Publicado: (2026)
por: Sun, Dongwei, et al.
Publicado: (2026)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)
por: Wu, Shengqiong, et al.
Publicado: (2025)
Robust Change Captioning in Remote Sensing: SECOND-CC Dataset and MModalCC Framework
por: Karaca, Ali Can, et al.
Publicado: (2025)
por: Karaca, Ali Can, et al.
Publicado: (2025)
Self-Explainable Affordance Learning with Embodied Caption
por: Zhang, Zhipeng, et al.
Publicado: (2024)
por: Zhang, Zhipeng, et al.
Publicado: (2024)
SeFi-CD: A Semantic First Change Detection Paradigm That Can Detect Any Change You Want
por: Zhao, Ling, et al.
Publicado: (2024)
por: Zhao, Ling, et al.
Publicado: (2024)
CaptionFool: Universal Image Captioning Model Attacks
por: Parekh, Swapnil
Publicado: (2026)
por: Parekh, Swapnil
Publicado: (2026)
Changes in Gaza: DINOv3-Powered Multi-Class Change Detection for Damage Assessment in Conflict Zones
por: Zheng, Kai, et al.
Publicado: (2025)
por: Zheng, Kai, et al.
Publicado: (2025)
Real-Time Monocular Scene Analysis for UAV in Outdoor Environments
por: AlaaEldin, Yara
Publicado: (2026)
por: AlaaEldin, Yara
Publicado: (2026)
Dual Prompt-Driven Feature Encoding for Nighttime UAV Tracking
por: Wang, Yiheng, et al.
Publicado: (2026)
por: Wang, Yiheng, et al.
Publicado: (2026)
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
por: Kim, Ye-Chan, et al.
Publicado: (2026)
por: Kim, Ye-Chan, et al.
Publicado: (2026)
ChangeFlow -- Latent Rectified Flow for Change Detection in Remote Sensing
por: Rolih, Blaž, et al.
Publicado: (2026)
por: Rolih, Blaž, et al.
Publicado: (2026)
Consistency Change Detection Framework for Unsupervised Remote Sensing Change Detection
por: Liu, Yating, et al.
Publicado: (2025)
por: Liu, Yating, et al.
Publicado: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
por: Bansal, Hritik, et al.
Publicado: (2024)
por: Bansal, Hritik, et al.
Publicado: (2024)
AGIC: Attention-Guided Image Captioning to Improve Caption Relevance
por: Teja, L. D. M. S. Sai, et al.
Publicado: (2025)
por: Teja, L. D. M. S. Sai, et al.
Publicado: (2025)
Describe Anything: Detailed Localized Image and Video Captioning
por: Lian, Long, et al.
Publicado: (2025)
por: Lian, Long, et al.
Publicado: (2025)
Ejemplares similares
-
SAM Guided Semantic and Motion Changed Region Mining for Remote Sensing Change Captioning
por: Wang, Futian, et al.
Publicado: (2025) -
Leveraging Textual Compositional Reasoning for Robust Change Captioning
por: Park, Kyu Ri, et al.
Publicado: (2025) -
Imagine How To Change: Explicit Procedure Modeling for Change Captioning
por: Sun, Jiayang, et al.
Publicado: (2026) -
DualCap: Enhancing Lightweight Image Captioning via Dual Retrieval with Similar Scenes Visual Prompts
por: Li, Binbin, et al.
Publicado: (2025) -
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
por: Ge, Shiping, et al.
Publicado: (2024)