Imagine How To Change: Explicit Procedure Modeling for Change Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Jiayang, Guo, Zixin, Cao, Min, Zhu, Guibo, Laaksonen, Jorma |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hybrid Deep Learning for Hyperspectral Single Image Super-Resolution
di: Muhammad, Usman, et al.
Pubblicazione: (2025)
di: Muhammad, Usman, et al.
Pubblicazione: (2025)
OSCaR: Object State Captioning and State Change Representation
di: Nguyen, Nguyen, et al.
Pubblicazione: (2024)
di: Nguyen, Nguyen, et al.
Pubblicazione: (2024)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
Figuring out Figures: Using Textual References to Caption Scientific Figures
di: Cao, Stanley, et al.
Pubblicazione: (2024)
di: Cao, Stanley, et al.
Pubblicazione: (2024)
Hierarchical Dual-Change Collaborative Learning for UAV Scene Change Captioning
di: Chen, Fuhai, et al.
Pubblicazione: (2026)
di: Chen, Fuhai, et al.
Pubblicazione: (2026)
OSCBench: Benchmarking Object State Change in Text-to-Video Generation
di: Han, Xianjing, et al.
Pubblicazione: (2026)
di: Han, Xianjing, et al.
Pubblicazione: (2026)
CapGeo: A Caption-Assisted Approach to Geometric Reasoning
di: Li, Yuying, et al.
Pubblicazione: (2025)
di: Li, Yuying, et al.
Pubblicazione: (2025)
SAM Guided Semantic and Motion Changed Region Mining for Remote Sensing Change Captioning
di: Wang, Futian, et al.
Pubblicazione: (2025)
di: Wang, Futian, et al.
Pubblicazione: (2025)
Explaining Caption-Image Interactions in CLIP Models with Second-Order Attributions
di: Möller, Lucas, et al.
Pubblicazione: (2024)
di: Möller, Lucas, et al.
Pubblicazione: (2024)
The Power of Many: Multi-Agent Multimodal Models for Cultural Image Captioning
di: Bai, Longju, et al.
Pubblicazione: (2024)
di: Bai, Longju, et al.
Pubblicazione: (2024)
Decoding fMRI Data into Captions using Prefix Language Modeling
di: Shen, Vyacheslav, et al.
Pubblicazione: (2025)
di: Shen, Vyacheslav, et al.
Pubblicazione: (2025)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
di: Xing, Long, et al.
Pubblicazione: (2025)
di: Xing, Long, et al.
Pubblicazione: (2025)
Leveraging Textual Compositional Reasoning for Robust Change Captioning
di: Park, Kyu Ri, et al.
Pubblicazione: (2025)
di: Park, Kyu Ri, et al.
Pubblicazione: (2025)
Unveiling the Invisible: Captioning Videos with Metaphors
di: Kalarani, Abisek Rajakumar, et al.
Pubblicazione: (2024)
di: Kalarani, Abisek Rajakumar, et al.
Pubblicazione: (2024)
Text-only Synthesis for Image Captioning
di: Zhou, Qing, et al.
Pubblicazione: (2024)
di: Zhou, Qing, et al.
Pubblicazione: (2024)
The Role of Data Curation in Image Captioning
di: Li, Wenyan, et al.
Pubblicazione: (2023)
di: Li, Wenyan, et al.
Pubblicazione: (2023)
WsiCaption: Multiple Instance Generation of Pathology Reports for Gigapixel Whole-Slide Images
di: Chen, Pingyi, et al.
Pubblicazione: (2023)
di: Chen, Pingyi, et al.
Pubblicazione: (2023)
Mask Approximation Net: A Novel Diffusion Model Approach for Remote Sensing Change Captioning
di: Sun, Dongwei, et al.
Pubblicazione: (2024)
di: Sun, Dongwei, et al.
Pubblicazione: (2024)
Updating CLIP to Prefer Descriptions Over Captions
di: Zur, Amir, et al.
Pubblicazione: (2024)
di: Zur, Amir, et al.
Pubblicazione: (2024)
Vision-Language Agents for Interactive Forest Change Analysis
di: Brock, James, et al.
Pubblicazione: (2026)
di: Brock, James, et al.
Pubblicazione: (2026)
AC-Lite : A Lightweight Image Captioning Model for Low-Resource Assamese Language
di: Choudhury, Pankaj, et al.
Pubblicazione: (2025)
di: Choudhury, Pankaj, et al.
Pubblicazione: (2025)
CAMEL-Bench: A Comprehensive Arabic LMM Benchmark
di: Ghaboura, Sara, et al.
Pubblicazione: (2024)
di: Ghaboura, Sara, et al.
Pubblicazione: (2024)
A Fusion-Guided Inception Network for Hyperspectral Image Super-Resolution
di: Muhammad, Usman, et al.
Pubblicazione: (2025)
di: Muhammad, Usman, et al.
Pubblicazione: (2025)
StableI2I: Spotting Unintended Changes in Image-to-Image Transition
di: Li, Jiayang, et al.
Pubblicazione: (2026)
di: Li, Jiayang, et al.
Pubblicazione: (2026)
Video Summarization: Towards Entity-Aware Captions
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
CAPEEN: Image Captioning with Early Exits and Knowledge Distillation
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2024)
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2024)
ChartCap: Mitigating Hallucination of Dense Chart Captioning
di: Lim, Junyoung, et al.
Pubblicazione: (2025)
di: Lim, Junyoung, et al.
Pubblicazione: (2025)
CIC: A Framework for Culturally-Aware Image Captioning
di: Yun, Youngsik, et al.
Pubblicazione: (2024)
di: Yun, Youngsik, et al.
Pubblicazione: (2024)
HAZARD Challenge: Embodied Decision Making in Dynamically Changing Environments
di: Zhou, Qinhong, et al.
Pubblicazione: (2024)
di: Zhou, Qinhong, et al.
Pubblicazione: (2024)
HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities
di: Dönmez, Esra, et al.
Pubblicazione: (2026)
di: Dönmez, Esra, et al.
Pubblicazione: (2026)
FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model
di: Lee, Yebin, et al.
Pubblicazione: (2024)
di: Lee, Yebin, et al.
Pubblicazione: (2024)
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
di: Kim, Si-Woo, et al.
Pubblicazione: (2025)
di: Kim, Si-Woo, et al.
Pubblicazione: (2025)
EXPERT: An Explainable Image Captioning Evaluation Metric with Structured Explanations
di: Kim, Hyunjong, et al.
Pubblicazione: (2025)
di: Kim, Hyunjong, et al.
Pubblicazione: (2025)
Transfer Learning from ImageNet for MEG-Based Decoding of Imagined Speech
di: Jhilal, Soufiane, et al.
Pubblicazione: (2026)
di: Jhilal, Soufiane, et al.
Pubblicazione: (2026)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
MAMI: Multi-Attentional Mutual-Information for Long Sequence Neuron Captioning
di: Fauzulhaq, Alfirsa Damasyifa, et al.
Pubblicazione: (2024)
di: Fauzulhaq, Alfirsa Damasyifa, et al.
Pubblicazione: (2024)
Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives
di: Sarto, Sara, et al.
Pubblicazione: (2025)
di: Sarto, Sara, et al.
Pubblicazione: (2025)
DENEB: A Hallucination-Robust Automatic Evaluation Metric for Image Captioning
di: Matsuda, Kazuki, et al.
Pubblicazione: (2024)
di: Matsuda, Kazuki, et al.
Pubblicazione: (2024)
From Pixels to Posts: Retrieval-Augmented Fashion Captioning and Hashtag Generation
di: Gondal, Moazzam Umer, et al.
Pubblicazione: (2025)
di: Gondal, Moazzam Umer, et al.
Pubblicazione: (2025)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
di: Du, Yang, et al.
Pubblicazione: (2025)
di: Du, Yang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Hybrid Deep Learning for Hyperspectral Single Image Super-Resolution
di: Muhammad, Usman, et al.
Pubblicazione: (2025) -
OSCaR: Object State Captioning and State Change Representation
di: Nguyen, Nguyen, et al.
Pubblicazione: (2024) -
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
di: Yu, Shoubin, et al.
Pubblicazione: (2026) -
Figuring out Figures: Using Textual References to Caption Scientific Figures
di: Cao, Stanley, et al.
Pubblicazione: (2024) -
Hierarchical Dual-Change Collaborative Learning for UAV Scene Change Captioning
di: Chen, Fuhai, et al.
Pubblicazione: (2026)