Enhancing Scientific Figure Captioning Through Cross-modal Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Rojas, Mateo Alejandro, Carranza, Rafael |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change Captioning
di: Tu, Yunbin, et al.
Pubblicazione: (2024)
di: Tu, Yunbin, et al.
Pubblicazione: (2024)
Figuring out Figures: Using Textual References to Caption Scientific Figures
di: Cao, Stanley, et al.
Pubblicazione: (2024)
di: Cao, Stanley, et al.
Pubblicazione: (2024)
The Solution for the ICCV 2023 1st Scientific Figure Captioning Challenge
di: Chao, Dian, et al.
Pubblicazione: (2024)
di: Chao, Dian, et al.
Pubblicazione: (2024)
Personalized Scientific Figure Caption Generation: An Empirical Study on Author-Specific Writing Style Transfer
di: Kim, Jaeyoung, et al.
Pubblicazione: (2025)
di: Kim, Jaeyoung, et al.
Pubblicazione: (2025)
SCA3D: Enhancing Cross-modal 3D Retrieval via 3D Shape and Caption Paired Data Augmentation
di: Ren, Junlong, et al.
Pubblicazione: (2025)
di: Ren, Junlong, et al.
Pubblicazione: (2025)
FigEx2: Visual-Conditioned Panel Detection and Captioning for Scientific Compound Figures
di: Song, Jifeng, et al.
Pubblicazione: (2026)
di: Song, Jifeng, et al.
Pubblicazione: (2026)
Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
di: Kapuriya, Janak, et al.
Pubblicazione: (2025)
di: Kapuriya, Janak, et al.
Pubblicazione: (2025)
Stacked Cross-modal Feature Consolidation Attention Networks for Image Captioning
di: Pourkeshavarz, Mozhgan, et al.
Pubblicazione: (2023)
di: Pourkeshavarz, Mozhgan, et al.
Pubblicazione: (2023)
Enhanced Cross-modal 3D Retrieval via Tri-modal Reconstruction
di: Ren, Junlong, et al.
Pubblicazione: (2025)
di: Ren, Junlong, et al.
Pubblicazione: (2025)
Five Years of SciCap: What We Learned and Future Directions for Scientific Figure Captioning
di: Huang, Ting-Hao 'Kenneth', et al.
Pubblicazione: (2025)
di: Huang, Ting-Hao 'Kenneth', et al.
Pubblicazione: (2025)
CREST: Cross-modal Resonance through Evidential Deep Learning for Enhanced Zero-Shot Learning
di: Huang, Haojian, et al.
Pubblicazione: (2024)
di: Huang, Haojian, et al.
Pubblicazione: (2024)
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
di: Liu, Yanqing, et al.
Pubblicazione: (2024)
di: Liu, Yanqing, et al.
Pubblicazione: (2024)
Multi-LLM Collaborative Caption Generation in Scientific Documents
di: Kim, Jaeyoung, et al.
Pubblicazione: (2025)
di: Kim, Jaeyoung, et al.
Pubblicazione: (2025)
Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SciCap Challenge 2023
di: Hsu, Ting-Yao E., et al.
Pubblicazione: (2025)
di: Hsu, Ting-Yao E., et al.
Pubblicazione: (2025)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2024)
di: Wang, Yabing, et al.
Pubblicazione: (2024)
T2ICount: Enhancing Cross-modal Understanding for Zero-Shot Counting
di: Qian, Yifei, et al.
Pubblicazione: (2025)
di: Qian, Yifei, et al.
Pubblicazione: (2025)
SCPNet: Unsupervised Cross-modal Homography Estimation via Intra-modal Self-supervised Learning
di: Zhang, Runmin, et al.
Pubblicazione: (2024)
di: Zhang, Runmin, et al.
Pubblicazione: (2024)
AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning
di: Ren, Yiming, et al.
Pubblicazione: (2025)
di: Ren, Yiming, et al.
Pubblicazione: (2025)
SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
di: Zhang, Lin, et al.
Pubblicazione: (2025)
di: Zhang, Lin, et al.
Pubblicazione: (2025)
Multi-modal Generation via Cross-Modal In-Context Learning
di: Kumar, Amandeep, et al.
Pubblicazione: (2024)
di: Kumar, Amandeep, et al.
Pubblicazione: (2024)
Learning Robust Anymodal Segmentor with Unimodal and Cross-modal Distillation
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
di: Zheng, Hao, et al.
Pubblicazione: (2025)
di: Zheng, Hao, et al.
Pubblicazione: (2025)
Aesthetic Image Captioning with Saliency Enhanced MLLMs
di: Tao, Yilin, et al.
Pubblicazione: (2025)
di: Tao, Yilin, et al.
Pubblicazione: (2025)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
di: Huang, Junming, et al.
Pubblicazione: (2026)
di: Huang, Junming, et al.
Pubblicazione: (2026)
Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition
di: He, Wen-Jue, et al.
Pubblicazione: (2025)
di: He, Wen-Jue, et al.
Pubblicazione: (2025)
CrossVideo: Self-supervised Cross-modal Contrastive Learning for Point Cloud Video Understanding
di: Liu, Yunze, et al.
Pubblicazione: (2024)
di: Liu, Yunze, et al.
Pubblicazione: (2024)
Test-time Distribution Learning Adapter for Cross-modal Visual Reasoning
di: Zhang, Yi, et al.
Pubblicazione: (2024)
di: Zhang, Yi, et al.
Pubblicazione: (2024)
LaMP-Cap: Personalized Figure Caption Generation With Multimodal Figure Profiles
di: Ng, Ho Yin 'Sam', et al.
Pubblicazione: (2025)
di: Ng, Ho Yin 'Sam', et al.
Pubblicazione: (2025)
Deep Reversible Consistency Learning for Cross-modal Retrieval
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
Cross-modal learning for plankton recognition
di: Kareinen, Joona, et al.
Pubblicazione: (2026)
di: Kareinen, Joona, et al.
Pubblicazione: (2026)
Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
Caption-Matching: A Multimodal Approach for Cross-Domain Image Retrieval
di: Iijima, Lucas, et al.
Pubblicazione: (2024)
di: Iijima, Lucas, et al.
Pubblicazione: (2024)
BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature
di: Lozano, Alejandro, et al.
Pubblicazione: (2025)
di: Lozano, Alejandro, et al.
Pubblicazione: (2025)
Learnable Cross-modal Knowledge Distillation for Multi-modal Learning with Missing Modality
di: Wang, Hu, et al.
Pubblicazione: (2023)
di: Wang, Hu, et al.
Pubblicazione: (2023)
CRKD: Enhanced Camera-Radar Object Detection with Cross-modality Knowledge Distillation
di: Zhao, Lingjun, et al.
Pubblicazione: (2024)
di: Zhao, Lingjun, et al.
Pubblicazione: (2024)
Attention-Enhanced Cross-modal Localization Between 360 Images and Point Clouds
di: Zhao, Zhipeng, et al.
Pubblicazione: (2022)
di: Zhao, Zhipeng, et al.
Pubblicazione: (2022)
Do You Remember? Dense Video Captioning with Cross-Modal Memory Retrieval
di: Kim, Minkuk, et al.
Pubblicazione: (2024)
di: Kim, Minkuk, et al.
Pubblicazione: (2024)
CrossWeaver: Cross-modal Weaving for Arbitrary-Modality Semantic Segmentation
di: Zhang, Zelin, et al.
Pubblicazione: (2026)
di: Zhang, Zelin, et al.
Pubblicazione: (2026)
SciFIBench: Benchmarking Large Multimodal Models for Scientific Figure Interpretation
di: Roberts, Jonathan, et al.
Pubblicazione: (2024)
di: Roberts, Jonathan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change Captioning
di: Tu, Yunbin, et al.
Pubblicazione: (2024) -
Figuring out Figures: Using Textual References to Caption Scientific Figures
di: Cao, Stanley, et al.
Pubblicazione: (2024) -
The Solution for the ICCV 2023 1st Scientific Figure Captioning Challenge
di: Chao, Dian, et al.
Pubblicazione: (2024) -
Personalized Scientific Figure Caption Generation: An Empirical Study on Author-Specific Writing Style Transfer
di: Kim, Jaeyoung, et al.
Pubblicazione: (2025) -
SCA3D: Enhancing Cross-modal 3D Retrieval via 3D Shape and Caption Paired Data Augmentation
di: Ren, Junlong, et al.
Pubblicazione: (2025)