FigEx2: Visual-Conditioned Panel Detection and Captioning for Scientific Compound Figures
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Jifeng, Das, Arun, Wang, Pan, Ji, Hui, Zhao, Kun, Huang, Yufei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Figuring out Figures: Using Textual References to Caption Scientific Figures
par: Cao, Stanley, et autres
Publié: (2024)
par: Cao, Stanley, et autres
Publié: (2024)
FigCaps-HF: A Figure-to-Caption Generative Framework and Benchmark with Human Feedback
par: Singh, Ashish, et autres
Publié: (2023)
par: Singh, Ashish, et autres
Publié: (2023)
Personalized Scientific Figure Caption Generation: An Empirical Study on Author-Specific Writing Style Transfer
par: Kim, Jaeyoung, et autres
Publié: (2025)
par: Kim, Jaeyoung, et autres
Publié: (2025)
From Image Captioning to Visual Storytelling
par: Passadakis, Admitos, et autres
Publié: (2025)
par: Passadakis, Admitos, et autres
Publié: (2025)
Multi-LLM Collaborative Caption Generation in Scientific Documents
par: Kim, Jaeyoung, et autres
Publié: (2025)
par: Kim, Jaeyoung, et autres
Publié: (2025)
Five Years of SciCap: What We Learned and Future Directions for Scientific Figure Captioning
par: Huang, Ting-Hao 'Kenneth', et autres
Publié: (2025)
par: Huang, Ting-Hao 'Kenneth', et autres
Publié: (2025)
Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SciCap Challenge 2023
par: Hsu, Ting-Yao E., et autres
Publié: (2025)
par: Hsu, Ting-Yao E., et autres
Publié: (2025)
LaMP-Cap: Personalized Figure Caption Generation With Multimodal Figure Profiles
par: Ng, Ho Yin 'Sam', et autres
Publié: (2025)
par: Ng, Ho Yin 'Sam', et autres
Publié: (2025)
BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature
par: Lozano, Alejandro, et autres
Publié: (2025)
par: Lozano, Alejandro, et autres
Publié: (2025)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
par: Du, Yifan, et autres
Publié: (2023)
par: Du, Yifan, et autres
Publié: (2023)
VIXEN: Visual Text Comparison Network for Image Difference Captioning
par: Black, Alexander, et autres
Publié: (2024)
par: Black, Alexander, et autres
Publié: (2024)
Visual Lifelog Retrieval through Captioning-Enhanced Interpretation
par: Shih, Yu-Fei, et autres
Publié: (2025)
par: Shih, Yu-Fei, et autres
Publié: (2025)
See or Guess: Counterfactually Regularized Image Captioning
par: Cao, Qian, et autres
Publié: (2024)
par: Cao, Qian, et autres
Publié: (2024)
OmniCaptioner: One Captioner to Rule Them All
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
SciFigDetect: A Benchmark for AI-Generated Scientific Figure Detection
par: Hu, You, et autres
Publié: (2026)
par: Hu, You, et autres
Publié: (2026)
Discovering Meaningful Units with Visually Grounded Semantics from Image Captions
par: Behjati, Melika, et autres
Publié: (2025)
par: Behjati, Melika, et autres
Publié: (2025)
Transformer based Multitask Learning for Image Captioning and Object Detection
par: Basak, Debolena, et autres
Publié: (2024)
par: Basak, Debolena, et autres
Publié: (2024)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
par: Liu, Zikang, et autres
Publié: (2025)
par: Liu, Zikang, et autres
Publié: (2025)
Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning
par: Tu, Yunbin, et autres
Publié: (2024)
par: Tu, Yunbin, et autres
Publié: (2024)
Multimodal Arabic Captioning with Interpretable Visual Concept Integration
par: Elchafei, Passant, et autres
Publié: (2025)
par: Elchafei, Passant, et autres
Publié: (2025)
Exploring the Design Space of Visual Context Representation in Video MLLMs
par: Du, Yifan, et autres
Publié: (2024)
par: Du, Yifan, et autres
Publié: (2024)
Image Captioning via Compact Bidirectional Architecture
par: Song, Zijie, et autres
Publié: (2022)
par: Song, Zijie, et autres
Publié: (2022)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
par: Jin, Yang, et autres
Publié: (2024)
par: Jin, Yang, et autres
Publié: (2024)
Less is More: High-value Data Selection for Visual Instruction Tuning
par: Liu, Zikang, et autres
Publié: (2024)
par: Liu, Zikang, et autres
Publié: (2024)
DeTikZify: Synthesizing Graphics Programs for Scientific Figures and Sketches with TikZ
par: Belouadi, Jonas, et autres
Publié: (2024)
par: Belouadi, Jonas, et autres
Publié: (2024)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
par: Ma, Ziyu, et autres
Publié: (2024)
par: Ma, Ziyu, et autres
Publié: (2024)
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
par: Tang, Changli, et autres
Publié: (2025)
par: Tang, Changli, et autres
Publié: (2025)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
par: Lu, Xingyu, et autres
Publié: (2026)
par: Lu, Xingyu, et autres
Publié: (2026)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
par: Chaffin, Antoine, et autres
Publié: (2024)
par: Chaffin, Antoine, et autres
Publié: (2024)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
par: Byun, Sanghyun, et autres
Publié: (2025)
par: Byun, Sanghyun, et autres
Publié: (2025)
FigSIM: A Dataset for Fine-grained Suicide Severity and Figurative Language in Suicide Memes
par: Chen, Liuliu, et autres
Publié: (2026)
par: Chen, Liuliu, et autres
Publié: (2026)
Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
par: Zhao, Haozhe, et autres
Publié: (2026)
par: Zhao, Haozhe, et autres
Publié: (2026)
Text-only Synthesis for Image Captioning
par: Zhou, Qing, et autres
Publié: (2024)
par: Zhou, Qing, et autres
Publié: (2024)
Enhancing Scientific Figure Captioning Through Cross-modal Learning
par: Rojas, Mateo Alejandro, et autres
Publié: (2024)
par: Rojas, Mateo Alejandro, et autres
Publié: (2024)
CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness
par: Liu, Zhihang, et autres
Publié: (2025)
par: Liu, Zhihang, et autres
Publié: (2025)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
par: Yanuka, Moran, et autres
Publié: (2024)
par: Yanuka, Moran, et autres
Publié: (2024)
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
par: Cheng, Kanzhi, et autres
Publié: (2025)
par: Cheng, Kanzhi, et autres
Publié: (2025)
The Solution for the ICCV 2023 1st Scientific Figure Captioning Challenge
par: Chao, Dian, et autres
Publié: (2024)
par: Chao, Dian, et autres
Publié: (2024)
Documents similaires
-
Figuring out Figures: Using Textual References to Caption Scientific Figures
par: Cao, Stanley, et autres
Publié: (2024) -
FigCaps-HF: A Figure-to-Caption Generative Framework and Benchmark with Human Feedback
par: Singh, Ashish, et autres
Publié: (2023) -
Personalized Scientific Figure Caption Generation: An Empirical Study on Author-Specific Writing Style Transfer
par: Kim, Jaeyoung, et autres
Publié: (2025) -
From Image Captioning to Visual Storytelling
par: Passadakis, Admitos, et autres
Publié: (2025) -
Multi-LLM Collaborative Caption Generation in Scientific Documents
par: Kim, Jaeyoung, et autres
Publié: (2025)