SciGA: A Comprehensive Dataset for Designing Graphical Abstracts in Academic Papers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kawada, Takuro, Kitada, Shunsuke, Nemoto, Sota, Iyatomi, Hitoshi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Majority or Minority: Data Imbalance Learning Method for Named Entity Recognition
par: Nemoto, Sota, et autres
Publié: (2024)
par: Nemoto, Sota, et autres
Publié: (2024)
TAUE: Training-free Noise Transplant and Cultivation Diffusion Model
par: Nagai, Daichi, et autres
Publié: (2025)
par: Nagai, Daichi, et autres
Publié: (2025)
Improving Prediction Performance and Model Interpretability through Attention Mechanisms from Basic and Applied Research Perspectives
par: Kitada, Shunsuke
Publié: (2023)
par: Kitada, Shunsuke
Publié: (2023)
A11y-Compressor: A Framework for Enhancing the Efficiency of GUI Agent Observations through Visual Context Reconstruction and Redundancy Reduction
par: Takeshita, Michito, et autres
Publié: (2026)
par: Takeshita, Michito, et autres
Publié: (2026)
DDD: Discriminative Difficulty Distance for plant disease diagnosis
par: Arima, Yuji, et autres
Publié: (2025)
par: Arima, Yuji, et autres
Publié: (2025)
Few-shot Metric Domain Adaptation: Practical Learning Strategies for an Automated Plant Disease Diagnosis
par: Kudo, Shoma, et autres
Publié: (2024)
par: Kudo, Shoma, et autres
Publié: (2024)
EnsemHalDet: Robust VLM Hallucination Detection via Ensemble of Internal State Detectors
par: Miyazato, Ryuhei, et autres
Publié: (2026)
par: Miyazato, Ryuhei, et autres
Publié: (2026)
iCBIR-Sli: Interpretable Content-Based Image Retrieval with 2D Slice Embeddings
par: Tomoshige, Shuhei, et autres
Publié: (2025)
par: Tomoshige, Shuhei, et autres
Publié: (2025)
Domain-invariant feature learning in brain MR imaging for content-based image retrieval
par: Tobari, Shuya, et autres
Publié: (2025)
par: Tobari, Shuya, et autres
Publié: (2025)
Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks
par: Deganutti, Adrienne, et autres
Publié: (2026)
par: Deganutti, Adrienne, et autres
Publié: (2026)
Layout-Corrector: Alleviating Layout Sticking Phenomenon in Discrete Diffusion Model
par: Iwai, Shoma, et autres
Publié: (2024)
par: Iwai, Shoma, et autres
Publié: (2024)
General Transform: A Unified Framework for Adaptive Transform to Enhance Representations
par: Budiutama, Gekko, et autres
Publié: (2025)
par: Budiutama, Gekko, et autres
Publié: (2025)
DreamLLM: Synergistic Multimodal Comprehension and Creation
par: Dong, Runpei, et autres
Publié: (2023)
par: Dong, Runpei, et autres
Publié: (2023)
BloomVQA: Assessing Hierarchical Multi-modal Comprehension
par: Gong, Yunye, et autres
Publié: (2023)
par: Gong, Yunye, et autres
Publié: (2023)
Can Large Language Models Understand Symbolic Graphics Programs?
par: Qiu, Zeju, et autres
Publié: (2024)
par: Qiu, Zeju, et autres
Publié: (2024)
A Framework For Refining Text Classification and Object Recognition from Academic Articles
par: Li, Jinghong, et autres
Publié: (2023)
par: Li, Jinghong, et autres
Publié: (2023)
Improving Resnet-9 Generalization Trained on Small Datasets
par: Awad, Omar Mohamed, et autres
Publié: (2023)
par: Awad, Omar Mohamed, et autres
Publié: (2023)
Harlequin: Color-driven Generation of Synthetic Data for Referring Expression Comprehension
par: Parolari, Luca, et autres
Publié: (2024)
par: Parolari, Luca, et autres
Publié: (2024)
A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
par: Xiu, Lixin, et autres
Publié: (2026)
par: Xiu, Lixin, et autres
Publié: (2026)
The Solution for the 5th GCAIAC Zero-shot Referring Expression Comprehension Challenge
par: Huang, Longfei, et autres
Publié: (2024)
par: Huang, Longfei, et autres
Publié: (2024)
CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness
par: Liu, Zhihang, et autres
Publié: (2025)
par: Liu, Zhihang, et autres
Publié: (2025)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
Rethinking Comprehensive Benchmark for Chart Understanding: A Perspective from Scientific Literature
par: Shen, Lingdong, et autres
Publié: (2024)
par: Shen, Lingdong, et autres
Publié: (2024)
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
Omnimodal Dataset Distillation via High-order Proxy Alignment
par: Gao, Yuxuan, et autres
Publié: (2026)
par: Gao, Yuxuan, et autres
Publié: (2026)
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies
par: Pathak, Surendra, et autres
Publié: (2026)
par: Pathak, Surendra, et autres
Publié: (2026)
From Pixels to Prose: A Large Dataset of Dense Image Captions
par: Singla, Vasu, et autres
Publié: (2024)
par: Singla, Vasu, et autres
Publié: (2024)
One Category One Prompt: Dataset Distillation using Diffusion Models
par: Abbasi, Ali, et autres
Publié: (2024)
par: Abbasi, Ali, et autres
Publié: (2024)
Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional
par: Madaan, Divyam, et autres
Publié: (2025)
par: Madaan, Divyam, et autres
Publié: (2025)
Neural Style Transfer for Synthesising a Dataset of Ancient Egyptian Hieroglyphs
par: Creed, Lewis Matheson
Publié: (2025)
par: Creed, Lewis Matheson
Publié: (2025)
RealKIE: Five Novel Datasets for Enterprise Key Information Extraction
par: Townsend, Benjamin, et autres
Publié: (2024)
par: Townsend, Benjamin, et autres
Publié: (2024)
Robust Plant Disease Diagnosis with Few Target-Domain Samples
par: Nogami, Takafumi, et autres
Publié: (2025)
par: Nogami, Takafumi, et autres
Publié: (2025)
WLASL-LEX: a Dataset for Recognising Phonological Properties in American Sign Language
par: Tavella, Federico, et autres
Publié: (2022)
par: Tavella, Federico, et autres
Publié: (2022)
Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models
par: Zheng, Kening, et autres
Publié: (2024)
par: Zheng, Kening, et autres
Publié: (2024)
Brazilian Portuguese Image Captioning with Transformers: A Study on Cross-Native-Translated Dataset
par: Bromonschenkel, Gabriel, et autres
Publié: (2026)
par: Bromonschenkel, Gabriel, et autres
Publié: (2026)
E-TSL: A Continuous Educational Turkish Sign Language Dataset with Baseline Methods
par: Öztürk, Şükrü, et autres
Publié: (2024)
par: Öztürk, Şükrü, et autres
Publié: (2024)
Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme
par: Ma, Yan, et autres
Publié: (2025)
par: Ma, Yan, et autres
Publié: (2025)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
par: Wang, Zekun, et autres
Publié: (2025)
par: Wang, Zekun, et autres
Publié: (2025)
Documents similaires
-
Majority or Minority: Data Imbalance Learning Method for Named Entity Recognition
par: Nemoto, Sota, et autres
Publié: (2024) -
TAUE: Training-free Noise Transplant and Cultivation Diffusion Model
par: Nagai, Daichi, et autres
Publié: (2025) -
Improving Prediction Performance and Model Interpretability through Attention Mechanisms from Basic and Applied Research Perspectives
par: Kitada, Shunsuke
Publié: (2023) -
A11y-Compressor: A Framework for Enhancing the Efficiency of GUI Agent Observations through Visual Context Reconstruction and Redundancy Reduction
par: Takeshita, Michito, et autres
Publié: (2026) -
DDD: Discriminative Difficulty Distance for plant disease diagnosis
par: Arima, Yuji, et autres
Publié: (2025)