MMCIG: Multimodal Cover Image Generation for Text-only Documents and Its Dataset Construction via Pseudo-labeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Hyeyeon, Han, Sungwoo, Kwon, Jingun, Kamigaito, Hidetaka, Okumura, Manabu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CodeNER: Code Prompting for Named Entity Recognition
par: Han, Sungwoo, et autres
Publié: (2025)
par: Han, Sungwoo, et autres
Publié: (2025)
TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
par: Ozaki, Shintaro, et autres
Publié: (2025)
par: Ozaki, Shintaro, et autres
Publié: (2025)
InstructCMP: Length Control in Sentence Compression through Instruction-based Large Language Models
par: Juseon-Do, et autres
Publié: (2024)
par: Juseon-Do, et autres
Publié: (2024)
Length Representations in Large Language Models
par: Moon, Sangjun, et autres
Publié: (2025)
par: Moon, Sangjun, et autres
Publié: (2025)
Considering Length Diversity in Retrieval-Augmented Summarization
par: Juseon-Do, et autres
Publié: (2025)
par: Juseon-Do, et autres
Publié: (2025)
Diversity of Transformer Layers: One Aspect of Parameter Scaling Laws
par: Kamigaito, Hidetaka, et autres
Publié: (2025)
par: Kamigaito, Hidetaka, et autres
Publié: (2025)
Enhancing Factuality through Consensus and Consistency in Summarization Using Minimum Bayes Risk Decoding
par: Soetedjo, Riza Setiawan, et autres
Publié: (2026)
par: Soetedjo, Riza Setiawan, et autres
Publié: (2026)
AdParaphrase: Paraphrase Dataset for Analyzing Linguistic Features toward Generating Attractive Ad Texts
par: Murakami, Soichiro, et autres
Publié: (2025)
par: Murakami, Soichiro, et autres
Publié: (2025)
AdParaphrase v2.0: Generating Attractive Ad Texts Using a Preference-Annotated Paraphrase Dataset
par: Murakami, Soichiro, et autres
Publié: (2025)
par: Murakami, Soichiro, et autres
Publié: (2025)
Oogiri-Master: Benchmarking Humor Understanding via Oogiri
par: Murakami, Soichiro, et autres
Publié: (2025)
par: Murakami, Soichiro, et autres
Publié: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
par: Atuhurra, Jesse, et autres
Publié: (2024)
par: Atuhurra, Jesse, et autres
Publié: (2024)
Can we obtain significant success in RST discourse parsing by using Large Language Models?
par: Maekawa, Aru, et autres
Publié: (2024)
par: Maekawa, Aru, et autres
Publié: (2024)
Who Laughs with Whom? Disentangling Influential Factors in Humor Preferences across User Clusters and LLMs
par: Murakami, Soichiro, et autres
Publié: (2026)
par: Murakami, Soichiro, et autres
Publié: (2026)
Unveiling the Power of Source: Source-based Minimum Bayes Risk Decoding for Neural Machine Translation
par: Lyu, Boxuan, et autres
Publié: (2024)
par: Lyu, Boxuan, et autres
Publié: (2024)
J-ORA: A Framework and Multimodal Dataset for Japanese Object Identification, Reference, Action Prediction in Robot Perception
par: Atuhurra, Jesse, et autres
Publié: (2025)
par: Atuhurra, Jesse, et autres
Publié: (2025)
Towards Temporal Change Explanations from Bi-Temporal Satellite Images
par: Tsujimoto, Ryo, et autres
Publié: (2024)
par: Tsujimoto, Ryo, et autres
Publié: (2024)
Revealing Trends in Datasets from the 2022 ACL and EMNLP Conferences
par: Atuhurra, Jesse, et autres
Publié: (2024)
par: Atuhurra, Jesse, et autres
Publié: (2024)
Multi-Frame Vision-Language Model for Long-form Reasoning in Driver Behavior Analysis
par: Takato, Hiroshi, et autres
Publié: (2024)
par: Takato, Hiroshi, et autres
Publié: (2024)
Can Impressions of Music be Extracted from Thumbnail Images?
par: Harada, Takashi, et autres
Publié: (2025)
par: Harada, Takashi, et autres
Publié: (2025)
RePL: Pseudo-label Refinement for Semi-supervised LiDAR Semantic Segmentation
par: Kwon, Donghyeon, et autres
Publié: (2026)
par: Kwon, Donghyeon, et autres
Publié: (2026)
How Panel Layouts Define Manga: Insights from Visual Ablation Experiments
par: Feng, Siyuan, et autres
Publié: (2024)
par: Feng, Siyuan, et autres
Publié: (2024)
Towards Artwork Explanation in Large-scale Vision Language Models
par: Hayashi, Kazuki, et autres
Publié: (2024)
par: Hayashi, Kazuki, et autres
Publié: (2024)
Learning from Noisy Pseudo-labels for All-Weather Land Cover Mapping
par: Liu, Wang, et autres
Publié: (2025)
par: Liu, Wang, et autres
Publié: (2025)
Do LLMs Implicitly Determine the Suitable Text Difficulty for Users?
par: Gobara, Seiji, et autres
Publié: (2024)
par: Gobara, Seiji, et autres
Publié: (2024)
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
par: Hayashi, Kazuki, et autres
Publié: (2025)
par: Hayashi, Kazuki, et autres
Publié: (2025)
Pseudo-label Based Domain Adaptation for Zero-Shot Text Steganalysis
par: Luo, Yufei, et autres
Publié: (2024)
par: Luo, Yufei, et autres
Publié: (2024)
mCSQA: Multilingual Commonsense Reasoning Dataset with Unified Creation Strategy by Language Models and Humans
par: Sakai, Yusuke, et autres
Publié: (2024)
par: Sakai, Yusuke, et autres
Publié: (2024)
Multi-label Learning with Random Circular Vectors
par: Nishida, Ken, et autres
Publié: (2024)
par: Nishida, Ken, et autres
Publié: (2024)
NERsocial: Efficient Named Entity Recognition Dataset Construction for Human-Robot Interaction Utilizing RapidNER
par: Atuhurra, Jesse, et autres
Publié: (2024)
par: Atuhurra, Jesse, et autres
Publié: (2024)
VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages
par: Atuhurra, Jesse, et autres
Publié: (2025)
par: Atuhurra, Jesse, et autres
Publié: (2025)
From Formal Language Theory to Statistical Learning: Finite Observability of Subregular Languages
par: Hayashi, Katsuhiko, et autres
Publié: (2025)
par: Hayashi, Katsuhiko, et autres
Publié: (2025)
Toffee: Efficient Million-Scale Dataset Construction for Subject-Driven Text-to-Image Generation
par: Zhou, Yufan, et autres
Publié: (2024)
par: Zhou, Yufan, et autres
Publié: (2024)
Text-only Synthesis for Image Captioning
par: Zhou, Qing, et autres
Publié: (2024)
par: Zhou, Qing, et autres
Publié: (2024)
Improving Pseudo-labelling and Enhancing Robustness for Semi-Supervised Domain Generalization
par: Khan, Adnan, et autres
Publié: (2024)
par: Khan, Adnan, et autres
Publié: (2024)
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
More Reliable Pseudo-labels, Better Performance: A Generalized Approach to Single Positive Multi-label Learning
par: Tran, Luong, et autres
Publié: (2025)
par: Tran, Luong, et autres
Publié: (2025)
Minimum Bayes Risk Decoding for Error Span Detection in Reference-Free Automatic Machine Translation Evaluation
par: Lyu, Boxuan, et autres
Publié: (2025)
par: Lyu, Boxuan, et autres
Publié: (2025)
Weakly-Supervised 3D Scene Graph Generation via Visual-Linguistic Assisted Pseudo-labeling
par: Wang, Xu, et autres
Publié: (2024)
par: Wang, Xu, et autres
Publié: (2024)
DiLM: Distilling Dataset into Language Model for Text-level Dataset Distillation
par: Maekawa, Aru, et autres
Publié: (2024)
par: Maekawa, Aru, et autres
Publié: (2024)
Accurate and Diverse Recommendations via Propensity-Weighted Linear Autoencoders
par: Onishi, Kazuma, et autres
Publié: (2025)
par: Onishi, Kazuma, et autres
Publié: (2025)
Documents similaires
-
CodeNER: Code Prompting for Named Entity Recognition
par: Han, Sungwoo, et autres
Publié: (2025) -
TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
par: Ozaki, Shintaro, et autres
Publié: (2025) -
InstructCMP: Length Control in Sentence Compression through Instruction-based Large Language Models
par: Juseon-Do, et autres
Publié: (2024) -
Length Representations in Large Language Models
par: Moon, Sangjun, et autres
Publié: (2025) -
Considering Length Diversity in Retrieval-Augmented Summarization
par: Juseon-Do, et autres
Publié: (2025)