Image-Text Relation Prediction for Multilingual Tweets
Fuente:
arXiv
Salvato in:
| Autori principali: | Rikters, Matīss, Marrese-Taylor, Edison |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Annotations for Exploring Food Tweets From Multiple Aspects
di: Rikters, Matīss, et al.
Pubblicazione: (2024)
di: Rikters, Matīss, et al.
Pubblicazione: (2024)
ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations
di: Jiang, Bowen, et al.
Pubblicazione: (2025)
di: Jiang, Bowen, et al.
Pubblicazione: (2025)
Translation-Enhanced Multilingual Text-to-Image Generation
di: Li, Yaoyiran, et al.
Pubblicazione: (2023)
di: Li, Yaoyiran, et al.
Pubblicazione: (2023)
Text Change Detection in Multilingual Documents Using Image Comparison
di: Park, Doyoung, et al.
Pubblicazione: (2024)
di: Park, Doyoung, et al.
Pubblicazione: (2024)
Multimodal Foundation Models Exploit Text to Make Medical Image Predictions
di: Buckley, Thomas, et al.
Pubblicazione: (2023)
di: Buckley, Thomas, et al.
Pubblicazione: (2023)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
Text-guided Image Restoration and Semantic Enhancement for Text-to-Image Person Retrieval
di: Liu, Delong, et al.
Pubblicazione: (2023)
di: Liu, Delong, et al.
Pubblicazione: (2023)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
di: Yamabe, Shojiro, et al.
Pubblicazione: (2025)
di: Yamabe, Shojiro, et al.
Pubblicazione: (2025)
Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning
di: Cao, Min, et al.
Pubblicazione: (2025)
di: Cao, Min, et al.
Pubblicazione: (2025)
Text-only Synthesis for Image Captioning
di: Zhou, Qing, et al.
Pubblicazione: (2024)
di: Zhou, Qing, et al.
Pubblicazione: (2024)
Teaching Text-to-Image Models to Communicate in Dialog
di: Sun, Xiaowen, et al.
Pubblicazione: (2023)
di: Sun, Xiaowen, et al.
Pubblicazione: (2023)
MULTI: Multimodal Understanding Leaderboard with Text and Images
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
Holistic Evaluation for Interleaved Text-and-Image Generation
di: Liu, Minqian, et al.
Pubblicazione: (2024)
di: Liu, Minqian, et al.
Pubblicazione: (2024)
MATE: Meet At The Embedding -- Connecting Images with Long Texts
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
di: Chen, Wenting, et al.
Pubblicazione: (2023)
di: Chen, Wenting, et al.
Pubblicazione: (2023)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
Multi-Modal Language Models as Text-to-Image Model Evaluators
di: Chen, Jiahui, et al.
Pubblicazione: (2025)
di: Chen, Jiahui, et al.
Pubblicazione: (2025)
MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing
di: Cheng, Liwei, et al.
Pubblicazione: (2026)
di: Cheng, Liwei, et al.
Pubblicazione: (2026)
TempViz: On the Evaluation of Temporal Knowledge in Text-to-Image Models
di: Holtermann, Carolin, et al.
Pubblicazione: (2026)
di: Holtermann, Carolin, et al.
Pubblicazione: (2026)
ComCLIP: Training-Free Compositional Image and Text Matching
di: Jiang, Kenan, et al.
Pubblicazione: (2022)
di: Jiang, Kenan, et al.
Pubblicazione: (2022)
Medical Image Synthesis via Fine-Grained Image-Text Alignment and Anatomy-Pathology Prompting
di: Chen, Wenting, et al.
Pubblicazione: (2024)
di: Chen, Wenting, et al.
Pubblicazione: (2024)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
di: Zhang, Leixin, et al.
Pubblicazione: (2024)
di: Zhang, Leixin, et al.
Pubblicazione: (2024)
RusCode: Russian Cultural Code Benchmark for Text-to-Image Generation
di: Vasilev, Viacheslav, et al.
Pubblicazione: (2025)
di: Vasilev, Viacheslav, et al.
Pubblicazione: (2025)
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
di: Kou, Siqi, et al.
Pubblicazione: (2024)
di: Kou, Siqi, et al.
Pubblicazione: (2024)
Image-Text Out-Of-Context Detection Using Synthetic Multimodal Misinformation
di: Shalabi, Fatma, et al.
Pubblicazione: (2024)
di: Shalabi, Fatma, et al.
Pubblicazione: (2024)
Strategic Insights in Human and Large Language Model Tactics at Word Guessing Games
di: Rikters, Matīss, et al.
Pubblicazione: (2024)
di: Rikters, Matīss, et al.
Pubblicazione: (2024)
Unconstrained Open Vocabulary Image Classification: Zero-Shot Transfer from Text to Image via CLIP Inversion
di: Allgeuer, Philipp, et al.
Pubblicazione: (2024)
di: Allgeuer, Philipp, et al.
Pubblicazione: (2024)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
di: Feng, Weixi, et al.
Pubblicazione: (2024)
di: Feng, Weixi, et al.
Pubblicazione: (2024)
Mitigating Multilingual Hallucination in Large Vision-Language Models
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
StarVector: Generating Scalable Vector Graphics Code from Images and Text
di: Rodriguez, Juan A., et al.
Pubblicazione: (2023)
di: Rodriguez, Juan A., et al.
Pubblicazione: (2023)
PQPP: A Joint Benchmark for Text-to-Image Prompt and Query Performance Prediction
di: Poesina, Eduard, et al.
Pubblicazione: (2024)
di: Poesina, Eduard, et al.
Pubblicazione: (2024)
CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics
di: Nayak, Shravan, et al.
Pubblicazione: (2025)
di: Nayak, Shravan, et al.
Pubblicazione: (2025)
Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education
di: Wang, Junling, et al.
Pubblicazione: (2026)
di: Wang, Junling, et al.
Pubblicazione: (2026)
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
di: Li, Zhang, et al.
Pubblicazione: (2023)
di: Li, Zhang, et al.
Pubblicazione: (2023)
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
di: Fu, Xingyu, et al.
Pubblicazione: (2024)
di: Fu, Xingyu, et al.
Pubblicazione: (2024)
ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation
di: Chern, Ethan, et al.
Pubblicazione: (2024)
di: Chern, Ethan, et al.
Pubblicazione: (2024)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
di: Li, Xiujun, et al.
Pubblicazione: (2023)
di: Li, Xiujun, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Annotations for Exploring Food Tweets From Multiple Aspects
di: Rikters, Matīss, et al.
Pubblicazione: (2024) -
ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations
di: Jiang, Bowen, et al.
Pubblicazione: (2025) -
Translation-Enhanced Multilingual Text-to-Image Generation
di: Li, Yaoyiran, et al.
Pubblicazione: (2023) -
Text Change Detection in Multilingual Documents Using Image Comparison
di: Park, Doyoung, et al.
Pubblicazione: (2024) -
Multimodal Foundation Models Exploit Text to Make Medical Image Predictions
di: Buckley, Thomas, et al.
Pubblicazione: (2023)