Image-Text Relation Prediction for Multilingual Tweets
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rikters, Matīss, Marrese-Taylor, Edison |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Annotations for Exploring Food Tweets From Multiple Aspects
par: Rikters, Matīss, et autres
Publié: (2024)
par: Rikters, Matīss, et autres
Publié: (2024)
ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations
par: Jiang, Bowen, et autres
Publié: (2025)
par: Jiang, Bowen, et autres
Publié: (2025)
Translation-Enhanced Multilingual Text-to-Image Generation
par: Li, Yaoyiran, et autres
Publié: (2023)
par: Li, Yaoyiran, et autres
Publié: (2023)
Text Change Detection in Multilingual Documents Using Image Comparison
par: Park, Doyoung, et autres
Publié: (2024)
par: Park, Doyoung, et autres
Publié: (2024)
Multimodal Foundation Models Exploit Text to Make Medical Image Predictions
par: Buckley, Thomas, et autres
Publié: (2023)
par: Buckley, Thomas, et autres
Publié: (2023)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
Text-guided Image Restoration and Semantic Enhancement for Text-to-Image Person Retrieval
par: Liu, Delong, et autres
Publié: (2023)
par: Liu, Delong, et autres
Publié: (2023)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
par: Jiang, Dongzhi, et autres
Publié: (2024)
par: Jiang, Dongzhi, et autres
Publié: (2024)
Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
par: Yamabe, Shojiro, et autres
Publié: (2025)
par: Yamabe, Shojiro, et autres
Publié: (2025)
Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning
par: Cao, Min, et autres
Publié: (2025)
par: Cao, Min, et autres
Publié: (2025)
Text-only Synthesis for Image Captioning
par: Zhou, Qing, et autres
Publié: (2024)
par: Zhou, Qing, et autres
Publié: (2024)
Teaching Text-to-Image Models to Communicate in Dialog
par: Sun, Xiaowen, et autres
Publié: (2023)
par: Sun, Xiaowen, et autres
Publié: (2023)
MULTI: Multimodal Understanding Leaderboard with Text and Images
par: Zhu, Zichen, et autres
Publié: (2024)
par: Zhu, Zichen, et autres
Publié: (2024)
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024)
par: Liu, Minqian, et autres
Publié: (2024)
MATE: Meet At The Embedding -- Connecting Images with Long Texts
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
par: Chen, Wenting, et autres
Publié: (2023)
par: Chen, Wenting, et autres
Publié: (2023)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
Multi-Modal Language Models as Text-to-Image Model Evaluators
par: Chen, Jiahui, et autres
Publié: (2025)
par: Chen, Jiahui, et autres
Publié: (2025)
MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing
par: Cheng, Liwei, et autres
Publié: (2026)
par: Cheng, Liwei, et autres
Publié: (2026)
TempViz: On the Evaluation of Temporal Knowledge in Text-to-Image Models
par: Holtermann, Carolin, et autres
Publié: (2026)
par: Holtermann, Carolin, et autres
Publié: (2026)
ComCLIP: Training-Free Compositional Image and Text Matching
par: Jiang, Kenan, et autres
Publié: (2022)
par: Jiang, Kenan, et autres
Publié: (2022)
Medical Image Synthesis via Fine-Grained Image-Text Alignment and Anatomy-Pathology Prompting
par: Chen, Wenting, et autres
Publié: (2024)
par: Chen, Wenting, et autres
Publié: (2024)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
par: Zhang, Leixin, et autres
Publié: (2024)
par: Zhang, Leixin, et autres
Publié: (2024)
RusCode: Russian Cultural Code Benchmark for Text-to-Image Generation
par: Vasilev, Viacheslav, et autres
Publié: (2025)
par: Vasilev, Viacheslav, et autres
Publié: (2025)
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
par: Kou, Siqi, et autres
Publié: (2024)
par: Kou, Siqi, et autres
Publié: (2024)
Image-Text Out-Of-Context Detection Using Synthetic Multimodal Misinformation
par: Shalabi, Fatma, et autres
Publié: (2024)
par: Shalabi, Fatma, et autres
Publié: (2024)
Strategic Insights in Human and Large Language Model Tactics at Word Guessing Games
par: Rikters, Matīss, et autres
Publié: (2024)
par: Rikters, Matīss, et autres
Publié: (2024)
Unconstrained Open Vocabulary Image Classification: Zero-Shot Transfer from Text to Image via CLIP Inversion
par: Allgeuer, Philipp, et autres
Publié: (2024)
par: Allgeuer, Philipp, et autres
Publié: (2024)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
par: Zhang, Junzhe, et autres
Publié: (2025)
par: Zhang, Junzhe, et autres
Publié: (2025)
Mitigating Multilingual Hallucination in Large Vision-Language Models
par: Qu, Xiaoye, et autres
Publié: (2024)
par: Qu, Xiaoye, et autres
Publié: (2024)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
par: Zhou, Chenyu, et autres
Publié: (2024)
par: Zhou, Chenyu, et autres
Publié: (2024)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
par: Feng, Weixi, et autres
Publié: (2024)
par: Feng, Weixi, et autres
Publié: (2024)
StarVector: Generating Scalable Vector Graphics Code from Images and Text
par: Rodriguez, Juan A., et autres
Publié: (2023)
par: Rodriguez, Juan A., et autres
Publié: (2023)
PQPP: A Joint Benchmark for Text-to-Image Prompt and Query Performance Prediction
par: Poesina, Eduard, et autres
Publié: (2024)
par: Poesina, Eduard, et autres
Publié: (2024)
CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics
par: Nayak, Shravan, et autres
Publié: (2025)
par: Nayak, Shravan, et autres
Publié: (2025)
Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education
par: Wang, Junling, et autres
Publié: (2026)
par: Wang, Junling, et autres
Publié: (2026)
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
par: Li, Zhang, et autres
Publié: (2023)
par: Li, Zhang, et autres
Publié: (2023)
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
par: Fu, Xingyu, et autres
Publié: (2024)
par: Fu, Xingyu, et autres
Publié: (2024)
ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation
par: Chern, Ethan, et autres
Publié: (2024)
par: Chern, Ethan, et autres
Publié: (2024)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
par: Li, Xiujun, et autres
Publié: (2023)
par: Li, Xiujun, et autres
Publié: (2023)
Documents similaires
-
Annotations for Exploring Food Tweets From Multiple Aspects
par: Rikters, Matīss, et autres
Publié: (2024) -
ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations
par: Jiang, Bowen, et autres
Publié: (2025) -
Translation-Enhanced Multilingual Text-to-Image Generation
par: Li, Yaoyiran, et autres
Publié: (2023) -
Text Change Detection in Multilingual Documents Using Image Comparison
par: Park, Doyoung, et autres
Publié: (2024) -
Multimodal Foundation Models Exploit Text to Make Medical Image Predictions
par: Buckley, Thomas, et autres
Publié: (2023)