MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Bo, Zhu, Shaolin, Wen, Lijie |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
by: Li, Bo, et al.
Published: (2026)
by: Li, Bo, et al.
Published: (2026)
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
by: Li, Qingyun, et al.
Published: (2024)
by: Li, Qingyun, et al.
Published: (2024)
AnyTrans: Translate AnyText in the Image with Large Scale Models
by: Qian, Zhipeng, et al.
Published: (2024)
by: Qian, Zhipeng, et al.
Published: (2024)
Multi-Sensor Diffusion-Driven Optical Image Translation for Large-Scale Applications
by: Vinholi, João Gabriel, et al.
Published: (2024)
by: Vinholi, João Gabriel, et al.
Published: (2024)
Translation-Enhanced Multilingual Text-to-Image Generation
by: Li, Yaoyiran, et al.
Published: (2023)
by: Li, Yaoyiran, et al.
Published: (2023)
SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation
by: Khalil, Mohammad Amer, et al.
Published: (2026)
by: Khalil, Mohammad Amer, et al.
Published: (2026)
Spatial Transcriptomics as Images for Large-Scale Pretraining
by: Zhu, Yishun, et al.
Published: (2026)
by: Zhu, Yishun, et al.
Published: (2026)
Contrastive Learning Guided Latent Diffusion Model for Image-to-Image Translation
by: Si, Qi, et al.
Published: (2025)
by: Si, Qi, et al.
Published: (2025)
GPIC: A Giant Permissive Image Corpus for Visual Generation
by: Chandrasegaran, Keshigeyan, et al.
Published: (2026)
by: Chandrasegaran, Keshigeyan, et al.
Published: (2026)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
by: Zhou, Lijie
Published: (2026)
by: Zhou, Lijie
Published: (2026)
RL-I2IT: Image-to-Image Translation with Deep Reinforcement Learning
by: Hu, Jing, et al.
Published: (2023)
by: Hu, Jing, et al.
Published: (2023)
Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning
by: Cao, Min, et al.
Published: (2025)
by: Cao, Min, et al.
Published: (2025)
FaceID-6M: A Large-Scale, Open-Source FaceID Customization Dataset
by: Wang, Shuhe, et al.
Published: (2025)
by: Wang, Shuhe, et al.
Published: (2025)
Quantifying the Gaps Between Translation and Native Perception in Training for Multimodal, Multilingual Retrieval
by: Buettner, Kyle, et al.
Published: (2024)
by: Buettner, Kyle, et al.
Published: (2024)
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
by: Anugraha, David, et al.
Published: (2025)
by: Anugraha, David, et al.
Published: (2025)
Progressive Energy-Based Cooperative Learning for Multi-Domain Image-to-Image Translation
by: Song, Weinan, et al.
Published: (2023)
by: Song, Weinan, et al.
Published: (2023)
DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model
by: Wu, Zhanglin, et al.
Published: (2025)
by: Wu, Zhanglin, et al.
Published: (2025)
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
by: Zhuang, Wanru, et al.
Published: (2025)
by: Zhuang, Wanru, et al.
Published: (2025)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
by: You, Liangliang, et al.
Published: (2025)
by: You, Liangliang, et al.
Published: (2025)
Text Guided Image Editing with Automatic Concept Locating and Forgetting
by: Li, Jia, et al.
Published: (2024)
by: Li, Jia, et al.
Published: (2024)
Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
by: Yang, Qishun, et al.
Published: (2026)
by: Yang, Qishun, et al.
Published: (2026)
Fourier Boundary Features Network with Wider Catchers for Glass Segmentation
by: Qin, Xiaolin, et al.
Published: (2024)
by: Qin, Xiaolin, et al.
Published: (2024)
Introducing 3D Representation for Medical Image Volume-to-Volume Translation via Score Fusion
by: Zhu, Xiyue, et al.
Published: (2025)
by: Zhu, Xiyue, et al.
Published: (2025)
Large Sign Language Models: Toward 3D American Sign Language Translation
by: Zhang, Sen, et al.
Published: (2025)
by: Zhang, Sen, et al.
Published: (2025)
Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems
by: Faraz, Ali, et al.
Published: (2026)
by: Faraz, Ali, et al.
Published: (2026)
CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
by: Han, Hongyong, et al.
Published: (2025)
by: Han, Hongyong, et al.
Published: (2025)
mAVE: A Watermark for Joint Audio-Visual Generation Models
by: Si, Luyang, et al.
Published: (2026)
by: Si, Luyang, et al.
Published: (2026)
Stroke-based Cyclic Amplifier: Image Super-Resolution at Arbitrary Ultra-Large Scales
by: Guo, Wenhao, et al.
Published: (2025)
by: Guo, Wenhao, et al.
Published: (2025)
SAMScore: A Content Structural Similarity Metric for Image Translation Evaluation
by: Li, Yunxiang, et al.
Published: (2023)
by: Li, Yunxiang, et al.
Published: (2023)
HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding
by: Lv, Qitan, et al.
Published: (2026)
by: Lv, Qitan, et al.
Published: (2026)
WebUOT-1M: Advancing Deep Underwater Object Tracking with A Million-Scale Benchmark
by: Zhang, Chunhui, et al.
Published: (2024)
by: Zhang, Chunhui, et al.
Published: (2024)
Replace in Translation: Boost Concept Alignment in Counterfactual Text-to-Image
by: Li, Sifan, et al.
Published: (2025)
by: Li, Sifan, et al.
Published: (2025)
OT-ALD: Aligning Latent Distributions with Optimal Transport for Accelerated Image-to-Image Translation
by: Wang, Zhanpeng, et al.
Published: (2025)
by: Wang, Zhanpeng, et al.
Published: (2025)
STAR: A First-Ever Dataset and A Large-Scale Benchmark for Scene Graph Generation in Large-Size Satellite Imagery
by: Li, Yansheng, et al.
Published: (2024)
by: Li, Yansheng, et al.
Published: (2024)
MsaMIL-Net: An End-to-End Multi-Scale Aware Multiple Instance Learning Network for Efficient Whole Slide Image Classification
by: Wen, Jiangping, et al.
Published: (2025)
by: Wen, Jiangping, et al.
Published: (2025)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
by: Chen, Houlun, et al.
Published: (2024)
by: Chen, Houlun, et al.
Published: (2024)
One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception
by: Li, Yang, et al.
Published: (2026)
by: Li, Yang, et al.
Published: (2026)
xT: Nested Tokenization for Larger Context in Large Images
by: Gupta, Ritwik, et al.
Published: (2024)
by: Gupta, Ritwik, et al.
Published: (2024)
Locality-aware Parallel Decoding for Efficient Autoregressive Image Generation
by: Zhang, Zhuoyang, et al.
Published: (2025)
by: Zhang, Zhuoyang, et al.
Published: (2025)
AnySR: Realizing Image Super-Resolution as Any-Scale, Any-Resource
by: Zhan, Wengyi, et al.
Published: (2024)
by: Zhan, Wengyi, et al.
Published: (2024)
Similar Items
-
VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
by: Li, Bo, et al.
Published: (2026) -
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
by: Li, Qingyun, et al.
Published: (2024) -
AnyTrans: Translate AnyText in the Image with Large Scale Models
by: Qian, Zhipeng, et al.
Published: (2024) -
Multi-Sensor Diffusion-Driven Optical Image Translation for Large-Scale Applications
by: Vinholi, João Gabriel, et al.
Published: (2024) -
Translation-Enhanced Multilingual Text-to-Image Generation
by: Li, Yaoyiran, et al.
Published: (2023)