MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Bo, Zhu, Shaolin, Wen, Lijie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
von: Li, Bo, et al.
Veröffentlicht: (2026)
von: Li, Bo, et al.
Veröffentlicht: (2026)
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
von: Li, Qingyun, et al.
Veröffentlicht: (2024)
von: Li, Qingyun, et al.
Veröffentlicht: (2024)
AnyTrans: Translate AnyText in the Image with Large Scale Models
von: Qian, Zhipeng, et al.
Veröffentlicht: (2024)
von: Qian, Zhipeng, et al.
Veröffentlicht: (2024)
Multi-Sensor Diffusion-Driven Optical Image Translation for Large-Scale Applications
von: Vinholi, João Gabriel, et al.
Veröffentlicht: (2024)
von: Vinholi, João Gabriel, et al.
Veröffentlicht: (2024)
Translation-Enhanced Multilingual Text-to-Image Generation
von: Li, Yaoyiran, et al.
Veröffentlicht: (2023)
von: Li, Yaoyiran, et al.
Veröffentlicht: (2023)
SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation
von: Khalil, Mohammad Amer, et al.
Veröffentlicht: (2026)
von: Khalil, Mohammad Amer, et al.
Veröffentlicht: (2026)
Spatial Transcriptomics as Images for Large-Scale Pretraining
von: Zhu, Yishun, et al.
Veröffentlicht: (2026)
von: Zhu, Yishun, et al.
Veröffentlicht: (2026)
Contrastive Learning Guided Latent Diffusion Model for Image-to-Image Translation
von: Si, Qi, et al.
Veröffentlicht: (2025)
von: Si, Qi, et al.
Veröffentlicht: (2025)
GPIC: A Giant Permissive Image Corpus for Visual Generation
von: Chandrasegaran, Keshigeyan, et al.
Veröffentlicht: (2026)
von: Chandrasegaran, Keshigeyan, et al.
Veröffentlicht: (2026)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
von: Zhou, Lijie
Veröffentlicht: (2026)
von: Zhou, Lijie
Veröffentlicht: (2026)
RL-I2IT: Image-to-Image Translation with Deep Reinforcement Learning
von: Hu, Jing, et al.
Veröffentlicht: (2023)
von: Hu, Jing, et al.
Veröffentlicht: (2023)
Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning
von: Cao, Min, et al.
Veröffentlicht: (2025)
von: Cao, Min, et al.
Veröffentlicht: (2025)
FaceID-6M: A Large-Scale, Open-Source FaceID Customization Dataset
von: Wang, Shuhe, et al.
Veröffentlicht: (2025)
von: Wang, Shuhe, et al.
Veröffentlicht: (2025)
Quantifying the Gaps Between Translation and Native Perception in Training for Multimodal, Multilingual Retrieval
von: Buettner, Kyle, et al.
Veröffentlicht: (2024)
von: Buettner, Kyle, et al.
Veröffentlicht: (2024)
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
von: Anugraha, David, et al.
Veröffentlicht: (2025)
von: Anugraha, David, et al.
Veröffentlicht: (2025)
Progressive Energy-Based Cooperative Learning for Multi-Domain Image-to-Image Translation
von: Song, Weinan, et al.
Veröffentlicht: (2023)
von: Song, Weinan, et al.
Veröffentlicht: (2023)
DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model
von: Wu, Zhanglin, et al.
Veröffentlicht: (2025)
von: Wu, Zhanglin, et al.
Veröffentlicht: (2025)
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
von: Zhuang, Wanru, et al.
Veröffentlicht: (2025)
von: Zhuang, Wanru, et al.
Veröffentlicht: (2025)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
von: You, Liangliang, et al.
Veröffentlicht: (2025)
von: You, Liangliang, et al.
Veröffentlicht: (2025)
Text Guided Image Editing with Automatic Concept Locating and Forgetting
von: Li, Jia, et al.
Veröffentlicht: (2024)
von: Li, Jia, et al.
Veröffentlicht: (2024)
Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
von: Yang, Qishun, et al.
Veröffentlicht: (2026)
von: Yang, Qishun, et al.
Veröffentlicht: (2026)
Fourier Boundary Features Network with Wider Catchers for Glass Segmentation
von: Qin, Xiaolin, et al.
Veröffentlicht: (2024)
von: Qin, Xiaolin, et al.
Veröffentlicht: (2024)
Introducing 3D Representation for Medical Image Volume-to-Volume Translation via Score Fusion
von: Zhu, Xiyue, et al.
Veröffentlicht: (2025)
von: Zhu, Xiyue, et al.
Veröffentlicht: (2025)
Large Sign Language Models: Toward 3D American Sign Language Translation
von: Zhang, Sen, et al.
Veröffentlicht: (2025)
von: Zhang, Sen, et al.
Veröffentlicht: (2025)
Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems
von: Faraz, Ali, et al.
Veröffentlicht: (2026)
von: Faraz, Ali, et al.
Veröffentlicht: (2026)
CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
von: Han, Hongyong, et al.
Veröffentlicht: (2025)
von: Han, Hongyong, et al.
Veröffentlicht: (2025)
mAVE: A Watermark for Joint Audio-Visual Generation Models
von: Si, Luyang, et al.
Veröffentlicht: (2026)
von: Si, Luyang, et al.
Veröffentlicht: (2026)
Stroke-based Cyclic Amplifier: Image Super-Resolution at Arbitrary Ultra-Large Scales
von: Guo, Wenhao, et al.
Veröffentlicht: (2025)
von: Guo, Wenhao, et al.
Veröffentlicht: (2025)
SAMScore: A Content Structural Similarity Metric for Image Translation Evaluation
von: Li, Yunxiang, et al.
Veröffentlicht: (2023)
von: Li, Yunxiang, et al.
Veröffentlicht: (2023)
HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding
von: Lv, Qitan, et al.
Veröffentlicht: (2026)
von: Lv, Qitan, et al.
Veröffentlicht: (2026)
WebUOT-1M: Advancing Deep Underwater Object Tracking with A Million-Scale Benchmark
von: Zhang, Chunhui, et al.
Veröffentlicht: (2024)
von: Zhang, Chunhui, et al.
Veröffentlicht: (2024)
Replace in Translation: Boost Concept Alignment in Counterfactual Text-to-Image
von: Li, Sifan, et al.
Veröffentlicht: (2025)
von: Li, Sifan, et al.
Veröffentlicht: (2025)
OT-ALD: Aligning Latent Distributions with Optimal Transport for Accelerated Image-to-Image Translation
von: Wang, Zhanpeng, et al.
Veröffentlicht: (2025)
von: Wang, Zhanpeng, et al.
Veröffentlicht: (2025)
STAR: A First-Ever Dataset and A Large-Scale Benchmark for Scene Graph Generation in Large-Size Satellite Imagery
von: Li, Yansheng, et al.
Veröffentlicht: (2024)
von: Li, Yansheng, et al.
Veröffentlicht: (2024)
MsaMIL-Net: An End-to-End Multi-Scale Aware Multiple Instance Learning Network for Efficient Whole Slide Image Classification
von: Wen, Jiangping, et al.
Veröffentlicht: (2025)
von: Wen, Jiangping, et al.
Veröffentlicht: (2025)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
von: Chen, Houlun, et al.
Veröffentlicht: (2024)
von: Chen, Houlun, et al.
Veröffentlicht: (2024)
One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception
von: Li, Yang, et al.
Veröffentlicht: (2026)
von: Li, Yang, et al.
Veröffentlicht: (2026)
xT: Nested Tokenization for Larger Context in Large Images
von: Gupta, Ritwik, et al.
Veröffentlicht: (2024)
von: Gupta, Ritwik, et al.
Veröffentlicht: (2024)
Locality-aware Parallel Decoding for Efficient Autoregressive Image Generation
von: Zhang, Zhuoyang, et al.
Veröffentlicht: (2025)
von: Zhang, Zhuoyang, et al.
Veröffentlicht: (2025)
AnySR: Realizing Image Super-Resolution as Any-Scale, Any-Resource
von: Zhan, Wengyi, et al.
Veröffentlicht: (2024)
von: Zhan, Wengyi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
von: Li, Bo, et al.
Veröffentlicht: (2026) -
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
von: Li, Qingyun, et al.
Veröffentlicht: (2024) -
AnyTrans: Translate AnyText in the Image with Large Scale Models
von: Qian, Zhipeng, et al.
Veröffentlicht: (2024) -
Multi-Sensor Diffusion-Driven Optical Image Translation for Large-Scale Applications
von: Vinholi, João Gabriel, et al.
Veröffentlicht: (2024) -
Translation-Enhanced Multilingual Text-to-Image Generation
von: Li, Yaoyiran, et al.
Veröffentlicht: (2023)