A Survey on Multi-modal Machine Translation: Tasks, Methods and Challenges
Fuente:
arXiv
Saved in:
| Main Authors: | Shen, Huangjun, Shao, Liangying, Li, Wenbo, Lan, Zhibin, Liu, Zhanyu, Su, Jinsong |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UniGenCoder: Merging Seq2Seq and Seq2Tree Paradigms for Unified Code Generation
by: Shao, Liangying, et al.
Published: (2025)
by: Shao, Liangying, et al.
Published: (2025)
Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models
by: Liu, Bingshuai, et al.
Published: (2023)
by: Liu, Bingshuai, et al.
Published: (2023)
Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation
by: Lan, Zhibin, et al.
Published: (2024)
by: Lan, Zhibin, et al.
Published: (2024)
Beyond Single-Reward: Multi-Pair, Multi-Perspective Preference Optimization for Machine Translation
by: Wang, Hao, et al.
Published: (2025)
by: Wang, Hao, et al.
Published: (2025)
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
by: Zhuang, Wanru, et al.
Published: (2025)
by: Zhuang, Wanru, et al.
Published: (2025)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
by: Lan, Zhibin, et al.
Published: (2024)
by: Lan, Zhibin, et al.
Published: (2024)
ReflectMT: Internalizing Reflection for Efficient and High-Quality Machine Translation
by: Li, Kunquan, et al.
Published: (2026)
by: Li, Kunquan, et al.
Published: (2026)
One2set + Large Language Model: Best Partners for Keyphrase Generation
by: Shao, Liangying, et al.
Published: (2024)
by: Shao, Liangying, et al.
Published: (2024)
Can LLMs Track Their Output Length? A Dynamic Feedback Mechanism for Precise Length Regulation
by: Xiao, Meiman, et al.
Published: (2026)
by: Xiao, Meiman, et al.
Published: (2026)
Scaling Model and Data for Multilingual Machine Translation with Open Large Language Models
by: Shang, Yuzhe, et al.
Published: (2026)
by: Shang, Yuzhe, et al.
Published: (2026)
Investigating Inference-time Scaling for Chain of Multi-modal Thought: A Preliminary Study
by: Lin, Yujie, et al.
Published: (2025)
by: Lin, Yujie, et al.
Published: (2025)
Efficient k-Nearest-Neighbor Machine Translation with Dynamic Retrieval
by: Gao, Yan, et al.
Published: (2024)
by: Gao, Yan, et al.
Published: (2024)
Towards Fine-Grained Code-Switch Speech Translation with Semantic Space Alignment
by: Gao, Yan, et al.
Published: (2025)
by: Gao, Yan, et al.
Published: (2025)
TDAG: A Multi-Agent Framework based on Dynamic Task Decomposition and Agent Generation
by: Wang, Yaoxiang, et al.
Published: (2024)
by: Wang, Yaoxiang, et al.
Published: (2024)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
by: Lan, Zhibin, et al.
Published: (2025)
by: Lan, Zhibin, et al.
Published: (2025)
Applying Intrinsic Debiasing on Downstream Tasks: Challenges and Considerations for Machine Translation
by: Iluz, Bar, et al.
Published: (2024)
by: Iluz, Bar, et al.
Published: (2024)
ExPosST: Explicit Positioning with Adaptive Masking for LLM-Based Simultaneous Machine Translation
by: Shang, Yuzhe, et al.
Published: (2026)
by: Shang, Yuzhe, et al.
Published: (2026)
Towards Privacy-Preserving Machine Translation at the Inference Stage: A New Task and Benchmark
by: Shao, Wei, et al.
Published: (2026)
by: Shao, Wei, et al.
Published: (2026)
On the Information Redundancy in Non-Autoregressive Translation
by: Wang, Zhihao, et al.
Published: (2024)
by: Wang, Zhihao, et al.
Published: (2024)
From Handcrafted Features to LLMs: A Brief Survey for Machine Translation Quality Estimation
by: Zhao, Haofei, et al.
Published: (2024)
by: Zhao, Haofei, et al.
Published: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
by: Zhang, Kaichen, et al.
Published: (2024)
by: Zhang, Kaichen, et al.
Published: (2024)
A Case Study on Context-Aware Neural Machine Translation with Multi-Task Learning
by: Appicharla, Ramakrishna, et al.
Published: (2024)
by: Appicharla, Ramakrishna, et al.
Published: (2024)
Selective Contrastive Learning For Gloss Free Sign Language Translation
by: Lai, Changhao, et al.
Published: (2026)
by: Lai, Changhao, et al.
Published: (2026)
A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges
by: Yan, Yibo, et al.
Published: (2024)
by: Yan, Yibo, et al.
Published: (2024)
Machine Translation Meta Evaluation through Translation Accuracy Challenge Sets
by: Moghe, Nikita, et al.
Published: (2024)
by: Moghe, Nikita, et al.
Published: (2024)
Overview of the NLPCC 2025 Shared Task 4: Multi-modal, Multilingual, and Multi-hop Medical Instructional Video Question Answering Challenge
by: Li, Bin, et al.
Published: (2025)
by: Li, Bin, et al.
Published: (2025)
LDIR: Low-Dimensional Dense and Interpretable Text Embeddings with Relative Representations
by: Wang, Yile, et al.
Published: (2025)
by: Wang, Yile, et al.
Published: (2025)
Multi-domain Multi-modal Document Classification Benchmark with a Multi-level Taxonomy
by: Ma, Denghao, et al.
Published: (2026)
by: Ma, Denghao, et al.
Published: (2026)
"I've Heard of You!": Generate Spoken Named Entity Recognition Data for Unseen Entities
by: Yu, Jiawei, et al.
Published: (2024)
by: Yu, Jiawei, et al.
Published: (2024)
MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning
by: Feng, Zhaopeng, et al.
Published: (2025)
by: Feng, Zhaopeng, et al.
Published: (2025)
KD4MT: A Survey of Knowledge Distillation for Machine Translation
by: de Gibert, Ona, et al.
Published: (2026)
by: de Gibert, Ona, et al.
Published: (2026)
Optimal Multi-Task Learning at Regularization Horizon for Speech Translation Task
by: Jung, JungHo, et al.
Published: (2025)
by: Jung, JungHo, et al.
Published: (2025)
HW-TSC's Submission to the CCMT 2024 Machine Translation Tasks
by: Wu, Zhanglin, et al.
Published: (2024)
by: Wu, Zhanglin, et al.
Published: (2024)
Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines
by: Ma, Zi-Ao, et al.
Published: (2024)
by: Ma, Zi-Ao, et al.
Published: (2024)
Medical Dialogue: A Survey of Categories, Methods, Evaluation and Challenges
by: Shi, Xiaoming, et al.
Published: (2024)
by: Shi, Xiaoming, et al.
Published: (2024)
Distractor Generation in Multiple-Choice Tasks: A Survey of Methods, Datasets, and Evaluation
by: Alhazmi, Elaf, et al.
Published: (2024)
by: Alhazmi, Elaf, et al.
Published: (2024)
Tibetan Language and AI: A Comprehensive Survey of Resources, Methods and Challenges
by: Huang, Cheng, et al.
Published: (2025)
by: Huang, Cheng, et al.
Published: (2025)
Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval
by: Sun, Hao, et al.
Published: (2026)
by: Sun, Hao, et al.
Published: (2026)
Direct Neural Machine Translation with Task-level Mixture of Experts models
by: Tourni, Isidora Chara, et al.
Published: (2023)
by: Tourni, Isidora Chara, et al.
Published: (2023)
Scaling Laws of Decoder-Only Models on the Multilingual Machine Translation Task
by: Caillaut, Gaëtan, et al.
Published: (2024)
by: Caillaut, Gaëtan, et al.
Published: (2024)
Similar Items
-
UniGenCoder: Merging Seq2Seq and Seq2Tree Paradigms for Unified Code Generation
by: Shao, Liangying, et al.
Published: (2025) -
Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models
by: Liu, Bingshuai, et al.
Published: (2023) -
Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation
by: Lan, Zhibin, et al.
Published: (2024) -
Beyond Single-Reward: Multi-Pair, Multi-Perspective Preference Optimization for Machine Translation
by: Wang, Hao, et al.
Published: (2025) -
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
by: Zhuang, Wanru, et al.
Published: (2025)