Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation
Fuente:
arXiv
Salvato in:
| Autori principali: | Lan, Zhibin, Niu, Liqiang, Meng, Fandong, Zhou, Jie, Zhang, Min, Su, Jinsong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
di: Lan, Zhibin, et al.
Pubblicazione: (2025)
di: Lan, Zhibin, et al.
Pubblicazione: (2025)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
di: Lan, Zhibin, et al.
Pubblicazione: (2024)
di: Lan, Zhibin, et al.
Pubblicazione: (2024)
UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings
di: Lan, Zhibin, et al.
Pubblicazione: (2025)
di: Lan, Zhibin, et al.
Pubblicazione: (2025)
Retrieval-Augmented Machine Translation with Unstructured Knowledge
di: Wang, Jiaan, et al.
Pubblicazione: (2024)
di: Wang, Jiaan, et al.
Pubblicazione: (2024)
Using Large Language Model for End-to-End Chinese ASR and NER
di: Li, Yuang, et al.
Pubblicazione: (2024)
di: Li, Yuang, et al.
Pubblicazione: (2024)
EAG: Extract and Generate Multi-way Aligned Corpus for Complete Multi-lingual Neural Machine Translation
di: Xu, Yulin, et al.
Pubblicazione: (2022)
di: Xu, Yulin, et al.
Pubblicazione: (2022)
Speech to Speech Translation with Translatotron: A State of the Art Review
di: Kala, Jules R., et al.
Pubblicazione: (2025)
di: Kala, Jules R., et al.
Pubblicazione: (2025)
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
di: Wang, Jiaan, et al.
Pubblicazione: (2025)
di: Wang, Jiaan, et al.
Pubblicazione: (2025)
ExTrans: Multilingual Deep Reasoning Translation via Exemplar-Enhanced Reinforcement Learning
di: Wang, Jiaan, et al.
Pubblicazione: (2025)
di: Wang, Jiaan, et al.
Pubblicazione: (2025)
TasTe: Teaching Large Language Models to Translate through Self-Reflection
di: Wang, Yutong, et al.
Pubblicazione: (2024)
di: Wang, Yutong, et al.
Pubblicazione: (2024)
DRT: Deep Reasoning Translation via Long Chain-of-Thought
di: Wang, Jiaan, et al.
Pubblicazione: (2024)
di: Wang, Jiaan, et al.
Pubblicazione: (2024)
LCS: A Language Converter Strategy for Zero-Shot Neural Machine Translation
di: Sun, Zengkui, et al.
Pubblicazione: (2024)
di: Sun, Zengkui, et al.
Pubblicazione: (2024)
Towards Fine-Grained Code-Switch Speech Translation with Semantic Space Alignment
di: Gao, Yan, et al.
Pubblicazione: (2025)
di: Gao, Yan, et al.
Pubblicazione: (2025)
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
di: Yang, Zhen, et al.
Pubblicazione: (2023)
di: Yang, Zhen, et al.
Pubblicazione: (2023)
DelTA: An Online Document-Level Translation Agent Based on Multi-Level Memory
di: Wang, Yutong, et al.
Pubblicazione: (2024)
di: Wang, Yutong, et al.
Pubblicazione: (2024)
The End of Manual Decoding: Towards Truly End-to-End Language Models
di: Wang, Zhichao, et al.
Pubblicazione: (2025)
di: Wang, Zhichao, et al.
Pubblicazione: (2025)
CSCD-NS: a Chinese Spelling Check Dataset for Native Speakers
di: Hu, Yong, et al.
Pubblicazione: (2022)
di: Hu, Yong, et al.
Pubblicazione: (2022)
End-to-End Evaluation for Low-Latency Simultaneous Speech Translation
di: Huber, Christian, et al.
Pubblicazione: (2023)
di: Huber, Christian, et al.
Pubblicazione: (2023)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
di: Shao, Chenze, et al.
Pubblicazione: (2024)
di: Shao, Chenze, et al.
Pubblicazione: (2024)
WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
di: He, Hongliang, et al.
Pubblicazione: (2024)
di: He, Hongliang, et al.
Pubblicazione: (2024)
ReflectMT: Internalizing Reflection for Efficient and High-Quality Machine Translation
di: Li, Kunquan, et al.
Pubblicazione: (2026)
di: Li, Kunquan, et al.
Pubblicazione: (2026)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
di: Ma, Zhengrui, et al.
Pubblicazione: (2024)
di: Ma, Zhengrui, et al.
Pubblicazione: (2024)
GSQA: An End-to-End Model for Generative Spoken Question Answering
di: Shih, Min-Han, et al.
Pubblicazione: (2023)
di: Shih, Min-Han, et al.
Pubblicazione: (2023)
Continuous Autoregressive Language Models
di: Shao, Chenze, et al.
Pubblicazione: (2025)
di: Shao, Chenze, et al.
Pubblicazione: (2025)
When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation
di: Min, Anna, et al.
Pubblicazione: (2025)
di: Min, Anna, et al.
Pubblicazione: (2025)
Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
di: Chen, Zhuoen, et al.
Pubblicazione: (2026)
di: Chen, Zhuoen, et al.
Pubblicazione: (2026)
Towards End-to-End Open Conversational Machine Reading
di: Zhou, Sizhe, et al.
Pubblicazione: (2022)
di: Zhou, Sizhe, et al.
Pubblicazione: (2022)
End-to-End Graph Flattening Method for Large Language Models
di: Hong, Bin, et al.
Pubblicazione: (2024)
di: Hong, Bin, et al.
Pubblicazione: (2024)
Language Model Inversion through End-to-End Differentiation
di: Denamganaï, Kevin Yandoka, et al.
Pubblicazione: (2026)
di: Denamganaï, Kevin Yandoka, et al.
Pubblicazione: (2026)
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
di: Zhuang, Wanru, et al.
Pubblicazione: (2025)
di: Zhuang, Wanru, et al.
Pubblicazione: (2025)
Recent Advances in End-to-End Simultaneous Speech Translation
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024)
Locate-and-Focus: Enhancing Terminology Translation in Speech Language Models
di: Wu, Suhang, et al.
Pubblicazione: (2025)
di: Wu, Suhang, et al.
Pubblicazione: (2025)
PokerGPT: An End-to-End Lightweight Solver for Multi-Player Texas Hold'em via Large Language Model
di: Huang, Chenghao, et al.
Pubblicazione: (2024)
di: Huang, Chenghao, et al.
Pubblicazione: (2024)
Detecting Errors through Ensembling Prompts (DEEP): An End-to-End LLM Framework for Detecting Factual Errors
di: Chandler, Alex, et al.
Pubblicazione: (2024)
di: Chandler, Alex, et al.
Pubblicazione: (2024)
End-To-End Clinical Trial Matching with Large Language Models
di: Ferber, Dyke, et al.
Pubblicazione: (2024)
di: Ferber, Dyke, et al.
Pubblicazione: (2024)
General learned delegation by clones
di: Li, Darren, et al.
Pubblicazione: (2026)
di: Li, Darren, et al.
Pubblicazione: (2026)
MiCU: End-to-End Smart Home Command Understanding with Large Language Model
di: Han, Haowei, et al.
Pubblicazione: (2026)
di: Han, Haowei, et al.
Pubblicazione: (2026)
E2E-AFG: An End-to-End Model with Adaptive Filtering for Retrieval-Augmented Generation
di: Jiang, Yun, et al.
Pubblicazione: (2024)
di: Jiang, Yun, et al.
Pubblicazione: (2024)
WebDS: An End-to-End Benchmark for Web-based Data Science
di: Hsu, Ethan, et al.
Pubblicazione: (2025)
di: Hsu, Ethan, et al.
Pubblicazione: (2025)
FormalASR: End-to-End Spoken Chinese to Formal Text
di: Ning, Wanyi, et al.
Pubblicazione: (2026)
di: Ning, Wanyi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
di: Lan, Zhibin, et al.
Pubblicazione: (2025) -
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
di: Lan, Zhibin, et al.
Pubblicazione: (2024) -
UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings
di: Lan, Zhibin, et al.
Pubblicazione: (2025) -
Retrieval-Augmented Machine Translation with Unstructured Knowledge
di: Wang, Jiaan, et al.
Pubblicazione: (2024) -
Using Large Language Model for End-to-End Chinese ASR and NER
di: Li, Yuang, et al.
Pubblicazione: (2024)