ICDAR 2025 Competition on End-to-End Document Image Machine Translation Towards Complex Layouts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yaping, Liang, Yupu, Zhang, Zhiyang, Chen, Zhiyuan, Xiang, Lu, Zhao, Yang, Zhou, Yu, Zong, Chengqing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
par: Liang, Yupu, et autres
Publié: (2025)
par: Liang, Yupu, et autres
Publié: (2025)
Improving MLLM's Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiency
par: Liang, Yupu, et autres
Publié: (2025)
par: Liang, Yupu, et autres
Publié: (2025)
DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model
par: Wu, Zhanglin, et autres
Publié: (2025)
par: Wu, Zhanglin, et autres
Publié: (2025)
PromptDLA: A Domain-aware Prompt Document Layout Analysis Framework with Descriptive Knowledge as a Cue
par: Zhang, Zirui, et autres
Publié: (2026)
par: Zhang, Zirui, et autres
Publié: (2026)
A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opportunities
par: Xiang, Lu, et autres
Publié: (2025)
par: Xiang, Lu, et autres
Publié: (2025)
HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery
par: Zhang, Yaping, et autres
Publié: (2025)
par: Zhang, Yaping, et autres
Publié: (2025)
EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal World
par: Ye, Jing, et autres
Publié: (2026)
par: Ye, Jing, et autres
Publié: (2026)
SweetieChat: A Strategy-Enhanced Role-playing Framework for Diverse Scenarios Handling Emotional Support Agent
par: Ye, Jing, et autres
Publié: (2024)
par: Ye, Jing, et autres
Publié: (2024)
From Generic Empathy to Personalized Emotional Support: A Self-Evolution Framework for User Preference Alignment
par: Ye, Jing, et autres
Publié: (2025)
par: Ye, Jing, et autres
Publié: (2025)
Listening to the Echo: User-Reaction Aware Policy Optimization via Scalar-Verbal Hybrid Reinforcement Learning
par: Ye, Jing, et autres
Publié: (2026)
par: Ye, Jing, et autres
Publié: (2026)
Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation
par: Lan, Zhibin, et autres
Publié: (2024)
par: Lan, Zhibin, et autres
Publié: (2024)
Towards End-to-End Open Conversational Machine Reading
par: Zhou, Sizhe, et autres
Publié: (2022)
par: Zhou, Sizhe, et autres
Publié: (2022)
SimulPL: Aligning Human Preferences in Simultaneous Machine Translation
par: Yu, Donglei, et autres
Publié: (2025)
par: Yu, Donglei, et autres
Publié: (2025)
DLAFormer: An End-to-End Transformer For Document Layout Analysis
par: Wang, Jiawei, et autres
Publié: (2024)
par: Wang, Jiawei, et autres
Publié: (2024)
Self-Modifying State Modeling for Simultaneous Machine Translation
par: Yu, Donglei, et autres
Publié: (2024)
par: Yu, Donglei, et autres
Publié: (2024)
Toward the End-To-End Optimization of the SWGO Array Layout
par: Dorigo, Tommaso, et autres
Publié: (2023)
par: Dorigo, Tommaso, et autres
Publié: (2023)
Representation Purification for End-to-End Speech Translation
par: Zhang, Chengwei, et autres
Publié: (2024)
par: Zhang, Chengwei, et autres
Publié: (2024)
F-MALLOC: Feed-forward Memory Allocation for Continual Learning in Neural Machine Translation
par: Wu, Junhong, et autres
Publié: (2024)
par: Wu, Junhong, et autres
Publié: (2024)
GinAR: An End-To-End Multivariate Time Series Forecasting Model Suitable for Variable Missing
par: Yu, Chengqing, et autres
Publié: (2024)
par: Yu, Chengqing, et autres
Publié: (2024)
ICDAR 2025 Competition on FEw-Shot Text line segmentation of ancient handwritten documents (FEST)
par: Zottin, Silvia, et autres
Publié: (2025)
par: Zottin, Silvia, et autres
Publié: (2025)
Taiwan Test Data for ICDAR'25 MapText Competition
par: Lin, Yijun, et autres
Publié: (2025)
par: Lin, Yijun, et autres
Publié: (2025)
VoxMind: An End-to-End Agentic Spoken Dialogue System
par: Liang, Tianle, et autres
Publié: (2026)
par: Liang, Tianle, et autres
Publié: (2026)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation
par: Li, Gengluo, et autres
Publié: (2026)
par: Li, Gengluo, et autres
Publié: (2026)
Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving
par: Jia, Xiaosong, et autres
Publié: (2024)
par: Jia, Xiaosong, et autres
Publié: (2024)
Beyond Adapting SAM: Towards End-to-End Ultrasound Image Segmentation via Auto Prompting
par: Lin, Xian, et autres
Publié: (2023)
par: Lin, Xian, et autres
Publié: (2023)
Team PA-VCG's Solution for Competition on Understanding Chinese College Entrance Exam Papers in ICDAR'25
par: Wu, Wei, et autres
Publié: (2025)
par: Wu, Wei, et autres
Publié: (2025)
DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation
par: Du, Yongkun, et autres
Publié: (2025)
par: Du, Yongkun, et autres
Publié: (2025)
FinWorld: An All-in-One Open-Source Platform for End-to-End Financial AI Research and Deployment
par: Zhang, Wentao, et autres
Publié: (2025)
par: Zhang, Wentao, et autres
Publié: (2025)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
par: Ma, Zhengrui, et autres
Publié: (2024)
par: Ma, Zhengrui, et autres
Publié: (2024)
Boosting LLM Translation Skills without General Ability Loss via Rationale Distillation
par: Wu, Junhong, et autres
Publié: (2024)
par: Wu, Junhong, et autres
Publié: (2024)
Towards Motion Forecasting with Real-World Perception Inputs: Are End-to-End Approaches Competitive?
par: Xu, Yihong, et autres
Publié: (2023)
par: Xu, Yihong, et autres
Publié: (2023)
CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention
par: Tang, Jiacheng, et autres
Publié: (2026)
par: Tang, Jiacheng, et autres
Publié: (2026)
RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository
par: Peng, Zhiyuan, et autres
Publié: (2026)
par: Peng, Zhiyuan, et autres
Publié: (2026)
End-to-End Generative Semantic Communication Powered by Shared Semantic Knowledge Base
par: Li, Shuling, et autres
Publié: (2024)
par: Li, Shuling, et autres
Publié: (2024)
ASI++: Towards Distributionally Balanced End-to-End Generative Retrieval
par: Liu, Yuxuan, et autres
Publié: (2024)
par: Liu, Yuxuan, et autres
Publié: (2024)
DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving
par: Jia, Xiaosong, et autres
Publié: (2025)
par: Jia, Xiaosong, et autres
Publié: (2025)
Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition
par: Hao, Ruiyang, et autres
Publié: (2025)
par: Hao, Ruiyang, et autres
Publié: (2025)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
par: Yu, Haiyang, et autres
Publié: (2025)
par: Yu, Haiyang, et autres
Publié: (2025)
ResearchEVO: An End-to-End Framework for Automated Scientific Discovery and Documentation
par: Zhao, Zhe, et autres
Publié: (2026)
par: Zhao, Zhe, et autres
Publié: (2026)
Documents similaires
-
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
par: Liang, Yupu, et autres
Publié: (2025) -
Improving MLLM's Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiency
par: Liang, Yupu, et autres
Publié: (2025) -
DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model
par: Wu, Zhanglin, et autres
Publié: (2025) -
PromptDLA: A Domain-aware Prompt Document Layout Analysis Framework with Descriptive Knowledge as a Cue
par: Zhang, Zirui, et autres
Publié: (2026) -
A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opportunities
par: Xiang, Lu, et autres
Publié: (2025)