Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Junxin, Song, Tengfei, Wu, Zhanglin, Li, Pengfei, Liang, Xiaowei, Yang, Hui, Chen, Kun, Xie, Ning, Lu, Yunfei, Zhao, Jing, Sun, Shiliang, Wei, Daimeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Causality-Aware Spatiotemporal Model for Multi-Region and Multi-Pollutant Air Quality Forecasting
di: Lu, Junxin, et al.
Pubblicazione: (2025)
di: Lu, Junxin, et al.
Pubblicazione: (2025)
Evaluating Menu OCR and Translation: A Benchmark for Aligning Human and Automated Evaluations in Large Vision-Language Models
di: Wu, Zhanglin, et al.
Pubblicazione: (2025)
di: Wu, Zhanglin, et al.
Pubblicazione: (2025)
Multimodal Machine Translation with Visual Scene Graph Pruning
di: Lu, Chenyu, et al.
Pubblicazione: (2025)
di: Lu, Chenyu, et al.
Pubblicazione: (2025)
DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model
di: Wu, Zhanglin, et al.
Pubblicazione: (2025)
di: Wu, Zhanglin, et al.
Pubblicazione: (2025)
Memory Reviving, Continuing Learning and Beyond: Evaluation of Pre-trained Encoders and Decoders for Multimodal Machine Translation
di: Yu, Zhuang, et al.
Pubblicazione: (2025)
di: Yu, Zhuang, et al.
Pubblicazione: (2025)
Choose the Final Translation from NMT and LLM hypotheses Using MBR Decoding: HW-TSC's Submission to the WMT24 General MT Shared Task
di: Wu, Zhanglin, et al.
Pubblicazione: (2024)
di: Wu, Zhanglin, et al.
Pubblicazione: (2024)
HW-TSC's Submission to the CCMT 2024 Machine Translation Tasks
di: Wu, Zhanglin, et al.
Pubblicazione: (2024)
di: Wu, Zhanglin, et al.
Pubblicazione: (2024)
LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?
di: Yu, Zhuang, et al.
Pubblicazione: (2026)
di: Yu, Zhuang, et al.
Pubblicazione: (2026)
PromptEVC: Controllable Emotional Voice Conversion with Natural Language Prompts
di: Qi, Tianhua, et al.
Pubblicazione: (2025)
di: Qi, Tianhua, et al.
Pubblicazione: (2025)
R-BI: Regularized Batched Inputs enhance Incremental Decoding Framework for Low-Latency Simultaneous Speech Translation
di: Guo, Jiaxin, et al.
Pubblicazione: (2024)
di: Guo, Jiaxin, et al.
Pubblicazione: (2024)
Combining the Best of Both Worlds: A Method for Hybrid NMT and LLM Translation
di: Wu, Zhanglin, et al.
Pubblicazione: (2025)
di: Wu, Zhanglin, et al.
Pubblicazione: (2025)
Context-aware and Style-related Incremental Decoding framework for Discourse-Level Literary Translation
di: Luo, Yuanchang, et al.
Pubblicazione: (2024)
di: Luo, Yuanchang, et al.
Pubblicazione: (2024)
MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages
di: Du, Yexing, et al.
Pubblicazione: (2025)
di: Du, Yexing, et al.
Pubblicazione: (2025)
FCNR: Fast Compressive Neural Representation of Visualization Images
di: Lu, Yunfei, et al.
Pubblicazione: (2024)
di: Lu, Yunfei, et al.
Pubblicazione: (2024)
Text-Phase Synergy Network with Dual Priors for Unsupervised Cross-Domain Image Retrieval
di: Yang, Jing, et al.
Pubblicazione: (2026)
di: Yang, Jing, et al.
Pubblicazione: (2026)
Machine Translation Advancements of Low-Resource Indian Languages by Transfer Learning
di: Wei, Bin, et al.
Pubblicazione: (2024)
di: Wei, Bin, et al.
Pubblicazione: (2024)
DoCIA: An Online Document-Level Context Incorporation Agent for Speech Translation
di: Lyu, Xinglin, et al.
Pubblicazione: (2025)
di: Lyu, Xinglin, et al.
Pubblicazione: (2025)
Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference
di: Wang, Kuo, et al.
Pubblicazione: (2025)
di: Wang, Kuo, et al.
Pubblicazione: (2025)
Align-then-Slide: A complete evaluation framework for Ultra-Long Document-Level Machine Translation
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
Bridging Local Details and Global Context in Text-Attributed Graphs
di: Wang, Yaoke, et al.
Pubblicazione: (2024)
di: Wang, Yaoke, et al.
Pubblicazione: (2024)
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
Doc-Guided Sent2Sent++: A Sent2Sent++ Agent with Doc-Guided memory for Document-level Machine Translation
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
Struct2D: A Perception-Guided Framework for Spatial Reasoning in MLLMs
di: Zhu, Fangrui, et al.
Pubblicazione: (2025)
di: Zhu, Fangrui, et al.
Pubblicazione: (2025)
From Text to Pixel: Advancing Long-Context Understanding in MLLMs
di: Lu, Yujie, et al.
Pubblicazione: (2024)
di: Lu, Yujie, et al.
Pubblicazione: (2024)
TiO 2 ‐Engineered MOFs Activate Electron‐Rich Ni Sites for Efficient and Durable Hydrogen Production
di: Tao Liang, et al.
Pubblicazione: (2026)
di: Tao Liang, et al.
Pubblicazione: (2026)
Enhanced Differential Evolution Based on Adaptive Mutation and Wrapper Local Search Strategies for Global Optimization Problems
di: Chun-Liang Lu
Pubblicazione: (2014)
di: Chun-Liang Lu
Pubblicazione: (2014)
Global-Local Stepwise Generative Network for Ultra High-Resolution Image Restoration
di: Feng, Xin, et al.
Pubblicazione: (2022)
di: Feng, Xin, et al.
Pubblicazione: (2022)
Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
di: Kang, Caixin, et al.
Pubblicazione: (2026)
di: Kang, Caixin, et al.
Pubblicazione: (2026)
PEAN: A Diffusion-Based Prior-Enhanced Attention Network for Scene Text Image Super-Resolution
di: Zhao, Zuoyan, et al.
Pubblicazione: (2023)
di: Zhao, Zuoyan, et al.
Pubblicazione: (2023)
Linking Perception, Confidence and Accuracy in MLLMs
di: Du, Yuetian, et al.
Pubblicazione: (2026)
di: Du, Yuetian, et al.
Pubblicazione: (2026)
BovWGS-Pipeline
di: Gao, Junxin
Pubblicazione: (2026)
di: Gao, Junxin
Pubblicazione: (2026)
Object-Driven One-Shot Fine-tuning of Text-to-Image Diffusion with Prototypical Embedding
di: Lu, Jianxiang, et al.
Pubblicazione: (2024)
di: Lu, Jianxiang, et al.
Pubblicazione: (2024)
MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
Global existence, blowup phenomena, and asymptotic behavior for quasilinear Schrödinger equations
di: An, Xiaowei, et al.
Pubblicazione: (2018)
di: An, Xiaowei, et al.
Pubblicazione: (2018)
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
di: Guan, Tongkun, et al.
Pubblicazione: (2026)
di: Guan, Tongkun, et al.
Pubblicazione: (2026)
Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training
di: Liu, Anglin, et al.
Pubblicazione: (2026)
di: Liu, Anglin, et al.
Pubblicazione: (2026)
Spatial Preference Rewarding for MLLMs Spatial Understanding
di: Qiu, Han, et al.
Pubblicazione: (2025)
di: Qiu, Han, et al.
Pubblicazione: (2025)
A Dual-Branch Local-Global Framework for Cross-Resolution Land Cover Mapping
di: Gao, Peng, et al.
Pubblicazione: (2025)
di: Gao, Peng, et al.
Pubblicazione: (2025)
From Local Cues to Global Percepts: Emergent Gestalt Organization in Self-Supervised Vision Models
di: Li, Tianqin, et al.
Pubblicazione: (2025)
di: Li, Tianqin, et al.
Pubblicazione: (2025)
Text-Video Retrieval With Global-Local Contrastive Consistency Learning
di: Jing, Xiaolun, et al.
Pubblicazione: (2026)
di: Jing, Xiaolun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Causality-Aware Spatiotemporal Model for Multi-Region and Multi-Pollutant Air Quality Forecasting
di: Lu, Junxin, et al.
Pubblicazione: (2025) -
Evaluating Menu OCR and Translation: A Benchmark for Aligning Human and Automated Evaluations in Large Vision-Language Models
di: Wu, Zhanglin, et al.
Pubblicazione: (2025) -
Multimodal Machine Translation with Visual Scene Graph Pruning
di: Lu, Chenyu, et al.
Pubblicazione: (2025) -
DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model
di: Wu, Zhanglin, et al.
Pubblicazione: (2025) -
Memory Reviving, Continuing Learning and Beyond: Evaluation of Pre-trained Encoders and Decoders for Multimodal Machine Translation
di: Yu, Zhuang, et al.
Pubblicazione: (2025)