VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Bo, Chen, Ronghao, Deng, Ningyuan, Wang, Huacan, Zhu, Shaolin, Wen, Lijie |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation
by: Li, Bo, et al.
Published: (2024)
by: Li, Bo, et al.
Published: (2024)
Minimal Interaction Separated Tuning: A New Paradigm for Visual Adaptation
by: Tang, Ningyuan, et al.
Published: (2024)
by: Tang, Ningyuan, et al.
Published: (2024)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
by: Li, Daiqiang, et al.
Published: (2026)
by: Li, Daiqiang, et al.
Published: (2026)
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
by: Wang, Xintong, et al.
Published: (2025)
by: Wang, Xintong, et al.
Published: (2025)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
by: Zhou, Lijie
Published: (2026)
by: Zhou, Lijie
Published: (2026)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
by: Liu, Jiaqi, et al.
Published: (2025)
by: Liu, Jiaqi, et al.
Published: (2025)
Sample-Aware Test-Time Adaptation for Medical Image-to-Image Translation
by: Iele, Irene, et al.
Published: (2025)
by: Iele, Irene, et al.
Published: (2025)
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
by: Liu, Jiaqi, et al.
Published: (2025)
by: Liu, Jiaqi, et al.
Published: (2025)
CoDA: Instructive Chain-of-Domain Adaptation with Severity-Aware Visual Prompt Tuning
by: Gong, Ziyang, et al.
Published: (2024)
by: Gong, Ziyang, et al.
Published: (2024)
MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks
by: Xu, Yushen, et al.
Published: (2025)
by: Xu, Yushen, et al.
Published: (2025)
Negation-Aware Test-Time Adaptation for Vision-Language Models
by: Han, Haochen, et al.
Published: (2025)
by: Han, Haochen, et al.
Published: (2025)
FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation
by: Zhang, Liuzhou, et al.
Published: (2026)
by: Zhang, Liuzhou, et al.
Published: (2026)
MoTE: Reconciling Generalization with Specialization for Visual-Language to Video Knowledge Transfer
by: Zhu, Minghao, et al.
Published: (2024)
by: Zhu, Minghao, et al.
Published: (2024)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
by: Chen, Junzhe, et al.
Published: (2024)
by: Chen, Junzhe, et al.
Published: (2024)
SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision
by: Li, Zhaoxu, et al.
Published: (2025)
by: Li, Zhaoxu, et al.
Published: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
by: Atuhurra, Jesse, et al.
Published: (2024)
by: Atuhurra, Jesse, et al.
Published: (2024)
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
by: Lin, Ci-Siang, et al.
Published: (2025)
by: Lin, Ci-Siang, et al.
Published: (2025)
ZOTTA: Test-Time Adaptation with Gradient-Free Zeroth-Order Optimization
by: Zhang, Ronghao, et al.
Published: (2026)
by: Zhang, Ronghao, et al.
Published: (2026)
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
by: Madinei, Parsa, et al.
Published: (2025)
by: Madinei, Parsa, et al.
Published: (2025)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
by: Fu, Ronghao, et al.
Published: (2026)
by: Fu, Ronghao, et al.
Published: (2026)
Image Translation as Diffusion Visual Programmers
by: Han, Cheng, et al.
Published: (2024)
by: Han, Cheng, et al.
Published: (2024)
GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
by: Zhang, Jensen, et al.
Published: (2025)
by: Zhang, Jensen, et al.
Published: (2025)
Bayesian Test-Time Adaptation for Vision-Language Models
by: Zhou, Lihua, et al.
Published: (2025)
by: Zhou, Lihua, et al.
Published: (2025)
mAVE: A Watermark for Joint Audio-Visual Generation Models
by: Si, Luyang, et al.
Published: (2026)
by: Si, Luyang, et al.
Published: (2026)
PRIM: Towards Practical In-Image Multilingual Machine Translation
by: Tian, Yanzhi, et al.
Published: (2025)
by: Tian, Yanzhi, et al.
Published: (2025)
Dynamic Rank Adaptation for Vision-Language Models
by: Wang, Jiahui, et al.
Published: (2025)
by: Wang, Jiahui, et al.
Published: (2025)
TherA: Thermal-Aware Visual-Language Prompting for Controllable RGB-to-Thermal Infrared Translation
by: Lee, Dong-Guw, et al.
Published: (2026)
by: Lee, Dong-Guw, et al.
Published: (2026)
Leveraging Text-to-Image Diffusion Models for Unsupervised Visual Object Tracking
by: Zhang, Zhengbo, et al.
Published: (2026)
by: Zhang, Zhengbo, et al.
Published: (2026)
Task-Aware Resolution Optimization for Visual Large Language Models
by: Luo, Weiqing, et al.
Published: (2025)
by: Luo, Weiqing, et al.
Published: (2025)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
by: Li, Shuang, et al.
Published: (2024)
by: Li, Shuang, et al.
Published: (2024)
Beyond Text: Frozen Large Language Models in Visual Signal Comprehension
by: Zhu, Lei, et al.
Published: (2024)
by: Zhu, Lei, et al.
Published: (2024)
Large Language Models are Universal Reasoners for Visual Generation
by: Ren, Sucheng, et al.
Published: (2026)
by: Ren, Sucheng, et al.
Published: (2026)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
by: Yang, Chenyu, et al.
Published: (2024)
by: Yang, Chenyu, et al.
Published: (2024)
LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
by: Huang, Jing, et al.
Published: (2025)
by: Huang, Jing, et al.
Published: (2025)
LAPIG: Language Guided Projector Image Generation with Surface Adaptation and Stylization
by: Deng, Yuchen, et al.
Published: (2025)
by: Deng, Yuchen, et al.
Published: (2025)
Visually-Aware Context Modeling for News Image Captioning
by: Qu, Tingyu, et al.
Published: (2023)
by: Qu, Tingyu, et al.
Published: (2023)
VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection
by: Deng, Huilin, et al.
Published: (2024)
by: Deng, Huilin, et al.
Published: (2024)
Dynamic Updates for Language Adaptation in Visual-Language Tracking
by: Li, Xiaohai, et al.
Published: (2025)
by: Li, Xiaohai, et al.
Published: (2025)
Image Translation-Based Unsupervised Cross-Modality Domain Adaptation for Medical Image Segmentation
by: Yang, Tao, et al.
Published: (2025)
by: Yang, Tao, et al.
Published: (2025)
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
by: Zhuang, Wanru, et al.
Published: (2025)
by: Zhuang, Wanru, et al.
Published: (2025)
Similar Items
-
MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation
by: Li, Bo, et al.
Published: (2024) -
Minimal Interaction Separated Tuning: A New Paradigm for Visual Adaptation
by: Tang, Ningyuan, et al.
Published: (2024) -
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
by: Li, Daiqiang, et al.
Published: (2026) -
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
by: Wang, Xintong, et al.
Published: (2025) -
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
by: Zhou, Lijie
Published: (2026)