VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Bo, Chen, Ronghao, Deng, Ningyuan, Wang, Huacan, Zhu, Shaolin, Wen, Lijie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
Minimal Interaction Separated Tuning: A New Paradigm for Visual Adaptation
par: Tang, Ningyuan, et autres
Publié: (2024)
par: Tang, Ningyuan, et autres
Publié: (2024)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
par: Li, Daiqiang, et autres
Publié: (2026)
par: Li, Daiqiang, et autres
Publié: (2026)
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
par: Wang, Xintong, et autres
Publié: (2025)
par: Wang, Xintong, et autres
Publié: (2025)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
par: Zhou, Lijie
Publié: (2026)
par: Zhou, Lijie
Publié: (2026)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
Sample-Aware Test-Time Adaptation for Medical Image-to-Image Translation
par: Iele, Irene, et autres
Publié: (2025)
par: Iele, Irene, et autres
Publié: (2025)
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
CoDA: Instructive Chain-of-Domain Adaptation with Severity-Aware Visual Prompt Tuning
par: Gong, Ziyang, et autres
Publié: (2024)
par: Gong, Ziyang, et autres
Publié: (2024)
MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks
par: Xu, Yushen, et autres
Publié: (2025)
par: Xu, Yushen, et autres
Publié: (2025)
Negation-Aware Test-Time Adaptation for Vision-Language Models
par: Han, Haochen, et autres
Publié: (2025)
par: Han, Haochen, et autres
Publié: (2025)
FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation
par: Zhang, Liuzhou, et autres
Publié: (2026)
par: Zhang, Liuzhou, et autres
Publié: (2026)
MoTE: Reconciling Generalization with Specialization for Visual-Language to Video Knowledge Transfer
par: Zhu, Minghao, et autres
Publié: (2024)
par: Zhu, Minghao, et autres
Publié: (2024)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
par: Chen, Junzhe, et autres
Publié: (2024)
par: Chen, Junzhe, et autres
Publié: (2024)
SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision
par: Li, Zhaoxu, et autres
Publié: (2025)
par: Li, Zhaoxu, et autres
Publié: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
par: Atuhurra, Jesse, et autres
Publié: (2024)
par: Atuhurra, Jesse, et autres
Publié: (2024)
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
par: Lin, Ci-Siang, et autres
Publié: (2025)
par: Lin, Ci-Siang, et autres
Publié: (2025)
ZOTTA: Test-Time Adaptation with Gradient-Free Zeroth-Order Optimization
par: Zhang, Ronghao, et autres
Publié: (2026)
par: Zhang, Ronghao, et autres
Publié: (2026)
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
par: Madinei, Parsa, et autres
Publié: (2025)
par: Madinei, Parsa, et autres
Publié: (2025)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
par: Fu, Ronghao, et autres
Publié: (2026)
par: Fu, Ronghao, et autres
Publié: (2026)
Image Translation as Diffusion Visual Programmers
par: Han, Cheng, et autres
Publié: (2024)
par: Han, Cheng, et autres
Publié: (2024)
GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
par: Zhang, Jensen, et autres
Publié: (2025)
par: Zhang, Jensen, et autres
Publié: (2025)
Bayesian Test-Time Adaptation for Vision-Language Models
par: Zhou, Lihua, et autres
Publié: (2025)
par: Zhou, Lihua, et autres
Publié: (2025)
mAVE: A Watermark for Joint Audio-Visual Generation Models
par: Si, Luyang, et autres
Publié: (2026)
par: Si, Luyang, et autres
Publié: (2026)
PRIM: Towards Practical In-Image Multilingual Machine Translation
par: Tian, Yanzhi, et autres
Publié: (2025)
par: Tian, Yanzhi, et autres
Publié: (2025)
Dynamic Rank Adaptation for Vision-Language Models
par: Wang, Jiahui, et autres
Publié: (2025)
par: Wang, Jiahui, et autres
Publié: (2025)
TherA: Thermal-Aware Visual-Language Prompting for Controllable RGB-to-Thermal Infrared Translation
par: Lee, Dong-Guw, et autres
Publié: (2026)
par: Lee, Dong-Guw, et autres
Publié: (2026)
Leveraging Text-to-Image Diffusion Models for Unsupervised Visual Object Tracking
par: Zhang, Zhengbo, et autres
Publié: (2026)
par: Zhang, Zhengbo, et autres
Publié: (2026)
Task-Aware Resolution Optimization for Visual Large Language Models
par: Luo, Weiqing, et autres
Publié: (2025)
par: Luo, Weiqing, et autres
Publié: (2025)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
par: Li, Shuang, et autres
Publié: (2024)
par: Li, Shuang, et autres
Publié: (2024)
Beyond Text: Frozen Large Language Models in Visual Signal Comprehension
par: Zhu, Lei, et autres
Publié: (2024)
par: Zhu, Lei, et autres
Publié: (2024)
Large Language Models are Universal Reasoners for Visual Generation
par: Ren, Sucheng, et autres
Publié: (2026)
par: Ren, Sucheng, et autres
Publié: (2026)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
par: Huang, Jing, et autres
Publié: (2025)
par: Huang, Jing, et autres
Publié: (2025)
LAPIG: Language Guided Projector Image Generation with Surface Adaptation and Stylization
par: Deng, Yuchen, et autres
Publié: (2025)
par: Deng, Yuchen, et autres
Publié: (2025)
Visually-Aware Context Modeling for News Image Captioning
par: Qu, Tingyu, et autres
Publié: (2023)
par: Qu, Tingyu, et autres
Publié: (2023)
VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection
par: Deng, Huilin, et autres
Publié: (2024)
par: Deng, Huilin, et autres
Publié: (2024)
Dynamic Updates for Language Adaptation in Visual-Language Tracking
par: Li, Xiaohai, et autres
Publié: (2025)
par: Li, Xiaohai, et autres
Publié: (2025)
Image Translation-Based Unsupervised Cross-Modality Domain Adaptation for Medical Image Segmentation
par: Yang, Tao, et autres
Publié: (2025)
par: Yang, Tao, et autres
Publié: (2025)
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
par: Zhuang, Wanru, et autres
Publié: (2025)
par: Zhuang, Wanru, et autres
Publié: (2025)
Documents similaires
-
MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation
par: Li, Bo, et autres
Publié: (2024) -
Minimal Interaction Separated Tuning: A New Paradigm for Visual Adaptation
par: Tang, Ningyuan, et autres
Publié: (2024) -
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
par: Li, Daiqiang, et autres
Publié: (2026) -
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
par: Wang, Xintong, et autres
Publié: (2025) -
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
par: Zhou, Lijie
Publié: (2026)