Dual-branch Prompting for Multimodal Machine Translation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Jie, Yang, Zhendong, Zong, Liansong, Zhang, Xiaobo, Wang, Dexian, Zhang, Ji |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
por: Liang, Yupu, et al.
Publicado: (2025)
por: Liang, Yupu, et al.
Publicado: (2025)
MoLAN: A Unified Modality-Aware Noise Dynamic Editing Framework for Multimodal Sentiment Analysis
por: Xu, Xingle, et al.
Publicado: (2025)
por: Xu, Xingle, et al.
Publicado: (2025)
Pixel-Level Reasoning Segmentation via Multi-turn Conversations
por: Cai, Dexian, et al.
Publicado: (2025)
por: Cai, Dexian, et al.
Publicado: (2025)
Acceleration Multiple Heads Decoding for LLM via Dynamic Tree Attention
por: Zhang, Zhendong
Publicado: (2025)
por: Zhang, Zhendong
Publicado: (2025)
VP-MEL: Visual Prompts Guided Multimodal Entity Linking
por: Mi, Hongze, et al.
Publicado: (2024)
por: Mi, Hongze, et al.
Publicado: (2024)
Improving MLLM's Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiency
por: Liang, Yupu, et al.
Publicado: (2025)
por: Liang, Yupu, et al.
Publicado: (2025)
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
por: Qian, Yusu, et al.
Publicado: (2024)
por: Qian, Yusu, et al.
Publicado: (2024)
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
por: Zhang, Huatian, et al.
Publicado: (2026)
por: Zhang, Huatian, et al.
Publicado: (2026)
Multi-task Prompt Words Learning for Social Media Content Generation
por: Xue, Haochen, et al.
Publicado: (2024)
por: Xue, Haochen, et al.
Publicado: (2024)
Learning How To Ask: Cycle-Consistency Refines Prompts in Multimodal Foundation Models
por: Diesendruck, Maurice, et al.
Publicado: (2024)
por: Diesendruck, Maurice, et al.
Publicado: (2024)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
por: Hong, Jixiang, et al.
Publicado: (2025)
por: Hong, Jixiang, et al.
Publicado: (2025)
AOR: Anatomical Ontology-Guided Reasoning for Medical Large Multimodal Model in Chest X-Ray Interpretation
por: Li, Qingqiu, et al.
Publicado: (2025)
por: Li, Qingqiu, et al.
Publicado: (2025)
DWE+: Dual-Way Matching Enhanced Framework for Multimodal Entity Linking
por: Song, Shezheng, et al.
Publicado: (2024)
por: Song, Shezheng, et al.
Publicado: (2024)
Generalizable Prompt Learning of CLIP: A Brief Overview
por: Cui, Fangming, et al.
Publicado: (2025)
por: Cui, Fangming, et al.
Publicado: (2025)
Universal Prompt Optimizer for Safe Text-to-Image Generation
por: Wu, Zongyu, et al.
Publicado: (2024)
por: Wu, Zongyu, et al.
Publicado: (2024)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
por: Ji, Yatai, et al.
Publicado: (2024)
por: Ji, Yatai, et al.
Publicado: (2024)
Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation
por: Khan, Shaharukh, et al.
Publicado: (2025)
por: Khan, Shaharukh, et al.
Publicado: (2025)
CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation
por: Cui, Guofeng, et al.
Publicado: (2025)
por: Cui, Guofeng, et al.
Publicado: (2025)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
por: Li, Yan, et al.
Publicado: (2026)
por: Li, Yan, et al.
Publicado: (2026)
Exploring In-Image Machine Translation with Real-World Background
por: Tian, Yanzhi, et al.
Publicado: (2025)
por: Tian, Yanzhi, et al.
Publicado: (2025)
PRIM: Towards Practical In-Image Multilingual Machine Translation
por: Tian, Yanzhi, et al.
Publicado: (2025)
por: Tian, Yanzhi, et al.
Publicado: (2025)
Video-guided Machine Translation with Global Video Context
por: Chen, Jian, et al.
Publicado: (2026)
por: Chen, Jian, et al.
Publicado: (2026)
Similarity Guided Multimodal Fusion Transformer for Semantic Location Prediction in Social Media
por: Zhang, Zhizhen, et al.
Publicado: (2024)
por: Zhang, Zhizhen, et al.
Publicado: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
por: Du, Yiyang, et al.
Publicado: (2025)
por: Du, Yiyang, et al.
Publicado: (2025)
Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
por: Zhang, Dongxu, et al.
Publicado: (2026)
por: Zhang, Dongxu, et al.
Publicado: (2026)
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
por: Zhang, Yi-Fan, et al.
Publicado: (2025)
por: Zhang, Yi-Fan, et al.
Publicado: (2025)
CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers
por: Shi, Dachuan, et al.
Publicado: (2023)
por: Shi, Dachuan, et al.
Publicado: (2023)
Efficient Universal Goal Hijacking with Semantics-guided Prompt Organization
por: Huang, Yihao, et al.
Publicado: (2024)
por: Huang, Yihao, et al.
Publicado: (2024)
Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts
por: Xu, Run, et al.
Publicado: (2026)
por: Xu, Run, et al.
Publicado: (2026)
Spectral Prompt Tuning:Unveiling Unseen Classes for Zero-Shot Semantic Segmentation
por: Xu, Wenhao, et al.
Publicado: (2023)
por: Xu, Wenhao, et al.
Publicado: (2023)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
por: Gao, Timin, et al.
Publicado: (2024)
por: Gao, Timin, et al.
Publicado: (2024)
Fast Prompt Alignment for Text-to-Image Generation
por: Mrini, Khalil, et al.
Publicado: (2024)
por: Mrini, Khalil, et al.
Publicado: (2024)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
por: Zhao, Haozhe, et al.
Publicado: (2024)
por: Zhao, Haozhe, et al.
Publicado: (2024)
VidProM: A Million-scale Real Prompt-Gallery Dataset for Text-to-Video Diffusion Models
por: Wang, Wenhao, et al.
Publicado: (2024)
por: Wang, Wenhao, et al.
Publicado: (2024)
Towards Multimodal Sentiment Analysis Debiasing via Bias Purification
por: Yang, Dingkang, et al.
Publicado: (2024)
por: Yang, Dingkang, et al.
Publicado: (2024)
VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools
por: Qi, Ji, et al.
Publicado: (2023)
por: Qi, Ji, et al.
Publicado: (2023)
Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles
por: Slyman, Eric, et al.
Publicado: (2025)
por: Slyman, Eric, et al.
Publicado: (2025)
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
por: Guo, Zirun, et al.
Publicado: (2024)
por: Guo, Zirun, et al.
Publicado: (2024)
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
Ejemplares similares
-
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
por: Liang, Yupu, et al.
Publicado: (2025) -
MoLAN: A Unified Modality-Aware Noise Dynamic Editing Framework for Multimodal Sentiment Analysis
por: Xu, Xingle, et al.
Publicado: (2025) -
Pixel-Level Reasoning Segmentation via Multi-turn Conversations
por: Cai, Dexian, et al.
Publicado: (2025) -
Acceleration Multiple Heads Decoding for LLM via Dynamic Tree Attention
por: Zhang, Zhendong
Publicado: (2025) -
VP-MEL: Visual Prompts Guided Multimodal Entity Linking
por: Mi, Hongze, et al.
Publicado: (2024)