A U-Net and Transformer Pipeline for Multilingual Image Translation
Fuente:
arXiv
Guardado en:
| Autores principales: | Sahay, Siddharth, Agarwal, Radhika |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generalizable Blood Cell Detection via Unified Dataset and Faster R-CNN
por: Sahay, Siddharth
Publicado: (2025)
por: Sahay, Siddharth
Publicado: (2025)
Translation-Enhanced Multilingual Text-to-Image Generation
por: Li, Yaoyiran, et al.
Publicado: (2023)
por: Li, Yaoyiran, et al.
Publicado: (2023)
Crossing Language Borders: A Pipeline for Indonesian Manhwa Translation
por: Narasimhan, Nithyasri, et al.
Publicado: (2025)
por: Narasimhan, Nithyasri, et al.
Publicado: (2025)
Brazilian Portuguese Image Captioning with Transformers: A Study on Cross-Native-Translated Dataset
por: Bromonschenkel, Gabriel, et al.
Publicado: (2026)
por: Bromonschenkel, Gabriel, et al.
Publicado: (2026)
Deep Image-to-Recipe Translation
por: Ma, Jiangqin, et al.
Publicado: (2024)
por: Ma, Jiangqin, et al.
Publicado: (2024)
Aya Vision: Advancing the Frontier of Multilingual Multimodality
por: Dash, Saurabh, et al.
Publicado: (2025)
por: Dash, Saurabh, et al.
Publicado: (2025)
Efficient Scaling of Diffusion Transformers for Text-to-Image Generation
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
DocAtlas: Multilingual Document Understanding Across 80+ Languages
por: Heakl, Ahmed, et al.
Publicado: (2026)
por: Heakl, Ahmed, et al.
Publicado: (2026)
Scaling Sign Language Translation
por: Zhang, Biao, et al.
Publicado: (2024)
por: Zhang, Biao, et al.
Publicado: (2024)
Text Change Detection in Multilingual Documents Using Image Comparison
por: Park, Doyoung, et al.
Publicado: (2024)
por: Park, Doyoung, et al.
Publicado: (2024)
LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining
por: Shen, Huawen, et al.
Publicado: (2024)
por: Shen, Huawen, et al.
Publicado: (2024)
EMMA: Efficient Visual Alignment in Multi-Modal LLMs
por: Ghazanfari, Sara, et al.
Publicado: (2024)
por: Ghazanfari, Sara, et al.
Publicado: (2024)
Real-time Bangla Sign Language Translator
por: Pranto, Rotan Hawlader, et al.
Publicado: (2024)
por: Pranto, Rotan Hawlader, et al.
Publicado: (2024)
General Transform: A Unified Framework for Adaptive Transform to Enhance Representations
por: Budiutama, Gekko, et al.
Publicado: (2025)
por: Budiutama, Gekko, et al.
Publicado: (2025)
A Survey on Transformer Compression
por: Tang, Yehui, et al.
Publicado: (2024)
por: Tang, Yehui, et al.
Publicado: (2024)
CART: Compositional Auto-Regressive Transformer for Image Generation
por: Roheda, Siddharth, et al.
Publicado: (2024)
por: Roheda, Siddharth, et al.
Publicado: (2024)
S-E Pipeline: A Vision Transformer (ViT) based Resilient Classification Pipeline for Medical Imaging Against Adversarial Attacks
por: S, Neha A, et al.
Publicado: (2024)
por: S, Neha A, et al.
Publicado: (2024)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
por: Xu, Qinwu, et al.
Publicado: (2026)
por: Xu, Qinwu, et al.
Publicado: (2026)
PRIM: Towards Practical In-Image Multilingual Machine Translation
por: Tian, Yanzhi, et al.
Publicado: (2025)
por: Tian, Yanzhi, et al.
Publicado: (2025)
Transformer-VQ: Linear-Time Transformers via Vector Quantization
por: Lingle, Lucas D.
Publicado: (2023)
por: Lingle, Lucas D.
Publicado: (2023)
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
por: Joshi, Siddharth, et al.
Publicado: (2025)
por: Joshi, Siddharth, et al.
Publicado: (2025)
Exploring Attention Mechanisms in Integration of Multi-Modal Information for Sign Language Recognition and Translation
por: Hakim, Zaber Ibn Abdul, et al.
Publicado: (2023)
por: Hakim, Zaber Ibn Abdul, et al.
Publicado: (2023)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
por: Chen, Yangyi, et al.
Publicado: (2024)
por: Chen, Yangyi, et al.
Publicado: (2024)
Multi-Modal Hallucination Control by Visual Information Grounding
por: Favero, Alessandro, et al.
Publicado: (2024)
por: Favero, Alessandro, et al.
Publicado: (2024)
Parrot: Multilingual Visual Instruction Tuning
por: Sun, Hai-Long, et al.
Publicado: (2024)
por: Sun, Hai-Long, et al.
Publicado: (2024)
ConvNet vs Transformer, Supervised vs CLIP: Beyond ImageNet Accuracy
por: Vishniakov, Kirill, et al.
Publicado: (2023)
por: Vishniakov, Kirill, et al.
Publicado: (2023)
MatFormer: Nested Transformer for Elastic Inference
por: Devvrit, et al.
Publicado: (2023)
por: Devvrit, et al.
Publicado: (2023)
Transformer with Controlled Attention for Synchronous Motion Captioning
por: Radouane, Karim, et al.
Publicado: (2024)
por: Radouane, Karim, et al.
Publicado: (2024)
Head Pursuit: Probing Attention Specialization in Multimodal Transformers
por: Basile, Lorenzo, et al.
Publicado: (2025)
por: Basile, Lorenzo, et al.
Publicado: (2025)
CAT: Circular-Convolutional Attention for Sub-Quadratic Transformers
por: Yamada, Yoshihiro
Publicado: (2025)
por: Yamada, Yoshihiro
Publicado: (2025)
Breaking through the learning plateaus of in-context learning in Transformer
por: Fu, Jingwen, et al.
Publicado: (2023)
por: Fu, Jingwen, et al.
Publicado: (2023)
HATFormer: Historic Handwritten Arabic Text Recognition with Transformers
por: Chan, Adrian, et al.
Publicado: (2024)
por: Chan, Adrian, et al.
Publicado: (2024)
Matryoshka Query Transformer for Large Vision-Language Models
por: Hu, Wenbo, et al.
Publicado: (2024)
por: Hu, Wenbo, et al.
Publicado: (2024)
Babel-ImageNet: Massively Multilingual Evaluation of Vision-and-Language Representations
por: Geigle, Gregor, et al.
Publicado: (2023)
por: Geigle, Gregor, et al.
Publicado: (2023)
MOFI: Learning Image Representations from Noisy Entity Annotated Images
por: Wu, Wentao, et al.
Publicado: (2023)
por: Wu, Wentao, et al.
Publicado: (2023)
Text-to-Image Cross-Modal Generation: A Systematic Review
por: Żelaszczyk, Maciej, et al.
Publicado: (2024)
por: Żelaszczyk, Maciej, et al.
Publicado: (2024)
Words in Motion: Extracting Interpretable Control Vectors for Motion Transformers
por: Tas, Omer Sahin, et al.
Publicado: (2024)
por: Tas, Omer Sahin, et al.
Publicado: (2024)
Text Role Classification in Scientific Charts Using Multimodal Transformers
por: Kim, Hye Jin, et al.
Publicado: (2024)
por: Kim, Hye Jin, et al.
Publicado: (2024)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
por: Villegas, Danae Sánchez, et al.
Publicado: (2025)
por: Villegas, Danae Sánchez, et al.
Publicado: (2025)
IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models
por: Lei, Jiayi, et al.
Publicado: (2025)
por: Lei, Jiayi, et al.
Publicado: (2025)
Ejemplares similares
-
Generalizable Blood Cell Detection via Unified Dataset and Faster R-CNN
por: Sahay, Siddharth
Publicado: (2025) -
Translation-Enhanced Multilingual Text-to-Image Generation
por: Li, Yaoyiran, et al.
Publicado: (2023) -
Crossing Language Borders: A Pipeline for Indonesian Manhwa Translation
por: Narasimhan, Nithyasri, et al.
Publicado: (2025) -
Brazilian Portuguese Image Captioning with Transformers: A Study on Cross-Native-Translated Dataset
por: Bromonschenkel, Gabriel, et al.
Publicado: (2026) -
Deep Image-to-Recipe Translation
por: Ma, Jiangqin, et al.
Publicado: (2024)