AnyTrans: Translate AnyText in the Image with Large Scale Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Qian, Zhipeng, Zhang, Pei, Yang, Baosong, Fan, Kai, Ma, Yiwei, Wong, Derek F., Sun, Xiaoshuai, Ji, Rongrong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Any-to-3D Generation via Hybrid Diffusion Supervision
di: Fan, Yijun, et al.
Pubblicazione: (2024)
di: Fan, Yijun, et al.
Pubblicazione: (2024)
AnyText: Multilingual Visual Text Generation And Editing
di: Tuo, Yuxiang, et al.
Pubblicazione: (2023)
di: Tuo, Yuxiang, et al.
Pubblicazione: (2023)
AnyText2: Visual Text Generation and Editing With Customizable Attributes
di: Tuo, Yuxiang, et al.
Pubblicazione: (2024)
di: Tuo, Yuxiang, et al.
Pubblicazione: (2024)
AnySR: Realizing Image Super-Resolution as Any-Scale, Any-Resource
di: Zhan, Wengyi, et al.
Pubblicazione: (2024)
di: Zhan, Wengyi, et al.
Pubblicazione: (2024)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
di: Yang, Danni, et al.
Pubblicazione: (2024)
di: Yang, Danni, et al.
Pubblicazione: (2024)
X-Oscar: A Progressive Framework for High-quality Text-guided 3D Animatable Avatar Generation
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
AnyControl: Create Your Artwork with Versatile Control on Text-to-Image Generation
di: Sun, Yanan, et al.
Pubblicazione: (2024)
di: Sun, Yanan, et al.
Pubblicazione: (2024)
Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation
di: Liu, Sihan, et al.
Pubblicazione: (2023)
di: Liu, Sihan, et al.
Pubblicazione: (2023)
Beat: Bi-directional One-to-Many Embedding Alignment for Text-based Person Retrieval
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
Large Language Model for Multi-Domain Translation: Benchmarking and Domain CoT Fine-tuning
di: Hu, Tianxiang, et al.
Pubblicazione: (2024)
di: Hu, Tianxiang, et al.
Pubblicazione: (2024)
Direct Simultaneous Translation Activation for Large Audio-Language Models
di: Zhang, Pei, et al.
Pubblicazione: (2025)
di: Zhang, Pei, et al.
Pubblicazione: (2025)
X-Dreamer: Creating High-quality 3D Content by Bridging the Domain Gap Between Text-to-2D and Text-to-3D Generation
di: Ma, Yiwei, et al.
Pubblicazione: (2023)
di: Ma, Yiwei, et al.
Pubblicazione: (2023)
Emojinize: Enriching Any Text with Emoji Translations
di: Klein, Lars Henning, et al.
Pubblicazione: (2024)
di: Klein, Lars Henning, et al.
Pubblicazione: (2024)
Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
Image Captioning via Dynamic Path Customization
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs
di: Zhang, Pei, et al.
Pubblicazione: (2025)
di: Zhang, Pei, et al.
Pubblicazione: (2025)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception
di: Li, Yang, et al.
Pubblicazione: (2026)
di: Li, Yang, et al.
Pubblicazione: (2026)
JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues
di: Ji, Jiayi, et al.
Pubblicazione: (2023)
di: Ji, Jiayi, et al.
Pubblicazione: (2023)
Any2Any: Unified Arbitrary Modality Translation for Remote Sensing
di: Chen, Haoyang, et al.
Pubblicazione: (2026)
di: Chen, Haoyang, et al.
Pubblicazione: (2026)
Online Segment Any 3D Thing as Instance Tracking
di: Wang, Hanshi, et al.
Pubblicazione: (2025)
di: Wang, Hanshi, et al.
Pubblicazione: (2025)
Self-Evaluation Unlocks Any-Step Text-to-Image Generation
di: Yu, Xin, et al.
Pubblicazione: (2025)
di: Yu, Xin, et al.
Pubblicazione: (2025)
SAM as the Guide: Mastering Pseudo-Label Refinement in Semi-Supervised Referring Expression Segmentation
di: Yang, Danni, et al.
Pubblicazione: (2024)
di: Yang, Danni, et al.
Pubblicazione: (2024)
QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
NExT-GPT: Any-to-Any Multimodal LLM
di: Wu, Shengqiong, et al.
Pubblicazione: (2023)
di: Wu, Shengqiong, et al.
Pubblicazione: (2023)
AnyTSR: Any-Scale Thermal Super-Resolution for UAV
di: Li, Mengyuan, et al.
Pubblicazione: (2025)
di: Li, Mengyuan, et al.
Pubblicazione: (2025)
4D-LRM: Large Space-Time Reconstruction Model From and To Any View at Any Time
di: Ma, Ziqiao, et al.
Pubblicazione: (2025)
di: Ma, Ziqiao, et al.
Pubblicazione: (2025)
Latent Space Chain-of-Embedding Enables Output-free LLM Self-Evaluation
di: Wang, Yiming, et al.
Pubblicazione: (2024)
di: Wang, Yiming, et al.
Pubblicazione: (2024)
Single‐Cell Profiling: Any Scale, Any Size, All at Once
di: Denise Goh, et al.
Pubblicazione: (2025)
di: Denise Goh, et al.
Pubblicazione: (2025)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
di: Wu, Mingrui, et al.
Pubblicazione: (2026)
di: Wu, Mingrui, et al.
Pubblicazione: (2026)
HRSeg: High-Resolution Visual Perception and Enhancement for Reasoning Segmentation
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning
di: Ma, Yiwei, et al.
Pubblicazione: (2025)
di: Ma, Yiwei, et al.
Pubblicazione: (2025)
Differential Equations for Energy Correlators in Any Angle
di: Ma, Rourou, et al.
Pubblicazione: (2025)
di: Ma, Rourou, et al.
Pubblicazione: (2025)
AnyUser: Translating Sketched User Intent into Domestic Robots
di: Yang, Songyuan, et al.
Pubblicazione: (2026)
di: Yang, Songyuan, et al.
Pubblicazione: (2026)
AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks
di: Li, You, et al.
Pubblicazione: (2024)
di: Li, You, et al.
Pubblicazione: (2024)
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
di: Yu, Qifan, et al.
Pubblicazione: (2024)
di: Yu, Qifan, et al.
Pubblicazione: (2024)
AnyPattern: Towards In-context Image Copy Detection
di: Wang, Wenhao, et al.
Pubblicazione: (2024)
di: Wang, Wenhao, et al.
Pubblicazione: (2024)
AniClipart: Clipart Animation with Text-to-Video Priors
di: Wu, Ronghuan, et al.
Pubblicazione: (2024)
di: Wu, Ronghuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Any-to-3D Generation via Hybrid Diffusion Supervision
di: Fan, Yijun, et al.
Pubblicazione: (2024) -
AnyText: Multilingual Visual Text Generation And Editing
di: Tuo, Yuxiang, et al.
Pubblicazione: (2023) -
AnyText2: Visual Text Generation and Editing With Customizable Attributes
di: Tuo, Yuxiang, et al.
Pubblicazione: (2024) -
AnySR: Realizing Image Super-Resolution as Any-Scale, Any-Resource
di: Zhan, Wengyi, et al.
Pubblicazione: (2024) -
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
di: Yang, Danni, et al.
Pubblicazione: (2024)