Harmonizing Visual Text Comprehension and Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Zhen, Tang, Jingqun, Wu, Binghong, Lin, Chunhui, Wei, Shu, Liu, Hao, Tan, Xin, Zhang, Zhizhong, Huang, Can, Xie, Yuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multi-modal In-Context Learning Makes an Ego-evolving Scene Text Recognizer
di: Zhao, Zhen, et al.
Pubblicazione: (2023)
di: Zhao, Zhen, et al.
Pubblicazione: (2023)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
TabPedia: Towards Comprehensive Visual Table Understanding with Concept Synergy
di: Zhao, Weichao, et al.
Pubblicazione: (2024)
di: Zhao, Weichao, et al.
Pubblicazione: (2024)
Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
di: Feng, Hao, et al.
Pubblicazione: (2025)
di: Feng, Hao, et al.
Pubblicazione: (2025)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
di: Zhu, Hanshen, et al.
Pubblicazione: (2026)
di: Zhu, Hanshen, et al.
Pubblicazione: (2026)
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
di: Shan, Bin, et al.
Pubblicazione: (2024)
di: Shan, Bin, et al.
Pubblicazione: (2024)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
di: Fu, Ling, et al.
Pubblicazione: (2024)
di: Fu, Ling, et al.
Pubblicazione: (2024)
ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension
di: Xu, Duo, et al.
Pubblicazione: (2025)
di: Xu, Duo, et al.
Pubblicazione: (2025)
Beyond the Label Itself: Latent Labels Enhance Semi-supervised Point Cloud Panoptic Segmentation
di: Chen, Yujun, et al.
Pubblicazione: (2023)
di: Chen, Yujun, et al.
Pubblicazione: (2023)
Exploring the Untouched Sweeps for Conflict-Aware 3D Segmentation Pretraining
di: Sun, Tianfang, et al.
Pubblicazione: (2024)
di: Sun, Tianfang, et al.
Pubblicazione: (2024)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
di: Feng, Hao, et al.
Pubblicazione: (2023)
di: Feng, Hao, et al.
Pubblicazione: (2023)
Visual Text Meets Low-level Vision: A Comprehensive Survey on Visual Text Processing
di: Shu, Yan, et al.
Pubblicazione: (2024)
di: Shu, Yan, et al.
Pubblicazione: (2024)
Text-Animator: Controllable Visual Text Video Generation
di: Liu, Lin, et al.
Pubblicazione: (2024)
di: Liu, Lin, et al.
Pubblicazione: (2024)
FastLGS: Speeding up Language Embedded Gaussians with Feature Grid Mapping
di: Ji, Yuzhou, et al.
Pubblicazione: (2024)
di: Ji, Yuzhou, et al.
Pubblicazione: (2024)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
di: Wang, An-Lan, et al.
Pubblicazione: (2025)
di: Wang, An-Lan, et al.
Pubblicazione: (2025)
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
di: Wu, Size, et al.
Pubblicazione: (2025)
di: Wu, Size, et al.
Pubblicazione: (2025)
GSCompleter: A Distillation-Free Plugin for Metric-Aware 3D Gaussian Splatting Completion in Seconds
di: Gao, Ao, et al.
Pubblicazione: (2026)
di: Gao, Ao, et al.
Pubblicazione: (2026)
COTR: Compact Occupancy TRansformer for Vision-based 3D Occupancy Prediction
di: Ma, Qihang, et al.
Pubblicazione: (2023)
di: Ma, Qihang, et al.
Pubblicazione: (2023)
Building a Strong Pre-Training Baseline for Universal 3D Large-Scale Perception
di: Chen, Haoming, et al.
Pubblicazione: (2024)
di: Chen, Haoming, et al.
Pubblicazione: (2024)
Learning Visual Generative Priors without Text
di: Ma, Shuailei, et al.
Pubblicazione: (2024)
di: Ma, Shuailei, et al.
Pubblicazione: (2024)
S2GS: Streaming Semantic Gaussian Splatting for Online Scene Understanding and Reconstruction
di: Zhang, Renhe, et al.
Pubblicazione: (2026)
di: Zhang, Renhe, et al.
Pubblicazione: (2026)
LayerFusion: Harmonized Multi-Layer Text-to-Image Generation with Generative Priors
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)
Mutual Information Guided Optimal Transport for Unsupervised Visible-Infrared Person Re-identification
di: Zhang, Zhizhong, et al.
Pubblicazione: (2024)
di: Zhang, Zhizhong, et al.
Pubblicazione: (2024)
Generalizable Object Re-Identification via Visual In-Context Prompting
di: Huang, Zhizhong, et al.
Pubblicazione: (2025)
di: Huang, Zhizhong, et al.
Pubblicazione: (2025)
ParGo: Bridging Vision-Language with Partial and Global Views
di: Wang, An-Lan, et al.
Pubblicazione: (2024)
di: Wang, An-Lan, et al.
Pubblicazione: (2024)
Visual Text Processing: A Comprehensive Review and Unified Evaluation
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
Comprehensive Relighting: Generalizable and Consistent Monocular Human Relighting and Harmonization
di: Wang, Junying, et al.
Pubblicazione: (2025)
di: Wang, Junying, et al.
Pubblicazione: (2025)
YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos
di: Chen, Haoming, et al.
Pubblicazione: (2025)
di: Chen, Haoming, et al.
Pubblicazione: (2025)
GEOcc: Geometrically Enhanced 3D Occupancy Network with Implicit-Explicit Depth Fusion and Contextual Self-Supervision
di: Tan, Xin, et al.
Pubblicazione: (2024)
di: Tan, Xin, et al.
Pubblicazione: (2024)
BizGen: Advancing Article-level Visual Text Rendering for Infographics Generation
di: Peng, Yuyang, et al.
Pubblicazione: (2025)
di: Peng, Yuyang, et al.
Pubblicazione: (2025)
PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection
di: Li, Xiaofan, et al.
Pubblicazione: (2024)
di: Li, Xiaofan, et al.
Pubblicazione: (2024)
DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation
di: Wang, Zhizhong, et al.
Pubblicazione: (2025)
di: Wang, Zhizhong, et al.
Pubblicazione: (2025)
Human Motion Synthesis in 3D Scenes via Unified Scene Semantic Occupancy
di: Jingyu, Gong, et al.
Pubblicazione: (2025)
di: Jingyu, Gong, et al.
Pubblicazione: (2025)
Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
di: Feng, Hao, et al.
Pubblicazione: (2026)
di: Feng, Hao, et al.
Pubblicazione: (2026)
Human Image Generation: A Comprehensive Survey
di: Jia, Zhen, et al.
Pubblicazione: (2022)
di: Jia, Zhen, et al.
Pubblicazione: (2022)
AnyText: Multilingual Visual Text Generation And Editing
di: Tuo, Yuxiang, et al.
Pubblicazione: (2023)
di: Tuo, Yuxiang, et al.
Pubblicazione: (2023)
Text-guided Visual Prompt DINO for Generic Segmentation
di: Guan, Yuchen, et al.
Pubblicazione: (2025)
di: Guan, Yuchen, et al.
Pubblicazione: (2025)
Beyond Text: Frozen Large Language Models in Visual Signal Comprehension
di: Zhu, Lei, et al.
Pubblicazione: (2024)
di: Zhu, Lei, et al.
Pubblicazione: (2024)
EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Multi-modal In-Context Learning Makes an Ego-evolving Scene Text Recognizer
di: Zhao, Zhen, et al.
Pubblicazione: (2023) -
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
di: Tang, Jingqun, et al.
Pubblicazione: (2024) -
TabPedia: Towards Comprehensive Visual Table Understanding with Concept Synergy
di: Zhao, Weichao, et al.
Pubblicazione: (2024) -
Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
di: Feng, Hao, et al.
Pubblicazione: (2025) -
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
di: Tang, Jingqun, et al.
Pubblicazione: (2024)