RealSyn: An Effective and Scalable Multimodal Interleaved Document Transformation Paradigm
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gu, Tiancheng, Yang, Kaicheng, Zhang, Chaoyi, Xie, Yin, An, Xiang, Feng, Ziyong, Liu, Dongnan, Cai, Weidong, Deng, Jiankang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RWKV-CLIP: A Robust Vision-Language Representation Learner
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
ORID: Organ-Regional Information Driven Framework for Radiology Report Generation
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
par: Gu, Tiancheng, et autres
Publié: (2025)
par: Gu, Tiancheng, et autres
Publié: (2025)
CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination
par: Yang, Kaicheng, et autres
Publié: (2024)
par: Yang, Kaicheng, et autres
Publié: (2024)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs
par: Gu, Tiancheng, et autres
Publié: (2025)
par: Gu, Tiancheng, et autres
Publié: (2025)
Multi-label Cluster Discrimination for Visual Representation Learning
par: An, Xiang, et autres
Publié: (2024)
par: An, Xiang, et autres
Publié: (2024)
PaCo-FR: Patch-Pixel Aligned End-to-End Codebook Learning for Facial Representation Pre-training
par: Xie, Yin, et autres
Publié: (2025)
par: Xie, Yin, et autres
Publié: (2025)
ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs
par: Xie, Yin, et autres
Publié: (2024)
par: Xie, Yin, et autres
Publié: (2024)
Exploring Annotation-free Image Captioning with Retrieval-augmented Pseudo Sentence Generation
par: Li, Zhiyuan, et autres
Publié: (2023)
par: Li, Zhiyuan, et autres
Publié: (2023)
High-Fidelity Facial Albedo Estimation via Texture Quantization
par: Ran, Zimin, et autres
Publié: (2024)
par: Ran, Zimin, et autres
Publié: (2024)
Region-based Cluster Discrimination for Visual Representation Learning
par: Xie, Yin, et autres
Publié: (2025)
par: Xie, Yin, et autres
Publié: (2025)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
par: Shen, Hengyu, et autres
Publié: (2026)
par: Shen, Hengyu, et autres
Publié: (2026)
Efficient, Validation-Free Intrinsic Quality Estimation for Large-Scale Face Recognition Datasets
par: Chen, Zhichao, et autres
Publié: (2026)
par: Chen, Zhichao, et autres
Publié: (2026)
UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
Enhancing Robustness to Noise Corruption for Point Cloud Recognition via Spatial Sorting and Set-Mixing Aggregation Module
par: Zhang, Dingxin, et autres
Publié: (2024)
par: Zhang, Dingxin, et autres
Publié: (2024)
ForCenNet: Foreground-Centric Network for Document Image Rectification
par: Cai, Peng, et autres
Publié: (2025)
par: Cai, Peng, et autres
Publié: (2025)
Gradient-Attention Guided Dual-Masking Synergetic Framework for Robust Text-based Person Retrieval
par: Zheng, Tianlu, et autres
Publié: (2025)
par: Zheng, Tianlu, et autres
Publié: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
par: Chen, Jiaxing, et autres
Publié: (2024)
par: Chen, Jiaxing, et autres
Publié: (2024)
IDAdapter: Learning Mixed Features for Tuning-Free Personalization of Text-to-Image Models
par: Cui, Siying, et autres
Publié: (2024)
par: Cui, Siying, et autres
Publié: (2024)
OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence
par: Tang, Feilong, et autres
Publié: (2026)
par: Tang, Feilong, et autres
Publié: (2026)
1st Place Solution to the 1st SkatingVerse Challenge
par: Sun, Tao, et autres
Publié: (2024)
par: Sun, Tao, et autres
Publié: (2024)
Multi-source-free Domain Adaptation via Uncertainty-aware Adaptive Distillation
par: Song, Yaxuan, et autres
Publié: (2024)
par: Song, Yaxuan, et autres
Publié: (2024)
Cross-View Consistency Regularisation for Knowledge Distillation
par: Zhang, Weijia, et autres
Publié: (2024)
par: Zhang, Weijia, et autres
Publié: (2024)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
par: Wang, Xuanchen, et autres
Publié: (2024)
par: Wang, Xuanchen, et autres
Publié: (2024)
Learning to Generalize over Subpartitions for Heterogeneity-aware Domain Adaptive Nuclei Segmentation
par: Fan, Jianan, et autres
Publié: (2024)
par: Fan, Jianan, et autres
Publié: (2024)
Learning to Synthesize Graphics Programs for Geometric Artworks
par: Bing, Qi, et autres
Publié: (2024)
par: Bing, Qi, et autres
Publié: (2024)
Through the Magnifying Glass: Adaptive Perception Magnification for Hallucination-Free VLM Decoding
par: Mao, Shunqi, et autres
Publié: (2025)
par: Mao, Shunqi, et autres
Publié: (2025)
DeepIcon: A Hierarchical Network for Layer-wise Icon Vectorization
par: Bing, Qi, et autres
Publié: (2024)
par: Bing, Qi, et autres
Publié: (2024)
InterSyn: Interleaved Learning for Dynamic Motion Synthesis in the Wild
par: Ma, Yiyi, et autres
Publié: (2025)
par: Ma, Yiyi, et autres
Publié: (2025)
Decoupled Global-Local Alignment for Improving Compositional Understanding
par: Hu, Xiaoxing, et autres
Publié: (2025)
par: Hu, Xiaoxing, et autres
Publié: (2025)
Unified Multimodal Interleaved Document Representation for Retrieval
par: Lee, Jaewoo, et autres
Publié: (2024)
par: Lee, Jaewoo, et autres
Publié: (2024)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
par: An, Xiang, et autres
Publié: (2025)
par: An, Xiang, et autres
Publié: (2025)
AMNCutter: Affinity-Attention-Guided Multi-View Normalized Cutter for Unsupervised Surgical Instrument Segmentation
par: Sheng, Mingyu, et autres
Publié: (2024)
par: Sheng, Mingyu, et autres
Publié: (2024)
Revisiting Surgical Instrument Segmentation Without Human Intervention: A Graph Partitioning View
par: Sheng, Mingyu, et autres
Publié: (2024)
par: Sheng, Mingyu, et autres
Publié: (2024)
TextBind: Multi-turn Interleaved Multimodal Instruction-following in the Wild
par: Li, Huayang, et autres
Publié: (2023)
par: Li, Huayang, et autres
Publié: (2023)
ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder
par: Hu, Xiaoxing, et autres
Publié: (2025)
par: Hu, Xiaoxing, et autres
Publié: (2025)
PMC-InterCPT: Rethinking Biomedical Interleaved Data for Multimodal Continued Pretraining
par: Zhu, Guanghao, et autres
Publié: (2026)
par: Zhu, Guanghao, et autres
Publié: (2026)
Documents similaires
-
RWKV-CLIP: A Robust Vision-Language Representation Learner
par: Gu, Tiancheng, et autres
Publié: (2024) -
ORID: Organ-Regional Information Driven Framework for Radiology Report Generation
par: Gu, Tiancheng, et autres
Publié: (2024) -
UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
par: Gu, Tiancheng, et autres
Publié: (2025) -
CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination
par: Yang, Kaicheng, et autres
Publié: (2024) -
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
par: Gu, Tiancheng, et autres
Publié: (2024)