Text-Only Data Synthesis for Vision Language Model Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Xiaomin, Zhang, Wenjie, Qiao, Ziyue, Qin, Chengwei, Xiong, Hui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models
di: Zhang, Yabin, et al.
Pubblicazione: (2024)
di: Zhang, Yabin, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
di: Li, Yongqi, et al.
Pubblicazione: (2024)
di: Li, Yongqi, et al.
Pubblicazione: (2024)
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
di: Wu, Yi, et al.
Pubblicazione: (2025)
di: Wu, Yi, et al.
Pubblicazione: (2025)
A User-Friendly Framework for Generating Model-Preferred Prompts in Text-to-Image Synthesis
di: Hei, Nailei, et al.
Pubblicazione: (2024)
di: Hei, Nailei, et al.
Pubblicazione: (2024)
Distilling Vision-Language Foundation Models: A Data-Free Approach via Prompt Diversification
di: Xuan, Yunyi, et al.
Pubblicazione: (2024)
di: Xuan, Yunyi, et al.
Pubblicazione: (2024)
InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)
Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
di: Liu, Che, et al.
Pubblicazione: (2026)
di: Liu, Che, et al.
Pubblicazione: (2026)
ScaleDreamer: Scalable Text-to-3D Synthesis with Asynchronous Score Distillation
di: Ma, Zhiyuan, et al.
Pubblicazione: (2024)
di: Ma, Zhiyuan, et al.
Pubblicazione: (2024)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
di: Xu, Yichen, et al.
Pubblicazione: (2025)
di: Xu, Yichen, et al.
Pubblicazione: (2025)
Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework
di: Arkhipkin, Vladimir, et al.
Pubblicazione: (2024)
di: Arkhipkin, Vladimir, et al.
Pubblicazione: (2024)
KAN Text to Vision? The Exploration of Kolmogorov-Arnold Networks for Multi-Scale Sequence-Based Pose Animation from Sign Language Notation
di: Du, Guanyi, et al.
Pubblicazione: (2026)
di: Du, Guanyi, et al.
Pubblicazione: (2026)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
Concept Conductor: Orchestrating Multiple Personalized Concepts in Text-to-Image Synthesis
di: Yao, Zebin, et al.
Pubblicazione: (2024)
di: Yao, Zebin, et al.
Pubblicazione: (2024)
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2023)
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2023)
PanMatch: Unleashing the Potential of Large Vision Models for Unified Matching Models
di: Zhang, Yongjian, et al.
Pubblicazione: (2025)
di: Zhang, Yongjian, et al.
Pubblicazione: (2025)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis
di: Li, Dexiang, et al.
Pubblicazione: (2026)
di: Li, Dexiang, et al.
Pubblicazione: (2026)
Discriminative Probing and Tuning for Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric
di: Lin, Haokun, et al.
Pubblicazione: (2024)
di: Lin, Haokun, et al.
Pubblicazione: (2024)
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
di: Deng, Ailin, et al.
Pubblicazione: (2025)
di: Deng, Ailin, et al.
Pubblicazione: (2025)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
di: Zhang, Zilun, et al.
Pubblicazione: (2023)
di: Zhang, Zilun, et al.
Pubblicazione: (2023)
Hyperbolic Safety-Aware Vision-Language Models
di: Poppi, Tobia, et al.
Pubblicazione: (2025)
di: Poppi, Tobia, et al.
Pubblicazione: (2025)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
di: Wu, Haoning, et al.
Pubblicazione: (2023)
di: Wu, Haoning, et al.
Pubblicazione: (2023)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
di: Wang, Zihang, et al.
Pubblicazione: (2026)
di: Wang, Zihang, et al.
Pubblicazione: (2026)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement
di: Wu, Hao, et al.
Pubblicazione: (2024)
di: Wu, Hao, et al.
Pubblicazione: (2024)
Audio Visual Segmentation Through Text Embeddings
di: Lee, Kyungbok, et al.
Pubblicazione: (2025)
di: Lee, Kyungbok, et al.
Pubblicazione: (2025)
Causal Graphical Models for Vision-Language Compositional Understanding
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2024)
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2024)
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
di: Ouyang, Shuyi, et al.
Pubblicazione: (2024)
di: Ouyang, Shuyi, et al.
Pubblicazione: (2024)
POINTS: Improving Your Vision-language Model with Affordable Strategies
di: Liu, Yuan, et al.
Pubblicazione: (2024)
di: Liu, Yuan, et al.
Pubblicazione: (2024)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
di: Han, Wei, et al.
Pubblicazione: (2023)
di: Han, Wei, et al.
Pubblicazione: (2023)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
di: Ghosh, Dhruba, et al.
Pubblicazione: (2026)
di: Ghosh, Dhruba, et al.
Pubblicazione: (2026)
Anisotropic Modality Align
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
Harmonizing Attention: Training-free Texture-aware Geometry Transfer
di: Ikuta, Eito, et al.
Pubblicazione: (2024)
di: Ikuta, Eito, et al.
Pubblicazione: (2024)
Enhancing Self-Supervised Talking Head Forgery Detection via a Training-Free Dual-System Framework
di: Liu, Ke, et al.
Pubblicazione: (2026)
di: Liu, Ke, et al.
Pubblicazione: (2026)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
Can Large Language Models Grasp Event Signals? Exploring Pure Zero-Shot Event-based Recognition
di: Yu, Zongyou, et al.
Pubblicazione: (2024)
di: Yu, Zongyou, et al.
Pubblicazione: (2024)
IRR: Image Review Ranking Framework for Evaluating Vision-Language Models
di: Hayashi, Kazuki, et al.
Pubblicazione: (2024)
di: Hayashi, Kazuki, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
di: Yu, Xiaomin, et al.
Pubblicazione: (2026) -
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models
di: Zhang, Yabin, et al.
Pubblicazione: (2024) -
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
di: Zhang, Yue, et al.
Pubblicazione: (2025) -
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
di: Li, Yongqi, et al.
Pubblicazione: (2024) -
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
di: Wu, Yi, et al.
Pubblicazione: (2025)