LeX-Art: Rethinking Text Generation via Scalable High-Quality Data Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Shitian, Wu, Qilong, Li, Xinyue, Zhang, Bo, Li, Ming, Qin, Qi, Liu, Dongyang, Zhang, Kaipeng, Li, Hongsheng, Qiao, Yu, Gao, Peng, Fu, Bin, Li, Zhen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining
par: Liu, Dongyang, et autres
Publié: (2024)
par: Liu, Dongyang, et autres
Publié: (2024)
PyVision: Agentic Vision with Dynamic Tooling
par: Zhao, Shitian, et autres
Publié: (2025)
par: Zhao, Shitian, et autres
Publié: (2025)
Rethinking Long-tailed Dataset Distillation: A Uni-Level Framework with Unbiased Recovery and Relabeling
par: Cui, Xiao, et autres
Publié: (2025)
par: Cui, Xiao, et autres
Publié: (2025)
PyVision-RL: Forging Open Agentic Vision Models via RL
par: Zhao, Shitian, et autres
Publié: (2026)
par: Zhao, Shitian, et autres
Publié: (2026)
Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Multi-Modal Character Localization and Extraction for Chinese Text Recognition
par: Li, Qilong, et autres
Publié: (2026)
par: Li, Qilong, et autres
Publié: (2026)
IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models
par: Lei, Jiayi, et autres
Publié: (2025)
par: Lei, Jiayi, et autres
Publié: (2025)
SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
par: Liu, Dongyang, et autres
Publié: (2024)
par: Liu, Dongyang, et autres
Publié: (2024)
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Scalable Multi-Objective Optimization for Robust Traffic Signal Control in Uncertain Environments
par: Guo, Weian, et autres
Publié: (2024)
par: Guo, Weian, et autres
Publié: (2024)
Yume-1.5: A Text-Controlled Interactive World Generation Model
par: Mao, Xiaofeng, et autres
Publié: (2025)
par: Mao, Xiaofeng, et autres
Publié: (2025)
Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT
par: Liu, Dongyang, et autres
Publié: (2025)
par: Liu, Dongyang, et autres
Publié: (2025)
Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield
par: Liu, Dongyang, et autres
Publié: (2025)
par: Liu, Dongyang, et autres
Publié: (2025)
Sekai: A Video Dataset towards World Exploration
par: Li, Zhen, et autres
Publié: (2025)
par: Li, Zhen, et autres
Publié: (2025)
T3M: Text Guided 3D Human Motion Synthesis from Speech
par: Peng, Wenshuo, et autres
Publié: (2024)
par: Peng, Wenshuo, et autres
Publié: (2024)
Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
par: Qin, Qi, et autres
Publié: (2025)
par: Qin, Qi, et autres
Publié: (2025)
A High-Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation
par: Feng, Yukang, et autres
Publié: (2025)
par: Feng, Yukang, et autres
Publié: (2025)
OmniCaptioner: One Captioner to Rule Them All
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
3DRot: Rediscovering the Missing Primitive for RGB-Based 3D Augmentation
par: Yang, Shitian, et autres
Publié: (2025)
par: Yang, Shitian, et autres
Publié: (2025)
I-Max: Maximize the Resolution Potential of Pre-trained Rectified Flow Transformers with Projected Flow
par: Du, Ruoyi, et autres
Publié: (2024)
par: Du, Ruoyi, et autres
Publié: (2024)
Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
par: Zhao, Shijie, et autres
Publié: (2025)
par: Zhao, Shijie, et autres
Publié: (2025)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
par: Li, Maomao, et autres
Publié: (2026)
par: Li, Maomao, et autres
Publié: (2026)
Radiation‐Hardened Design of High‐Voltage Gate Drive Circuit in a 0.5‐μm SOI‐BCD Process
par: Xiaohui Li, et autres
Publié: (2025)
par: Xiaohui Li, et autres
Publié: (2025)
Optimal error estimates of a decoupled finite element scheme for the unsteady inductionless MHD equations
par: Xiaodi Zhang, et autres
Publié: (2024)
par: Xiaodi Zhang, et autres
Publié: (2024)
Rethinking Human Evaluation Protocol for Text-to-Video Models: Enhancing Reliability,Reproducibility, and Practicality
par: Zhang, Tianle, et autres
Publié: (2024)
par: Zhang, Tianle, et autres
Publié: (2024)
InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
par: Zhang, Ziyun, et autres
Publié: (2026)
par: Zhang, Ziyun, et autres
Publié: (2026)
Resurrect Mask AutoRegressive Modeling for Efficient and Scalable Image Generation
par: Xin, Yi, et autres
Publié: (2025)
par: Xin, Yi, et autres
Publié: (2025)
Benzimidazo[1,2‐c]Quinazolines Luminescent Materials: Synthesis, Molecular Packing, and Aggregation Effects
par: Chunhua Zhang, et autres
Publié: (2025)
par: Chunhua Zhang, et autres
Publié: (2025)
Rethinking Text-based Protein Understanding: Retrieval or LLM?
par: Wu, Juntong, et autres
Publié: (2025)
par: Wu, Juntong, et autres
Publié: (2025)
General Procedure to Provide High-Probability Guarantees for Stochastic Saddle Point Problems
par: Li, Dongyang, et autres
Publié: (2024)
par: Li, Dongyang, et autres
Publié: (2024)
Concept Based Continuous Prompts for Interpretable Text Classification
par: Chen, Qian, et autres
Publié: (2024)
par: Chen, Qian, et autres
Publié: (2024)
BeSimulator: A Large Language Model Powered Text-based Behavior Simulator
par: Wang, Jianan, et autres
Publié: (2024)
par: Wang, Jianan, et autres
Publié: (2024)
WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG
par: Li, Zhen, et autres
Publié: (2026)
par: Li, Zhen, et autres
Publié: (2026)
DREAM: Scalable Red Teaming for Text-to-Image Generative Systems via Distribution Modeling
par: Li, Boheng, et autres
Publié: (2025)
par: Li, Boheng, et autres
Publié: (2025)
ScaleDreamer: Scalable Text-to-3D Synthesis with Asynchronous Score Distillation
par: Ma, Zhiyuan, et autres
Publié: (2024)
par: Ma, Zhiyuan, et autres
Publié: (2024)
PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
par: Lin, Weifeng, et autres
Publié: (2024)
par: Lin, Weifeng, et autres
Publié: (2024)
IA-T2I: Internet-Augmented Text-to-Image Generation
par: Li, Chuanhao, et autres
Publié: (2025)
par: Li, Chuanhao, et autres
Publié: (2025)
Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
par: Zhuo, Le, et autres
Publié: (2024)
par: Zhuo, Le, et autres
Publié: (2024)
Blockchain-Based Multi-Path Mobile Access Point Selection for Secure 5G VANETs
par: Zhang, Zhiou, et autres
Publié: (2024)
par: Zhang, Zhiou, et autres
Publié: (2024)
Scalable $k$-clique Densest Subgraph Search
par: Ye, Xiaowei, et autres
Publié: (2024)
par: Ye, Xiaowei, et autres
Publié: (2024)
Documents similaires
-
Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining
par: Liu, Dongyang, et autres
Publié: (2024) -
PyVision: Agentic Vision with Dynamic Tooling
par: Zhao, Shitian, et autres
Publié: (2025) -
Rethinking Long-tailed Dataset Distillation: A Uni-Level Framework with Unbiased Recovery and Relabeling
par: Cui, Xiao, et autres
Publié: (2025) -
PyVision-RL: Forging Open Agentic Vision Models via RL
par: Zhao, Shitian, et autres
Publié: (2026) -
Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
par: Li, Ming, et autres
Publié: (2025)