Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Dong, Wei, Fangyun, Wan, Ziyu, Chen, Dongdong, Zhang, Jiawei, Zhao, Jinjing, Zhang, Sirui, Yue, Yang, Liang, Zhiyang, Guo, Baining, Luo, Chong, Bao, Jianmin, Li, Ji, Shi, Lei, Yang, Qinhong, Wu, Xiuyu, Feng, Xuelu, Lu, Yan, Dong, Yanchen, Wang, Yitong, Chen, Yunuo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fast Autoregressive Models for Continuous Latent Generation
par: Hang, Tiankai, et autres
Publié: (2025)
par: Hang, Tiankai, et autres
Publié: (2025)
Diffusion Models without Classifier-free Guidance
par: Tang, Zhicong, et autres
Publié: (2025)
par: Tang, Zhicong, et autres
Publié: (2025)
MageBench: Bridging Large Multimodal Models to Agents
par: Zhang, Miaosen, et autres
Publié: (2024)
par: Zhang, Miaosen, et autres
Publié: (2024)
VolumeDiffusion: Flexible Text-to-3D Generation with Efficient Volumetric Encoder
par: Tang, Zhicong, et autres
Publié: (2023)
par: Tang, Zhicong, et autres
Publié: (2023)
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
par: Li, Qixiu, et autres
Publié: (2024)
par: Li, Qixiu, et autres
Publié: (2024)
Rethinking Generative Large Language Model Evaluation for Semantic Comprehension
par: Wei, Fangyun, et autres
Publié: (2024)
par: Wei, Fangyun, et autres
Publié: (2024)
SynChart: Synthesizing Charts from Language Models
par: Liu, Mengchen, et autres
Publié: (2024)
par: Liu, Mengchen, et autres
Publié: (2024)
LACON: Training Text-to-Image Model from Uncurated Data
par: Liang, Zhiyang, et autres
Publié: (2026)
par: Liang, Zhiyang, et autres
Publié: (2026)
Efficient Diffusion Training via Min-SNR Weighting Strategy
par: Hang, Tiankai, et autres
Publié: (2023)
par: Hang, Tiankai, et autres
Publié: (2023)
From Virtual Games to Real-World Play
par: Sun, Wenqiang, et autres
Publié: (2025)
par: Sun, Wenqiang, et autres
Publié: (2025)
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
par: Feng, Xuelu, et autres
Publié: (2025)
par: Feng, Xuelu, et autres
Publié: (2025)
Semantic Image Synthesis via Diffusion Models
par: Zhou, Wengang, et autres
Publié: (2022)
par: Zhou, Wengang, et autres
Publié: (2022)
CCEdit: Creative and Controllable Video Editing via Diffusion Models
par: Feng, Ruoyu, et autres
Publié: (2023)
par: Feng, Ruoyu, et autres
Publié: (2023)
EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty
par: Li, Yuhui, et autres
Publié: (2024)
par: Li, Yuhui, et autres
Publié: (2024)
AtlasGS: Atlanta-world Guided Surface Reconstruction with Implicit Structured Gaussians
par: Zhang, Xiyu, et autres
Publié: (2025)
par: Zhang, Xiyu, et autres
Publié: (2025)
Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%
par: Zhu, Lei, et autres
Publié: (2024)
par: Zhu, Lei, et autres
Publié: (2024)
InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation
par: Yue, Yang, et autres
Publié: (2026)
par: Yue, Yang, et autres
Publié: (2026)
ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
SmartEraser: Remove Anything from Images using Masked-Region Guidance
par: Jiang, Longtao, et autres
Publié: (2025)
par: Jiang, Longtao, et autres
Publié: (2025)
MobileManiBench: Simplifying Model Verification for Mobile Manipulation
par: Wang, Wenbo, et autres
Publié: (2026)
par: Wang, Wenbo, et autres
Publié: (2026)
Spatia: Video Generation with Updatable Spatial Memory
par: Zhao, Jinjing, et autres
Publié: (2025)
par: Zhao, Jinjing, et autres
Publié: (2025)
Full‐Dimensional Penetration Strategy with Degradable PEAI Enables 8.21% Efficiency in Bulk Heterojunction Sb2S3 Solar Cells
par: Yang Wang, et autres
Publié: (2025)
par: Yang Wang, et autres
Publié: (2025)
Laparoscopic Cervical Cerclage Offers Greatest Benefit for Patients With Multiple Conizations or Significantly Shortened Cervix: A Retrospective Study Based on Causal Inference Modeling
par: Xia Li, et autres
Publié: (2026)
par: Xia Li, et autres
Publié: (2026)
Gaussian Variation Field Diffusion for High-fidelity Video-to-4D Synthesis
par: Zhang, Bowen, et autres
Publié: (2025)
par: Zhang, Bowen, et autres
Publié: (2025)
Animate Any Character in Any World
par: Wang, Yitong, et autres
Publié: (2025)
par: Wang, Yitong, et autres
Publié: (2025)
Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models
par: Chen, Jierun, et autres
Publié: (2024)
par: Chen, Jierun, et autres
Publié: (2024)
Rethinking Quantum Noise in Quantum Machine Learning: When Noise Improves Learning
par: Zhu, Linghua, et autres
Publié: (2026)
par: Zhu, Linghua, et autres
Publié: (2026)
Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation
par: Zhu, Zixin, et autres
Publié: (2024)
par: Zhu, Zixin, et autres
Publié: (2024)
DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer
par: Dong, Qingji, et autres
Publié: (2026)
par: Dong, Qingji, et autres
Publié: (2026)
Antibacterial Activity of MC‐170, a 2,2‐Disubstituted Indole‐3‐one Derivative, Against Staphylococcus aureus via Phosphatidylglycerol
par: Yumiao Zhao, et autres
Publié: (2025)
par: Yumiao Zhao, et autres
Publié: (2025)
Rethinking the Vulnerability of Concept Erasure and a New Method
par: Richardson, Alex D., et autres
Publié: (2025)
par: Richardson, Alex D., et autres
Publié: (2025)
Simplified Diffusion Schrödinger Bridge
par: Tang, Zhicong, et autres
Publié: (2024)
par: Tang, Zhicong, et autres
Publié: (2024)
CCA: Collaborative Competitive Agents for Image Editing
par: Hang, Tiankai, et autres
Publié: (2024)
par: Hang, Tiankai, et autres
Publié: (2024)
Incorporating Pre-trained Diffusion Models in Solving the Schrödinger Bridge Problem
par: Tang, Zhicong, et autres
Publié: (2025)
par: Tang, Zhicong, et autres
Publié: (2025)
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
par: Chen, Huanran, et autres
Publié: (2023)
par: Chen, Huanran, et autres
Publié: (2023)
A High‐Efficiency Codesign Method for Bandgap Circuit by Submodule Optimization
par: Yunqi Yang, et autres
Publié: (2025)
par: Yunqi Yang, et autres
Publié: (2025)
VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
par: Shen, Yichao, et autres
Publié: (2025)
par: Shen, Yichao, et autres
Publié: (2025)
New record-breaking binary linear codes constructed from group codes
par: Yu, Cong, et autres
Publié: (2024)
par: Yu, Cong, et autres
Publié: (2024)
Inevitable Encounters: Backdoor Attacks Involving Lossy Compression
par: Li, Qian, et autres
Publié: (2026)
par: Li, Qian, et autres
Publié: (2026)
PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action
par: Shao, Yijia, et autres
Publié: (2024)
par: Shao, Yijia, et autres
Publié: (2024)
Documents similaires
-
Fast Autoregressive Models for Continuous Latent Generation
par: Hang, Tiankai, et autres
Publié: (2025) -
Diffusion Models without Classifier-free Guidance
par: Tang, Zhicong, et autres
Publié: (2025) -
MageBench: Bridging Large Multimodal Models to Agents
par: Zhang, Miaosen, et autres
Publié: (2024) -
VolumeDiffusion: Flexible Text-to-3D Generation with Efficient Volumetric Encoder
par: Tang, Zhicong, et autres
Publié: (2023) -
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
par: Li, Qixiu, et autres
Publié: (2024)