Glance: Accelerating Diffusion Models with 1 Sample
Fuente:
arXiv
Salvato in:
| Autori principali: | Dong, Zhuobai, Zhao, Rui, Wu, Songjie, Yi, Junchao, Li, Linjie, Yang, Zhengyuan, Wang, Lijuan, Wang, Alex Jinpeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT
di: Dong, Zhuobai, et al.
Pubblicazione: (2025)
di: Dong, Zhuobai, et al.
Pubblicazione: (2025)
FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
di: Yi, Junchao, et al.
Pubblicazione: (2026)
di: Yi, Junchao, et al.
Pubblicazione: (2026)
TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
di: Zheng, Xiangxi, et al.
Pubblicazione: (2025)
di: Zheng, Xiangxi, et al.
Pubblicazione: (2025)
Bring Metric Functions into Diffusion Models
di: An, Jie, et al.
Pubblicazione: (2024)
di: An, Jie, et al.
Pubblicazione: (2024)
TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering
di: Mao, Dongxing, et al.
Pubblicazione: (2026)
di: Mao, Dongxing, et al.
Pubblicazione: (2026)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
di: Lin, Yiqi, et al.
Pubblicazione: (2025)
di: Lin, Yiqi, et al.
Pubblicazione: (2025)
Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization
di: Miao, Zichen, et al.
Pubblicazione: (2024)
di: Miao, Zichen, et al.
Pubblicazione: (2024)
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025)
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2025)
di: Wang, Xiyao, et al.
Pubblicazione: (2025)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
di: Yang, Zhengyuan, et al.
Pubblicazione: (2023)
di: Yang, Zhengyuan, et al.
Pubblicazione: (2023)
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
di: Qiu, Jielin, et al.
Pubblicazione: (2024)
di: Qiu, Jielin, et al.
Pubblicazione: (2024)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
GlanceVAD: Exploring Glance Supervision for Label-efficient Video Anomaly Detection
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2023)
di: Yu, Weihao, et al.
Pubblicazione: (2023)
GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
T2VUnlearning: A Concept Erasing Method for Text-to-Video Diffusion Models
di: Ye, Xiaoyu, et al.
Pubblicazione: (2025)
di: Ye, Xiaoyu, et al.
Pubblicazione: (2025)
Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation
di: Zhang, Jihai, et al.
Pubblicazione: (2025)
di: Zhang, Jihai, et al.
Pubblicazione: (2025)
GenXD: Generating Any 3D and 4D Scenes
di: Zhao, Yuyang, et al.
Pubblicazione: (2024)
di: Zhao, Yuyang, et al.
Pubblicazione: (2024)
Accelerating Diffusion-based Super-Resolution with Dynamic Time-Spatial Sampling
di: Qin, Rui, et al.
Pubblicazione: (2025)
di: Qin, Rui, et al.
Pubblicazione: (2025)
Planning with the Views via Scene Self-Exploration
di: Wang, Kangrui, et al.
Pubblicazione: (2026)
di: Wang, Kangrui, et al.
Pubblicazione: (2026)
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
DisCo: Disentangled Control for Realistic Human Dance Generation
di: Wang, Tan, et al.
Pubblicazione: (2023)
di: Wang, Tan, et al.
Pubblicazione: (2023)
Adaptive Stochastic Coefficients for Accelerating Diffusion Sampling
di: Wang, Ruoyu, et al.
Pubblicazione: (2025)
di: Wang, Ruoyu, et al.
Pubblicazione: (2025)
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
Single-Stage Signal Attenuation Diffusion Model for Low-Light Image Enhancement and Denoising
di: Liu, Ying, et al.
Pubblicazione: (2026)
di: Liu, Ying, et al.
Pubblicazione: (2026)
EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
di: Zheng, Kaizhi, et al.
Pubblicazione: (2024)
di: Zheng, Kaizhi, et al.
Pubblicazione: (2024)
Training-free Diffusion Acceleration with Bottleneck Sampling
di: Tian, Ye, et al.
Pubblicazione: (2025)
di: Tian, Ye, et al.
Pubblicazione: (2025)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2024)
di: Yu, Weihao, et al.
Pubblicazione: (2024)
TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
Glance and Focus Reinforcement for Pan-cancer Screening
di: Wu, Linshan, et al.
Pubblicazione: (2026)
di: Wu, Linshan, et al.
Pubblicazione: (2026)
Glance-MCMT: A General MCMT Framework with Glance Initialization and Progressive Association
di: Hashempoor, Hamidreza
Pubblicazione: (2025)
di: Hashempoor, Hamidreza
Pubblicazione: (2025)
Documenti analoghi
-
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025) -
Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT
di: Dong, Zhuobai, et al.
Pubblicazione: (2025) -
FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
di: Yi, Junchao, et al.
Pubblicazione: (2026) -
TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025) -
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
di: Zheng, Xiangxi, et al.
Pubblicazione: (2025)