Guardado en:
| Autores principales: | Zhao, Yaqi, Wang, Xiaochen, Dong, Li, Zhang, Wentao, Yuan, Yuhui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2510.11117 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reinforced Diffusion: Learning to Push the Limits of Anisotropic Diffusion for Image Denoising
por: Qin, Xinran, et al.
Publicado: (2025)
por: Qin, Xinran, et al.
Publicado: (2025)
Demystifying Variational Diffusion Models
por: Ribeiro, Fabio De Sousa, et al.
Publicado: (2024)
por: Ribeiro, Fabio De Sousa, et al.
Publicado: (2024)
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
por: Zhao, Yaqi, et al.
Publicado: (2026)
por: Zhao, Yaqi, et al.
Publicado: (2026)
Reversing Skin Cancer Adversarial Examples by Multiscale Diffusive and Denoising Aggregation Mechanism
por: Wang, Yongwei, et al.
Publicado: (2022)
por: Wang, Yongwei, et al.
Publicado: (2022)
FontStudio: Shape-Adaptive Diffusion Model for Coherent and Consistent Font Effect Generation
por: Mu, Xinzhi, et al.
Publicado: (2024)
por: Mu, Xinzhi, et al.
Publicado: (2024)
Demystifying Foreground-Background Memorization in Diffusion Models
por: Di, Jimmy Z., et al.
Publicado: (2025)
por: Di, Jimmy Z., et al.
Publicado: (2025)
Adaptive Query Prompting for Multi-Domain Landmark Detection
por: Li, Yuhui, et al.
Publicado: (2024)
por: Li, Yuhui, et al.
Publicado: (2024)
CPKD: Clinical Prior Knowledge-Constrained Diffusion Models for Surgical Phase Recognition in Endoscopic Submucosal Dissection
por: Zhang, Xiangning, et al.
Publicado: (2025)
por: Zhang, Xiangning, et al.
Publicado: (2025)
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
por: Dong, Hejun, et al.
Publicado: (2026)
por: Dong, Hejun, et al.
Publicado: (2026)
Bridge to Non-Barrier Communication: Gloss-Prompted Fine-grained Cued Speech Gesture Generation with Diffusion Model
por: Lei, Wentao, et al.
Publicado: (2024)
por: Lei, Wentao, et al.
Publicado: (2024)
CCEdit: Creative and Controllable Video Editing via Diffusion Models
por: Feng, Ruoyu, et al.
Publicado: (2023)
por: Feng, Ruoyu, et al.
Publicado: (2023)
Controlling the Latent Diffusion Model for Generative Image Shadow Removal via Residual Generation
por: Li, Xinjie, et al.
Publicado: (2024)
por: Li, Xinjie, et al.
Publicado: (2024)
SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs
por: Yin, Yuanyang, et al.
Publicado: (2024)
por: Yin, Yuanyang, et al.
Publicado: (2024)
JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement
por: Wu, Yuhui, et al.
Publicado: (2023)
por: Wu, Yuhui, et al.
Publicado: (2023)
Revisiting MLLM Based Image Quality Assessment: Errors and Remedy
por: Tang, Zhenchen, et al.
Publicado: (2025)
por: Tang, Zhenchen, et al.
Publicado: (2025)
Demystifying CLIP Data
por: Xu, Hu, et al.
Publicado: (2023)
por: Xu, Hu, et al.
Publicado: (2023)
Demystifying Flux Architecture
por: Greenberg, Or
Publicado: (2025)
por: Greenberg, Or
Publicado: (2025)
Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization
por: Liang, Zhanhao, et al.
Publicado: (2024)
por: Liang, Zhanhao, et al.
Publicado: (2024)
Demystifying Video Reasoning
por: Wang, Ruisi, et al.
Publicado: (2026)
por: Wang, Ruisi, et al.
Publicado: (2026)
PrismLayers: Open Data for High-Quality Multi-Layer Transparent Image Generative Models
por: Chen, Junwen, et al.
Publicado: (2025)
por: Chen, Junwen, et al.
Publicado: (2025)
Demystifying Catastrophic Forgetting in Two-Stage Incremental Object Detector
por: Wu, Qirui, et al.
Publicado: (2025)
por: Wu, Qirui, et al.
Publicado: (2025)
BiDM: Pushing the Limit of Quantization for Diffusion Models
por: Zheng, Xingyu, et al.
Publicado: (2024)
por: Zheng, Xingyu, et al.
Publicado: (2024)
Demystifying the Visual Quality Paradox in Multimodal Large Language Models
por: Xing, Shuo, et al.
Publicado: (2025)
por: Xing, Shuo, et al.
Publicado: (2025)
Unsupervised Generation of Pseudo Normal PET from MRI with Diffusion Model for Epileptic Focus Localization
por: Chen, Wentao, et al.
Publicado: (2024)
por: Chen, Wentao, et al.
Publicado: (2024)
A Survey on Personalized Content Synthesis with Diffusion Models
por: Zhang, Xulu, et al.
Publicado: (2024)
por: Zhang, Xulu, et al.
Publicado: (2024)
UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
por: Zhao, Min, et al.
Publicado: (2025)
por: Zhao, Min, et al.
Publicado: (2025)
Demystify Transformers & Convolutions in Modern Image Deep Networks
por: Hu, Xiaowei, et al.
Publicado: (2022)
por: Hu, Xiaowei, et al.
Publicado: (2022)
Semantic Image Synthesis via Diffusion Models
por: Zhou, Wengang, et al.
Publicado: (2022)
por: Zhou, Wengang, et al.
Publicado: (2022)
Demystifying Action Space Design for Robotic Manipulation Policies
por: Feng, Yuchun, et al.
Publicado: (2026)
por: Feng, Yuchun, et al.
Publicado: (2026)
Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness
por: Hu, Xin, et al.
Publicado: (2026)
por: Hu, Xin, et al.
Publicado: (2026)
Physically-Grounded Manifold Projection Model for Generalizable Metal Artifact Reduction in Dental CBCT
por: Li, Zhi, et al.
Publicado: (2025)
por: Li, Zhi, et al.
Publicado: (2025)
Distribution-Aware Data Expansion with Diffusion Models
por: Zhu, Haowei, et al.
Publicado: (2024)
por: Zhu, Haowei, et al.
Publicado: (2024)
High-Quality 3D Creation from A Single Image Using Subject-Specific Knowledge Prior
por: Huang, Nan, et al.
Publicado: (2023)
por: Huang, Nan, et al.
Publicado: (2023)
E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources
por: Shen, Tong, et al.
Publicado: (2025)
por: Shen, Tong, et al.
Publicado: (2025)
SeaDATE: Remedy Dual-Attention Transformer with Semantic Alignment via Contrast Learning for Multimodal Object Detection
por: Dong, Shuhan, et al.
Publicado: (2024)
por: Dong, Shuhan, et al.
Publicado: (2024)
Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics
por: Wang, Hai, et al.
Publicado: (2026)
por: Wang, Hai, et al.
Publicado: (2026)
FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers
por: Wang, Qiang, et al.
Publicado: (2025)
por: Wang, Qiang, et al.
Publicado: (2025)
Reconciling Semantic Controllability and Diversity for Remote Sensing Image Synthesis with Hybrid Semantic Embedding
por: Liu, Junde, et al.
Publicado: (2024)
por: Liu, Junde, et al.
Publicado: (2024)
Evolving Without Ending: Unifying Multimodal Incremental Learning for Continual Panoptic Perception
por: Yuan, Bo, et al.
Publicado: (2026)
por: Yuan, Bo, et al.
Publicado: (2026)
Debiasing Diffusion Priors via 3D Attention for Consistent Gaussian Splatting
por: Jin, Shilong, et al.
Publicado: (2025)
por: Jin, Shilong, et al.
Publicado: (2025)
Ejemplares similares
-
Reinforced Diffusion: Learning to Push the Limits of Anisotropic Diffusion for Image Denoising
por: Qin, Xinran, et al.
Publicado: (2025) -
Demystifying Variational Diffusion Models
por: Ribeiro, Fabio De Sousa, et al.
Publicado: (2024) -
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
por: Zhao, Yaqi, et al.
Publicado: (2026) -
Reversing Skin Cancer Adversarial Examples by Multiscale Diffusive and Denoising Aggregation Mechanism
por: Wang, Yongwei, et al.
Publicado: (2022) -
FontStudio: Shape-Adaptive Diffusion Model for Coherent and Consistent Font Effect Generation
por: Mu, Xinzhi, et al.
Publicado: (2024)