Uniform Discrete Diffusion with Metric Path for Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Deng, Haoge, Pan, Ting, Zhang, Fan, Liu, Yang, Luo, Zhuoyan, Cui, Yufeng, Wang, Wenxuan, Shen, Chunhua, Shan, Shiguang, Zhang, Zhaoxiang, Wang, Xinlong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Autoregressive Video Generation without Vector Quantization
di: Deng, Haoge, et al.
Pubblicazione: (2024)
di: Deng, Haoge, et al.
Pubblicazione: (2024)
UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models
di: Wang, Jiaqi, et al.
Pubblicazione: (2026)
di: Wang, Jiaqi, et al.
Pubblicazione: (2026)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
End-to-End Vision Tokenizer Tuning
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
LINA: Linear Autoregressive Image Generative Models with Continuous Tokens
di: Wang, Jiahao, et al.
Pubblicazione: (2026)
di: Wang, Jiahao, et al.
Pubblicazione: (2026)
Tokenize Anything via Prompting
di: Pan, Ting, et al.
Pubblicazione: (2023)
di: Pan, Ting, et al.
Pubblicazione: (2023)
Emu3.5: Native Multimodal Models are World Learners
di: Cui, Yufeng, et al.
Pubblicazione: (2025)
di: Cui, Yufeng, et al.
Pubblicazione: (2025)
You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale
di: Ma, Baorui, et al.
Pubblicazione: (2024)
di: Ma, Baorui, et al.
Pubblicazione: (2024)
CI-VID: A Coherent Interleaved Text-Video Dataset
di: Ju, Yiming, et al.
Pubblicazione: (2025)
di: Ju, Yiming, et al.
Pubblicazione: (2025)
Diffusion Feedback Helps CLIP See Better
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models
di: Wang, Wen, et al.
Pubblicazione: (2023)
di: Wang, Wen, et al.
Pubblicazione: (2023)
Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion Models
di: Wang, Zhongqi, et al.
Pubblicazione: (2025)
di: Wang, Zhongqi, et al.
Pubblicazione: (2025)
T2IShield: Defending Against Backdoors on Text-to-Image Diffusion Models
di: Wang, Zhongqi, et al.
Pubblicazione: (2024)
di: Wang, Zhongqi, et al.
Pubblicazione: (2024)
Unified Vision-Language-Action Model
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
Trigger without Trace: Towards Stealthy Backdoor Attack on Text-to-Image Diffusion Models
di: Zhang, Jie, et al.
Pubblicazione: (2025)
di: Zhang, Jie, et al.
Pubblicazione: (2025)
Geo-Align: Video Generation Alignment via Metric Geometry Reward
di: Li, Zizun, et al.
Pubblicazione: (2026)
di: Li, Zizun, et al.
Pubblicazione: (2026)
EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
di: Sun, Quan, et al.
Pubblicazione: (2024)
di: Sun, Quan, et al.
Pubblicazione: (2024)
Generalized Face Liveness Detection via De-fake Face Generator
di: Long, Xingming, et al.
Pubblicazione: (2024)
di: Long, Xingming, et al.
Pubblicazione: (2024)
T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models
di: Li, Changzhen, et al.
Pubblicazione: (2025)
di: Li, Changzhen, et al.
Pubblicazione: (2025)
LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation
di: Gao, Huanlin, et al.
Pubblicazione: (2025)
di: Gao, Huanlin, et al.
Pubblicazione: (2025)
Generative Multimodal Models are In-Context Learners
di: Sun, Quan, et al.
Pubblicazione: (2023)
di: Sun, Quan, et al.
Pubblicazione: (2023)
Unleashing the Potential of the Diffusion Model in Few-shot Semantic Segmentation
di: Zhu, Muzhi, et al.
Pubblicazione: (2024)
di: Zhu, Muzhi, et al.
Pubblicazione: (2024)
Anonymization Prompt Learning for Facial Privacy-Preserving Text-to-Image Generation
di: Shi, Liang, et al.
Pubblicazione: (2024)
di: Shi, Liang, et al.
Pubblicazione: (2024)
Design-based Estimation Theory for Complex Experiments
di: Chang, Haoge
Pubblicazione: (2023)
di: Chang, Haoge
Pubblicazione: (2023)
Emu: Generative Pretraining in Multimodality
di: Sun, Quan, et al.
Pubblicazione: (2023)
di: Sun, Quan, et al.
Pubblicazione: (2023)
BIMM: Brain Inspired Masked Modeling for Video Representation Learning
di: Wan, Zhifan, et al.
Pubblicazione: (2024)
di: Wan, Zhifan, et al.
Pubblicazione: (2024)
MotionVerse: A Unified Multimodal Framework for Motion Comprehension, Generation and Editing
di: Hou, Ruibing, et al.
Pubblicazione: (2025)
di: Hou, Ruibing, et al.
Pubblicazione: (2025)
Optimizing for the Shortest Path in Denoising Diffusion Model
di: Chen, Ping, et al.
Pubblicazione: (2025)
di: Chen, Ping, et al.
Pubblicazione: (2025)
Computer-Aided Design Generation by Cascaded Discrete Diffusion Model
di: Pan, Honghu, et al.
Pubblicazione: (2026)
di: Pan, Honghu, et al.
Pubblicazione: (2026)
EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models
di: Cai, Yufei, et al.
Pubblicazione: (2025)
di: Cai, Yufei, et al.
Pubblicazione: (2025)
Segment Anything for Videos: A Systematic Survey
di: Zhang, Chunhui, et al.
Pubblicazione: (2024)
di: Zhang, Chunhui, et al.
Pubblicazione: (2024)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
di: Luo, Zhuoyan, et al.
Pubblicazione: (2024)
di: Luo, Zhuoyan, et al.
Pubblicazione: (2024)
Generalized Discrete Diffusion with Self-Correction
di: Wang, Linxuan, et al.
Pubblicazione: (2026)
di: Wang, Linxuan, et al.
Pubblicazione: (2026)
CapsFusion: Rethinking Image-Text Data at Scale
di: Yu, Qiying, et al.
Pubblicazione: (2023)
di: Yu, Qiying, et al.
Pubblicazione: (2023)
LensWalk: Agentic Video Understanding by Planning How You See in Videos
di: Li, Keliang, et al.
Pubblicazione: (2026)
di: Li, Keliang, et al.
Pubblicazione: (2026)
Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models
di: Wang, Zhongqi, et al.
Pubblicazione: (2025)
di: Wang, Zhongqi, et al.
Pubblicazione: (2025)
Pre-trained Model Guided Fine-Tuning for Zero-Shot Adversarial Robustness
di: Wang, Sibo, et al.
Pubblicazione: (2024)
di: Wang, Sibo, et al.
Pubblicazione: (2024)
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
di: Yang, Junqi, et al.
Pubblicazione: (2026)
di: Yang, Junqi, et al.
Pubblicazione: (2026)
Confidence Aware Learning for Reliable Face Anti-spoofing
di: Long, Xingming, et al.
Pubblicazione: (2024)
di: Long, Xingming, et al.
Pubblicazione: (2024)
Revisiting Backdoor Attacks on Time Series Classification in the Frequency Domain
di: Huang, Yuanmin, et al.
Pubblicazione: (2025)
di: Huang, Yuanmin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Autoregressive Video Generation without Vector Quantization
di: Deng, Haoge, et al.
Pubblicazione: (2024) -
UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models
di: Wang, Jiaqi, et al.
Pubblicazione: (2026) -
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2025) -
End-to-End Vision Tokenizer Tuning
di: Wang, Wenxuan, et al.
Pubblicazione: (2025) -
LINA: Linear Autoregressive Image Generative Models with Continuous Tokens
di: Wang, Jiahao, et al.
Pubblicazione: (2026)