Uniform Discrete Diffusion with Metric Path for Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deng, Haoge, Pan, Ting, Zhang, Fan, Liu, Yang, Luo, Zhuoyan, Cui, Yufeng, Wang, Wenxuan, Shen, Chunhua, Shan, Shiguang, Zhang, Zhaoxiang, Wang, Xinlong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Autoregressive Video Generation without Vector Quantization
par: Deng, Haoge, et autres
Publié: (2024)
par: Deng, Haoge, et autres
Publié: (2024)
UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models
par: Wang, Jiaqi, et autres
Publié: (2026)
par: Wang, Jiaqi, et autres
Publié: (2026)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
par: Diao, Haiwen, et autres
Publié: (2025)
par: Diao, Haiwen, et autres
Publié: (2025)
End-to-End Vision Tokenizer Tuning
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
LINA: Linear Autoregressive Image Generative Models with Continuous Tokens
par: Wang, Jiahao, et autres
Publié: (2026)
par: Wang, Jiahao, et autres
Publié: (2026)
Tokenize Anything via Prompting
par: Pan, Ting, et autres
Publié: (2023)
par: Pan, Ting, et autres
Publié: (2023)
Emu3.5: Native Multimodal Models are World Learners
par: Cui, Yufeng, et autres
Publié: (2025)
par: Cui, Yufeng, et autres
Publié: (2025)
You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale
par: Ma, Baorui, et autres
Publié: (2024)
par: Ma, Baorui, et autres
Publié: (2024)
CI-VID: A Coherent Interleaved Text-Video Dataset
par: Ju, Yiming, et autres
Publié: (2025)
par: Ju, Yiming, et autres
Publié: (2025)
Diffusion Feedback Helps CLIP See Better
par: Wang, Wenxuan, et autres
Publié: (2024)
par: Wang, Wenxuan, et autres
Publié: (2024)
Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models
par: Wang, Wen, et autres
Publié: (2023)
par: Wang, Wen, et autres
Publié: (2023)
Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion Models
par: Wang, Zhongqi, et autres
Publié: (2025)
par: Wang, Zhongqi, et autres
Publié: (2025)
T2IShield: Defending Against Backdoors on Text-to-Image Diffusion Models
par: Wang, Zhongqi, et autres
Publié: (2024)
par: Wang, Zhongqi, et autres
Publié: (2024)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
Trigger without Trace: Towards Stealthy Backdoor Attack on Text-to-Image Diffusion Models
par: Zhang, Jie, et autres
Publié: (2025)
par: Zhang, Jie, et autres
Publié: (2025)
Geo-Align: Video Generation Alignment via Metric Geometry Reward
par: Li, Zizun, et autres
Publié: (2026)
par: Li, Zizun, et autres
Publié: (2026)
EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
par: Sun, Quan, et autres
Publié: (2024)
par: Sun, Quan, et autres
Publié: (2024)
Generalized Face Liveness Detection via De-fake Face Generator
par: Long, Xingming, et autres
Publié: (2024)
par: Long, Xingming, et autres
Publié: (2024)
T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models
par: Li, Changzhen, et autres
Publié: (2025)
par: Li, Changzhen, et autres
Publié: (2025)
LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation
par: Gao, Huanlin, et autres
Publié: (2025)
par: Gao, Huanlin, et autres
Publié: (2025)
Generative Multimodal Models are In-Context Learners
par: Sun, Quan, et autres
Publié: (2023)
par: Sun, Quan, et autres
Publié: (2023)
Unleashing the Potential of the Diffusion Model in Few-shot Semantic Segmentation
par: Zhu, Muzhi, et autres
Publié: (2024)
par: Zhu, Muzhi, et autres
Publié: (2024)
Anonymization Prompt Learning for Facial Privacy-Preserving Text-to-Image Generation
par: Shi, Liang, et autres
Publié: (2024)
par: Shi, Liang, et autres
Publié: (2024)
Design-based Estimation Theory for Complex Experiments
par: Chang, Haoge
Publié: (2023)
par: Chang, Haoge
Publié: (2023)
Emu: Generative Pretraining in Multimodality
par: Sun, Quan, et autres
Publié: (2023)
par: Sun, Quan, et autres
Publié: (2023)
BIMM: Brain Inspired Masked Modeling for Video Representation Learning
par: Wan, Zhifan, et autres
Publié: (2024)
par: Wan, Zhifan, et autres
Publié: (2024)
MotionVerse: A Unified Multimodal Framework for Motion Comprehension, Generation and Editing
par: Hou, Ruibing, et autres
Publié: (2025)
par: Hou, Ruibing, et autres
Publié: (2025)
Optimizing for the Shortest Path in Denoising Diffusion Model
par: Chen, Ping, et autres
Publié: (2025)
par: Chen, Ping, et autres
Publié: (2025)
Computer-Aided Design Generation by Cascaded Discrete Diffusion Model
par: Pan, Honghu, et autres
Publié: (2026)
par: Pan, Honghu, et autres
Publié: (2026)
EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models
par: Cai, Yufei, et autres
Publié: (2025)
par: Cai, Yufei, et autres
Publié: (2025)
Segment Anything for Videos: A Systematic Survey
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
par: Luo, Zhuoyan, et autres
Publié: (2024)
par: Luo, Zhuoyan, et autres
Publié: (2024)
Generalized Discrete Diffusion with Self-Correction
par: Wang, Linxuan, et autres
Publié: (2026)
par: Wang, Linxuan, et autres
Publié: (2026)
CapsFusion: Rethinking Image-Text Data at Scale
par: Yu, Qiying, et autres
Publié: (2023)
par: Yu, Qiying, et autres
Publié: (2023)
LensWalk: Agentic Video Understanding by Planning How You See in Videos
par: Li, Keliang, et autres
Publié: (2026)
par: Li, Keliang, et autres
Publié: (2026)
Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models
par: Wang, Zhongqi, et autres
Publié: (2025)
par: Wang, Zhongqi, et autres
Publié: (2025)
Pre-trained Model Guided Fine-Tuning for Zero-Shot Adversarial Robustness
par: Wang, Sibo, et autres
Publié: (2024)
par: Wang, Sibo, et autres
Publié: (2024)
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
par: Yang, Junqi, et autres
Publié: (2026)
par: Yang, Junqi, et autres
Publié: (2026)
Confidence Aware Learning for Reliable Face Anti-spoofing
par: Long, Xingming, et autres
Publié: (2024)
par: Long, Xingming, et autres
Publié: (2024)
Revisiting Backdoor Attacks on Time Series Classification in the Frequency Domain
par: Huang, Yuanmin, et autres
Publié: (2025)
par: Huang, Yuanmin, et autres
Publié: (2025)
Documents similaires
-
Autoregressive Video Generation without Vector Quantization
par: Deng, Haoge, et autres
Publié: (2024) -
UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models
par: Wang, Jiaqi, et autres
Publié: (2026) -
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
par: Diao, Haiwen, et autres
Publié: (2025) -
End-to-End Vision Tokenizer Tuning
par: Wang, Wenxuan, et autres
Publié: (2025) -
LINA: Linear Autoregressive Image Generative Models with Continuous Tokens
par: Wang, Jiahao, et autres
Publié: (2026)