Uniform Discrete Diffusion with Metric Path for Video Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Deng, Haoge, Pan, Ting, Zhang, Fan, Liu, Yang, Luo, Zhuoyan, Cui, Yufeng, Wang, Wenxuan, Shen, Chunhua, Shan, Shiguang, Zhang, Zhaoxiang, Wang, Xinlong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Autoregressive Video Generation without Vector Quantization
por: Deng, Haoge, et al.
Publicado: (2024)
por: Deng, Haoge, et al.
Publicado: (2024)
UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models
por: Wang, Jiaqi, et al.
Publicado: (2026)
por: Wang, Jiaqi, et al.
Publicado: (2026)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
por: Diao, Haiwen, et al.
Publicado: (2025)
por: Diao, Haiwen, et al.
Publicado: (2025)
End-to-End Vision Tokenizer Tuning
por: Wang, Wenxuan, et al.
Publicado: (2025)
por: Wang, Wenxuan, et al.
Publicado: (2025)
LINA: Linear Autoregressive Image Generative Models with Continuous Tokens
por: Wang, Jiahao, et al.
Publicado: (2026)
por: Wang, Jiahao, et al.
Publicado: (2026)
Tokenize Anything via Prompting
por: Pan, Ting, et al.
Publicado: (2023)
por: Pan, Ting, et al.
Publicado: (2023)
Emu3.5: Native Multimodal Models are World Learners
por: Cui, Yufeng, et al.
Publicado: (2025)
por: Cui, Yufeng, et al.
Publicado: (2025)
You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale
por: Ma, Baorui, et al.
Publicado: (2024)
por: Ma, Baorui, et al.
Publicado: (2024)
CI-VID: A Coherent Interleaved Text-Video Dataset
por: Ju, Yiming, et al.
Publicado: (2025)
por: Ju, Yiming, et al.
Publicado: (2025)
Diffusion Feedback Helps CLIP See Better
por: Wang, Wenxuan, et al.
Publicado: (2024)
por: Wang, Wenxuan, et al.
Publicado: (2024)
Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models
por: Wang, Wen, et al.
Publicado: (2023)
por: Wang, Wen, et al.
Publicado: (2023)
Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion Models
por: Wang, Zhongqi, et al.
Publicado: (2025)
por: Wang, Zhongqi, et al.
Publicado: (2025)
T2IShield: Defending Against Backdoors on Text-to-Image Diffusion Models
por: Wang, Zhongqi, et al.
Publicado: (2024)
por: Wang, Zhongqi, et al.
Publicado: (2024)
Unified Vision-Language-Action Model
por: Wang, Yuqi, et al.
Publicado: (2025)
por: Wang, Yuqi, et al.
Publicado: (2025)
Trigger without Trace: Towards Stealthy Backdoor Attack on Text-to-Image Diffusion Models
por: Zhang, Jie, et al.
Publicado: (2025)
por: Zhang, Jie, et al.
Publicado: (2025)
Geo-Align: Video Generation Alignment via Metric Geometry Reward
por: Li, Zizun, et al.
Publicado: (2026)
por: Li, Zizun, et al.
Publicado: (2026)
EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
por: Sun, Quan, et al.
Publicado: (2024)
por: Sun, Quan, et al.
Publicado: (2024)
Generalized Face Liveness Detection via De-fake Face Generator
por: Long, Xingming, et al.
Publicado: (2024)
por: Long, Xingming, et al.
Publicado: (2024)
T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models
por: Li, Changzhen, et al.
Publicado: (2025)
por: Li, Changzhen, et al.
Publicado: (2025)
LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation
por: Gao, Huanlin, et al.
Publicado: (2025)
por: Gao, Huanlin, et al.
Publicado: (2025)
Generative Multimodal Models are In-Context Learners
por: Sun, Quan, et al.
Publicado: (2023)
por: Sun, Quan, et al.
Publicado: (2023)
Unleashing the Potential of the Diffusion Model in Few-shot Semantic Segmentation
por: Zhu, Muzhi, et al.
Publicado: (2024)
por: Zhu, Muzhi, et al.
Publicado: (2024)
Anonymization Prompt Learning for Facial Privacy-Preserving Text-to-Image Generation
por: Shi, Liang, et al.
Publicado: (2024)
por: Shi, Liang, et al.
Publicado: (2024)
Design-based Estimation Theory for Complex Experiments
por: Chang, Haoge
Publicado: (2023)
por: Chang, Haoge
Publicado: (2023)
Emu: Generative Pretraining in Multimodality
por: Sun, Quan, et al.
Publicado: (2023)
por: Sun, Quan, et al.
Publicado: (2023)
BIMM: Brain Inspired Masked Modeling for Video Representation Learning
por: Wan, Zhifan, et al.
Publicado: (2024)
por: Wan, Zhifan, et al.
Publicado: (2024)
MotionVerse: A Unified Multimodal Framework for Motion Comprehension, Generation and Editing
por: Hou, Ruibing, et al.
Publicado: (2025)
por: Hou, Ruibing, et al.
Publicado: (2025)
Optimizing for the Shortest Path in Denoising Diffusion Model
por: Chen, Ping, et al.
Publicado: (2025)
por: Chen, Ping, et al.
Publicado: (2025)
Computer-Aided Design Generation by Cascaded Discrete Diffusion Model
por: Pan, Honghu, et al.
Publicado: (2026)
por: Pan, Honghu, et al.
Publicado: (2026)
EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models
por: Cai, Yufei, et al.
Publicado: (2025)
por: Cai, Yufei, et al.
Publicado: (2025)
Segment Anything for Videos: A Systematic Survey
por: Zhang, Chunhui, et al.
Publicado: (2024)
por: Zhang, Chunhui, et al.
Publicado: (2024)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
por: Luo, Zhuoyan, et al.
Publicado: (2024)
por: Luo, Zhuoyan, et al.
Publicado: (2024)
Generalized Discrete Diffusion with Self-Correction
por: Wang, Linxuan, et al.
Publicado: (2026)
por: Wang, Linxuan, et al.
Publicado: (2026)
CapsFusion: Rethinking Image-Text Data at Scale
por: Yu, Qiying, et al.
Publicado: (2023)
por: Yu, Qiying, et al.
Publicado: (2023)
LensWalk: Agentic Video Understanding by Planning How You See in Videos
por: Li, Keliang, et al.
Publicado: (2026)
por: Li, Keliang, et al.
Publicado: (2026)
Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models
por: Wang, Zhongqi, et al.
Publicado: (2025)
por: Wang, Zhongqi, et al.
Publicado: (2025)
Pre-trained Model Guided Fine-Tuning for Zero-Shot Adversarial Robustness
por: Wang, Sibo, et al.
Publicado: (2024)
por: Wang, Sibo, et al.
Publicado: (2024)
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
por: Yang, Junqi, et al.
Publicado: (2026)
por: Yang, Junqi, et al.
Publicado: (2026)
Confidence Aware Learning for Reliable Face Anti-spoofing
por: Long, Xingming, et al.
Publicado: (2024)
por: Long, Xingming, et al.
Publicado: (2024)
Revisiting Backdoor Attacks on Time Series Classification in the Frequency Domain
por: Huang, Yuanmin, et al.
Publicado: (2025)
por: Huang, Yuanmin, et al.
Publicado: (2025)
Ejemplares similares
-
Autoregressive Video Generation without Vector Quantization
por: Deng, Haoge, et al.
Publicado: (2024) -
UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models
por: Wang, Jiaqi, et al.
Publicado: (2026) -
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
por: Diao, Haiwen, et al.
Publicado: (2025) -
End-to-End Vision Tokenizer Tuning
por: Wang, Wenxuan, et al.
Publicado: (2025) -
LINA: Linear Autoregressive Image Generative Models with Continuous Tokens
por: Wang, Jiahao, et al.
Publicado: (2026)