GenRec: Unifying Video Generation and Recognition with Diffusion Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Weng, Zejia, Yang, Xitong, Xing, Zhen, Wu, Zuxuan, Jiang, Yu-Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction
por: Xing, Zhen, et al.
Publicado: (2024)
por: Xing, Zhen, et al.
Publicado: (2024)
GeoGS3D: Single-view 3D Reconstruction via Geometric-aware Diffusion Model and Gaussian Splatting
por: Feng, Qijun, et al.
Publicado: (2024)
por: Feng, Qijun, et al.
Publicado: (2024)
AdaDiff: Adaptive Step Selection for Fast Diffusion Models
por: Zhang, Hui, et al.
Publicado: (2023)
por: Zhang, Hui, et al.
Publicado: (2023)
A Survey on Video Diffusion Models
por: Xing, Zhen, et al.
Publicado: (2023)
por: Xing, Zhen, et al.
Publicado: (2023)
DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation
por: Zhao, Haoyu, et al.
Publicado: (2026)
por: Zhao, Haoyu, et al.
Publicado: (2026)
DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
por: Li, Quanhao, et al.
Publicado: (2026)
por: Li, Quanhao, et al.
Publicado: (2026)
StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
por: Tu, Shuyuan, et al.
Publicado: (2025)
por: Tu, Shuyuan, et al.
Publicado: (2025)
UniRecGen: Unifying Multi-View 3D Reconstruction and Generation
por: Huang, Zhisheng, et al.
Publicado: (2026)
por: Huang, Zhisheng, et al.
Publicado: (2026)
MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and Editing
por: Zhao, Haoyu, et al.
Publicado: (2023)
por: Zhao, Haoyu, et al.
Publicado: (2023)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
por: Wang, Junke, et al.
Publicado: (2024)
por: Wang, Junke, et al.
Publicado: (2024)
DiffusionAD: Norm-guided One-step Denoising Diffusion for Anomaly Detection
por: Zhang, Hui, et al.
Publicado: (2023)
por: Zhang, Hui, et al.
Publicado: (2023)
UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
por: Tian, Rui, et al.
Publicado: (2025)
por: Tian, Rui, et al.
Publicado: (2025)
UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters
por: Du, Yongkun, et al.
Publicado: (2025)
por: Du, Yongkun, et al.
Publicado: (2025)
Learning Accurate Segmentation Purely from Self-Supervision
por: You, Zuyao, et al.
Publicado: (2026)
por: You, Zuyao, et al.
Publicado: (2026)
Repeating Words for Video-Language Retrieval with Coarse-to-Fine Objectives
por: Zhao, Haoyu, et al.
Publicado: (2025)
por: Zhao, Haoyu, et al.
Publicado: (2025)
CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design
por: Zhang, Hui, et al.
Publicado: (2025)
por: Zhang, Hui, et al.
Publicado: (2025)
CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
por: Zhang, Hui, et al.
Publicado: (2024)
por: Zhang, Hui, et al.
Publicado: (2024)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
OmniVid: A Generative Framework for Universal Video Understanding
por: Wang, Junke, et al.
Publicado: (2024)
por: Wang, Junke, et al.
Publicado: (2024)
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
por: Tian, Rui, et al.
Publicado: (2025)
por: Tian, Rui, et al.
Publicado: (2025)
REDUCIO! Generating 1K Video within 16 Seconds using Extremely Compressed Motion Latents
por: Tian, Rui, et al.
Publicado: (2024)
por: Tian, Rui, et al.
Publicado: (2024)
OmniTracker: Unifying Object Tracking by Tracking-with-Detection
por: Wang, Junke, et al.
Publicado: (2023)
por: Wang, Junke, et al.
Publicado: (2023)
Attention Itself Could Retrieve.RetrieveVGGT: Training-Free Long Context Streaming 3D Reconstruction via Query-Key Similarity Retrieval
por: Zou, Zichen, et al.
Publicado: (2026)
por: Zou, Zichen, et al.
Publicado: (2026)
Multi-Prompt Alignment for Multi-Source Unsupervised Domain Adaptation
por: Chen, Haoran, et al.
Publicado: (2022)
por: Chen, Haoran, et al.
Publicado: (2022)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
por: Chen, Yitong, et al.
Publicado: (2026)
por: Chen, Yitong, et al.
Publicado: (2026)
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
por: Chen, Yitong, et al.
Publicado: (2025)
por: Chen, Yitong, et al.
Publicado: (2025)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
por: Chen, Feng, et al.
Publicado: (2024)
por: Chen, Feng, et al.
Publicado: (2024)
GenCompositor: Generative Video Compositing with Diffusion Transformer
por: Yang, Shuzhou, et al.
Publicado: (2025)
por: Yang, Shuzhou, et al.
Publicado: (2025)
Aligning Anime Video Generation with Human Feedback
por: Zhu, Bingwen, et al.
Publicado: (2025)
por: Zhu, Bingwen, et al.
Publicado: (2025)
DeRA: Decoupled Representation Alignment for Video Tokenization
por: Guo, Pengbo, et al.
Publicado: (2025)
por: Guo, Pengbo, et al.
Publicado: (2025)
AutoTVG: A New Vision-language Pre-training Paradigm for Temporal Video Grounding
por: Zhang, Xing, et al.
Publicado: (2024)
por: Zhang, Xing, et al.
Publicado: (2024)
StarGen: A Spatiotemporal Autoregression Framework with Video Diffusion Model for Scalable and Controllable Scene Generation
por: Zhai, Shangjin, et al.
Publicado: (2025)
por: Zhai, Shangjin, et al.
Publicado: (2025)
Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation
por: Tu, Shuyuan, et al.
Publicado: (2026)
por: Tu, Shuyuan, et al.
Publicado: (2026)
CameraNoise: Enabling Faithful Camera Control in Video Diffusion through Geometry-Flow-Guided Noise Warping
por: Zhao, Haoyu, et al.
Publicado: (2026)
por: Zhao, Haoyu, et al.
Publicado: (2026)
Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
por: Pu, Yujiang, et al.
Publicado: (2025)
por: Pu, Yujiang, et al.
Publicado: (2025)
UniHand: A Unified Model for Diverse Controlled 4D Hand Motion Modeling
por: Sun, Zhihao, et al.
Publicado: (2026)
por: Sun, Zhihao, et al.
Publicado: (2026)
GenTron: Diffusion Transformers for Image and Video Generation
por: Chen, Shoufa, et al.
Publicado: (2023)
por: Chen, Shoufa, et al.
Publicado: (2023)
PromptFusion: Decoupling Stability and Plasticity for Continual Learning
por: Chen, Haoran, et al.
Publicado: (2023)
por: Chen, Haoran, et al.
Publicado: (2023)
Multi-Prompt Progressive Alignment for Multi-Source Unsupervised Domain Adaptation
por: Chen, Haoran, et al.
Publicado: (2025)
por: Chen, Haoran, et al.
Publicado: (2025)
RecDiffusion: Rectangling for Image Stitching with Diffusion Models
por: Zhou, Tianhao, et al.
Publicado: (2024)
por: Zhou, Tianhao, et al.
Publicado: (2024)
Ejemplares similares
-
AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction
por: Xing, Zhen, et al.
Publicado: (2024) -
GeoGS3D: Single-view 3D Reconstruction via Geometric-aware Diffusion Model and Gaussian Splatting
por: Feng, Qijun, et al.
Publicado: (2024) -
AdaDiff: Adaptive Step Selection for Fast Diffusion Models
por: Zhang, Hui, et al.
Publicado: (2023) -
A Survey on Video Diffusion Models
por: Xing, Zhen, et al.
Publicado: (2023) -
DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation
por: Zhao, Haoyu, et al.
Publicado: (2026)