Hybrid Video Diffusion Models with 2D Triplane and 3D Wavelet Representation
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Kihong, Lee, Haneol, Park, Jihye, Kim, Seyeon, Lee, Kwanghee, Kim, Seungryong, Yoo, Jaejun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MoDiTalker: Motion-Disentangled Diffusion Model for High-Fidelity Talking Head Generation
por: Kim, Seyeon, et al.
Publicado: (2024)
por: Kim, Seyeon, et al.
Publicado: (2024)
Diffusion Model for Dense Matching
por: Nam, Jisu, et al.
Publicado: (2023)
por: Nam, Jisu, et al.
Publicado: (2023)
Geometry-Aware Representation Denoising for Robust Multi-view 3D Reconstruction
por: Kim, Jin Hyeon, et al.
Publicado: (2026)
por: Kim, Jin Hyeon, et al.
Publicado: (2026)
Let 2D Diffusion Model Know 3D-Consistency for Robust Text-to-3D Generation
por: Seo, Junyoung, et al.
Publicado: (2023)
por: Seo, Junyoung, et al.
Publicado: (2023)
STREAM: Spatio-TempoRal Evaluation and Analysis Metric for Video Generative Models
por: Kim, Pum Jun, et al.
Publicado: (2024)
por: Kim, Pum Jun, et al.
Publicado: (2024)
Singular Value Scaling: Efficient Generative Model Compression via Pruned Weights Refinement
por: Kim, Hyeonjin, et al.
Publicado: (2024)
por: Kim, Hyeonjin, et al.
Publicado: (2024)
MultiDreamer3D: Multi-concept 3D Customization with Concept-Aware Diffusion Guidance
por: Song, Wooseok, et al.
Publicado: (2025)
por: Song, Wooseok, et al.
Publicado: (2025)
Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration
por: Kim, Jin Hyeon, et al.
Publicado: (2025)
por: Kim, Jin Hyeon, et al.
Publicado: (2025)
JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync
por: Park, Sungjoon, et al.
Publicado: (2025)
por: Park, Sungjoon, et al.
Publicado: (2025)
DiffuseSlide: Training-Free High Frame Rate Video Generation Diffusion
por: Hwang, Geunmin, et al.
Publicado: (2025)
por: Hwang, Geunmin, et al.
Publicado: (2025)
PosterLlama: Bridging Design Ability of Langauge Model to Contents-Aware Layout Generation
por: Seol, Jaejung, et al.
Publicado: (2024)
por: Seol, Jaejung, et al.
Publicado: (2024)
Text-Aware Image Restoration with Diffusion Models
por: Min, Jaewon, et al.
Publicado: (2025)
por: Min, Jaewon, et al.
Publicado: (2025)
InterRVOS: Interaction-aware Referring Video Object Segmentation
por: Jin, Woojeong, et al.
Publicado: (2025)
por: Jin, Woojeong, et al.
Publicado: (2025)
V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping
por: Lee, Hyunkoo, et al.
Publicado: (2025)
por: Lee, Hyunkoo, et al.
Publicado: (2025)
PLOT: Pseudo-Labeling via Video Object Tracking for Scalable Monocular 3D Object Detection
por: Lee, Seokyeong, et al.
Publicado: (2025)
por: Lee, Seokyeong, et al.
Publicado: (2025)
Advancing Cross-Domain Generalizability in Face Anti-Spoofing: Insights, Design, and Metrics
por: Kim, Hyojin, et al.
Publicado: (2024)
por: Kim, Hyojin, et al.
Publicado: (2024)
Bridging the Domain Gap: A Simple Domain Matching Method for Reference-based Image Super-Resolution in Remote Sensing
por: Min, Jeongho, et al.
Publicado: (2024)
por: Min, Jeongho, et al.
Publicado: (2024)
BF-STVSR: B-Splines and Fourier-Best Friends for High Fidelity Spatial-Temporal Video Super-Resolution
por: Kim, Eunjin, et al.
Publicado: (2025)
por: Kim, Eunjin, et al.
Publicado: (2025)
TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking
por: Nam, Jisu, et al.
Publicado: (2026)
por: Nam, Jisu, et al.
Publicado: (2026)
Talk3D: High-Fidelity Talking Portrait Synthesis via Personalized 3D Generative Prior
por: Ko, Jaehoon, et al.
Publicado: (2024)
por: Ko, Jaehoon, et al.
Publicado: (2024)
C3G: Learning Compact 3D Representations with 2K Gaussians
por: An, Honggyu, et al.
Publicado: (2025)
por: An, Honggyu, et al.
Publicado: (2025)
Geometry-Aware Score Distillation via 3D Consistent Noising and Gradient Consistency Modeling
por: Kwak, Min-Seop, et al.
Publicado: (2024)
por: Kwak, Min-Seop, et al.
Publicado: (2024)
Recovering Dynamic 3D Sketches from Videos
por: Lee, Jaeah, et al.
Publicado: (2025)
por: Lee, Jaeah, et al.
Publicado: (2025)
MORPHOS: Autoregressive 4D Generation with Temporal Structured Latents
por: Kwon, Minkyung, et al.
Publicado: (2026)
por: Kwon, Minkyung, et al.
Publicado: (2026)
TriNeRFLet: A Wavelet Based Triplane NeRF Representation
por: Khatib, Rajaei, et al.
Publicado: (2024)
por: Khatib, Rajaei, et al.
Publicado: (2024)
SemCity: Semantic Scene Generation with Triplane Diffusion
por: Lee, Jumin, et al.
Publicado: (2024)
por: Lee, Jumin, et al.
Publicado: (2024)
B-RIGHT: Benchmark Re-evaluation for Integrity in Generalized Human-Object Interaction Testing
por: Jang, Yoojin, et al.
Publicado: (2025)
por: Jang, Yoojin, et al.
Publicado: (2025)
BEEP3D: Box-Supervised End-to-End Pseudo-Mask Generation for 3D Instance Segmentation
por: Yoo, Youngju, et al.
Publicado: (2025)
por: Yoo, Youngju, et al.
Publicado: (2025)
Relaxing Accurate Initialization Constraint for 3D Gaussian Splatting
por: Jung, Jaewoo, et al.
Publicado: (2024)
por: Jung, Jaewoo, et al.
Publicado: (2024)
On the Reliability of Cue Conflict and Beyond
por: Kim, Pum Jun, et al.
Publicado: (2026)
por: Kim, Pum Jun, et al.
Publicado: (2026)
Coherent 3D Portrait Video Reconstruction via Triplane Fusion
por: Wang, Shengze, et al.
Publicado: (2024)
por: Wang, Shengze, et al.
Publicado: (2024)
Domain Generalization Using Large Pretrained Models with Mixture-of-Adapters
por: Lee, Gyuseong, et al.
Publicado: (2023)
por: Lee, Gyuseong, et al.
Publicado: (2023)
Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation
por: Kim, Jisoo, et al.
Publicado: (2026)
por: Kim, Jisoo, et al.
Publicado: (2026)
DA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion Models
por: Min, Jaewon, et al.
Publicado: (2026)
por: Min, Jaewon, et al.
Publicado: (2026)
Compose and Conquer: Diffusion-Based 3D Depth Aware Composable Image Synthesis
por: Lee, Jonghyun, et al.
Publicado: (2024)
por: Lee, Jonghyun, et al.
Publicado: (2024)
Hyper3D: Efficient 3D Representation via Hybrid Triplane and Octree Feature for Enhanced 3D Shape Variational Auto-Encoders
por: Guo, Jingyu, et al.
Publicado: (2025)
por: Guo, Jingyu, et al.
Publicado: (2025)
CorGi: Contribution-Guided Block-Wise Interval Caching for Training-Free Acceleration of Diffusion Transformers
por: Son, Yonglak, et al.
Publicado: (2025)
por: Son, Yonglak, et al.
Publicado: (2025)
Emergent Temporal Correspondences from Video Diffusion Transformers
por: Nam, Jisu, et al.
Publicado: (2025)
por: Nam, Jisu, et al.
Publicado: (2025)
3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation
por: Lee, JoungBin, et al.
Publicado: (2025)
por: Lee, JoungBin, et al.
Publicado: (2025)
MATRIX: Mask Track Alignment for Interaction-aware Video Generation
por: Jin, Siyoon, et al.
Publicado: (2025)
por: Jin, Siyoon, et al.
Publicado: (2025)
Ejemplares similares
-
MoDiTalker: Motion-Disentangled Diffusion Model for High-Fidelity Talking Head Generation
por: Kim, Seyeon, et al.
Publicado: (2024) -
Diffusion Model for Dense Matching
por: Nam, Jisu, et al.
Publicado: (2023) -
Geometry-Aware Representation Denoising for Robust Multi-view 3D Reconstruction
por: Kim, Jin Hyeon, et al.
Publicado: (2026) -
Let 2D Diffusion Model Know 3D-Consistency for Robust Text-to-3D Generation
por: Seo, Junyoung, et al.
Publicado: (2023) -
STREAM: Spatio-TempoRal Evaluation and Analysis Metric for Video Generative Models
por: Kim, Pum Jun, et al.
Publicado: (2024)