DeCo-VAE: Learning Compact Latents for Video Reconstruction via Decoupled Representation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yin, Xiangchen, Yuan, Jiahui, Hu, Zhangchi, Sun, Wenzhang, Chen, Jie, Qiao, Xiaozhen, Li, Hao, Sun, Xiaoyan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Preserve, Reveal, Expand: Faithful 4D Video Editing with Region-Aware Conditioning
par: Hu, Zhangchi, et autres
Publié: (2026)
par: Hu, Zhangchi, et autres
Publié: (2026)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
par: Sun, Jiahui, et autres
Publié: (2025)
par: Sun, Jiahui, et autres
Publié: (2025)
Robust Latent Representation Tuning for Image-text Classification
par: Sun, Hao, et autres
Publié: (2024)
par: Sun, Hao, et autres
Publié: (2024)
Sec2Sec Co-attention for Video-Based Apparent Affective Prediction
par: Sun, Mingwei, et autres
Publié: (2024)
par: Sun, Mingwei, et autres
Publié: (2024)
DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement
par: Wu, Hao, et autres
Publié: (2024)
par: Wu, Hao, et autres
Publié: (2024)
Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model
par: He, Xu, et autres
Publié: (2024)
par: He, Xu, et autres
Publié: (2024)
Joint Optimization of Buffer Delay and HARQ for Video Communications
par: Cheng, Baoping, et autres
Publié: (2024)
par: Cheng, Baoping, et autres
Publié: (2024)
LAVA: Language Driven Scalable and Versatile Traffic Video Analytics
par: Yu, Yanrui, et autres
Publié: (2025)
par: Yu, Yanrui, et autres
Publié: (2025)
Beyond Interpretability: Exploring the Comprehensibility of Adaptive Video Streaming through Large Language Models
par: Jia, Lianchen, et autres
Publié: (2025)
par: Jia, Lianchen, et autres
Publié: (2025)
Bernini: Latent Semantic Planning for Video Diffusion
par: Bernini Team, et autres
Publié: (2026)
par: Bernini Team, et autres
Publié: (2026)
Latent Feature-Guided Conditional Diffusion for Generative Image Semantic Communication
par: Chen, Zehao, et autres
Publié: (2025)
par: Chen, Zehao, et autres
Publié: (2025)
Wireless Video Semantic Communication with Decoupled Diffusion Multi-frame Compensation
par: Xie, Bingyan, et autres
Publié: (2025)
par: Xie, Bingyan, et autres
Publié: (2025)
Gradient-Guided Modality Decoupling for Missing-Modality Robustness
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Editing Physiological Signals in Videos Using Latent Representations
par: Zhou, Tianwen, et autres
Publié: (2025)
par: Zhou, Tianwen, et autres
Publié: (2025)
Music2Palette: Emotion-aligned Color Palette Generation via Cross-Modal Representation Learning
par: Hu, Jiayun, et autres
Publié: (2025)
par: Hu, Jiayun, et autres
Publié: (2025)
VVRec: Reconstruction Attacks on DL-based Volumetric Video Upstreaming via Latent Diffusion Model with Gamma Distribution
par: Lu, Rui, et autres
Publié: (2025)
par: Lu, Rui, et autres
Publié: (2025)
D2SL: Decouple Defogging and Semantic Learning for Foggy Domain-Adaptive Segmentation
par: Sun, Xuan, et autres
Publié: (2024)
par: Sun, Xuan, et autres
Publié: (2024)
Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?
par: An, Xiao, et autres
Publié: (2026)
par: An, Xiao, et autres
Publié: (2026)
EyEar: Learning Audio Synchronized Human Gaze Trajectory Based on Physics-Informed Dynamics
par: Liu, Xiaochuan, et autres
Publié: (2025)
par: Liu, Xiaochuan, et autres
Publié: (2025)
Learning Complex Heterogeneous Multimodal Fake News via Social Latent Network Inference
par: Li, Mingxin, et autres
Publié: (2025)
par: Li, Mingxin, et autres
Publié: (2025)
Feedback-Driven Rate Control for Learned Video Compression
par: Xu, Zhiheng, et autres
Publié: (2026)
par: Xu, Zhiheng, et autres
Publié: (2026)
Dual-Stream Decoupled Learning for Temporal Consistency and Speaker Interaction in AVSD
par: Xiao, Junhao, et autres
Publié: (2025)
par: Xiao, Junhao, et autres
Publié: (2025)
Improving the Consistency in Cross-Lingual Cross-Modal Retrieval with 1-to-K Contrastive Learning
par: Nie, Zhijie, et autres
Publié: (2024)
par: Nie, Zhijie, et autres
Publié: (2024)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
par: Tong, Haonan, et autres
Publié: (2024)
par: Tong, Haonan, et autres
Publié: (2024)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
par: Chen, Zixuan, et autres
Publié: (2026)
par: Chen, Zixuan, et autres
Publié: (2026)
SVD: Spatial Video Dataset
par: Izadimehr, M. H., et autres
Publié: (2025)
par: Izadimehr, M. H., et autres
Publié: (2025)
Compact Visual Data Representation for Green Multimedia -- A Human Visual System Perspective
par: Chen, Peilin, et autres
Publié: (2024)
par: Chen, Peilin, et autres
Publié: (2024)
DT-UFC: Universal Large Model Feature Coding via Peaky-to-Balanced Distribution Transformation
par: Gao, Changsheng, et autres
Publié: (2025)
par: Gao, Changsheng, et autres
Publié: (2025)
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition
par: Zhou, Qianrui, et autres
Publié: (2026)
par: Zhou, Qianrui, et autres
Publié: (2026)
FlexCache: Flexible Approximate Cache System for Video Diffusion
par: Sun, Desen, et autres
Publié: (2024)
par: Sun, Desen, et autres
Publié: (2024)
Latent Reconstruction from Generated Data for Multimodal Misinformation Detection
par: Papadopoulos, Stefanos-Iordanis, et autres
Publié: (2025)
par: Papadopoulos, Stefanos-Iordanis, et autres
Publié: (2025)
Adaptive 3D Gaussian Splatting Video Streaming
par: Gong, Han, et autres
Publié: (2025)
par: Gong, Han, et autres
Publié: (2025)
Cap2Sum: Learning to Summarize Videos by Generating Captions
par: Zhao, Cairong, et autres
Publié: (2024)
par: Zhao, Cairong, et autres
Publié: (2024)
DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment
par: Li, Xinyue, et autres
Publié: (2026)
par: Li, Xinyue, et autres
Publié: (2026)
DRKF: Decoupled Representations with Knowledge Fusion for Multimodal Emotion Recognition
par: Jiang, Peiyuan, et autres
Publié: (2025)
par: Jiang, Peiyuan, et autres
Publié: (2025)
EV-NVC: Efficient Variable bitrate Neural Video Compression
par: Hu, Yongcun, et autres
Publié: (2025)
par: Hu, Yongcun, et autres
Publié: (2025)
ConCLVD: Controllable Chinese Landscape Video Generation via Diffusion Model
par: Liu, Dingming, et autres
Publié: (2024)
par: Liu, Dingming, et autres
Publié: (2024)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
par: Li, Huilai, et autres
Publié: (2026)
par: Li, Huilai, et autres
Publié: (2026)
Temporal-Spatial Decouple before Act: Disentangled Representation Learning for Multimodal Sentiment Analysis
par: Meng, Chunlei, et autres
Publié: (2026)
par: Meng, Chunlei, et autres
Publié: (2026)
High-Fidelity 3D Gaussian Human Reconstruction via Region-Aware Initialization and Geometric Priors
par: Liu, Yang, et autres
Publié: (2026)
par: Liu, Yang, et autres
Publié: (2026)
Documents similaires
-
Preserve, Reveal, Expand: Faithful 4D Video Editing with Region-Aware Conditioning
par: Hu, Zhangchi, et autres
Publié: (2026) -
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
par: Sun, Jiahui, et autres
Publié: (2025) -
Robust Latent Representation Tuning for Image-text Classification
par: Sun, Hao, et autres
Publié: (2024) -
Sec2Sec Co-attention for Video-Based Apparent Affective Prediction
par: Sun, Mingwei, et autres
Publié: (2024) -
DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement
par: Wu, Hao, et autres
Publié: (2024)