Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Haotian, Wang, Wenjing, Li, Chen, Lyu, Jing, Lin, Di |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Understanding to Erasing: Towards Complete and Stable Video Object Removal
par: Liu, Dingming, et autres
Publié: (2026)
par: Liu, Dingming, et autres
Publié: (2026)
NoiseController: Towards Consistent Multi-view Video Generation via Noise Decomposition and Collaboration
par: Dong, Haotian, et autres
Publié: (2025)
par: Dong, Haotian, et autres
Publié: (2025)
TransPixeler: Advancing Text-to-Video Generation with Transparency
par: Wang, Luozhou, et autres
Publié: (2025)
par: Wang, Luozhou, et autres
Publié: (2025)
Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
par: Xue, Bowen, et autres
Publié: (2025)
par: Xue, Bowen, et autres
Publié: (2025)
Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation
par: Chen, Yingjie, et autres
Publié: (2026)
par: Chen, Yingjie, et autres
Publié: (2026)
MonoGS++: Fast and Accurate Monocular RGB Gaussian SLAM
par: Li, Renwu, et autres
Publié: (2025)
par: Li, Renwu, et autres
Publié: (2025)
Video Diffusion Transformers are In-Context Learners
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
Few-Shot Learner Generalizes Across AI-Generated Image Detection
par: Wu, Shiyu, et autres
Publié: (2025)
par: Wu, Shiyu, et autres
Publié: (2025)
TransText: Alpha-as-RGB Representation for Transparent Text Animation
par: Zhang, Fei, et autres
Publié: (2026)
par: Zhang, Fei, et autres
Publié: (2026)
Stable Part Diffusion 4D: Multi-View RGB and Kinematic Parts Video Generation
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
RefDrop: Controllable Consistency in Image or Video Generation via Reference Feature Guidance
par: Fan, Jiaojiao, et autres
Publié: (2024)
par: Fan, Jiaojiao, et autres
Publié: (2024)
TransDiff: Diffusion-Based Method for Manipulating Transparent Objects Using a Single RGB-D Image
par: Wang, Haoxiao, et autres
Publié: (2025)
par: Wang, Haoxiao, et autres
Publié: (2025)
RainFusion: Adaptive Video Generation Acceleration via Multi-Dimensional Visual Redundancy
par: Chen, Aiyue, et autres
Publié: (2025)
par: Chen, Aiyue, et autres
Publié: (2025)
VideoTetris: Towards Compositional Text-to-Video Generation
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
StableWorld: Towards Stable and Consistent Long Interactive Video Generation
par: Yang, Ying, et autres
Publié: (2026)
par: Yang, Ying, et autres
Publié: (2026)
SLAM3R: Real-Time Dense Scene Reconstruction from Monocular RGB Videos
par: Liu, Yuzheng, et autres
Publié: (2024)
par: Liu, Yuzheng, et autres
Publié: (2024)
MLP Can Be A Good Transformer Learner
par: Lin, Sihao, et autres
Publié: (2024)
par: Lin, Sihao, et autres
Publié: (2024)
Invisible Gas Detection: An RGB-Thermal Cross Attention Network and A New Benchmark
par: Wang, Jue, et autres
Publié: (2024)
par: Wang, Jue, et autres
Publié: (2024)
Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation
par: Xu, Shaocong, et autres
Publié: (2025)
par: Xu, Shaocong, et autres
Publié: (2025)
Towards RGB-NIR Cross-modality Image Registration and Beyond
par: Li, Huadong, et autres
Publié: (2024)
par: Li, Huadong, et autres
Publié: (2024)
Dexterous Manipulation Policies from RGB Human Videos via 3D Hand-Object Trajectory Reconstruction
par: Chen, Hongyi, et autres
Publié: (2026)
par: Chen, Hongyi, et autres
Publié: (2026)
RGB-D Tracking via Hierarchical Modality Aggregation and Distribution Network
par: Xu, Boyue, et autres
Publié: (2025)
par: Xu, Boyue, et autres
Publié: (2025)
VADMamba++: Efficient Video Anomaly Detection via Hybrid Modeling in Grayscale Space
par: Lyu, Jihao, et autres
Publié: (2026)
par: Lyu, Jihao, et autres
Publié: (2026)
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
par: Chen, Lin, et autres
Publié: (2024)
par: Chen, Lin, et autres
Publié: (2024)
ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation
par: Pu, Yifan, et autres
Publié: (2025)
par: Pu, Yifan, et autres
Publié: (2025)
CompEvent: Complex-valued Event-RGB Fusion for Low-light Video Enhancement and Deblurring
par: Zhong, Mingchen, et autres
Publié: (2025)
par: Zhong, Mingchen, et autres
Publié: (2025)
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
par: Guo, Yiwei, et autres
Publié: (2026)
par: Guo, Yiwei, et autres
Publié: (2026)
Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering
par: Luo, Jiayi, et autres
Publié: (2026)
par: Luo, Jiayi, et autres
Publié: (2026)
PrismLayers: Open Data for High-Quality Multi-Layer Transparent Image Generative Models
par: Chen, Junwen, et autres
Publié: (2025)
par: Chen, Junwen, et autres
Publié: (2025)
MAVIN: Multi-Action Video Generation with Diffusion Models via Transition Video Infilling
par: Zhang, Bowen, et autres
Publié: (2024)
par: Zhang, Bowen, et autres
Publié: (2024)
Salient Object Detection in RGB-D Videos
par: Mou, Ao, et autres
Publié: (2023)
par: Mou, Ao, et autres
Publié: (2023)
EigenSR: Eigenimage-Bridged Pre-Trained RGB Learners for Single Hyperspectral Image Super-Resolution
par: Su, Xi, et autres
Publié: (2024)
par: Su, Xi, et autres
Publié: (2024)
SECURE: Stable Early Collision Understanding via Robust Embeddings in Autonomous Driving
par: Wang, Wenjing, et autres
Publié: (2026)
par: Wang, Wenjing, et autres
Publié: (2026)
ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling
par: Li, Daowen, et autres
Publié: (2026)
par: Li, Daowen, et autres
Publié: (2026)
RGB-to-Polarization Estimation: A New Task and Benchmark Study
par: Lin, Beibei, et autres
Publié: (2025)
par: Lin, Beibei, et autres
Publié: (2025)
Stable Video Infinity: Infinite-Length Video Generation with Error Recycling
par: Li, Wuyang, et autres
Publié: (2025)
par: Li, Wuyang, et autres
Publié: (2025)
Expressive Gaussian Human Avatars from Monocular RGB Video
par: Hu, Hezhen, et autres
Publié: (2024)
par: Hu, Hezhen, et autres
Publié: (2024)
ViDSOD-100: A New Dataset and a Baseline Model for RGB-D Video Salient Object Detection
par: Lin, Junhao, et autres
Publié: (2024)
par: Lin, Junhao, et autres
Publié: (2024)
RGB-D Video Object Segmentation via Enhanced Multi-store Feature Memory
par: Xu, Boyue, et autres
Publié: (2025)
par: Xu, Boyue, et autres
Publié: (2025)
StableV2V: Stablizing Shape Consistency in Video-to-Video Editing
par: Liu, Chang, et autres
Publié: (2024)
par: Liu, Chang, et autres
Publié: (2024)
Documents similaires
-
From Understanding to Erasing: Towards Complete and Stable Video Object Removal
par: Liu, Dingming, et autres
Publié: (2026) -
NoiseController: Towards Consistent Multi-view Video Generation via Noise Decomposition and Collaboration
par: Dong, Haotian, et autres
Publié: (2025) -
TransPixeler: Advancing Text-to-Video Generation with Transparency
par: Wang, Luozhou, et autres
Publié: (2025) -
Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
par: Xue, Bowen, et autres
Publié: (2025) -
Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation
par: Chen, Yingjie, et autres
Publié: (2026)