AlphaVAE: Unified End-to-End RGBA Image Reconstruction and Generation with Alpha-Aware Representation Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zile, Yu, Hao, Zhan, Jiabo, Yuan, Chun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning
par: Yu, Hao, et autres
Publié: (2025)
par: Yu, Hao, et autres
Publié: (2025)
End-to-End Deep Learning for Structural Brain Imaging: A Unified Framework
par: Su, Yao, et autres
Publié: (2025)
par: Su, Yao, et autres
Publié: (2025)
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
par: Shao, Hao, et autres
Publié: (2026)
par: Shao, Hao, et autres
Publié: (2026)
DualComp: End-to-End Learning of a Unified Dual-Modality Lossless Compressor
par: Zhao, Yan, et autres
Publié: (2025)
par: Zhao, Yan, et autres
Publié: (2025)
An End-to-End Two-Stream Network Based on RGB Flow and Representation Flow for Human Action Recognition
par: Lai, Song-Jiang, et autres
Publié: (2024)
par: Lai, Song-Jiang, et autres
Publié: (2024)
An End-to-End Deep Learning Generative Framework for Refinable Shape Matching and Generation
par: Kalaie, Soodeh, et autres
Publié: (2024)
par: Kalaie, Soodeh, et autres
Publié: (2024)
DLFR-VAE: Dynamic Latent Frame Rate VAE for Video Generation
par: Yuan, Zhihang, et autres
Publié: (2025)
par: Yuan, Zhihang, et autres
Publié: (2025)
Training Multi-Image Vision Agents via End2End Reinforcement Learning
par: Dong, Chengqi, et autres
Publié: (2025)
par: Dong, Chengqi, et autres
Publié: (2025)
Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving
par: Jiang, Hao, et autres
Publié: (2025)
par: Jiang, Hao, et autres
Publié: (2025)
MsaMIL-Net: An End-to-End Multi-Scale Aware Multiple Instance Learning Network for Efficient Whole Slide Image Classification
par: Wen, Jiangping, et autres
Publié: (2025)
par: Wen, Jiangping, et autres
Publié: (2025)
EA-RAS: Towards Efficient and Accurate End-to-End Reconstruction of Anatomical Skeleton
par: Peng, Zhiheng, et autres
Publié: (2024)
par: Peng, Zhiheng, et autres
Publié: (2024)
Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models
par: Hao, Jitai, et autres
Publié: (2025)
par: Hao, Jitai, et autres
Publié: (2025)
HeightMapNet: Explicit Height Modeling for End-to-End HD Map Learning
par: Qiu, Wenzhao, et autres
Publié: (2024)
par: Qiu, Wenzhao, et autres
Publié: (2024)
JointRF: End-to-End Joint Optimization for Dynamic Neural Radiance Field Representation and Compression
par: Zheng, Zihan, et autres
Publié: (2024)
par: Zheng, Zihan, et autres
Publié: (2024)
An End-to-End Deep Learning Framework for Arsenicosis Diagnosis Using Mobile-Captured Skin Images
par: Newaz, Asif, et autres
Publié: (2025)
par: Newaz, Asif, et autres
Publié: (2025)
Beyond Adapting SAM: Towards End-to-End Ultrasound Image Segmentation via Auto Prompting
par: Lin, Xian, et autres
Publié: (2023)
par: Lin, Xian, et autres
Publié: (2023)
Alpha Divergence Losses for Biometric Verification
par: Koutsianos, Dimitrios, et autres
Publié: (2025)
par: Koutsianos, Dimitrios, et autres
Publié: (2025)
Spatially Visual Perception for End-to-End Robotic Learning
par: Davies, Travis, et autres
Publié: (2024)
par: Davies, Travis, et autres
Publié: (2024)
UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware Preservation
par: Li, Xingyuan, et autres
Publié: (2026)
par: Li, Xingyuan, et autres
Publié: (2026)
EVA: Efficient Reinforcement Learning for End-to-End Video Agent
par: Zhang, Yaolun, et autres
Publié: (2026)
par: Zhang, Yaolun, et autres
Publié: (2026)
DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers
par: Wang, Zitong, et autres
Publié: (2025)
par: Wang, Zitong, et autres
Publié: (2025)
ICDAR 2025 Competition on End-to-End Document Image Machine Translation Towards Complex Layouts
par: Zhang, Yaping, et autres
Publié: (2026)
par: Zhang, Yaping, et autres
Publié: (2026)
TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment
par: Qin, Chunxia, et autres
Publié: (2026)
par: Qin, Chunxia, et autres
Publié: (2026)
FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
par: Cao, Jiajun, et autres
Publié: (2025)
par: Cao, Jiajun, et autres
Publié: (2025)
Multi-granularity Contrastive Cross-modal Collaborative Generation for End-to-End Long-term Video Question Answering
par: Yu, Ting, et autres
Publié: (2024)
par: Yu, Ting, et autres
Publié: (2024)
Towards End-to-End Neuromorphic Event-based 3D Object Reconstruction Without Physical Priors
par: Xu, Chuanzhi, et autres
Publié: (2025)
par: Xu, Chuanzhi, et autres
Publié: (2025)
End-to-End Training for Unified Tokenization and Latent Denoising
par: Duggal, Shivam, et autres
Publié: (2026)
par: Duggal, Shivam, et autres
Publié: (2026)
End-to-End Optimized Image Compression with the Frequency-Oriented Transform
par: Zhang, Yuefeng, et autres
Publié: (2024)
par: Zhang, Yuefeng, et autres
Publié: (2024)
Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets
par: Koran, Alex, et autres
Publié: (2026)
par: Koran, Alex, et autres
Publié: (2026)
SimpleLLM4AD: An End-to-End Vision-Language Model with Graph Visual Question Answering for Autonomous Driving
par: Zheng, Peiru, et autres
Publié: (2024)
par: Zheng, Peiru, et autres
Publié: (2024)
Vision without Images: End-to-End Computer Vision from Single Compressive Measurements
par: Pan, Fengpu, et autres
Publié: (2025)
par: Pan, Fengpu, et autres
Publié: (2025)
ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation
par: Zhang, Mengchen, et autres
Publié: (2025)
par: Zhang, Mengchen, et autres
Publié: (2025)
End-to-End Human Instance Matting
par: Liu, Qinglin, et autres
Publié: (2024)
par: Liu, Qinglin, et autres
Publié: (2024)
FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder
par: Dong, Zeyu, et autres
Publié: (2026)
par: Dong, Zeyu, et autres
Publié: (2026)
Denoising Multi-Beta VAE: Representation Learning for Disentanglement and Generation
par: Uppal, Anshuk, et autres
Publié: (2025)
par: Uppal, Anshuk, et autres
Publié: (2025)
No Image, No Problem: End-to-End Multi-Task Cardiac Analysis from Undersampled k-Space
par: Zhang, Yundi, et autres
Publié: (2026)
par: Zhang, Yundi, et autres
Publié: (2026)
Risk-Aware World Model Predictive Control for Generalizable End-to-End Autonomous Driving
par: Sun, Jiangxin, et autres
Publié: (2026)
par: Sun, Jiangxin, et autres
Publié: (2026)
Hint-AD: Holistically Aligned Interpretability in End-to-End Autonomous Driving
par: Ding, Kairui, et autres
Publié: (2024)
par: Ding, Kairui, et autres
Publié: (2024)
ContourFormer: Real-Time Contour-Based End-to-End Instance Segmentation Transformer
par: Yao, Weiwei, et autres
Publié: (2025)
par: Yao, Weiwei, et autres
Publié: (2025)
Documents similaires
-
OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning
par: Yu, Hao, et autres
Publié: (2025) -
End-to-End Deep Learning for Structural Brain Imaging: A Unified Framework
par: Su, Yao, et autres
Publié: (2025) -
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
par: Ma, Zehong, et autres
Publié: (2025) -
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
par: Shao, Hao, et autres
Publié: (2026) -
DualComp: End-to-End Learning of a Unified Dual-Modality Lossless Compressor
par: Zhao, Yan, et autres
Publié: (2025)