VIVAT: Virtuous Improving VAE Training through Artifact Mitigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Novitskiy, Lev, Vasilev, Viacheslav, Kovaleva, Maria, Arkhipkin, Vladimir, Dimitrov, Denis |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Kandinsky 3.0 Technical Report
par: Arkhipkin, Vladimir, et autres
Publié: (2023)
par: Arkhipkin, Vladimir, et autres
Publié: (2023)
Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework
par: Arkhipkin, Vladimir, et autres
Publié: (2024)
par: Arkhipkin, Vladimir, et autres
Publié: (2024)
$\nabla$NABLA: Neighborhood Adaptive Block-Level Attention
par: Mikhailov, Dmitrii, et autres
Publié: (2025)
par: Mikhailov, Dmitrii, et autres
Publié: (2025)
DeCo-VAE: Learning Compact Latents for Video Reconstruction via Decoupled Representation
par: Yin, Xiangchen, et autres
Publié: (2025)
par: Yin, Xiangchen, et autres
Publié: (2025)
Storybooth: Training-free Multi-Subject Consistency for Improved Visual Storytelling
par: Singh, Jaskirat, et autres
Publié: (2025)
par: Singh, Jaskirat, et autres
Publié: (2025)
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
par: Arkhipkin, Vladimir, et autres
Publié: (2025)
par: Arkhipkin, Vladimir, et autres
Publié: (2025)
CRAFT: Cultural Russian-Oriented Dataset Adaptation for Focused Text-to-Image Generation
par: Vasilev, Viacheslav, et autres
Publié: (2025)
par: Vasilev, Viacheslav, et autres
Publié: (2025)
Parameter-Efficient Subspace Decoupling ViT for Mitigating Multi-Task Negative Transfer in Histological Scoring
par: Huang, Youhan, et autres
Publié: (2026)
par: Huang, Youhan, et autres
Publié: (2026)
Operationalizing Fairness in Text-to-Image Models: A Survey of Bias, Fairness Audits and Mitigation Strategies
par: Smith, Megan, et autres
Publié: (2026)
par: Smith, Megan, et autres
Publié: (2026)
Improving Accuracy and Generalization for Efficient Visual Tracking
par: Zaveri, Ram, et autres
Publié: (2024)
par: Zaveri, Ram, et autres
Publié: (2024)
Semantic-Aware Adversarial Training for Reliable Deep Hashing Retrieval
par: Yuan, Xu, et autres
Publié: (2023)
par: Yuan, Xu, et autres
Publié: (2023)
Knowledge Bridger: Towards Training-free Missing Modality Completion
par: Ke, Guanzhou, et autres
Publié: (2025)
par: Ke, Guanzhou, et autres
Publié: (2025)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
par: Liu, Luping, et autres
Publié: (2024)
par: Liu, Luping, et autres
Publié: (2024)
InvZW: Invariant Feature Learning via Noise-Adversarial Training for Robust Image Zero-Watermarking
par: Tanvir, Abdullah All, et autres
Publié: (2025)
par: Tanvir, Abdullah All, et autres
Publié: (2025)
Pay Less Attention to Deceptive Artifacts: Robust Detection of Compressed Deepfakes on Online Social Networks
par: Li, Manyi, et autres
Publié: (2025)
par: Li, Manyi, et autres
Publié: (2025)
Self-Supervised Compression and Artifact Correction for Streaming Underwater Imaging Sonar
par: Qian, Rongsheng, et autres
Publié: (2025)
par: Qian, Rongsheng, et autres
Publié: (2025)
Improving Generative Adversarial Network Generalization for Facial Expression Synthesis
par: Akram, Arbish, et autres
Publié: (2026)
par: Akram, Arbish, et autres
Publié: (2026)
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
par: Shahzad, Sahibzada Adil, et autres
Publié: (2026)
par: Shahzad, Sahibzada Adil, et autres
Publié: (2026)
CLIP as RNN: Segment Countless Visual Concepts without Training Endeavor
par: Sun, Shuyang, et autres
Publié: (2023)
par: Sun, Shuyang, et autres
Publié: (2023)
Conditioning GAN Without Training Dataset
par: Mekonnen, Kidist Amde
Publié: (2024)
par: Mekonnen, Kidist Amde
Publié: (2024)
Improving Visual Representation Alignment Generation with GRPO
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
Omnidirectional Video Super-Resolution using Deep Learning
par: Baniya, Arbind Agrahari, et autres
Publié: (2025)
par: Baniya, Arbind Agrahari, et autres
Publié: (2025)
Zero-shot image privacy classification with Vision-Language Models
par: Baia, Alina Elena, et autres
Publié: (2025)
par: Baia, Alina Elena, et autres
Publié: (2025)
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
par: Ouyang, Pengxiang, et autres
Publié: (2025)
par: Ouyang, Pengxiang, et autres
Publié: (2025)
CreativeVR: Diffusion-Prior-Guided Approach for Structure and Motion Restoration in Generative and Real Videos
par: Panambur, Tejas, et autres
Publié: (2025)
par: Panambur, Tejas, et autres
Publié: (2025)
Long-Range Feature Propagating for Natural Image Matting
par: Liu, Qinglin, et autres
Publié: (2021)
par: Liu, Qinglin, et autres
Publié: (2021)
Balanced Multi-modal Federated Learning via Cross-Modal Infiltration
par: Fan, Yunfeng, et autres
Publié: (2023)
par: Fan, Yunfeng, et autres
Publié: (2023)
MCE: Towards a General Framework for Handling Missing Modalities under Imbalanced Missing Rates
par: Zhao, Binyu, et autres
Publié: (2025)
par: Zhao, Binyu, et autres
Publié: (2025)
Unveiling the Visual Counting Bottleneck in Vision-Language Models
par: Pang, Xingzhou, et autres
Publié: (2026)
par: Pang, Xingzhou, et autres
Publié: (2026)
Principled Multimodal Representation Learning
par: Liu, Xiaohao, et autres
Publié: (2025)
par: Liu, Xiaohao, et autres
Publié: (2025)
Detecting Content Rating Violations in Android Applications: A Vision-Language Approach
par: Denipitiyage, D., et autres
Publié: (2025)
par: Denipitiyage, D., et autres
Publié: (2025)
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
par: Zhang, Yafei, et autres
Publié: (2025)
par: Zhang, Yafei, et autres
Publié: (2025)
GroMo: Plant Growth Modeling with Multiview Images
par: Bhatt, Ruchi, et autres
Publié: (2025)
par: Bhatt, Ruchi, et autres
Publié: (2025)
Cross-Modal Coordination Across a Diverse Set of Input Modalities
par: Sánchez, Jorge, et autres
Publié: (2024)
par: Sánchez, Jorge, et autres
Publié: (2024)
Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization
par: Wang, Tianyu, et autres
Publié: (2026)
par: Wang, Tianyu, et autres
Publié: (2026)
3DTV: A Feedforward Interpolation Network for Real-Time View Synthesis
par: Schulz, Stefan, et autres
Publié: (2026)
par: Schulz, Stefan, et autres
Publié: (2026)
From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images
par: Chen, Yiming, et autres
Publié: (2025)
par: Chen, Yiming, et autres
Publié: (2025)
Regularized Contrastive Partial Multi-view Outlier Detection
par: Wang, Yijia, et autres
Publié: (2024)
par: Wang, Yijia, et autres
Publié: (2024)
Generalized Jersey Number Recognition Using Multi-task Learning With Orientation-guided Weight Refinement
par: Lin, Yung-Hui, et autres
Publié: (2024)
par: Lin, Yung-Hui, et autres
Publié: (2024)
Relating CNN-Transformer Fusion Network for Change Detection
par: Gao, Yuhao, et autres
Publié: (2024)
par: Gao, Yuhao, et autres
Publié: (2024)
Documents similaires
-
Kandinsky 3.0 Technical Report
par: Arkhipkin, Vladimir, et autres
Publié: (2023) -
Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework
par: Arkhipkin, Vladimir, et autres
Publié: (2024) -
$\nabla$NABLA: Neighborhood Adaptive Block-Level Attention
par: Mikhailov, Dmitrii, et autres
Publié: (2025) -
DeCo-VAE: Learning Compact Latents for Video Reconstruction via Decoupled Representation
par: Yin, Xiangchen, et autres
Publié: (2025) -
Storybooth: Training-free Multi-Subject Consistency for Improved Visual Storytelling
par: Singh, Jaskirat, et autres
Publié: (2025)