OmniPrism: Learning Disentangled Visual Concept for Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yangyang, Liu, Daqing, Liu, Wu, He, Allen, Liu, Xinchen, Zhang, Yongdong, Jin, Guoqing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos
par: He, Allen, et autres
Publié: (2026)
par: He, Allen, et autres
Publié: (2026)
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
par: Liu, Runtao, et autres
Publié: (2024)
par: Liu, Runtao, et autres
Publié: (2024)
Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
par: Mao, Fangyuan, et autres
Publié: (2025)
par: Mao, Fangyuan, et autres
Publié: (2025)
Editing Massive Concepts in Text-to-Image Diffusion Models
par: Xiong, Tianwei, et autres
Publié: (2024)
par: Xiong, Tianwei, et autres
Publié: (2024)
OmniGen: Unified Image Generation
par: Xiao, Shitao, et autres
Publié: (2024)
par: Xiao, Shitao, et autres
Publié: (2024)
Disentangling Regional Primitives for Image Generation
par: Chen, Zhengting, et autres
Publié: (2024)
par: Chen, Zhengting, et autres
Publié: (2024)
Post-Hoc Concept Disentanglement: From Correlated to Isolated Concept Representations
par: Erogullari, Eren, et autres
Publié: (2025)
par: Erogullari, Eren, et autres
Publié: (2025)
ConceptScope: Characterizing Dataset Bias via Disentangled Visual Concepts
par: Choi, Jinho, et autres
Publié: (2025)
par: Choi, Jinho, et autres
Publié: (2025)
CoDeGAN: Contrastive Disentanglement for Generative Adversarial Network
par: Zhao, Jiangwei, et autres
Publié: (2021)
par: Zhao, Jiangwei, et autres
Publié: (2021)
Controllable Video Generation with Provable Disentanglement
par: Shen, Yifan, et autres
Publié: (2025)
par: Shen, Yifan, et autres
Publié: (2025)
Learning to Infer Generative Template Programs for Visual Concepts
par: Jones, R. Kenny, et autres
Publié: (2024)
par: Jones, R. Kenny, et autres
Publié: (2024)
VideoPrism: A Foundational Visual Encoder for Video Understanding
par: Zhao, Long, et autres
Publié: (2024)
par: Zhao, Long, et autres
Publié: (2024)
Disentangled Sparse Representations for Concept-Separated Diffusion Unlearning
par: Kim, Hyeonjin, et autres
Publié: (2026)
par: Kim, Hyeonjin, et autres
Publié: (2026)
DEAL: Disentangle and Localize Concept-level Explanations for VLMs
par: Li, Tang, et autres
Publié: (2024)
par: Li, Tang, et autres
Publié: (2024)
Scaling Down Text Encoders of Text-to-Image Diffusion Models
par: Wang, Lifu, et autres
Publié: (2025)
par: Wang, Lifu, et autres
Publié: (2025)
Boosting the Transferability of Adversarial Examples via Local Mixup and Adaptive Step Size
par: Liu, Junlin, et autres
Publié: (2024)
par: Liu, Junlin, et autres
Publié: (2024)
Learning Concept-Based Causal Transition and Symbolic Reasoning for Visual Planning
par: Qian, Yilue, et autres
Publié: (2023)
par: Qian, Yilue, et autres
Publié: (2023)
SigFormer: Sparse Signal-Guided Transformer for Multi-Modal Human Action Segmentation
par: Liu, Qi, et autres
Publié: (2023)
par: Liu, Qi, et autres
Publié: (2023)
Superclass-Guided Representation Disentanglement for Spurious Correlation Mitigation
par: Liu, Chenruo, et autres
Publié: (2025)
par: Liu, Chenruo, et autres
Publié: (2025)
Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners
par: Feng, Chun, et autres
Publié: (2024)
par: Feng, Chun, et autres
Publié: (2024)
Explore the Limits of Omni-modal Pretraining at Scale
par: Zhang, Yiyuan, et autres
Publié: (2024)
par: Zhang, Yiyuan, et autres
Publié: (2024)
Pre-Training Meta-Rule Selection Policy for Visual Generative Abductive Learning
par: Jin, Yu, et autres
Publié: (2025)
par: Jin, Yu, et autres
Publié: (2025)
Unsupervised Synthetic Image Attribution: Alignment and Disentanglement
par: Liu, Zongfang, et autres
Publié: (2026)
par: Liu, Zongfang, et autres
Publié: (2026)
DTL: Disentangled Transfer Learning for Visual Recognition
par: Fu, Minghao, et autres
Publié: (2023)
par: Fu, Minghao, et autres
Publié: (2023)
Symbolic Disentangled Representations for Images
par: Korchemnyi, Alexandr, et autres
Publié: (2024)
par: Korchemnyi, Alexandr, et autres
Publié: (2024)
Pretrained Reversible Generation as Unsupervised Visual Representation Learning
par: Xue, Rongkun, et autres
Publié: (2024)
par: Xue, Rongkun, et autres
Publié: (2024)
Omni-SILA: Towards Omni-scene Driven Visual Sentiment Identifying, Locating and Attributing in Videos
par: Luo, Jiamin, et autres
Publié: (2025)
par: Luo, Jiamin, et autres
Publié: (2025)
Weakly Supervised Concept Learning for Object-centric Visual Reasoning
par: Tiwari, Sparsh, et autres
Publié: (2026)
par: Tiwari, Sparsh, et autres
Publié: (2026)
Learning Generalized and Flexible Trajectory Models from Omni-Semantic Supervision
par: Zhu, Yuanshao, et autres
Publié: (2025)
par: Zhu, Yuanshao, et autres
Publié: (2025)
MVP-CBM:Multi-layer Visual Preference-enhanced Concept Bottleneck Model for Explainable Medical Image Classification
par: Wang, Chunjiang, et autres
Publié: (2025)
par: Wang, Chunjiang, et autres
Publié: (2025)
Denoising Multi-Beta VAE: Representation Learning for Disentanglement and Generation
par: Uppal, Anshuk, et autres
Publié: (2025)
par: Uppal, Anshuk, et autres
Publié: (2025)
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
par: Zhang, Yiman, et autres
Publié: (2025)
par: Zhang, Yiman, et autres
Publié: (2025)
Omni-Dish: Photorealistic and Faithful Image Generation and Editing for Arbitrary Chinese Dishes
par: Liu, Huijie, et autres
Publié: (2025)
par: Liu, Huijie, et autres
Publié: (2025)
Pix2Code: Learning to Compose Neural Visual Concepts as Programs
par: Wüst, Antonia, et autres
Publié: (2024)
par: Wüst, Antonia, et autres
Publié: (2024)
DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
par: Jiang, Dongzhi, et autres
Publié: (2025)
par: Jiang, Dongzhi, et autres
Publié: (2025)
Explaining Generalization Power of a DNN Using Interactive Concepts
par: Zhou, Huilin, et autres
Publié: (2023)
par: Zhou, Huilin, et autres
Publié: (2023)
Prism: Spectral-Aware Block-Sparse Attention
par: Wang, Xinghao, et autres
Publié: (2026)
par: Wang, Xinghao, et autres
Publié: (2026)
Automatically Generating Visual Hallucination Test Cases for Multimodal Large Language Models
par: Liu, Zhongye, et autres
Publié: (2024)
par: Liu, Zhongye, et autres
Publié: (2024)
Understanding Visual Concepts Across Models
par: Trabucco, Brandon, et autres
Publié: (2024)
par: Trabucco, Brandon, et autres
Publié: (2024)
IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning
par: Li, Chenghao, et autres
Publié: (2026)
par: Li, Chenghao, et autres
Publié: (2026)
Documents similaires
-
A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos
par: He, Allen, et autres
Publié: (2026) -
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
par: Liu, Runtao, et autres
Publié: (2024) -
Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
par: Mao, Fangyuan, et autres
Publié: (2025) -
Editing Massive Concepts in Text-to-Image Diffusion Models
par: Xiong, Tianwei, et autres
Publié: (2024) -
OmniGen: Unified Image Generation
par: Xiao, Shitao, et autres
Publié: (2024)