aMUSEd: An Open MUSE Reproduction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Patil, Suraj, Berman, William, Rombach, Robin, von Platen, Patrick |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fast High-Resolution Image Synthesis with Latent Adversarial Diffusion Distillation
par: Sauer, Axel, et autres
Publié: (2024)
par: Sauer, Axel, et autres
Publié: (2024)
Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
par: Chefer, Hila, et autres
Publié: (2026)
par: Chefer, Hila, et autres
Publié: (2026)
MUMU: Bootstrapping Multimodal Image Generation from Text-to-Image Data
par: Berman, William, et autres
Publié: (2024)
par: Berman, William, et autres
Publié: (2024)
SV3D: Novel Multi-view Synthesis and 3D Generation from a Single Image using Latent Video Diffusion
par: Voleti, Vikram, et autres
Publié: (2024)
par: Voleti, Vikram, et autres
Publié: (2024)
Progressive Knowledge Distillation Of Stable Diffusion XL Using Layer Level Loss
par: Gupta, Yatharth, et autres
Publié: (2024)
par: Gupta, Yatharth, et autres
Publié: (2024)
MUSE: Mamba is Efficient Multi-scale Learner for Text-video Retrieval
par: Tang, Haoran, et autres
Publié: (2024)
par: Tang, Haoran, et autres
Publié: (2024)
MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding
par: Xie, Rongchang, et autres
Publié: (2024)
par: Xie, Rongchang, et autres
Publié: (2024)
MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality
par: Yang, Panqi, et autres
Publié: (2026)
par: Yang, Panqi, et autres
Publié: (2026)
MUSE: Multi-Scale Dense Self-Distillation for Nucleus Detection and Classification
par: Yang, Zijiang, et autres
Publié: (2025)
par: Yang, Zijiang, et autres
Publié: (2025)
DiffusionSat: A Generative Foundation Model for Satellite Imagery
par: Khanna, Samar, et autres
Publié: (2023)
par: Khanna, Samar, et autres
Publié: (2023)
MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion
par: Peng, Fei, et autres
Publié: (2025)
par: Peng, Fei, et autres
Publié: (2025)
MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification
par: Xu, Jiahao, et autres
Publié: (2026)
par: Xu, Jiahao, et autres
Publié: (2026)
MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
par: Xia, Yingjie, et autres
Publié: (2025)
par: Xia, Yingjie, et autres
Publié: (2025)
Digital Scale: Open-Source On-Device BMI Estimation from Smartphone Camera Images Trained on a Large-Scale Real-World Dataset
par: Manichand, Frederik Rajiv, et autres
Publié: (2025)
par: Manichand, Frederik Rajiv, et autres
Publié: (2025)
SFGANS Self-supervised Future Generator for human ActioN Segmentation
par: Berman, Or, et autres
Publié: (2023)
par: Berman, Or, et autres
Publié: (2023)
MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive Orchestration
par: Sun, Wenzhang, et autres
Publié: (2026)
par: Sun, Wenzhang, et autres
Publié: (2026)
Densely Decoded Networks with Adaptive Deep Supervision for Medical Image Segmentation
par: Mishra, Suraj, et autres
Publié: (2024)
par: Mishra, Suraj, et autres
Publié: (2024)
Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
par: Esser, Patrick, et autres
Publié: (2024)
par: Esser, Patrick, et autres
Publié: (2024)
Boosting Open Set Recognition Performance through Modulated Representation Learning
par: Kundu, Amit Kumar, et autres
Publié: (2025)
par: Kundu, Amit Kumar, et autres
Publié: (2025)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025)
par: Berman, Shmuel, et autres
Publié: (2025)
Progressive Photorealistic Simplification
par: Rosenthal, Adi, et autres
Publié: (2026)
par: Rosenthal, Adi, et autres
Publié: (2026)
TULIP: Transformer for Upsampling of LiDAR Point Clouds
par: Yang, Bin, et autres
Publié: (2023)
par: Yang, Bin, et autres
Publié: (2023)
FlexMUSE: Multimodal Unification and Semantics Enhancement Framework with Flexible interaction for Creative Writing
par: Chen, Jiahao, et autres
Publié: (2025)
par: Chen, Jiahao, et autres
Publié: (2025)
PathFinder: Attention-Driven Dynamic Non-Line-of-Sight Tracking with a Mobile Robot
par: Kannapiran, Shenbagaraj, et autres
Publié: (2024)
par: Kannapiran, Shenbagaraj, et autres
Publié: (2024)
TERRA-CD: Multi-Temporal Framework for Multi-class and Semantic Change Detection
par: Oak, Omkar, et autres
Publié: (2026)
par: Oak, Omkar, et autres
Publié: (2026)
Federated Cross-Modal Style-Aware Prompt Generation
par: Prasad, Suraj, et autres
Publié: (2025)
par: Prasad, Suraj, et autres
Publié: (2025)
Advancing Melanoma Diagnosis with Self-Supervised Neural Networks: Evaluating the Effectiveness of Different Techniques
par: Vusirikala, Srivishnu, et autres
Publié: (2024)
par: Vusirikala, Srivishnu, et autres
Publié: (2024)
SynthPID: P&ID digitization from Topology-Preserving Synthetic Data
par: Prasad, Suraj, et autres
Publié: (2026)
par: Prasad, Suraj, et autres
Publié: (2026)
Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations
par: Prasad, Suraj, et autres
Publié: (2026)
par: Prasad, Suraj, et autres
Publié: (2026)
Non-linear Analysis Based ECG Classification of Cardiovascular Disorders
par: Behera, Suraj Kumar, et autres
Publié: (2024)
par: Behera, Suraj Kumar, et autres
Publié: (2024)
MONET -- Virtual Cell Painting of Brightfield Images and Time Lapses Using Reference Consistent Diffusion
par: Peysakhovich, Alexander, et autres
Publié: (2025)
par: Peysakhovich, Alexander, et autres
Publié: (2025)
Novel View Synthesis with Pixel-Space Diffusion Models
par: Elata, Noam, et autres
Publié: (2024)
par: Elata, Noam, et autres
Publié: (2024)
Accelerating Text-to-Video Generation with Calibrated Sparse Attention
par: Yehezkel, Shai, et autres
Publié: (2026)
par: Yehezkel, Shai, et autres
Publié: (2026)
A Comparative Analysis of CNN-based Deep Learning Models for Landslide Detection
par: Oak, Omkar, et autres
Publié: (2024)
par: Oak, Omkar, et autres
Publié: (2024)
Pseudo-Invertible Neural Networks
par: Ehrlich, Yamit, et autres
Publié: (2026)
par: Ehrlich, Yamit, et autres
Publié: (2026)
MUSE: Model-based Uncertainty-aware Similarity Estimation for zero-shot 2D Object Detection and Segmentation
par: Cho, Sungmin, et autres
Publié: (2025)
par: Cho, Sungmin, et autres
Publié: (2025)
A Novel Structure-Agnostic Multi-Objective Approach for Weight-Sharing Compression in Deep Neural Networks
par: Khosrowshahli, Rasa, et autres
Publié: (2025)
par: Khosrowshahli, Rasa, et autres
Publié: (2025)
Classifying the Unknown: In-Context Learning for Open-Vocabulary Text and Symbol Recognition
par: Simon, Tom, et autres
Publié: (2025)
par: Simon, Tom, et autres
Publié: (2025)
AI Assisted Cervical Cancer Screening for Cytology Samples in Developing Countries
par: Panta, Love, et autres
Publié: (2025)
par: Panta, Love, et autres
Publié: (2025)
POP-3D: Open-Vocabulary 3D Occupancy Prediction from Images
par: Vobecky, Antonin, et autres
Publié: (2024)
par: Vobecky, Antonin, et autres
Publié: (2024)
Documents similaires
-
Fast High-Resolution Image Synthesis with Latent Adversarial Diffusion Distillation
par: Sauer, Axel, et autres
Publié: (2024) -
Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
par: Chefer, Hila, et autres
Publié: (2026) -
MUMU: Bootstrapping Multimodal Image Generation from Text-to-Image Data
par: Berman, William, et autres
Publié: (2024) -
SV3D: Novel Multi-view Synthesis and 3D Generation from a Single Image using Latent Video Diffusion
par: Voleti, Vikram, et autres
Publié: (2024) -
Progressive Knowledge Distillation Of Stable Diffusion XL Using Layer Level Loss
par: Gupta, Yatharth, et autres
Publié: (2024)