Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective
Fuente:
arXiv
Salvato in:
| Autori principali: | Lai, Bolin, Wang, Xudong, Rambhatla, Saketh, Rehg, James M., Kira, Zsolt, Girdhar, Rohit, Misra, Ishan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
InstanceDiffusion: Instance-level Control for Image Generation
di: Wang, Xudong, et al.
Pubblicazione: (2024)
di: Wang, Xudong, et al.
Pubblicazione: (2024)
Diffusion Autoencoders are Scalable Image Tokenizers
di: Chen, Yinbo, et al.
Pubblicazione: (2025)
di: Chen, Yinbo, et al.
Pubblicazione: (2025)
SelfEval: Leveraging the discriminative nature of generative models for evaluation
di: Rambhatla, Sai Saketh, et al.
Pubblicazione: (2023)
di: Rambhatla, Sai Saketh, et al.
Pubblicazione: (2023)
MotiF: Making Text Count in Image Animation with Motion Focal Loss
di: Wang, Shijie, et al.
Pubblicazione: (2024)
di: Wang, Shijie, et al.
Pubblicazione: (2024)
Generating Illustrated Instructions
di: Menon, Sachit, et al.
Pubblicazione: (2023)
di: Menon, Sachit, et al.
Pubblicazione: (2023)
Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning
di: Girdhar, Rohit, et al.
Pubblicazione: (2023)
di: Girdhar, Rohit, et al.
Pubblicazione: (2023)
LLMs can see and hear without any training
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
Human detectors are surprisingly powerful reward models
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
Trajectory-aligned Space-time Tokens for Few-shot Action Recognition
di: Kumar, Pulkit, et al.
Pubblicazione: (2024)
di: Kumar, Pulkit, et al.
Pubblicazione: (2024)
In the Eye of Transformer: Global-Local Correlation for Egocentric Gaze Estimation
di: Lai, Bolin, et al.
Pubblicazione: (2022)
di: Lai, Bolin, et al.
Pubblicazione: (2022)
Towards Online Multi-Modal Social Interaction Understanding
di: Li, Xinpeng, et al.
Pubblicazione: (2025)
di: Li, Xinpeng, et al.
Pubblicazione: (2025)
Human Action Anticipation: A Survey
di: Lai, Bolin, et al.
Pubblicazione: (2024)
di: Lai, Bolin, et al.
Pubblicazione: (2024)
Listen to Look into the Future: Audio-Visual Egocentric Gaze Anticipation
di: Lai, Bolin, et al.
Pubblicazione: (2023)
di: Lai, Bolin, et al.
Pubblicazione: (2023)
Learning Predictive Visuomotor Coordination
di: Jia, Wenqi, et al.
Pubblicazione: (2025)
di: Jia, Wenqi, et al.
Pubblicazione: (2025)
Trokens: Semantic-Aware Relational Trajectory Tokens for Few-Shot Action Recognition
di: Kumar, Pulkit, et al.
Pubblicazione: (2025)
di: Kumar, Pulkit, et al.
Pubblicazione: (2025)
Omni-MMSI: Toward Identity-attributed Social Interaction Understanding
di: Li, Xinpeng, et al.
Pubblicazione: (2026)
di: Li, Xinpeng, et al.
Pubblicazione: (2026)
Unified Text-Image-to-Video Generation: A Training-Free Approach to Flexible Visual Conditioning
di: Lai, Bolin, et al.
Pubblicazione: (2025)
di: Lai, Bolin, et al.
Pubblicazione: (2025)
LEGO: Learning EGOcentric Action Frame Generation via Visual Instruction Tuning
di: Lai, Bolin, et al.
Pubblicazione: (2023)
di: Lai, Bolin, et al.
Pubblicazione: (2023)
SAGE: Sink-Aware Grounded Decoding for Multimodal Hallucination Mitigation
di: Shukla, Tripti, et al.
Pubblicazione: (2026)
di: Shukla, Tripti, et al.
Pubblicazione: (2026)
Modeling Multimodal Social Interactions: New Challenges and Baselines with Densely Aligned Representations
di: Lee, Sangmin, et al.
Pubblicazione: (2024)
di: Lee, Sangmin, et al.
Pubblicazione: (2024)
SocialGesture: Delving into Multi-person Gesture Understanding
di: Cao, Xu, et al.
Pubblicazione: (2025)
di: Cao, Xu, et al.
Pubblicazione: (2025)
UVIS: Unsupervised Video Instance Segmentation
di: Huang, Shuaiyi, et al.
Pubblicazione: (2024)
di: Huang, Shuaiyi, et al.
Pubblicazione: (2024)
MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs
di: Ye, Wenqian, et al.
Pubblicazione: (2024)
di: Ye, Wenqian, et al.
Pubblicazione: (2024)
Diffuse, Attend, and Segment: Unsupervised Zero-Shot Segmentation using Stable Diffusion
di: Tian, Junjiao, et al.
Pubblicazione: (2023)
di: Tian, Junjiao, et al.
Pubblicazione: (2023)
DiffEye: Diffusion-Based Continuous Eye-Tracking Data Generation Conditioned on Natural Images
di: Kara, Ozgur, et al.
Pubblicazione: (2025)
di: Kara, Ozgur, et al.
Pubblicazione: (2025)
Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding
di: Kumar, Akash, et al.
Pubblicazione: (2025)
di: Kumar, Akash, et al.
Pubblicazione: (2025)
Continual Diffusion with STAMINA: STack-And-Mask INcremental Adapters
di: Smith, James Seale, et al.
Pubblicazione: (2023)
di: Smith, James Seale, et al.
Pubblicazione: (2023)
PointInfinity: Resolution-Invariant Point Diffusion Models
di: Huang, Zixuan, et al.
Pubblicazione: (2024)
di: Huang, Zixuan, et al.
Pubblicazione: (2024)
Latent Watermark: Inject and Detect Watermarks in Latent Diffusion Space
di: Meng, Zheling, et al.
Pubblicazione: (2024)
di: Meng, Zheling, et al.
Pubblicazione: (2024)
FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding
di: Yang, Jinghan, et al.
Pubblicazione: (2026)
di: Yang, Jinghan, et al.
Pubblicazione: (2026)
LatentBKI: Open-Dictionary Continuous Mapping in Visual-Language Latent Spaces with Quantifiable Uncertainty
di: Wilson, Joey, et al.
Pubblicazione: (2024)
di: Wilson, Joey, et al.
Pubblicazione: (2024)
FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space
di: FSVideo Team, et al.
Pubblicazione: (2026)
di: FSVideo Team, et al.
Pubblicazione: (2026)
Nodule-Aligned Latent Space Learning with LLM-Driven Multimodal Diffusion for Lung Nodule Progression Prediction
di: Song, James, et al.
Pubblicazione: (2026)
di: Song, James, et al.
Pubblicazione: (2026)
Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent Space
di: Zhou, Yifan, et al.
Pubblicazione: (2025)
di: Zhou, Yifan, et al.
Pubblicazione: (2025)
GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions
di: Kim, Junho, et al.
Pubblicazione: (2026)
di: Kim, Junho, et al.
Pubblicazione: (2026)
Privacy Beyond Pixels: Latent Anonymization for Privacy-Preserving Video Understanding
di: Fioresi, Joseph, et al.
Pubblicazione: (2025)
di: Fioresi, Joseph, et al.
Pubblicazione: (2025)
Spectrum Matching: a Unified Perspective for Superior Diffusability in Latent Diffusion
di: Ning, Mang, et al.
Pubblicazione: (2026)
di: Ning, Mang, et al.
Pubblicazione: (2026)
The effectiveness of MAE pre-pretraining for billion-scale pretraining
di: Singh, Mannat, et al.
Pubblicazione: (2023)
di: Singh, Mannat, et al.
Pubblicazione: (2023)
The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models
di: Chopra, Shivang, et al.
Pubblicazione: (2026)
di: Chopra, Shivang, et al.
Pubblicazione: (2026)
Rethinking Weight Decay for Robust Fine-Tuning of Foundation Models
di: Tian, Junjiao, et al.
Pubblicazione: (2024)
di: Tian, Junjiao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
InstanceDiffusion: Instance-level Control for Image Generation
di: Wang, Xudong, et al.
Pubblicazione: (2024) -
Diffusion Autoencoders are Scalable Image Tokenizers
di: Chen, Yinbo, et al.
Pubblicazione: (2025) -
SelfEval: Leveraging the discriminative nature of generative models for evaluation
di: Rambhatla, Sai Saketh, et al.
Pubblicazione: (2023) -
MotiF: Making Text Count in Image Animation with Motion Focal Loss
di: Wang, Shijie, et al.
Pubblicazione: (2024) -
Generating Illustrated Instructions
di: Menon, Sachit, et al.
Pubblicazione: (2023)