FreSca: Scaling in Frequency Space Enhances Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Chao, Liang, Susan, Tang, Yunlong, Bi, Jing, Ma, Li, Tian, Yapeng, Xu, Chenliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Concept With Text-Guided Diffusion Models
di: Huang, Chao, et al.
Pubblicazione: (2024)
di: Huang, Chao, et al.
Pubblicazione: (2024)
High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
Language-Guided Joint Audio-Visual Editing via One-Shot Adaptation
di: Liang, Susan, et al.
Pubblicazione: (2024)
di: Liang, Susan, et al.
Pubblicazione: (2024)
FreNBRDF: A Frequency-Rectified Neural Material Representation
di: Zhou, Chenliang, et al.
Pubblicazione: (2025)
di: Zhou, Chenliang, et al.
Pubblicazione: (2025)
FrePolad: Frequency-Rectified Point Latent Diffusion for Point Cloud Generation
di: Zhou, Chenliang, et al.
Pubblicazione: (2023)
di: Zhou, Chenliang, et al.
Pubblicazione: (2023)
High-Quality Visually-Guided Sound Separation from Diverse Categories
di: Huang, Chao, et al.
Pubblicazione: (2023)
di: Huang, Chao, et al.
Pubblicazione: (2023)
ZeroSep: Separate Anything in Audio with Zero Training
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
Efficiently Leveraging Linguistic Priors for Scene Text Spotting
di: Nguyen, Nguyen, et al.
Pubblicazione: (2024)
di: Nguyen, Nguyen, et al.
Pubblicazione: (2024)
Harnessing the Computation Redundancy in ViTs to Boost Adversarial Transferability
di: Liu, Jiani, et al.
Pubblicazione: (2025)
di: Liu, Jiani, et al.
Pubblicazione: (2025)
Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach
di: Bi, Jing, et al.
Pubblicazione: (2024)
di: Bi, Jing, et al.
Pubblicazione: (2024)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
di: Liang, Susan, et al.
Pubblicazione: (2026)
di: Liang, Susan, et al.
Pubblicazione: (2026)
FreGS: 3D Gaussian Splatting with Progressive Frequency Regularization
di: Zhang, Jiahui, et al.
Pubblicazione: (2024)
di: Zhang, Jiahui, et al.
Pubblicazione: (2024)
EAGLE: Egocentric AGgregated Language-video Engine
di: Bi, Jing, et al.
Pubblicazione: (2024)
di: Bi, Jing, et al.
Pubblicazione: (2024)
CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
TDMM-LM: Bridging Facial Understanding and Animation via Language Models
di: Song, Luchuan, et al.
Pubblicazione: (2026)
di: Song, Luchuan, et al.
Pubblicazione: (2026)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
What to Do Next? Memorizing skills from Egocentric Instructional Video
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
OSCaR: Object State Captioning and State Change Representation
di: Nguyen, Nguyen, et al.
Pubblicazione: (2024)
di: Nguyen, Nguyen, et al.
Pubblicazione: (2024)
FreBIS: Frequency-Based Stratification for Neural Implicit Surface Representations
di: Sawada, Naoko, et al.
Pubblicazione: (2025)
di: Sawada, Naoko, et al.
Pubblicazione: (2025)
VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning
di: Tan, Zhangyun, et al.
Pubblicazione: (2026)
di: Tan, Zhangyun, et al.
Pubblicazione: (2026)
ScaMo: Exploring the Scaling Law in Autoregressive Motion Generation Model
di: Lu, Shunlin, et al.
Pubblicazione: (2024)
di: Lu, Shunlin, et al.
Pubblicazione: (2024)
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
FreDFT: Frequency Domain Fusion Transformer for Visible-Infrared Object Detection
di: Wu, Wencong, et al.
Pubblicazione: (2025)
di: Wu, Wencong, et al.
Pubblicazione: (2025)
Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?
di: Feng, Mingqian, et al.
Pubblicazione: (2024)
di: Feng, Mingqian, et al.
Pubblicazione: (2024)
Scaling Diffusion Mamba with Bidirectional SSMs for Efficient Image and Video Generation
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Will the Inclusion of Generated Data Amplify Bias Across Generations in Future Image Classification Models?
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
FreCaS: Efficient Higher-Resolution Image Generation via Frequency-aware Cascaded Sampling
di: Zhang, Zhengqiang, et al.
Pubblicazione: (2024)
di: Zhang, Zhengqiang, et al.
Pubblicazione: (2024)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Diagnosing Visual Reasoning: Challenges, Insights, and a Path Forward
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
di: Zhang, Zeliang, et al.
Pubblicazione: (2025)
di: Zhang, Zeliang, et al.
Pubblicazione: (2025)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
di: Wang, Kai, et al.
Pubblicazione: (2024)
di: Wang, Kai, et al.
Pubblicazione: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
di: Tang, Yolo Y., et al.
Pubblicazione: (2024)
di: Tang, Yolo Y., et al.
Pubblicazione: (2024)
When to Think and When to Look: Uncertainty-Guided Lookback
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs
di: Feng, Yigui, et al.
Pubblicazione: (2026)
di: Feng, Yigui, et al.
Pubblicazione: (2026)
Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters
di: Hogue, Steven, et al.
Pubblicazione: (2024)
di: Hogue, Steven, et al.
Pubblicazione: (2024)
FrequencyBooster: Full-Frequency Modeling for High-Fidelity Pixel Diffusion
di: Ma, Lichen, et al.
Pubblicazione: (2026)
di: Ma, Lichen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Scaling Concept With Text-Guided Diffusion Models
di: Huang, Chao, et al.
Pubblicazione: (2024) -
High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
di: Huang, Chao, et al.
Pubblicazione: (2025) -
Language-Guided Joint Audio-Visual Editing via One-Shot Adaptation
di: Liang, Susan, et al.
Pubblicazione: (2024) -
FreNBRDF: A Frequency-Rectified Neural Material Representation
di: Zhou, Chenliang, et al.
Pubblicazione: (2025) -
FrePolad: Frequency-Rectified Point Latent Diffusion for Point Cloud Generation
di: Zhou, Chenliang, et al.
Pubblicazione: (2023)