Language-Guided Joint Audio-Visual Editing via One-Shot Adaptation
Fuente:
arXiv
Guardado en:
| Autores principales: | Liang, Susan, Huang, Chao, Tian, Yapeng, Kumar, Anurag, Xu, Chenliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
High-Quality Visually-Guided Sound Separation from Diverse Categories
por: Huang, Chao, et al.
Publicado: (2023)
por: Huang, Chao, et al.
Publicado: (2023)
Scaling Concept With Text-Guided Diffusion Models
por: Huang, Chao, et al.
Publicado: (2024)
por: Huang, Chao, et al.
Publicado: (2024)
FreSca: Scaling in Frequency Space Enhances Diffusion Models
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
por: Zhang, Zeliang, et al.
Publicado: (2025)
por: Zhang, Zeliang, et al.
Publicado: (2025)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
por: Wang, Kai, et al.
Publicado: (2024)
por: Wang, Kai, et al.
Publicado: (2024)
Efficiently Leveraging Linguistic Priors for Scene Text Spotting
por: Nguyen, Nguyen, et al.
Publicado: (2024)
por: Nguyen, Nguyen, et al.
Publicado: (2024)
From Waveforms to Pixels: A Survey on Audio-Visual Segmentation
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
Exploiting Temporal Audio-Visual Correlation Embedding for Audio-Driven One-Shot Talking Head Animation
por: Xu, Zhihua, et al.
Publicado: (2025)
por: Xu, Zhihua, et al.
Publicado: (2025)
MAGIC: Map-Guided Few-Shot Audio-Visual Acoustics Modeling
por: Huang, Diwei, et al.
Publicado: (2024)
por: Huang, Diwei, et al.
Publicado: (2024)
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
por: Yang, Tianyu, et al.
Publicado: (2024)
por: Yang, Tianyu, et al.
Publicado: (2024)
Audio-Guided Visual Editing with Complex Multi-Modal Prompts
por: Kim, Hyeonyu, et al.
Publicado: (2025)
por: Kim, Hyeonyu, et al.
Publicado: (2025)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
por: Kushwaha, Saksham Singh, et al.
Publicado: (2024)
por: Kushwaha, Saksham Singh, et al.
Publicado: (2024)
InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
por: Zheng, Haojie, et al.
Publicado: (2026)
por: Zheng, Haojie, et al.
Publicado: (2026)
Learning to Highlight Audio by Watching Movies
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures
por: Hogue, Steven, et al.
Publicado: (2024)
por: Hogue, Steven, et al.
Publicado: (2024)
From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations
por: Li, Yuzhi, et al.
Publicado: (2025)
por: Li, Yuzhi, et al.
Publicado: (2025)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
por: Liang, Susan, et al.
Publicado: (2026)
por: Liang, Susan, et al.
Publicado: (2026)
Spherical World-Locking for Audio-Visual Localization in Egocentric Videos
por: Yun, Heeseung, et al.
Publicado: (2024)
por: Yun, Heeseung, et al.
Publicado: (2024)
ZeroSep: Separate Anything in Audio with Zero Training
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
por: Chao, Jianghan, et al.
Publicado: (2025)
por: Chao, Jianghan, et al.
Publicado: (2025)
Harnessing the Computation Redundancy in ViTs to Boost Adversarial Transferability
por: Liu, Jiani, et al.
Publicado: (2025)
por: Liu, Jiani, et al.
Publicado: (2025)
ZONE: Zero-Shot Instruction-Guided Local Editing
por: Li, Shanglin, et al.
Publicado: (2023)
por: Li, Shanglin, et al.
Publicado: (2023)
Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
Will the Inclusion of Generated Data Amplify Bias Across Generations in Future Image Classification Models?
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
por: Guo, Xinyue, et al.
Publicado: (2025)
por: Guo, Xinyue, et al.
Publicado: (2025)
T-VSL: Text-Guided Visual Sound Source Localization in Mixtures
por: Mahmud, Tanvir, et al.
Publicado: (2024)
por: Mahmud, Tanvir, et al.
Publicado: (2024)
SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing
por: Liang, Sen, et al.
Publicado: (2026)
por: Liang, Sen, et al.
Publicado: (2026)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
OSSA: Unsupervised One-Shot Style Adaptation
por: Gerster, Robin, et al.
Publicado: (2024)
por: Gerster, Robin, et al.
Publicado: (2024)
Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters
por: Hogue, Steven, et al.
Publicado: (2024)
por: Hogue, Steven, et al.
Publicado: (2024)
StyleQoRA: Quality-Aware Low-Rank Adaptation for Few-Shot Multi-Style Editing
por: Cao, Cong, et al.
Publicado: (2025)
por: Cao, Cong, et al.
Publicado: (2025)
DRNet: All-in-One Image Restoration via Prior-Guided Dynamic Reparameterization
por: Li, Ao, et al.
Publicado: (2026)
por: Li, Ao, et al.
Publicado: (2026)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
por: Mahmud, Tanvir, et al.
Publicado: (2024)
por: Mahmud, Tanvir, et al.
Publicado: (2024)
Adaptive Super Resolution For One-Shot Talking-Head Generation
por: Song, Luchuan, et al.
Publicado: (2024)
por: Song, Luchuan, et al.
Publicado: (2024)
Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning
por: Li, Wenrui, et al.
Publicado: (2025)
por: Li, Wenrui, et al.
Publicado: (2025)
Audio-Visual Intelligence in Large Foundation Models
por: Qin, You, et al.
Publicado: (2026)
por: Qin, You, et al.
Publicado: (2026)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
por: Sun, Guangzhi, et al.
Publicado: (2024)
por: Sun, Guangzhi, et al.
Publicado: (2024)
Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models
por: Li, Xudong, et al.
Publicado: (2024)
por: Li, Xudong, et al.
Publicado: (2024)
Ejemplares similares
-
High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
por: Huang, Chao, et al.
Publicado: (2025) -
High-Quality Visually-Guided Sound Separation from Diverse Categories
por: Huang, Chao, et al.
Publicado: (2023) -
Scaling Concept With Text-Guided Diffusion Models
por: Huang, Chao, et al.
Publicado: (2024) -
FreSca: Scaling in Frequency Space Enhances Diffusion Models
por: Huang, Chao, et al.
Publicado: (2025) -
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
por: Zhang, Zeliang, et al.
Publicado: (2025)