Can We Hear from Events? Generating Speech from Event Camera
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Jingping, Chen, Lin, Xu, Chenyang, Zhao, Tong, Cai, Weidong, Chen, Xiaoming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MusicWeaver: Composer-Style Structural Editing and Minute-Scale Coherent Music Generation
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
Double Mixture: Towards Continual Event Detection from Speech
di: Kang, Jingqi, et al.
Pubblicazione: (2024)
di: Kang, Jingqi, et al.
Pubblicazione: (2024)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Gotta Hear Them All: Towards Sound Source Aware Audio Generation
di: Guo, Wei, et al.
Pubblicazione: (2024)
di: Guo, Wei, et al.
Pubblicazione: (2024)
MoTAS: MoE-Guided Feature Selection from TTS-Augmented Speech for Enhanced Multimodal Alzheimer's Early Screening
di: Shao, Yongqi, et al.
Pubblicazione: (2025)
di: Shao, Yongqi, et al.
Pubblicazione: (2025)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
di: Ren, Yong, et al.
Pubblicazione: (2025)
di: Ren, Yong, et al.
Pubblicazione: (2025)
MotionBeat: Motion-Aligned Music Representation via Embodied Contrastive Learning and Bar-Equivariant Contact-Aware Encoding
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
HI-TransPA: Hearing Impairments Translation Personal Assistant
di: Ma, Zhiming, et al.
Pubblicazione: (2025)
di: Ma, Zhiming, et al.
Pubblicazione: (2025)
ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation
di: Peng, Yuezhang, et al.
Pubblicazione: (2025)
di: Peng, Yuezhang, et al.
Pubblicazione: (2025)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
STCTS: Generative Semantic Compression for Ultra-Low Bitrate Speech via Explicit Text-Prosody-Timbre Decomposition
di: Wang, Siyu, et al.
Pubblicazione: (2025)
di: Wang, Siyu, et al.
Pubblicazione: (2025)
Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling
di: Fan, Congyi, et al.
Pubblicazione: (2026)
di: Fan, Congyi, et al.
Pubblicazione: (2026)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
di: Zhu, Jian, et al.
Pubblicazione: (2026)
di: Zhu, Jian, et al.
Pubblicazione: (2026)
Private Speech Classification without Collapse: Stabilized DP Training and Offline Distillation
di: Wen, Yadi, et al.
Pubblicazione: (2026)
di: Wen, Yadi, et al.
Pubblicazione: (2026)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection
di: Pan, Zihan, et al.
Pubblicazione: (2025)
di: Pan, Zihan, et al.
Pubblicazione: (2025)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
di: Li, Fu, et al.
Pubblicazione: (2025)
di: Li, Fu, et al.
Pubblicazione: (2025)
Low-latency Speech Enhancement via Speech Token Generation
di: Xue, Huaying, et al.
Pubblicazione: (2023)
di: Xue, Huaying, et al.
Pubblicazione: (2023)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
di: Guo, Zixin, et al.
Pubblicazione: (2024)
di: Guo, Zixin, et al.
Pubblicazione: (2024)
Research on Piano Timbre Transformation System Based on Diffusion Model
di: Hsu, Chun-Chieh, et al.
Pubblicazione: (2026)
di: Hsu, Chun-Chieh, et al.
Pubblicazione: (2026)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
di: Cui, Yang, et al.
Pubblicazione: (2025)
di: Cui, Yang, et al.
Pubblicazione: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
di: Zhou, Rui, et al.
Pubblicazione: (2024)
di: Zhou, Rui, et al.
Pubblicazione: (2024)
Generative Audio Extension and Morphing
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
Memo2496: Expert-Annotated Dataset and Dual-View Adaptive Framework for Music Emotion Recognition
di: Li, Qilin, et al.
Pubblicazione: (2025)
di: Li, Qilin, et al.
Pubblicazione: (2025)
CLAIP-Emo: Parameter-Efficient Adaptation of Language-supervised models for In-the-Wild Audiovisual Emotion Recognition
di: Chen, Yin, et al.
Pubblicazione: (2025)
di: Chen, Yin, et al.
Pubblicazione: (2025)
StereoFoley: Object-Aware Stereo Audio Generation from Video
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
CEM-Net: Cross-Emotion Memory Network for Emotional Talking Face Generation
di: Wu, Kangyi, et al.
Pubblicazione: (2025)
di: Wu, Kangyi, et al.
Pubblicazione: (2025)
Enkidu: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes
di: Feng, Zhou, et al.
Pubblicazione: (2025)
di: Feng, Zhou, et al.
Pubblicazione: (2025)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
di: Qiu, Ke, et al.
Pubblicazione: (2026)
di: Qiu, Ke, et al.
Pubblicazione: (2026)
ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
di: Li, Yaoru, et al.
Pubblicazione: (2025)
di: Li, Yaoru, et al.
Pubblicazione: (2025)
Microphone Conversion: Mitigating Device Variability in Sound Event Classification
di: Ryu, Myeonghoon, et al.
Pubblicazione: (2024)
di: Ryu, Myeonghoon, et al.
Pubblicazione: (2024)
Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation
di: Jeyaraj, Rathinaraja, et al.
Pubblicazione: (2025)
di: Jeyaraj, Rathinaraja, et al.
Pubblicazione: (2025)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
di: Wang, Jieyi, et al.
Pubblicazione: (2026)
di: Wang, Jieyi, et al.
Pubblicazione: (2026)
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
di: Li, Qingcao, et al.
Pubblicazione: (2026)
di: Li, Qingcao, et al.
Pubblicazione: (2026)
Timed text extraction from Taiwanese Kua-á-hì TV series
di: Huang, Tzu-Hung, et al.
Pubblicazione: (2026)
di: Huang, Tzu-Hung, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MusicWeaver: Composer-Style Structural Editing and Minute-Scale Coherent Music Generation
di: Wang, Xuanchen, et al.
Pubblicazione: (2025) -
Double Mixture: Towards Continual Event Detection from Speech
di: Kang, Jingqi, et al.
Pubblicazione: (2024) -
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
di: Wang, Qing, et al.
Pubblicazione: (2025) -
Gotta Hear Them All: Towards Sound Source Aware Audio Generation
di: Guo, Wei, et al.
Pubblicazione: (2024) -
MoTAS: MoE-Guided Feature Selection from TTS-Augmented Speech for Enhanced Multimodal Alzheimer's Early Screening
di: Shao, Yongqi, et al.
Pubblicazione: (2025)