Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Wenhuan, Song, Xinyue, Ke, Wenjun, Yu, Zhizhi, Yang, Wenhao, Wei, Jianguo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Low-latency Speech Enhancement via Speech Token Generation
par: Xue, Huaying, et autres
Publié: (2023)
par: Xue, Huaying, et autres
Publié: (2023)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
par: He, Mao-Kui, et autres
Publié: (2024)
par: He, Mao-Kui, et autres
Publié: (2024)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
par: Cui, Yang, et autres
Publié: (2025)
par: Cui, Yang, et autres
Publié: (2025)
When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation
par: Min, Anna, et autres
Publié: (2025)
par: Min, Anna, et autres
Publié: (2025)
Listening Between the Lines: Synthetic Speech Detection Disregarding Verbal Content
par: Salvi, Davide, et autres
Publié: (2024)
par: Salvi, Davide, et autres
Publié: (2024)
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
par: Gong, Jingyao
Publié: (2026)
par: Gong, Jingyao
Publié: (2026)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
par: Zhou, Rui, et autres
Publié: (2024)
par: Zhou, Rui, et autres
Publié: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
par: Liu, Qianhui, et autres
Publié: (2024)
par: Liu, Qianhui, et autres
Publié: (2024)
Conformer-based Ultrasound-to-Speech Conversion
par: Ibrahimov, Ibrahim, et autres
Publié: (2025)
par: Ibrahimov, Ibrahim, et autres
Publié: (2025)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
par: Yu, Fan, et autres
Publié: (2024)
par: Yu, Fan, et autres
Publié: (2024)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
par: Wang, Anna, et autres
Publié: (2024)
par: Wang, Anna, et autres
Publié: (2024)
Improving Speech Enhancement by Integrating Inter-Channel and Band Features with Dual-branch Conformer
par: Li, Jizhen, et autres
Publié: (2024)
par: Li, Jizhen, et autres
Publié: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
par: Zhang, Sidong, et autres
Publié: (2025)
par: Zhang, Sidong, et autres
Publié: (2025)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2023)
par: Pan, Yu, et autres
Publié: (2023)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)
par: Su, Fei, et autres
Publié: (2026)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
par: Guo, Zixin, et autres
Publié: (2024)
par: Guo, Zixin, et autres
Publié: (2024)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
par: Niu, Xinlei, et autres
Publié: (2025)
par: Niu, Xinlei, et autres
Publié: (2025)
Double Mixture: Towards Continual Event Detection from Speech
par: Kang, Jingqi, et autres
Publié: (2024)
par: Kang, Jingqi, et autres
Publié: (2024)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
par: Biyani, Ishan D., et autres
Publié: (2025)
par: Biyani, Ishan D., et autres
Publié: (2025)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
par: Tian, Wenjie, et autres
Publié: (2025)
par: Tian, Wenjie, et autres
Publié: (2025)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
par: Pan, Tianrui, et autres
Publié: (2024)
par: Pan, Tianrui, et autres
Publié: (2024)
A Survey on Speech Deepfake Detection
par: Li, Menglu, et autres
Publié: (2024)
par: Li, Menglu, et autres
Publié: (2024)
Beat and Downbeat Tracking in Performance MIDI Using an End-to-End Transformer Architecture
par: Murgul, Sebastian, et autres
Publié: (2025)
par: Murgul, Sebastian, et autres
Publié: (2025)
FoVNet: Configurable Field-of-View Speech Enhancement with Low Computation and Distortion for Smart Glasses
par: Xu, Zhongweiyang, et autres
Publié: (2024)
par: Xu, Zhongweiyang, et autres
Publié: (2024)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
par: Lin, Meng-Ping, et autres
Publié: (2025)
par: Lin, Meng-Ping, et autres
Publié: (2025)
Zero-Shot End-to-End Spoken Language Understanding via Cross-Modal Selective Self-Training
par: He, Jianfeng, et autres
Publié: (2023)
par: He, Jianfeng, et autres
Publié: (2023)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
Every Breath You Don't Take: Deepfake Speech Detection Using Breath
par: Layton, Seth, et autres
Publié: (2024)
par: Layton, Seth, et autres
Publié: (2024)
LSTMSE-Net: Long Short Term Speech Enhancement Network for Audio-visual Speech Enhancement
par: Jain, Arnav, et autres
Publié: (2024)
par: Jain, Arnav, et autres
Publié: (2024)
Integrated Multi-Level Knowledge Distillation for Enhanced Speaker Verification
par: Yang, Wenhao, et autres
Publié: (2024)
par: Yang, Wenhao, et autres
Publié: (2024)
Channel Adaptation for Speaker Verification Using Optimal Transport with Pseudo Label
par: Yang, Wenhao, et autres
Publié: (2024)
par: Yang, Wenhao, et autres
Publié: (2024)
IML-Spikeformer: Input-aware Multi-Level Spiking Transformer for Speech Processing
par: Song, Zeyang, et autres
Publié: (2025)
par: Song, Zeyang, et autres
Publié: (2025)
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
On the Design of Diffusion-based Neural Speech Codecs
par: Foti, Pietro, et autres
Publié: (2025)
par: Foti, Pietro, et autres
Publié: (2025)
Multimodal Speech Enhancement Using Burst Propagation
par: Raza, Mohsin, et autres
Publié: (2022)
par: Raza, Mohsin, et autres
Publié: (2022)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
par: Yang, Kaixing, et autres
Publié: (2024)
par: Yang, Kaixing, et autres
Publié: (2024)
StereoFoley: Object-Aware Stereo Audio Generation from Video
par: Karchkhadze, Tornike, et autres
Publié: (2025)
par: Karchkhadze, Tornike, et autres
Publié: (2025)
Documents similaires
-
Low-latency Speech Enhancement via Speech Token Generation
par: Xue, Huaying, et autres
Publié: (2023) -
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
par: He, Mao-Kui, et autres
Publié: (2024) -
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
par: Cui, Yang, et autres
Publié: (2025) -
When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation
par: Min, Anna, et autres
Publié: (2025) -
Listening Between the Lines: Synthetic Speech Detection Disregarding Verbal Content
par: Salvi, Davide, et autres
Publié: (2024)