Timed text extraction from Taiwanese Kua-á-hì TV series
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Tzu-Hung, Tsai, Yun-En, Hung, Yun-Ning, Wu, Chih-Wei, Wei, I-Chieh, Su, Li |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Study on Synthesizing Expressive Violin Performances: Approaches and Comparisons
di: Hung, Tzu-Yun, et al.
Pubblicazione: (2024)
di: Hung, Tzu-Yun, et al.
Pubblicazione: (2024)
Research on Piano Timbre Transformation System Based on Diffusion Model
di: Hsu, Chun-Chieh, et al.
Pubblicazione: (2026)
di: Hsu, Chun-Chieh, et al.
Pubblicazione: (2026)
Towards Practical Real-Time Low-Latency Music Source Separation
di: Wu, Junyu, et al.
Pubblicazione: (2025)
di: Wu, Junyu, et al.
Pubblicazione: (2025)
A Distribution Matching Approach to Neural Piano Transcription with Optimal Transport
di: Wei, Weixing, et al.
Pubblicazione: (2026)
di: Wei, Weixing, et al.
Pubblicazione: (2026)
Efficient Transformer-Based Piano Transcription With Sparse Attention Mechanisms
di: Wei, Weixing, et al.
Pubblicazione: (2025)
di: Wei, Weixing, et al.
Pubblicazione: (2025)
MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion
di: Wang, Junbo, et al.
Pubblicazione: (2025)
di: Wang, Junbo, et al.
Pubblicazione: (2025)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
di: Wang, Jieyi, et al.
Pubblicazione: (2026)
di: Wang, Jieyi, et al.
Pubblicazione: (2026)
Enkidu: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes
di: Feng, Zhou, et al.
Pubblicazione: (2025)
di: Feng, Zhou, et al.
Pubblicazione: (2025)
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
di: Chou, Huang-Cheng, et al.
Pubblicazione: (2024)
di: Chou, Huang-Cheng, et al.
Pubblicazione: (2024)
CEM-Net: Cross-Emotion Memory Network for Emotional Talking Face Generation
di: Wu, Kangyi, et al.
Pubblicazione: (2025)
di: Wu, Kangyi, et al.
Pubblicazione: (2025)
XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
TEAdapter: Supply abundant guidance for controllable text-to-music generation
di: Zou, Jialing, et al.
Pubblicazione: (2024)
di: Zou, Jialing, et al.
Pubblicazione: (2024)
TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation
di: Lee, Yubeen, et al.
Pubblicazione: (2025)
di: Lee, Yubeen, et al.
Pubblicazione: (2025)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
di: Li, Junjie, et al.
Pubblicazione: (2025)
di: Li, Junjie, et al.
Pubblicazione: (2025)
MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding
di: Yang, Meng, et al.
Pubblicazione: (2026)
di: Yang, Meng, et al.
Pubblicazione: (2026)
Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation
di: Jeyaraj, Rathinaraja, et al.
Pubblicazione: (2025)
di: Jeyaraj, Rathinaraja, et al.
Pubblicazione: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
di: Su, Fei, et al.
Pubblicazione: (2026)
di: Su, Fei, et al.
Pubblicazione: (2026)
Exploring compressibility of transformer based text-to-music (TTM) models
di: Moschopoulos, Vasileios, et al.
Pubblicazione: (2024)
di: Moschopoulos, Vasileios, et al.
Pubblicazione: (2024)
MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection
di: Pan, Zihan, et al.
Pubblicazione: (2025)
di: Pan, Zihan, et al.
Pubblicazione: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
di: Hu, Han, et al.
Pubblicazione: (2025)
di: Hu, Han, et al.
Pubblicazione: (2025)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
di: Zhou, Dingkun, et al.
Pubblicazione: (2025)
di: Zhou, Dingkun, et al.
Pubblicazione: (2025)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
di: Li, Fu, et al.
Pubblicazione: (2025)
di: Li, Fu, et al.
Pubblicazione: (2025)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
di: Surana, Rohan, et al.
Pubblicazione: (2025)
di: Surana, Rohan, et al.
Pubblicazione: (2025)
STCTS: Generative Semantic Compression for Ultra-Low Bitrate Speech via Explicit Text-Prosody-Timbre Decomposition
di: Wang, Siyu, et al.
Pubblicazione: (2025)
di: Wang, Siyu, et al.
Pubblicazione: (2025)
SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations
di: Wang, Chunshi, et al.
Pubblicazione: (2025)
di: Wang, Chunshi, et al.
Pubblicazione: (2025)
Private Speech Classification without Collapse: Stabilized DP Training and Offline Distillation
di: Wen, Yadi, et al.
Pubblicazione: (2026)
di: Wen, Yadi, et al.
Pubblicazione: (2026)
CLAIP-Emo: Parameter-Efficient Adaptation of Language-supervised models for In-the-Wild Audiovisual Emotion Recognition
di: Chen, Yin, et al.
Pubblicazione: (2025)
di: Chen, Yin, et al.
Pubblicazione: (2025)
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
di: Li, Qingcao, et al.
Pubblicazione: (2026)
di: Li, Qingcao, et al.
Pubblicazione: (2026)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
di: Sun, Luoyi, et al.
Pubblicazione: (2026)
di: Sun, Luoyi, et al.
Pubblicazione: (2026)
InconVAD: A Two-Stage Dual-Tower Framework for Multimodal Emotion Inconsistency Detection
di: Li, Zongyi, et al.
Pubblicazione: (2025)
di: Li, Zongyi, et al.
Pubblicazione: (2025)
ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation
di: Peng, Yuezhang, et al.
Pubblicazione: (2025)
di: Peng, Yuezhang, et al.
Pubblicazione: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
di: Li, Yaoru, et al.
Pubblicazione: (2025)
di: Li, Yaoru, et al.
Pubblicazione: (2025)
AMB-DSGDN: Adaptive Modality-Balanced Dynamic Semantic Graph Differential Network for Multimodal Emotion Recognition
di: Wang, Yunsheng, et al.
Pubblicazione: (2026)
di: Wang, Yunsheng, et al.
Pubblicazione: (2026)
musif: a Python package for symbolic music feature extraction
di: Llorens, Ana, et al.
Pubblicazione: (2023)
di: Llorens, Ana, et al.
Pubblicazione: (2023)
Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic Music
di: Su, Hongju, et al.
Pubblicazione: (2025)
di: Su, Hongju, et al.
Pubblicazione: (2025)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
di: Qiu, Ke, et al.
Pubblicazione: (2026)
di: Qiu, Ke, et al.
Pubblicazione: (2026)
HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
di: Zhu, Jian, et al.
Pubblicazione: (2026)
di: Zhu, Jian, et al.
Pubblicazione: (2026)
Sound effects in media:A comparative analysis of recorded and synthetic samples in live-action and animation
di: Garcia, Nelly, et al.
Pubblicazione: (2026)
di: Garcia, Nelly, et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Study on Synthesizing Expressive Violin Performances: Approaches and Comparisons
di: Hung, Tzu-Yun, et al.
Pubblicazione: (2024) -
Research on Piano Timbre Transformation System Based on Diffusion Model
di: Hsu, Chun-Chieh, et al.
Pubblicazione: (2026) -
Towards Practical Real-Time Low-Latency Music Source Separation
di: Wu, Junyu, et al.
Pubblicazione: (2025) -
A Distribution Matching Approach to Neural Piano Transcription with Optimal Transport
di: Wei, Weixing, et al.
Pubblicazione: (2026) -
Efficient Transformer-Based Piano Transcription With Sparse Attention Mechanisms
di: Wei, Weixing, et al.
Pubblicazione: (2025)