RISE: Adaptive music playback for Realtime Intensity Synchronization with Exercise
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Alexander, Donahue, Chris, Jain, Dhruv |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Osu2MIR: Beat Tracking Dataset Derived From Osu! Data
par: Liu, Ziyun, et autres
Publié: (2025)
par: Liu, Ziyun, et autres
Publié: (2025)
Local deployment of large-scale music AI models on commodity hardware
par: Zhou, Xun, et autres
Publié: (2024)
par: Zhou, Xun, et autres
Publié: (2024)
Building Enterprise Realtime Voice Agents from Scratch: A Technical Tutorial
par: Qiu, Jielin, et autres
Publié: (2026)
par: Qiu, Jielin, et autres
Publié: (2026)
Rethinking Music Captioning with Music Metadata LLMs
par: Bukey, Irmak, et autres
Publié: (2026)
par: Bukey, Irmak, et autres
Publié: (2026)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
par: Dixit, Satvik, et autres
Publié: (2024)
par: Dixit, Satvik, et autres
Publié: (2024)
Just Label the Repeats for In-The-Wild Audio-to-Score Alignment
par: Bukey, Irmak, et autres
Publié: (2024)
par: Bukey, Irmak, et autres
Publié: (2024)
Adaptive Accompaniment with ReaLchords
par: Wu, Yusong, et autres
Publié: (2025)
par: Wu, Yusong, et autres
Publié: (2025)
Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio
par: Long, Phillip, et autres
Publié: (2026)
par: Long, Phillip, et autres
Publié: (2026)
Anticipatory Music Transformer
par: Thickstun, John, et autres
Publié: (2023)
par: Thickstun, John, et autres
Publié: (2023)
Ichigo: Mixed-Modal Early-Fusion Realtime Voice Assistant
par: Dao, Alan, et autres
Publié: (2024)
par: Dao, Alan, et autres
Publié: (2024)
Learning Perceptually Relevant Temporal Envelope Morphing
par: Dixit, Satvik, et autres
Publié: (2025)
par: Dixit, Satvik, et autres
Publié: (2025)
Unmixing the Crowd: Learning Mixture-to-Set Speaker Embeddings for Enrollment-Free Target Speech Extraction
par: Sidharth, FNU, et autres
Publié: (2026)
par: Sidharth, FNU, et autres
Publié: (2026)
FoleyBench: A Benchmark For Video-to-Audio Models
par: Dixit, Satvik, et autres
Publié: (2025)
par: Dixit, Satvik, et autres
Publié: (2025)
EvolveCaptions: Empowering DHH Users Through Real-Time Collaborative Captioning
par: Wu, Liang-Yuan, et autres
Publié: (2025)
par: Wu, Liang-Yuan, et autres
Publié: (2025)
Investigation on the Robustness of Acoustic Foundation Models on Post Exercise Speech
par: Xue, Xiangyuan, et autres
Publié: (2026)
par: Xue, Xiangyuan, et autres
Publié: (2026)
Hookpad Aria: A Copilot for Songwriters
par: Donahue, Chris, et autres
Publié: (2025)
par: Donahue, Chris, et autres
Publié: (2025)
Do Music Generation Models Encode Music Theory?
par: Wei, Megan, et autres
Publié: (2024)
par: Wei, Megan, et autres
Publié: (2024)
A Fourier Explanation of AI-music Artifacts
par: Afchar, Darius, et autres
Publié: (2025)
par: Afchar, Darius, et autres
Publié: (2025)
TQCodec: Towards neural audio codec for high-fidelity music streaming
par: He, Lixing, et autres
Publié: (2026)
par: He, Lixing, et autres
Publié: (2026)
LargeSHS: A large-scale dataset of music adaptation
par: Tan, Chih-Pin, et autres
Publié: (2025)
par: Tan, Chih-Pin, et autres
Publié: (2025)
Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis
par: Li, Tianqi, et autres
Publié: (2024)
par: Li, Tianqi, et autres
Publié: (2024)
Music Arena: Live Evaluation for Text-to-Music
par: Kim, Yonghyun, et autres
Publié: (2025)
par: Kim, Yonghyun, et autres
Publié: (2025)
Facial Expression-Enhanced TTS: Combining Face Representation and Emotion Intensity for Adaptive Speech
par: Chu, Yunji, et autres
Publié: (2024)
par: Chu, Yunji, et autres
Publié: (2024)
Sona: Real-Time Multi-Target Sound Attenuation for Noise Sensitivity
par: Huang, Jeremy Zhengqi, et autres
Publié: (2026)
par: Huang, Jeremy Zhengqi, et autres
Publié: (2026)
From Hype to Insight: Rethinking Large Language Model Integration in Visual Speech Recognition
par: Jain, Rishabh, et autres
Publié: (2025)
par: Jain, Rishabh, et autres
Publié: (2025)
SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation
par: Wang, Hongrui, et autres
Publié: (2026)
par: Wang, Hongrui, et autres
Publié: (2026)
SMART: Tuning a symbolic music generation system with an audio domain aesthetic reward
par: Jonason, Nicolas, et autres
Publié: (2025)
par: Jonason, Nicolas, et autres
Publié: (2025)
Multimodal Fish Feeding Intensity Assessment in Aquaculture
par: Cui, Meng, et autres
Publié: (2023)
par: Cui, Meng, et autres
Publié: (2023)
RAPS: A self-contained reef acoustic playback system for underwater soundscape enrichment, larval settlement, and eco-acoustic studiesa).
par: Mooney, T Aran, et autres
Publié: (2025)
par: Mooney, T Aran, et autres
Publié: (2025)
Evolving music theory for emerging musical languages
par: Deruty, Emmanuel
Publié: (2025)
par: Deruty, Emmanuel
Publié: (2025)
Aligning Text-to-Music Evaluation with Human Preferences
par: Huang, Yichen, et autres
Publié: (2025)
par: Huang, Yichen, et autres
Publié: (2025)
Understanding Frechet Speech Distance for Synthetic Speech Quality Evaluation
par: Kim, June-Woo, et autres
Publié: (2026)
par: Kim, June-Woo, et autres
Publié: (2026)
Balancing physical modeling and musical requirements: Algorithmically simulating the calls of Hyalessa maculaticollis for real-time instrumental control
par: de Jong, Staas
Publié: (2025)
par: de Jong, Staas
Publié: (2025)
Contrastive timbre representations for musical instrument and synthesizer retrieval
par: Vaillant, Gwendal Le, et autres
Publié: (2025)
par: Vaillant, Gwendal Le, et autres
Publié: (2025)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
par: Li, Yaoru, et autres
Publié: (2025)
par: Li, Yaoru, et autres
Publié: (2025)
SoundShift: Exploring Sound Manipulations for Accessible Mixed-Reality Awareness
par: Chang, Ruei-Che, et autres
Publié: (2024)
par: Chang, Ruei-Che, et autres
Publié: (2024)
TARO: Timestep-Adaptive Representation Alignment with Onset-Aware Conditioning for Synchronized Video-to-Audio Synthesis
par: Ton, Tri, et autres
Publié: (2025)
par: Ton, Tri, et autres
Publié: (2025)
Speaker-agnostic Emotion Vector for Cross-speaker Emotion Intensity Control
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
RISC: A Corpus for Shout Type Classification and Shout Intensity Prediction
par: Fukumori, Takahiro, et autres
Publié: (2023)
par: Fukumori, Takahiro, et autres
Publié: (2023)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Documents similaires
-
Osu2MIR: Beat Tracking Dataset Derived From Osu! Data
par: Liu, Ziyun, et autres
Publié: (2025) -
Local deployment of large-scale music AI models on commodity hardware
par: Zhou, Xun, et autres
Publié: (2024) -
Building Enterprise Realtime Voice Agents from Scratch: A Technical Tutorial
par: Qiu, Jielin, et autres
Publié: (2026) -
Rethinking Music Captioning with Music Metadata LLMs
par: Bukey, Irmak, et autres
Publié: (2026) -
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
par: Dixit, Satvik, et autres
Publié: (2024)