ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Feng, Tiantian, Xu, Anfeng, Shi, Xuan, Kommineni, Aditya, Siam, Shakhrul Iman, Micheletti, Megan, Shi, Zhonghao, Tager-Flusberg, Helen, Zhang, Mi, Perry, Lynn K., Lord, Catherine, Messinger, Daniel, Narayanan, Shrikanth |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Data Efficient Child-Adult Speaker Diarization with Simulated Conversations
par: Xu, Anfeng, et autres
Publié: (2024)
par: Xu, Anfeng, et autres
Publié: (2024)
Audio-visual child-adult speaker classification in dyadic interactions
par: Xu, Anfeng, et autres
Publié: (2023)
par: Xu, Anfeng, et autres
Publié: (2023)
Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions
par: Xu, Anfeng, et autres
Publié: (2024)
par: Xu, Anfeng, et autres
Publié: (2024)
Towards Child-Inclusive Clinical Video Understanding for Autism Spectrum Disorder
par: Kommineni, Aditya, et autres
Publié: (2024)
par: Kommineni, Aditya, et autres
Publié: (2024)
Can Generic LLMs Help Analyze Child-adult Interactions Involving Children with Autism in Clinical Observation?
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
VoxCare: Studying Natural Communication Behaviors of Hospital Caregivers through Wearable Sensing of Egocentric Audio
par: Feng, Tiantian, et autres
Publié: (2026)
par: Feng, Tiantian, et autres
Publié: (2026)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
par: Xu, Anfeng, et autres
Publié: (2026)
par: Xu, Anfeng, et autres
Publié: (2026)
VoxCog: Towards End-to-End Multilingual Cognitive Impairment Classification through Dialectal Knowledge
par: Feng, Tiantian, et autres
Publié: (2026)
par: Feng, Tiantian, et autres
Publié: (2026)
Examining Test-Time Adaptation for Personalized Child Speech Recognition
par: Shi, Zhonghao, et autres
Publié: (2024)
par: Shi, Zhonghao, et autres
Publié: (2024)
Towards Interpretable Framework for Neural Audio Codecs via Sparse Autoencoders: A Case Study on Accent Information
par: Wang, Shih-Heng, et autres
Publié: (2026)
par: Wang, Shih-Heng, et autres
Publié: (2026)
Egocentric Speaker Classification in Child-Adult Dyadic Interactions: From Sensing to Computational Modeling
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
Large Language Models based ASR Error Correction for Child Conversations
par: Xu, Anfeng, et autres
Publié: (2025)
par: Xu, Anfeng, et autres
Publié: (2025)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
Evaluation of Speech Foundation Models for ASR on Child-Adult Conversations in Autism Diagnostic Sessions
par: Ashvin, Aditya, et autres
Publié: (2024)
par: Ashvin, Aditya, et autres
Publié: (2024)
Exploring Speech Foundation Models for Speaker Diarization Across Lifespan
par: Xu, Anfeng, et autres
Publié: (2026)
par: Xu, Anfeng, et autres
Publié: (2026)
Joint ASR and Speaker Role Tagging with Serialized Output Training
par: Xu, Anfeng, et autres
Publié: (2025)
par: Xu, Anfeng, et autres
Publié: (2025)
Debate: Standing up for science – how to combat misinformation in child mental health: protecting the integrity of autism research and practice in the United States
par: Helen Tager‐Flusberg
Publié: (2025)
par: Helen Tager‐Flusberg
Publié: (2025)
Enhancing Listened Speech Decoding from EEG via Parallel Phoneme Sequence Prediction
par: Lee, Jihwan, et autres
Publié: (2025)
par: Lee, Jihwan, et autres
Publié: (2025)
Who Said What WSW 2.0? Enhanced Automated Analysis of Preschool Classroom Speech
par: Sun, Anchen, et autres
Publié: (2025)
par: Sun, Anchen, et autres
Publié: (2025)
Toward Fully-End-to-End Listened Speech Decoding from EEG Signals
par: Lee, Jihwan, et autres
Publié: (2024)
par: Lee, Jihwan, et autres
Publié: (2024)
Knowledge-guided EEG Representation Learning
par: Kommineni, Aditya, et autres
Publié: (2024)
par: Kommineni, Aditya, et autres
Publié: (2024)
ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
VoxGuard: Evaluating User and Attribute Privacy in Speech via Membership Inference Attacks
par: Tsaprazlis, Efthymios, et autres
Publié: (2025)
par: Tsaprazlis, Efthymios, et autres
Publié: (2025)
PEFT-SER: On the Use of Parameter Efficient Transfer Learning Approaches For Speech Emotion Recognition Using Pre-trained Speech Models
par: Feng, Tiantian, et autres
Publié: (2023)
par: Feng, Tiantian, et autres
Publié: (2023)
Understanding Stress, Burnout, and Behavioral Patterns in Medical Residents Using Large-scale Longitudinal Wearable Recordings
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
On-device Large Multi-modal Agent for Human Activity Recognition
par: Siam, Md Shakhrul Iman, et autres
Publié: (2025)
par: Siam, Md Shakhrul Iman, et autres
Publié: (2025)
Trade-offs Between Capacity and Robustness in Neural Audio Codecs for Adversarially Robust Speech Recognition
par: Prescott, Jordan, et autres
Publié: (2026)
par: Prescott, Jordan, et autres
Publié: (2026)
TI-ASU: Toward Robust Automatic Speech Understanding through Text-to-speech Imputation Against Missing Speech Modality
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
Morph: ChirpTransformer-based Encoder-decoder Co-design for Reliable LoRa Communication
par: Ren, Yidong, et autres
Publié: (2025)
par: Ren, Yidong, et autres
Publié: (2025)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
par: Zhang, Hezhao, et autres
Publié: (2026)
par: Zhang, Hezhao, et autres
Publié: (2026)
What role does the environment play in language development? Exploring the associations among socioeconomic status, parent language input, and language skills in school‐aged children with autism
par: Meredith Pecukonis, et autres
Publié: (2024)
par: Meredith Pecukonis, et autres
Publié: (2024)
Real‐time coded measures in natural language samples capture change over time in minimally verbal autistic children
par: Chelsea La Valle, et autres
Publié: (2024)
par: Chelsea La Valle, et autres
Publié: (2024)
How to Retrieve Examples in In-context Learning to Improve Conversational Emotion Recognition using Large Language Models?
par: Wang, Mengqi, et autres
Publié: (2025)
par: Wang, Mengqi, et autres
Publié: (2025)
SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory
par: Alam, Samiul, et autres
Publié: (2026)
par: Alam, Samiul, et autres
Publié: (2026)
Voxlect: A Speech Foundation Model Benchmark for Modeling Dialects and Regional Languages Around the Globe
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
Phone Duration Modeling for Speaker Age Estimation in Children
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2021)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2021)
The NeurIPS 2023 Machine Learning for Audio Workshop: Affective Audio Benchmarks and Novel Data
par: Baird, Alice, et autres
Publié: (2024)
par: Baird, Alice, et autres
Publié: (2024)
Speech2rtMRI: Speech-Guided Diffusion Model for Real-time MRI Video of the Vocal Tract during Speech
par: Nguyen, Hong, et autres
Publié: (2024)
par: Nguyen, Hong, et autres
Publié: (2024)
Developing a High-performance Framework for Speech Emotion Recognition in Naturalistic Conditions Challenge for Emotional Attribute Prediction
par: Lertpetchpun, Thanathai, et autres
Publié: (2025)
par: Lertpetchpun, Thanathai, et autres
Publié: (2025)
Documents similaires
-
Data Efficient Child-Adult Speaker Diarization with Simulated Conversations
par: Xu, Anfeng, et autres
Publié: (2024) -
Audio-visual child-adult speaker classification in dyadic interactions
par: Xu, Anfeng, et autres
Publié: (2023) -
Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions
par: Xu, Anfeng, et autres
Publié: (2024) -
Towards Child-Inclusive Clinical Video Understanding for Autism Spectrum Disorder
par: Kommineni, Aditya, et autres
Publié: (2024) -
Can Generic LLMs Help Analyze Child-adult Interactions Involving Children with Autism in Clinical Observation?
par: Feng, Tiantian, et autres
Publié: (2024)