Computational modeling of early language learning from acoustic speech and audiovisual input without linguistic priors
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Räsänen, Okko |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can phones, syllables, and words emerge as side-products of cross-situational audiovisual learning? -- A computational investigation
par: Khorrami, Khazar, et autres
Publié: (2021)
par: Khorrami, Khazar, et autres
Publié: (2021)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
par: Adelson, Trevor, et autres
Publié: (2026)
par: Adelson, Trevor, et autres
Publié: (2026)
A Baseline Multimodal Approach to Emotion Recognition in Conversations
par: Yeste, Víctor, et autres
Publié: (2026)
par: Yeste, Víctor, et autres
Publié: (2026)
Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech
par: Mehta, Shivam, et autres
Publié: (2024)
par: Mehta, Shivam, et autres
Publié: (2024)
A Robust Classification Method using Hybrid Word Embedding for Early Diagnosis of Alzheimer's Disease
par: Li, Yangyang
Publié: (2025)
par: Li, Yangyang
Publié: (2025)
Quantifying the effect of speech pathology on automatic and human speaker verification
par: Halpern, Bence Mark, et autres
Publié: (2024)
par: Halpern, Bence Mark, et autres
Publié: (2024)
SigWavNet: Learning Multiresolution Signal Wavelet Network for Speech Emotion Recognition
par: Nfissi, Alaa, et autres
Publié: (2025)
par: Nfissi, Alaa, et autres
Publié: (2025)
Exploring rhythm formant analysis for Indic language classification
par: Gogoi, Parismita, et autres
Publié: (2024)
par: Gogoi, Parismita, et autres
Publié: (2024)
Splitformer: An improved early-exit architecture for automatic speech recognition on edge devices
par: Lasbordes, Maxence, et autres
Publié: (2025)
par: Lasbordes, Maxence, et autres
Publié: (2025)
FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations
par: Lee, Yoonhyung, et autres
Publié: (2026)
par: Lee, Yoonhyung, et autres
Publié: (2026)
Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS
par: Dai, Ziqi, et autres
Publié: (2025)
par: Dai, Ziqi, et autres
Publié: (2025)
An open-source voice type classifier for child-centered daylong recordings
par: Lavechin, Marvin, et autres
Publié: (2020)
par: Lavechin, Marvin, et autres
Publié: (2020)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
Unveiling Hidden Factors: Explainable AI for Feature Boosting in Speech Emotion Recognition
par: Nfissi, Alaa, et autres
Publié: (2024)
par: Nfissi, Alaa, et autres
Publié: (2024)
Iterative Feature Boosting for Explainable Speech Emotion Recognition
par: Nfissi, Alaa, et autres
Publié: (2024)
par: Nfissi, Alaa, et autres
Publié: (2024)
Fine-tuning Pre-trained Audio Models for COVID-19 Detection: A Technical Report
par: de Brito, Daniel Oliveira, et autres
Publié: (2025)
par: de Brito, Daniel Oliveira, et autres
Publié: (2025)
Prevailing Research Areas for Music AI in the Era of Foundation Models
par: Wei, Megan, et autres
Publié: (2024)
par: Wei, Megan, et autres
Publié: (2024)
Astro-HEP-BERT: A bidirectional language model for studying the meanings of concepts in astrophysics and high energy physics
par: Simons, Arno
Publié: (2024)
par: Simons, Arno
Publié: (2024)
The formation of perceptual space in early phonetic acquisition: a cross-linguistic modeling approach
par: Tan, Frank Lihui, et autres
Publié: (2024)
par: Tan, Frank Lihui, et autres
Publié: (2024)
KinSPEAK: Improving speech recognition for Kinyarwanda via semi-supervised learning methods
par: Nzeyimana, Antoine
Publié: (2023)
par: Nzeyimana, Antoine
Publié: (2023)
Reframing linguistic bootstrapping as joint inference using visually-grounded grammar induction models
par: Portelance, Eva, et autres
Publié: (2024)
par: Portelance, Eva, et autres
Publié: (2024)
Passive Underwater Acoustic Signal Separation based on Feature Decoupling Dual-path Network
par: Liu, Yucheng, et autres
Publié: (2025)
par: Liu, Yucheng, et autres
Publié: (2025)
An accurate and revised version of optical character recognition-based speech synthesis using LabVIEW
par: Mehta, Prateek, et autres
Publié: (2025)
par: Mehta, Prateek, et autres
Publié: (2025)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
par: Alamr, Meshal, et autres
Publié: (2026)
par: Alamr, Meshal, et autres
Publié: (2026)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
par: Kozak, Nazar
Publié: (2026)
par: Kozak, Nazar
Publié: (2026)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
par: Cheng, Zhuangfei, et autres
Publié: (2025)
par: Cheng, Zhuangfei, et autres
Publié: (2025)
Repetition Without Exclusivity: Scale Sensitivity of Referential Mechanisms in Child-Scale Language Models
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Categorical Perception in Large Language Model Hidden States: Structural Warping at Digit-Count Boundaries
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Joint Feature and Output Distillation for Low-complexity Acoustic Scene Classification
par: Li, Haowen, et autres
Publié: (2025)
par: Li, Haowen, et autres
Publié: (2025)
Stroke Lesions as a Rosetta Stone for Language Model Interpretability
par: Fridriksson, Julius, et autres
Publié: (2026)
par: Fridriksson, Julius, et autres
Publié: (2026)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
par: Kim, Minu, et autres
Publié: (2025)
par: Kim, Minu, et autres
Publié: (2025)
Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests
par: Yost, Alexandra, et autres
Publié: (2025)
par: Yost, Alexandra, et autres
Publié: (2025)
Deepfake audio as a data augmentation technique for training automatic speech to text transcription models
par: Ferreira, Alexandre R., et autres
Publié: (2023)
par: Ferreira, Alexandre R., et autres
Publié: (2023)
Impact of Phonetics on Speaker Identity in Adversarial Voice Attack
par: Dar, Daniyal Kabir, et autres
Publié: (2025)
par: Dar, Daniyal Kabir, et autres
Publié: (2025)
Matcha-TTS: A fast TTS architecture with conditional flow matching
par: Mehta, Shivam, et autres
Publié: (2023)
par: Mehta, Shivam, et autres
Publié: (2023)
From Syntax to Semantics: Unveiling the Emergence of Chirality in SMILES Translation Models
par: Li, Zehao, et autres
Publié: (2026)
par: Li, Zehao, et autres
Publié: (2026)
SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and Understanding
par: Bai, Bingsong, et autres
Publié: (2025)
par: Bai, Bingsong, et autres
Publié: (2025)
Towards Multi-Level Transcript Segmentation: LoRA Fine-Tuning for Table-of-Contents Generation
par: Freisinger, Steffen, et autres
Publié: (2026)
par: Freisinger, Steffen, et autres
Publié: (2026)
U2++ MoE: Scaling 4.7x parameters with minimal impact on RTF
par: Song, Xingchen, et autres
Publié: (2024)
par: Song, Xingchen, et autres
Publié: (2024)
Documents similaires
-
Can phones, syllables, and words emerge as side-products of cross-situational audiovisual learning? -- A computational investigation
par: Khorrami, Khazar, et autres
Publié: (2021) -
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
par: Adelson, Trevor, et autres
Publié: (2026) -
A Baseline Multimodal Approach to Emotion Recognition in Conversations
par: Yeste, Víctor, et autres
Publié: (2026) -
Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech
par: Mehta, Shivam, et autres
Publié: (2024) -
A Robust Classification Method using Hybrid Word Embedding for Early Diagnosis of Alzheimer's Disease
par: Li, Yangyang
Publié: (2025)