Towards Multi-Level Transcript Segmentation: LoRA Fine-Tuning for Table-of-Contents Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Freisinger, Steffen, Seeberger, Philipp, Ranzenberger, Thomas, Bocklet, Tobias, Riedhammer, Korbinian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features
par: Freisinger, Steffen, et autres
Publié: (2026)
par: Freisinger, Steffen, et autres
Publié: (2026)
Beyond Levenshtein: Leveraging Multiple Algorithms for Robust Word Error Rate Computations And Granular Error Classifications
par: Kuhn, Korbinian, et autres
Publié: (2024)
par: Kuhn, Korbinian, et autres
Publié: (2024)
Fine-Tuning Large Audio-Language Models with LoRA for Precise Temporal Localization of Prolonged Exposure Therapy Elements
par: BN, Suhas, et autres
Publié: (2025)
par: BN, Suhas, et autres
Publié: (2025)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
par: Wagner, Dominik, et autres
Publié: (2025)
par: Wagner, Dominik, et autres
Publié: (2025)
Measuring the Accuracy of Automatic Speech Recognition Solutions
par: Kuhn, Korbinian, et autres
Publié: (2024)
par: Kuhn, Korbinian, et autres
Publié: (2024)
Communication Access Real-Time Translation Through Collaborative Correction of Automatic Speech Recognition
par: Kuhn, Korbinian, et autres
Publié: (2025)
par: Kuhn, Korbinian, et autres
Publié: (2025)
FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations
par: Lee, Yoonhyung, et autres
Publié: (2026)
par: Lee, Yoonhyung, et autres
Publié: (2026)
Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS
par: Dai, Ziqi, et autres
Publié: (2025)
par: Dai, Ziqi, et autres
Publié: (2025)
An open-source voice type classifier for child-centered daylong recordings
par: Lavechin, Marvin, et autres
Publié: (2020)
par: Lavechin, Marvin, et autres
Publié: (2020)
Adapter-Based Multi-Agent AVSR Extension for Pre-Trained ASR Models
par: Simic, Christopher, et autres
Publié: (2025)
par: Simic, Christopher, et autres
Publié: (2025)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
par: Alamr, Meshal, et autres
Publié: (2026)
par: Alamr, Meshal, et autres
Publié: (2026)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
par: Cheng, Zhuangfei, et autres
Publié: (2025)
par: Cheng, Zhuangfei, et autres
Publié: (2025)
Quantifying the effect of speech pathology on automatic and human speaker verification
par: Halpern, Bence Mark, et autres
Publié: (2024)
par: Halpern, Bence Mark, et autres
Publié: (2024)
Evaluating ASR Confidence Scores for Automated Error Detection in User-Assisted Correction Interfaces
par: Kuhn, Korbinian, et autres
Publié: (2025)
par: Kuhn, Korbinian, et autres
Publié: (2025)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
par: Wang, Hsuan-Yu, et autres
Publié: (2025)
par: Wang, Hsuan-Yu, et autres
Publié: (2025)
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and Understanding
par: Bai, Bingsong, et autres
Publié: (2025)
par: Bai, Bingsong, et autres
Publié: (2025)
U2++ MoE: Scaling 4.7x parameters with minimal impact on RTF
par: Song, Xingchen, et autres
Publié: (2024)
par: Song, Xingchen, et autres
Publié: (2024)
Exploring rhythm formant analysis for Indic language classification
par: Gogoi, Parismita, et autres
Publié: (2024)
par: Gogoi, Parismita, et autres
Publié: (2024)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
par: Adelson, Trevor, et autres
Publié: (2026)
par: Adelson, Trevor, et autres
Publié: (2026)
Generalizing to Unseen Disaster Events: A Causal View
par: Seeberger, Philipp, et autres
Publié: (2025)
par: Seeberger, Philipp, et autres
Publié: (2025)
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
par: Sharma, Manali, et autres
Publié: (2026)
par: Sharma, Manali, et autres
Publié: (2026)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector
par: Costa-jussà, Marta R., et autres
Publié: (2024)
par: Costa-jussà, Marta R., et autres
Publié: (2024)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
par: Ahn, Taekyung, et autres
Publié: (2024)
par: Ahn, Taekyung, et autres
Publié: (2024)
Everyday Speech in the Indian Subcontinent
par: P, Utkarsh
Publié: (2024)
par: P, Utkarsh
Publié: (2024)
Avengers Assemble: Amalgamation of Non-Semantic Features for Depression Detection
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
par: Jain, Sarthak, et autres
Publié: (2024)
par: Jain, Sarthak, et autres
Publié: (2024)
Bigger is not Always Better: The Effect of Context Size on Speech Pre-Training
par: Robertson, Sean, et autres
Publié: (2023)
par: Robertson, Sean, et autres
Publié: (2023)
Representation Loss Minimization with Randomized Selection Strategy for Efficient Environmental Fake Audio Detection
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
The PARLO Dementia Corpus: A German Multi-Center Resource for Alzheimer's Disease
par: Braun, Franziska, et autres
Publié: (2026)
par: Braun, Franziska, et autres
Publié: (2026)
SoccerNet-Echoes: A Soccer Game Audio Commentary Dataset
par: Gautam, Sushant, et autres
Publié: (2024)
par: Gautam, Sushant, et autres
Publié: (2024)
A Voice-based Triage for Type 2 Diabetes using a Conversational Virtual Assistant in the Home Environment
par: Summoogum, Kelvin, et autres
Publié: (2024)
par: Summoogum, Kelvin, et autres
Publié: (2024)
Generation of Musical Timbres using a Text-Guided Diffusion Model
par: Yuan, Weixuan, et autres
Publié: (2025)
par: Yuan, Weixuan, et autres
Publié: (2025)
Self-Improvement for Audio Large Language Model using Unlabeled Speech
par: Wang, Shaowen, et autres
Publié: (2025)
par: Wang, Shaowen, et autres
Publié: (2025)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
par: Li, Pengcheng, et autres
Publié: (2024)
par: Li, Pengcheng, et autres
Publié: (2024)
CUPE: Contextless Universal Phoneme Encoder for Language-Agnostic Speech Processing
par: Rehman, Abdul, et autres
Publié: (2025)
par: Rehman, Abdul, et autres
Publié: (2025)
Documents similaires
-
Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features
par: Freisinger, Steffen, et autres
Publié: (2026) -
Beyond Levenshtein: Leveraging Multiple Algorithms for Robust Word Error Rate Computations And Granular Error Classifications
par: Kuhn, Korbinian, et autres
Publié: (2024) -
Fine-Tuning Large Audio-Language Models with LoRA for Precise Temporal Localization of Prolonged Exposure Therapy Elements
par: BN, Suhas, et autres
Publié: (2025) -
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
par: Wagner, Dominik, et autres
Publié: (2025) -
Measuring the Accuracy of Automatic Speech Recognition Solutions
par: Kuhn, Korbinian, et autres
Publié: (2024)