Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Peilin, Choi, Jinho D. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Do We Still Need Humans in the Loop? Comparing Human and LLM Annotation in Active Learning for Hostility Detection
por: Hakimi, Ahmad Dawar, et al.
Publicado: (2026)
por: Hakimi, Ahmad Dawar, et al.
Publicado: (2026)
Large Language Models Still Exhibit Bias in Long Text
por: Jeung, Wonje, et al.
Publicado: (2024)
por: Jeung, Wonje, et al.
Publicado: (2024)
Speakers Unembedded: Embedding-free Approach to Long-form Neural Diarization
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Model
por: Byun, Grace, et al.
Publicado: (2025)
por: Byun, Grace, et al.
Publicado: (2025)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
por: Shakeel, Muhammad, et al.
Publicado: (2025)
por: Shakeel, Muhammad, et al.
Publicado: (2025)
Domain-Aware Speaker Diarization On African-Accented English
por: Okocha, Chibuzor, et al.
Publicado: (2025)
por: Okocha, Chibuzor, et al.
Publicado: (2025)
A Review of Common Online Speaker Diarization Methods
por: Aperdannier, Roman, et al.
Publicado: (2024)
por: Aperdannier, Roman, et al.
Publicado: (2024)
DiariST: Streaming Speech Translation with Speaker Diarization
por: Yang, Mu, et al.
Publicado: (2023)
por: Yang, Mu, et al.
Publicado: (2023)
System Description for the Displace Speaker Diarization Challenge 2023
por: Aliyev, Ali
Publicado: (2024)
por: Aliyev, Ali
Publicado: (2024)
ETM: Modern Insights into Perspective on Text-to-SQL Evaluation in the Age of Large Language Models
por: Ascoli, Benjamin G., et al.
Publicado: (2024)
por: Ascoli, Benjamin G., et al.
Publicado: (2024)
Do Retrieval-Augmented Language Models Adapt to Varying User Needs?
por: Wu, Peilin, et al.
Publicado: (2025)
por: Wu, Peilin, et al.
Publicado: (2025)
Identifying Speakers in Dialogue Transcripts: A Text-based Approach Using Pretrained Language Models
por: Nguyen, Minh, et al.
Publicado: (2024)
por: Nguyen, Minh, et al.
Publicado: (2024)
Systematic Evaluation of Online Speaker Diarization Systems Regarding their Latency
por: Aperdannier, Roman, et al.
Publicado: (2024)
por: Aperdannier, Roman, et al.
Publicado: (2024)
Leveraging Explicit Reasoning for Inference Integration in Commonsense-Augmented Dialogue Models
por: Finch, Sarah E., et al.
Publicado: (2024)
por: Finch, Sarah E., et al.
Publicado: (2024)
Do We Need Language-Specific Fact-Checking Models? The Case of Chinese
por: Zhang, Caiqi, et al.
Publicado: (2024)
por: Zhang, Caiqi, et al.
Publicado: (2024)
Should We Still Pretrain Encoders with Masked Language Modeling?
por: Gisserot-Boukhlef, Hippolyte, et al.
Publicado: (2025)
por: Gisserot-Boukhlef, Hippolyte, et al.
Publicado: (2025)
Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions
por: Xu, Anfeng, et al.
Publicado: (2024)
por: Xu, Anfeng, et al.
Publicado: (2024)
LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation
por: Byun, Grace, et al.
Publicado: (2025)
por: Byun, Grace, et al.
Publicado: (2025)
Do We Need Domain-Specific Embedding Models? An Empirical Investigation
por: Tang, Yixuan, et al.
Publicado: (2024)
por: Tang, Yixuan, et al.
Publicado: (2024)
Do We Really Need Specialization? Evaluating Generalist Text Embeddings for Zero-Shot Recommendation and Search
por: Attimonelli, Matteo, et al.
Publicado: (2025)
por: Attimonelli, Matteo, et al.
Publicado: (2025)
A Semi-Automatic Approach to Create Large Gender- and Age-Balanced Speaker Corpora: Usefulness of Speaker Diarization & Identification
por: Uro, Rémi, et al.
Publicado: (2024)
por: Uro, Rémi, et al.
Publicado: (2024)
Do We Need Frontier Models to Verify Mathematical Proofs?
por: Naik, Aaditya, et al.
Publicado: (2026)
por: Naik, Aaditya, et al.
Publicado: (2026)
ShobdoSetu: A Data-Centric Framework for Bengali Long-Form Speech Recognition and Speaker Diarization
por: Sakib, Md. Nazmus, et al.
Publicado: (2026)
por: Sakib, Md. Nazmus, et al.
Publicado: (2026)
Why Are We Lonely? Leveraging LLMs to Measure and Understand Loneliness in Caregivers and Non-caregivers
por: Kim, Michelle Damin, et al.
Publicado: (2026)
por: Kim, Michelle Damin, et al.
Publicado: (2026)
Do We Need a Detailed Rubric for Automated Essay Scoring using Large Language Models?
por: Yoshida, Lui
Publicado: (2025)
por: Yoshida, Lui
Publicado: (2025)
Diverse and Effective Synthetic Data Generation for Adaptable Zero-Shot Dialogue State Tracking
por: Finch, James D., et al.
Publicado: (2024)
por: Finch, James D., et al.
Publicado: (2024)
Do We Really Need GNNs with Explicit Structural Modeling? MLPs Suffice for Language Model Representations
por: Zhou, Li, et al.
Publicado: (2025)
por: Zhou, Li, et al.
Publicado: (2025)
Do BERT-Like Bidirectional Models Still Perform Better on Text Classification in the Era of LLMs?
por: Zhang, Junyan, et al.
Publicado: (2025)
por: Zhang, Junyan, et al.
Publicado: (2025)
Improving Speaker Diarization using Semantic Information: Joint Pairwise Constraints Propagation
por: Cheng, Luyao, et al.
Publicado: (2023)
por: Cheng, Luyao, et al.
Publicado: (2023)
From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training
por: Liu, Tianqiao, et al.
Publicado: (2025)
por: Liu, Tianqiao, et al.
Publicado: (2025)
ConvoSense: Overcoming Monotonous Commonsense Inferences for Conversational AI
por: Finch, Sarah E., et al.
Publicado: (2024)
por: Finch, Sarah E., et al.
Publicado: (2024)
What is Your Favorite Gender, MLM? Gender Bias Evaluation in Multilingual Masked Language Models
por: Yu, Jeongrok, et al.
Publicado: (2024)
por: Yu, Jeongrok, et al.
Publicado: (2024)
Spoof Diarization: "What Spoofed When" in Partially Spoofed Audio
por: Zhang, Lin, et al.
Publicado: (2024)
por: Zhang, Lin, et al.
Publicado: (2024)
Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2025)
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2025)
SpeakerSleuth: Can Large Audio-Language Models Judge Speaker Consistency across Multi-turn Dialogues?
por: Lee, Jonggeun, et al.
Publicado: (2026)
por: Lee, Jonggeun, et al.
Publicado: (2026)
Are Optimal Algorithms Still Optimal? Rethinking Sorting in LLM-Based Pairwise Ranking with Batching and Caching
por: Wisznia, Juan, et al.
Publicado: (2025)
por: Wisznia, Juan, et al.
Publicado: (2025)
PersonaKit (PK): A Plug-and-Play Platform for User Testing Diverse Roles in Full-Duplex Dialogue
por: Jeon, Hyunbae, et al.
Publicado: (2026)
por: Jeon, Hyunbae, et al.
Publicado: (2026)
TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding
por: Huo, Mingyue, et al.
Publicado: (2026)
por: Huo, Mingyue, et al.
Publicado: (2026)
DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs
por: Choi, Nayoung, et al.
Publicado: (2026)
por: Choi, Nayoung, et al.
Publicado: (2026)
Iterative LLM-based improvement for French Clinical Interview Transcription and Speaker Diarization
por: Marie, Ambre, et al.
Publicado: (2026)
por: Marie, Ambre, et al.
Publicado: (2026)
Ejemplares similares
-
Do We Still Need Humans in the Loop? Comparing Human and LLM Annotation in Active Learning for Hostility Detection
por: Hakimi, Ahmad Dawar, et al.
Publicado: (2026) -
Large Language Models Still Exhibit Bias in Long Text
por: Jeung, Wonje, et al.
Publicado: (2024) -
Speakers Unembedded: Embedding-free Approach to Long-form Neural Diarization
por: Li, Xiang, et al.
Publicado: (2024) -
D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Model
por: Byun, Grace, et al.
Publicado: (2025) -
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
por: Shakeel, Muhammad, et al.
Publicado: (2025)