OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Park, Jeongkyun, Hwang, Jung-Wook, Choi, Kwanghee, Lee, Seung-Hyun, Ahn, Jun Hwan, Park, Rae-Hong, Park, Hyung-Min |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EMO100DB: An Open Dataset of Improvised Songs with Emotion Data
par: Hwang, Daeun, et autres
Publié: (2025)
par: Hwang, Daeun, et autres
Publié: (2025)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
par: Zhou, Dongliang, et autres
Publié: (2025)
par: Zhou, Dongliang, et autres
Publié: (2025)
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
par: Park, Young-Hu, et autres
Publié: (2025)
par: Park, Young-Hu, et autres
Publié: (2025)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
par: Wu, Wenxuan, et autres
Publié: (2025)
par: Wu, Wenxuan, et autres
Publié: (2025)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
par: Hu, Han, et autres
Publié: (2025)
par: Hu, Han, et autres
Publié: (2025)
SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning
par: Li, Zhu, et autres
Publié: (2026)
par: Li, Zhu, et autres
Publié: (2026)
PAVAS: Physics-Aware Video-to-Audio Synthesis
par: Hyun-Bin, Oh, et autres
Publié: (2025)
par: Hyun-Bin, Oh, et autres
Publié: (2025)
Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation
par: Goncalves, Lucas, et autres
Publié: (2024)
par: Goncalves, Lucas, et autres
Publié: (2024)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion
par: Wang, Junbo, et autres
Publié: (2025)
par: Wang, Junbo, et autres
Publié: (2025)
Audio-Guided Visual Perception for Audio-Visual Navigation
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
par: Xu, Weihan, et autres
Publié: (2025)
par: Xu, Weihan, et autres
Publié: (2025)
TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation
par: Lee, Yubeen, et autres
Publié: (2025)
par: Lee, Yubeen, et autres
Publié: (2025)
AudioSetMix: Enhancing Audio-Language Datasets with LLM-Assisted Augmentations
par: Xu, David
Publié: (2024)
par: Xu, David
Publié: (2024)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
par: Liu, Jiawei, et autres
Publié: (2025)
par: Liu, Jiawei, et autres
Publié: (2025)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
par: Araujo, Edson, et autres
Publié: (2026)
par: Araujo, Edson, et autres
Publié: (2026)
Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound
par: Wang, Jiahua, et autres
Publié: (2025)
par: Wang, Jiahua, et autres
Publié: (2025)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
par: Su, Yaofeng, et autres
Publié: (2026)
par: Su, Yaofeng, et autres
Publié: (2026)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
par: Cappellazzo, Umberto, et autres
Publié: (2024)
par: Cappellazzo, Umberto, et autres
Publié: (2024)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
par: Li, Cancan, et autres
Publié: (2025)
par: Li, Cancan, et autres
Publié: (2025)
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
par: Liu, Tengfei, et autres
Publié: (2026)
par: Liu, Tengfei, et autres
Publié: (2026)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
par: Rho, Kyeongha, et autres
Publié: (2025)
par: Rho, Kyeongha, et autres
Publié: (2025)
Interpretable Convolutional SyncNet
par: Park, Sungjoon, et autres
Publié: (2024)
par: Park, Sungjoon, et autres
Publié: (2024)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
par: Li, Kai, et autres
Publié: (2023)
par: Li, Kai, et autres
Publié: (2023)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
par: Du, Jiarong, et autres
Publié: (2025)
par: Du, Jiarong, et autres
Publié: (2025)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
SonoWorld: From One Image to a 3D Audio-Visual Scene
par: Jin, Derong, et autres
Publié: (2026)
par: Jin, Derong, et autres
Publié: (2026)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
par: Yang, Jianxuan, et autres
Publié: (2025)
par: Yang, Jianxuan, et autres
Publié: (2025)
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation
par: Min, Anna, et autres
Publié: (2025)
par: Min, Anna, et autres
Publié: (2025)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
par: Cheng, Shihao, et autres
Publié: (2026)
par: Cheng, Shihao, et autres
Publié: (2026)
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
par: Mei, Xinhao, et autres
Publié: (2023)
par: Mei, Xinhao, et autres
Publié: (2023)
Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation
par: Tan, Weiting, et autres
Publié: (2025)
par: Tan, Weiting, et autres
Publié: (2025)
Documents similaires
-
EMO100DB: An Open Dataset of Improvised Songs with Emotion Data
par: Hwang, Daeun, et autres
Publié: (2025) -
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
par: Yeo, Jeong Hun, et autres
Publié: (2025) -
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
par: Ma, Ziyang, et autres
Publié: (2026) -
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
par: Zhou, Dongliang, et autres
Publié: (2025) -
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
par: Park, Young-Hu, et autres
Publié: (2025)