Salta al contenuto
VuFind
  • Entra
    • English
    • Deutsch
    • Español
    • Français
    • Italiano
Avanzata
  • Citazione
  • Invia SMS
  • Invia email
  • Stampa
  • Esporta il record
    • Esporta a RefWorks
    • Esporta a EndNoteWeb
    • Esporta a EndNote
  • Aggiungi alla lista
  • PLink permanente
Copertina

Salvato in:
Dettagli Bibliografici
Autori principali: Park, Jeongkyun, Hwang, Jung-Wook, Choi, Kwanghee, Lee, Seung-Hyun, Ahn, Jun Hwan, Park, Rae-Hong, Park, Hyung-Min
Natura: Preprint
Pubblicazione: 2023
Soggetti:
Multimedia
Artificial Intelligence
Computation and Language
Computer Vision and Pattern Recognition
Machine Learning
Sound
Accesso online:https://arxiv.org/abs/2301.06375
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
  • Posseduto
  • Descrizione
  • Sommario
  • Commenti
  • Documenti analoghi
  • MARC21

Accesso online

https://arxiv.org/abs/2301.06375

Documenti analoghi

  • EMO100DB: An Open Dataset of Improvised Songs with Emotion Data
    di: Hwang, Daeun, et al.
    Pubblicazione: (2025)
  • MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
    di: Yeo, Jeong Hun, et al.
    Pubblicazione: (2025)
  • AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
    di: Zhou, Dongliang, et al.
    Pubblicazione: (2025)
  • SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
    di: Ma, Ziyang, et al.
    Pubblicazione: (2026)
  • SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
    di: Park, Young-Hu, et al.
    Pubblicazione: (2025)

Opzioni di ricerca

  • Ultime ricerche
  • Ricerca avanzata

Cerca

  • Scorri il catalogo
  • Scorri in ordine alfabetico
  • Esplora selezioni
  • Materiali riservati (per i corsi)
  • Nuovi documenti

Serve aiuto?

  • Suggerimenti per la ricerca
  • Chiedi al bibliotecario
  • FAQ