Multimodal Deep Learning for ATCO Command Lifecycle Modeling and Workload Prediction
Fuente:
arXiv
Guardado en:
| Autor principal: | Tan, Kaizhen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
por: Lin, Zhiqiu, et al.
Publicado: (2023)
por: Lin, Zhiqiu, et al.
Publicado: (2023)
The Evolution of Multimodal Model Architectures
por: Wadekar, Shakti N., et al.
Publicado: (2024)
por: Wadekar, Shakti N., et al.
Publicado: (2024)
NOTA: Multimodal Music Notation Understanding for Visual Large Language Model
por: Tang, Mingni, et al.
Publicado: (2025)
por: Tang, Mingni, et al.
Publicado: (2025)
Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
Modality-Inconsistent Continual Learning of Multimodal Large Language Models
por: Pian, Weiguo, et al.
Publicado: (2024)
por: Pian, Weiguo, et al.
Publicado: (2024)
Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time
por: Chowdhury, Sanjoy, et al.
Publicado: (2024)
por: Chowdhury, Sanjoy, et al.
Publicado: (2024)
Surface EMG-Based Inter-Session/Inter-Subject Gesture Recognition by Leveraging Lightweight All-ConvNet and Transfer Learning
por: Islam, Md. Rabiul, et al.
Publicado: (2023)
por: Islam, Md. Rabiul, et al.
Publicado: (2023)
Investigating the Invertibility of Multimodal Latent Spaces: Limitations of Optimization-Based Methods
por: Park, Siwoo
Publicado: (2025)
por: Park, Siwoo
Publicado: (2025)
Integrating Audio Narrations to Strengthen Domain Generalization in Multimodal First-Person Action Recognition
por: Gungor, Cagri, et al.
Publicado: (2024)
por: Gungor, Cagri, et al.
Publicado: (2024)
Spectral and Rhythm Features for Audio Classification with Deep Convolutional Neural Networks
por: Wolf-Monheim, Friedrich
Publicado: (2024)
por: Wolf-Monheim, Friedrich
Publicado: (2024)
Ming-Omni: A Unified Multimodal Model for Perception and Generation
por: AI, Inclusion, et al.
Publicado: (2025)
por: AI, Inclusion, et al.
Publicado: (2025)
Spectral and Rhythm Feature Performance Evaluation for Category and Class Level Audio Classification with Deep Convolutional Neural Networks
por: Wolf-Monheim, Friedrich
Publicado: (2025)
por: Wolf-Monheim, Friedrich
Publicado: (2025)
Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs
por: Chowdhury, Sanjoy, et al.
Publicado: (2025)
por: Chowdhury, Sanjoy, et al.
Publicado: (2025)
SAND: The Challenge on Speech Analysis for Neurodegenerative Disease Assessment
por: Sannino, Giovanna, et al.
Publicado: (2026)
por: Sannino, Giovanna, et al.
Publicado: (2026)
WhaleNet: a Novel Deep Learning Architecture for Marine Mammals Vocalizations on Watkins Marine Mammal Sound Database
por: Licciardi, Alessandro, et al.
Publicado: (2024)
por: Licciardi, Alessandro, et al.
Publicado: (2024)
The Effect of Perceptual Metrics on Music Representation Learning for Genre Classification
por: Namgyal, Tashi, et al.
Publicado: (2024)
por: Namgyal, Tashi, et al.
Publicado: (2024)
Multimodal Spatial Language Maps for Robot Navigation and Manipulation
por: Huang, Chenguang, et al.
Publicado: (2025)
por: Huang, Chenguang, et al.
Publicado: (2025)
Leveraging Embedding Techniques in Multimodal Machine Learning for Mental Illness Assessment
por: Hassan, Abdelrahaman A., et al.
Publicado: (2025)
por: Hassan, Abdelrahaman A., et al.
Publicado: (2025)
Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification
por: Zhu, Wentao
Publicado: (2024)
por: Zhu, Wentao
Publicado: (2024)
Synthesizing Audio from Silent Video using Sequence to Sequence Modeling
por: Belinchon, Hugo Garrido-Lestache, et al.
Publicado: (2024)
por: Belinchon, Hugo Garrido-Lestache, et al.
Publicado: (2024)
Chirp Localization via Fine-Tuned Transformer Model: A Proof-of-Concept Study
por: Bahador, Nooshin, et al.
Publicado: (2025)
por: Bahador, Nooshin, et al.
Publicado: (2025)
DiffGAP: A Lightweight Diffusion Module in Contrastive Space for Bridging Cross-Model Gap
por: Mo, Shentong, et al.
Publicado: (2025)
por: Mo, Shentong, et al.
Publicado: (2025)
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
por: Zhu, Wentao
Publicado: (2024)
por: Zhu, Wentao
Publicado: (2024)
MMFformer: Multimodal Fusion Transformer Network for Depression Detection
por: Haque, Md Rezwanul, et al.
Publicado: (2025)
por: Haque, Md Rezwanul, et al.
Publicado: (2025)
Release of Pre-Trained Models for the Japanese Language
por: Sawada, Kei, et al.
Publicado: (2024)
por: Sawada, Kei, et al.
Publicado: (2024)
AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2023)
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2023)
Deep Learning Models in Speech Recognition: Measuring GPU Energy Consumption, Impact of Noise and Model Quantization for Edge Deployment
por: Chakravarty, Aditya
Publicado: (2024)
por: Chakravarty, Aditya
Publicado: (2024)
Large Language Models Implicitly Learn to See and Hear Just By Reading
por: Verma, Prateek, et al.
Publicado: (2025)
por: Verma, Prateek, et al.
Publicado: (2025)
Neural Brain Fields: A NeRF-Inspired Approach for Generating Nonexistent EEG Electrodes
por: Kedem, Shahar Ain, et al.
Publicado: (2025)
por: Kedem, Shahar Ain, et al.
Publicado: (2025)
Hearing Anywhere in Any Environment
por: Liu, Xiulong, et al.
Publicado: (2025)
por: Liu, Xiulong, et al.
Publicado: (2025)
Data Augmentation Using Neural Acoustic Fields With Retrieval-Augmented Pre-training
por: Ick, Christopher, et al.
Publicado: (2025)
por: Ick, Christopher, et al.
Publicado: (2025)
Direction-Aware Neural Acoustic Fields for Few-Shot Interpolation of Ambisonic Impulse Responses
por: Ick, Christopher, et al.
Publicado: (2025)
por: Ick, Christopher, et al.
Publicado: (2025)
VisionScores -- A system-segmented image score dataset for deep learning tasks
por: Amezcua, Alejandro Romero, et al.
Publicado: (2025)
por: Amezcua, Alejandro Romero, et al.
Publicado: (2025)
DPN-GAN: Inducing Periodic Activations in Generative Adversarial Networks for High-Fidelity Audio Synthesis
por: Ahmad, Zeeshan, et al.
Publicado: (2025)
por: Ahmad, Zeeshan, et al.
Publicado: (2025)
Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows
por: Mo, Shentong, et al.
Publicado: (2026)
por: Mo, Shentong, et al.
Publicado: (2026)
Tell What You Hear From What You See -- Video to Audio Generation Through Text
por: Liu, Xiulong, et al.
Publicado: (2024)
por: Liu, Xiulong, et al.
Publicado: (2024)
InfantCryNet: A Data-driven Framework for Intelligent Analysis of Infant Cries
por: Hong, Mengze, et al.
Publicado: (2024)
por: Hong, Mengze, et al.
Publicado: (2024)
Attention-Based Efficient Breath Sound Removal in Studio Audio Recordings
por: Elgiriyewithana, Nidula, et al.
Publicado: (2024)
por: Elgiriyewithana, Nidula, et al.
Publicado: (2024)
SONICS: Synthetic Or Not -- Identifying Counterfeit Songs
por: Rahman, Md Awsafur, et al.
Publicado: (2024)
por: Rahman, Md Awsafur, et al.
Publicado: (2024)
Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities
por: Xie, Zhifei, et al.
Publicado: (2024)
por: Xie, Zhifei, et al.
Publicado: (2024)
Ejemplares similares
-
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
por: Lin, Zhiqiu, et al.
Publicado: (2023) -
The Evolution of Multimodal Model Architectures
por: Wadekar, Shakti N., et al.
Publicado: (2024) -
NOTA: Multimodal Music Notation Understanding for Visual Large Language Model
por: Tang, Mingni, et al.
Publicado: (2025) -
Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey
por: Chen, Liang, et al.
Publicado: (2024) -
Modality-Inconsistent Continual Learning of Multimodal Large Language Models
por: Pian, Weiguo, et al.
Publicado: (2024)