Developing an AI-based Integrated System for Bee Health Evaluation
Fuente:
arXiv
Guardado en:
| Autor principal: | Liang, Andrew |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Character-aware audio-visual subtitling in context
por: Huh, Jaesung, et al.
Publicado: (2024)
por: Huh, Jaesung, et al.
Publicado: (2024)
Exploring Green AI for Audio Deepfake Detection
por: Saha, Subhajit, et al.
Publicado: (2024)
por: Saha, Subhajit, et al.
Publicado: (2024)
Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization
por: Cheng, Luyao, et al.
Publicado: (2024)
por: Cheng, Luyao, et al.
Publicado: (2024)
Towards reliable respiratory disease diagnosis based on cough sounds and vision transformers
por: Wang, Qian, et al.
Publicado: (2024)
por: Wang, Qian, et al.
Publicado: (2024)
FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment
por: Gramaccioni, Riccardo Fosco, et al.
Publicado: (2024)
por: Gramaccioni, Riccardo Fosco, et al.
Publicado: (2024)
Images that Sound: Composing Images and Sounds on a Single Canvas
por: Chen, Ziyang, et al.
Publicado: (2024)
por: Chen, Ziyang, et al.
Publicado: (2024)
Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis
por: Li, Tianqi, et al.
Publicado: (2024)
por: Li, Tianqi, et al.
Publicado: (2024)
Addressing Representation Collapse in Vector Quantized Models with One Linear Layer
por: Zhu, Yongxin, et al.
Publicado: (2024)
por: Zhu, Yongxin, et al.
Publicado: (2024)
Exploring Federated Self-Supervised Learning for General Purpose Audio Understanding
por: Rehman, Yasar Abbas Ur, et al.
Publicado: (2024)
por: Rehman, Yasar Abbas Ur, et al.
Publicado: (2024)
Assessing the Robustness of Spectral Clustering for Deep Speaker Diarization
por: Raghav, Nikhil, et al.
Publicado: (2024)
por: Raghav, Nikhil, et al.
Publicado: (2024)
Joint Multimodal Transformer for Emotion Recognition in the Wild
por: Waligora, Paul, et al.
Publicado: (2024)
por: Waligora, Paul, et al.
Publicado: (2024)
Dynamic Cross Attention for Audio-Visual Person Verification
por: Praveen, R. Gnana, et al.
Publicado: (2024)
por: Praveen, R. Gnana, et al.
Publicado: (2024)
Dynamic Modality and View Selection for Multimodal Emotion Recognition with Missing Modalities
por: Menon, Luciana Trinkaus, et al.
Publicado: (2024)
por: Menon, Luciana Trinkaus, et al.
Publicado: (2024)
An Eye for an Ear: Zero-shot Audio Description Leveraging an Image Captioner using Audiovisual Distribution Alignment
por: Malard, Hugo, et al.
Publicado: (2024)
por: Malard, Hugo, et al.
Publicado: (2024)
The Solution for Temporal Sound Localisation Task of ICCV 1st Perception Test Challenge 2023
por: Huang, Yurui, et al.
Publicado: (2024)
por: Huang, Yurui, et al.
Publicado: (2024)
MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
por: Cheng, Ho Kei, et al.
Publicado: (2024)
por: Cheng, Ho Kei, et al.
Publicado: (2024)
AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation
por: Haji-Ali, Moayed, et al.
Publicado: (2024)
por: Haji-Ali, Moayed, et al.
Publicado: (2024)
SEE-2-SOUND: Zero-Shot Spatial Environment-to-Spatial Sound
por: Dagli, Rishit, et al.
Publicado: (2024)
por: Dagli, Rishit, et al.
Publicado: (2024)
SoundBrush: Sound as a Brush for Visual Scene Editing
por: Sung-Bin, Kim, et al.
Publicado: (2024)
por: Sung-Bin, Kim, et al.
Publicado: (2024)
Attention-guided Spectrogram Sequence Modeling with CNNs for Music Genre Classification
por: Sridhar, Aditya
Publicado: (2024)
por: Sridhar, Aditya
Publicado: (2024)
When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining
por: Yeo, Juan, et al.
Publicado: (2024)
por: Yeo, Juan, et al.
Publicado: (2024)
Characterizing Continual Learning Scenarios and Strategies for Audio Analysis
por: Bhatt, Ruchi, et al.
Publicado: (2024)
por: Bhatt, Ruchi, et al.
Publicado: (2024)
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition
por: Wang, Zixuan, et al.
Publicado: (2024)
por: Wang, Zixuan, et al.
Publicado: (2024)
Deep Neural Networks for Automatic Speaker Recognition Do Not Learn Supra-Segmental Temporal Features
por: Neururer, Daniel, et al.
Publicado: (2023)
por: Neururer, Daniel, et al.
Publicado: (2023)
Acoustic Scene Classification: A Competition Review
por: Gharib, Shayan, et al.
Publicado: (2018)
por: Gharib, Shayan, et al.
Publicado: (2018)
Benchmarking Machine Learning Methods for Distributed Acoustic Sensing
por: Shi, Shuaikai, et al.
Publicado: (2025)
por: Shi, Shuaikai, et al.
Publicado: (2025)
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
por: Takahashi, Akira, et al.
Publicado: (2025)
por: Takahashi, Akira, et al.
Publicado: (2025)
A High-Accuracy Optical Music Recognition Method Based on Bottleneck Residual Convolutions
por: Ma, Junwen, et al.
Publicado: (2026)
por: Ma, Junwen, et al.
Publicado: (2026)
Training-Free Voice Conversion with Factorized Optimal Transport
por: Lobashev, Alexander, et al.
Publicado: (2025)
por: Lobashev, Alexander, et al.
Publicado: (2025)
Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
por: Hayakawa, Akio, et al.
Publicado: (2025)
por: Hayakawa, Akio, et al.
Publicado: (2025)
Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation
por: Zeng, Runhao, et al.
Publicado: (2025)
por: Zeng, Runhao, et al.
Publicado: (2025)
Attention Isn't All You Need for Emotion Recognition:Domain Features Outperform Transformers on the EAV Dataset
por: Guragain, Anmol
Publicado: (2026)
por: Guragain, Anmol
Publicado: (2026)
Topological Deep Learning for Speech Data
por: Yu, Zhiwang
Publicado: (2025)
por: Yu, Zhiwang
Publicado: (2025)
Automated Detection of Dolphin Whistles with Convolutional Networks and Transfer Learning
por: Korkmaz, Burla Nur, et al.
Publicado: (2022)
por: Korkmaz, Burla Nur, et al.
Publicado: (2022)
MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation
por: Takahashi, Akira, et al.
Publicado: (2026)
por: Takahashi, Akira, et al.
Publicado: (2026)
Improving vision-inspired keyword spotting using dynamic module skipping in streaming conformer encoder
por: Bittar, Alexandre, et al.
Publicado: (2023)
por: Bittar, Alexandre, et al.
Publicado: (2023)
Audio-visual video-to-speech synthesis with synthesized input audio
por: Kefalas, Triantafyllos, et al.
Publicado: (2023)
por: Kefalas, Triantafyllos, et al.
Publicado: (2023)
Large-scale unsupervised audio pre-training for video-to-speech synthesis
por: Kefalas, Triantafyllos, et al.
Publicado: (2023)
por: Kefalas, Triantafyllos, et al.
Publicado: (2023)
Synchformer: Efficient Synchronization from Sparse Cues
por: Iashin, Vladimir, et al.
Publicado: (2024)
por: Iashin, Vladimir, et al.
Publicado: (2024)
Self-Supervised Audio-Visual Soundscape Stylization
por: Li, Tingle, et al.
Publicado: (2024)
por: Li, Tingle, et al.
Publicado: (2024)
Ejemplares similares
-
Character-aware audio-visual subtitling in context
por: Huh, Jaesung, et al.
Publicado: (2024) -
Exploring Green AI for Audio Deepfake Detection
por: Saha, Subhajit, et al.
Publicado: (2024) -
Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization
por: Cheng, Luyao, et al.
Publicado: (2024) -
Towards reliable respiratory disease diagnosis based on cough sounds and vision transformers
por: Wang, Qian, et al.
Publicado: (2024) -
FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment
por: Gramaccioni, Riccardo Fosco, et al.
Publicado: (2024)