Masked Autoencoders with Limited Data: Does It Work? A Fine-Grained Bioacoustics Case Study
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Wuao, Chasmai, Mustafa, Maji, Subhransu, Van Horn, Grant |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Audio Geolocation: A Natural Sounds Benchmark
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025)
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025)
The iNaturalist Sounds Dataset
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025)
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025)
RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMs
di: Lawrence, Logan, et al.
Pubblicazione: (2026)
di: Lawrence, Logan, et al.
Pubblicazione: (2026)
Moment Sampling in Video LLMs for Long-Form Video QA
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025)
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025)
Merlin L48 Spectrogram Dataset
di: Sun, Aaron, et al.
Pubblicazione: (2025)
di: Sun, Aaron, et al.
Pubblicazione: (2025)
Improved Zero-Shot Classification by Adapting VLMs with Text Descriptions
di: Saha, Oindrila, et al.
Pubblicazione: (2024)
di: Saha, Oindrila, et al.
Pubblicazione: (2024)
Audiovisual Masked Autoencoders
di: Georgescu, Mariana-Iuliana, et al.
Pubblicazione: (2022)
di: Georgescu, Mariana-Iuliana, et al.
Pubblicazione: (2022)
Consensus-Driven Active Model Selection
di: Kay, Justin, et al.
Pubblicazione: (2025)
di: Kay, Justin, et al.
Pubblicazione: (2025)
Generate, Transduct, Adapt: Iterative Transduction with VLMs
di: Saha, Oindrila, et al.
Pubblicazione: (2025)
di: Saha, Oindrila, et al.
Pubblicazione: (2025)
Human-in-the-Loop Visual Re-ID for Population Size Estimation
di: Perez, Gustavo, et al.
Pubblicazione: (2023)
di: Perez, Gustavo, et al.
Pubblicazione: (2023)
You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
di: Lawrence, Logan, et al.
Pubblicazione: (2025)
di: Lawrence, Logan, et al.
Pubblicazione: (2025)
WildSAT: Learning Satellite Image Representations from Wildlife Observations
di: Daroya, Rangel, et al.
Pubblicazione: (2024)
di: Daroya, Rangel, et al.
Pubblicazione: (2024)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
di: Araujo, Edson, et al.
Pubblicazione: (2025)
di: Araujo, Edson, et al.
Pubblicazione: (2025)
Automated Bioacoustic Monitoring for South African Bird Species on Unlabeled Data
di: Doell, Michael, et al.
Pubblicazione: (2024)
di: Doell, Michael, et al.
Pubblicazione: (2024)
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
di: Li, You, et al.
Pubblicazione: (2026)
di: Li, You, et al.
Pubblicazione: (2026)
Feedforward Few-shot Species Range Estimation
di: Lange, Christian, et al.
Pubblicazione: (2025)
di: Lange, Christian, et al.
Pubblicazione: (2025)
Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization
di: Vu, Tung, et al.
Pubblicazione: (2026)
di: Vu, Tung, et al.
Pubblicazione: (2026)
Ecologically Valid Benchmarking and Adaptive Attention: Scalable Marine Bioacoustic Monitoring
di: Rasmussen, Nicholas R., et al.
Pubblicazione: (2025)
di: Rasmussen, Nicholas R., et al.
Pubblicazione: (2025)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
EchoMask: Speech-Queried Attention-based Mask Modeling for Holistic Co-Speech Motion Generation
di: Zhang, Xiangyue, et al.
Pubblicazione: (2025)
di: Zhang, Xiangyue, et al.
Pubblicazione: (2025)
Speech Audio Generation from dynamic MRI via a Knowledge Enhanced Conditional Variational Autoencoder
di: Li, Yaxuan, et al.
Pubblicazione: (2025)
di: Li, Yaxuan, et al.
Pubblicazione: (2025)
An Automated Pipeline for Few-Shot Bird Call Classification: A Case Study with the Tooth-Billed Pigeon
di: Jana, Abhishek, et al.
Pubblicazione: (2025)
di: Jana, Abhishek, et al.
Pubblicazione: (2025)
Active Measurement: Efficient Estimation at Scale
di: Hamilton, Max, et al.
Pubblicazione: (2025)
di: Hamilton, Max, et al.
Pubblicazione: (2025)
Pindrop it! Audio and Visual Deepfake Countermeasures for Robust Detection and Fine Grained-Localization
di: Klein, Nicholas, et al.
Pubblicazione: (2025)
di: Klein, Nicholas, et al.
Pubblicazione: (2025)
Detecting Audio-Visual Deepfakes with Fine-Grained Inconsistencies
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
CleverBirds: A Multiple-Choice Benchmark for Fine-grained Human Knowledge Tracing
di: Bossemeyer, Leonie, et al.
Pubblicazione: (2025)
di: Bossemeyer, Leonie, et al.
Pubblicazione: (2025)
Not All Birds Look The Same: Identity-Preserving Generation For Birds
di: Sun, Aaron, et al.
Pubblicazione: (2025)
di: Sun, Aaron, et al.
Pubblicazione: (2025)
Task2Box: Box Embeddings for Modeling Asymmetric Task Relationships
di: Daroya, Rangel, et al.
Pubblicazione: (2024)
di: Daroya, Rangel, et al.
Pubblicazione: (2024)
Active Measurement of Two-Point Correlations
di: Hamilton, Max, et al.
Pubblicazione: (2026)
di: Hamilton, Max, et al.
Pubblicazione: (2026)
HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion Recognition
di: Sun, Licai, et al.
Pubblicazione: (2024)
di: Sun, Licai, et al.
Pubblicazione: (2024)
Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning
di: Vyas, Apoorv, et al.
Pubblicazione: (2025)
di: Vyas, Apoorv, et al.
Pubblicazione: (2025)
Audio Deepfake Detection with Half-Truth Localisation Using Cross-Attentive Feature Fusion
di: Sutharya, S., et al.
Pubblicazione: (2026)
di: Sutharya, S., et al.
Pubblicazione: (2026)
SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion Model
di: Li, Yan, et al.
Pubblicazione: (2024)
di: Li, Yan, et al.
Pubblicazione: (2024)
Comparison of self-supervised in-domain and supervised out-domain transfer learning for bird species recognition
di: Ghaffari, Houtan, et al.
Pubblicazione: (2024)
di: Ghaffari, Houtan, et al.
Pubblicazione: (2024)
Investigating self-supervised representations for audio-visual deepfake detection
di: Boldisor, Dragos-Alexandru, et al.
Pubblicazione: (2025)
di: Boldisor, Dragos-Alexandru, et al.
Pubblicazione: (2025)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
Semi-Supervised Masked Autoencoders: Unlocking Vision Transformer Potential with Limited Data
di: Faysal, Atik, et al.
Pubblicazione: (2026)
di: Faysal, Atik, et al.
Pubblicazione: (2026)
Chirp Localization via Fine-Tuned Transformer Model: A Proof-of-Concept Study
di: Bahador, Nooshin, et al.
Pubblicazione: (2025)
di: Bahador, Nooshin, et al.
Pubblicazione: (2025)
Adversarial Attacks on Audio Deepfake Detection: A Benchmark and Comparative Study
di: Uddin, Kutub, et al.
Pubblicazione: (2025)
di: Uddin, Kutub, et al.
Pubblicazione: (2025)
From Semantics to Pixels: Coarse-to-Fine Masked Autoencoders for Hierarchical Visual Understanding
di: Xiang, Wenzhao, et al.
Pubblicazione: (2026)
di: Xiang, Wenzhao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Audio Geolocation: A Natural Sounds Benchmark
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025) -
The iNaturalist Sounds Dataset
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025) -
RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMs
di: Lawrence, Logan, et al.
Pubblicazione: (2026) -
Moment Sampling in Video LLMs for Long-Form Video QA
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025) -
Merlin L48 Spectrogram Dataset
di: Sun, Aaron, et al.
Pubblicazione: (2025)