From Visual to Multimodal: Systematic Ablation of Encoders and Fusion Strategies in Animal Identification
Fuente:
arXiv
Salvato in:
| Autori principali: | Kudryavtsev, Vasiliy, Borodin, Kirill, Berezin, German, Bubenchikov, Kirill, Mkrtchian, Grach, Ryzhkov, Alexander |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Benchmarking Compact VLMs for Clip-Level Surveillance Anomaly Detection Under Weak Supervision
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech
di: Borodin, Kirill, et al.
Pubblicazione: (2025)
di: Borodin, Kirill, et al.
Pubblicazione: (2025)
From Dispersion to Attraction: Spectral Dynamics of Hallucination Across Whisper Model Scales
di: Viakhirev, Ivan, et al.
Pubblicazione: (2026)
di: Viakhirev, Ivan, et al.
Pubblicazione: (2026)
Evaluating Generalization and Robustness in Russian Anti-Spoofing: The RuASD Initiative
di: Lysikova, Ksenia, et al.
Pubblicazione: (2026)
di: Lysikova, Ksenia, et al.
Pubblicazione: (2026)
Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
Interpreting Multi-Branch Anti-Spoofing Architectures: Correlating Internal Strategy with Empirical Performance
di: Viakhirev, Ivan, et al.
Pubblicazione: (2026)
di: Viakhirev, Ivan, et al.
Pubblicazione: (2026)
Application of ASV for Voice Identification after VC and Duration Predictor Improvement in TTS Models
di: Nikolayevich, Borodin Kirill, et al.
Pubblicazione: (2024)
di: Nikolayevich, Borodin Kirill, et al.
Pubblicazione: (2024)
AASIST3: KAN-Enhanced AASIST Speech Deepfake Detection using SSL Features and Additional Regularization for the ASVspoof 2024 Challenge
di: Borodin, Kirill, et al.
Pubblicazione: (2024)
di: Borodin, Kirill, et al.
Pubblicazione: (2024)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
di: She, Yifei, et al.
Pubblicazione: (2025)
di: She, Yifei, et al.
Pubblicazione: (2025)
WildFusion: Individual Animal Identification with Calibrated Similarity Fusion
di: Cermak, Vojtěch, et al.
Pubblicazione: (2024)
di: Cermak, Vojtěch, et al.
Pubblicazione: (2024)
Improving Acne Image Grading with Label Distribution Smoothing
di: Prokhorov, Kirill, et al.
Pubblicazione: (2024)
di: Prokhorov, Kirill, et al.
Pubblicazione: (2024)
A High-Accuracy SSIM-based Scoring System for Coin Die Link Identification
di: Labedan, Patrice, et al.
Pubblicazione: (2025)
di: Labedan, Patrice, et al.
Pubblicazione: (2025)
CasTex: Cascaded Text-to-Texture Synthesis via Explicit Texture Maps and Physically-Based Shading
di: Aliev, Mishan, et al.
Pubblicazione: (2025)
di: Aliev, Mishan, et al.
Pubblicazione: (2025)
Towards properties of adversarial image perturbations
di: Kuznetsov, Egor, et al.
Pubblicazione: (2025)
di: Kuznetsov, Egor, et al.
Pubblicazione: (2025)
MixMask: Revisiting Masking Strategy for Siamese ConvNets
di: Vishniakov, Kirill, et al.
Pubblicazione: (2022)
di: Vishniakov, Kirill, et al.
Pubblicazione: (2022)
On-Device Continual Learning for Unsupervised Visual Anomaly Detection in Dynamic Manufacturing
di: Ren, Haoyu, et al.
Pubblicazione: (2025)
di: Ren, Haoyu, et al.
Pubblicazione: (2025)
VMAF Re-implementation on PyTorch: Some Experimental Results
di: Aistov, Kirill, et al.
Pubblicazione: (2023)
di: Aistov, Kirill, et al.
Pubblicazione: (2023)
Dual-Prompt CLIP with Hybrid Visual Encoders for Occluded Person Re-Identification
di: Ji, Zhangjian, et al.
Pubblicazione: (2026)
di: Ji, Zhangjian, et al.
Pubblicazione: (2026)
Deepfake detection in videos with multiple faces using geometric-fakeness features
di: Vyshegorodtsev, Kirill, et al.
Pubblicazione: (2024)
di: Vyshegorodtsev, Kirill, et al.
Pubblicazione: (2024)
Federated Modality-specific Encoders and Partially Personalized Fusion Decoder for Multimodal Brain Tumor Segmentation
di: Liu, Hong, et al.
Pubblicazione: (2026)
di: Liu, Hong, et al.
Pubblicazione: (2026)
Contextual Encoder-Decoder Network for Visual Saliency Prediction
di: Kroner, Alexander, et al.
Pubblicazione: (2019)
di: Kroner, Alexander, et al.
Pubblicazione: (2019)
ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
di: Ge, Chunjiang, et al.
Pubblicazione: (2024)
di: Ge, Chunjiang, et al.
Pubblicazione: (2024)
Animal Re-Identification on Microcontrollers
di: Chen, Yubo, et al.
Pubblicazione: (2025)
di: Chen, Yubo, et al.
Pubblicazione: (2025)
4D Primitive-Mâché: Glueing Primitives for Persistent 4D Scene Reconstruction
di: Mazur, Kirill, et al.
Pubblicazione: (2025)
di: Mazur, Kirill, et al.
Pubblicazione: (2025)
SuperPrimitive: Scene Reconstruction at a Primitive Level
di: Mazur, Kirill, et al.
Pubblicazione: (2023)
di: Mazur, Kirill, et al.
Pubblicazione: (2023)
Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition
di: Cong, Kaixuan, et al.
Pubblicazione: (2025)
di: Cong, Kaixuan, et al.
Pubblicazione: (2025)
Enhancing Image Layout Control with Loss-Guided Diffusion Models
di: Patel, Zakaria, et al.
Pubblicazione: (2024)
di: Patel, Zakaria, et al.
Pubblicazione: (2024)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
TIQA: Human-Aligned Perceptual Text Quality Assessment in Generated Images
di: Koltsov, Kirill, et al.
Pubblicazione: (2026)
di: Koltsov, Kirill, et al.
Pubblicazione: (2026)
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
di: Azadani, Mozhgan Nasr, et al.
Pubblicazione: (2025)
di: Azadani, Mozhgan Nasr, et al.
Pubblicazione: (2025)
Rethinking Early-Fusion Strategies for Improved Multimodal Image Segmentation
di: Shen, Zhengwen, et al.
Pubblicazione: (2025)
di: Shen, Zhengwen, et al.
Pubblicazione: (2025)
OpenAnimals: Revisiting Person Re-Identification for Animals Towards Better Generalization
di: Hou, Saihui, et al.
Pubblicazione: (2024)
di: Hou, Saihui, et al.
Pubblicazione: (2024)
Explaining How Visual, Textual and Multimodal Encoders Share Concepts
di: Cornet, Clément, et al.
Pubblicazione: (2025)
di: Cornet, Clément, et al.
Pubblicazione: (2025)
FusionBERT: Multi-View Image-3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder
di: Li, Wei, et al.
Pubblicazione: (2026)
di: Li, Wei, et al.
Pubblicazione: (2026)
Unified Multimodal Models as Auto-Encoders
di: Yan, Zhiyuan, et al.
Pubblicazione: (2025)
di: Yan, Zhiyuan, et al.
Pubblicazione: (2025)
Generative inpainting of incomplete Euclidean distance matrices of trajectories generated by a fractional Brownian motion
di: Lobashev, Alexander, et al.
Pubblicazione: (2024)
di: Lobashev, Alexander, et al.
Pubblicazione: (2024)
Animal Identification with Independent Foreground and Background Modeling
di: Picek, Lukas, et al.
Pubblicazione: (2024)
di: Picek, Lukas, et al.
Pubblicazione: (2024)
Self-Supervised Animal Identification for Long Videos
di: Fang, Xuyang, et al.
Pubblicazione: (2026)
di: Fang, Xuyang, et al.
Pubblicazione: (2026)
ConvNet vs Transformer, Supervised vs CLIP: Beyond ImageNet Accuracy
di: Vishniakov, Kirill, et al.
Pubblicazione: (2023)
di: Vishniakov, Kirill, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Benchmarking Compact VLMs for Clip-Level Surveillance Anomaly Detection Under Weak Supervision
di: Borodin, Kirill, et al.
Pubblicazione: (2026) -
When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus
di: Borodin, Kirill, et al.
Pubblicazione: (2026) -
Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech
di: Borodin, Kirill, et al.
Pubblicazione: (2025) -
From Dispersion to Attraction: Spectral Dynamics of Hallucination Across Whisper Model Scales
di: Viakhirev, Ivan, et al.
Pubblicazione: (2026) -
Evaluating Generalization and Robustness in Russian Anti-Spoofing: The RuASD Initiative
di: Lysikova, Ksenia, et al.
Pubblicazione: (2026)