Guardado en:
| Autores principales: | Chaudhuri, Yashwardhan, Kumar, Ankit, Phukan, Orchid Chetia, Buduru, Arun Balaji |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2401.05968 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FGA: Fourier-Guided Attention Network for Crowd Count Estimation
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
VoxMed: One-Step Respiratory Disease Classifier using Digital Stethoscope Sounds
por: Mundra, Paridhi, et al.
Publicado: (2024)
por: Mundra, Paridhi, et al.
Publicado: (2024)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
Towards Multilingual Audio-Visual Question Answering
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
BB-Patch: BlackBox Adversarial Patch-Attack using Zeroth-Order Optimization
por: Kumar, Satyadwyoom, et al.
Publicado: (2024)
por: Kumar, Satyadwyoom, et al.
Publicado: (2024)
SNIFR : Boosting Fine-Grained Child Harmful Content Detection Through Audio-Visual Alignment with Cascaded Cross-Transformer
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
CoLLAB: A Collaborative Approach for Multilingual Abuse Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
SONIC: Synergizing VisiON Foundation Models for Stress RecogNItion from ECG signals
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
The Reasonable Effectiveness of Speaker Embeddings for Violence Detection
por: Jain, Sarthak, et al.
Publicado: (2024)
por: Jain, Sarthak, et al.
Publicado: (2024)
Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages
por: Girish, et al.
Publicado: (2026)
por: Girish, et al.
Publicado: (2026)
Real-Time Crowd Counting for Embedded Systems with Lightweight Architecture
por: Zhao, Zhiyuan, et al.
Publicado: (2025)
por: Zhao, Zhiyuan, et al.
Publicado: (2025)
Heterogeneity over Homogeneity: Investigating Multilingual Speech Pre-Trained Models for Detecting Audio Deepfake
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Learning Discriminative Features for Crowd Counting
por: Chen, Yuehai, et al.
Publicado: (2023)
por: Chen, Yuehai, et al.
Publicado: (2023)
ComFeAT: Combination of Neural and Spectral Features for Improved Depression Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
PERSONA: An Application for Emotion Recognition, Gender Recognition and Age Estimation
por: Koshal, Devyani, et al.
Publicado: (2024)
por: Koshal, Devyani, et al.
Publicado: (2024)
AVR: Synergizing Foundation Models for Audio-Visual Humor Detection
por: Sharma, Sarthak, et al.
Publicado: (2024)
por: Sharma, Sarthak, et al.
Publicado: (2024)
Towards Neural Audio Codec Source Parsing
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
FOCA: Multimodal Malware Classification via Hyperbolic Cross-Attention
por: Choudhury, Nitin, et al.
Publicado: (2026)
por: Choudhury, Nitin, et al.
Publicado: (2026)
RepSFNet : A Single Fusion Network with Structural Reparameterization for Crowd Counting
por: Achmadiah, Mas Nurul, et al.
Publicado: (2026)
por: Achmadiah, Mas Nurul, et al.
Publicado: (2026)
Embodied Crowd Counting
por: Long, Runling, et al.
Publicado: (2025)
por: Long, Runling, et al.
Publicado: (2025)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
por: Jain, Sarthak, et al.
Publicado: (2024)
por: Jain, Sarthak, et al.
Publicado: (2024)
Density Estimation and Crowd Counting
por: Sunil, Balachandra Devarangadi, et al.
Publicado: (2025)
por: Sunil, Balachandra Devarangadi, et al.
Publicado: (2025)
3D Crowd Counting via Geometric Attention-guided Multi-View Fusion
por: Zhang, Qi, et al.
Publicado: (2020)
por: Zhang, Qi, et al.
Publicado: (2020)
Semi-Supervised Multi-View Crowd Counting by Ranking Multi-View Fusion Models
por: Zhang, Qi, et al.
Publicado: (2025)
por: Zhang, Qi, et al.
Publicado: (2025)
CountFormer: Multi-View Crowd Counting Transformer
por: Mo, Hong, et al.
Publicado: (2024)
por: Mo, Hong, et al.
Publicado: (2024)
Phys-3D: Physics-Constrained Real-Time Crowd Tracking and Counting on Railway Platforms
por: Zeng, Bin, et al.
Publicado: (2026)
por: Zeng, Bin, et al.
Publicado: (2026)
RACANet: Reliability-Aware Crowd Anchor Network for RGB-T Crowd Counting
por: Shi, Jinghao, et al.
Publicado: (2026)
por: Shi, Jinghao, et al.
Publicado: (2026)
Single Domain Generalization for Crowd Counting
por: Peng, Zhuoxuan, et al.
Publicado: (2024)
por: Peng, Zhuoxuan, et al.
Publicado: (2024)
Rethinking Global Context in Crowd Counting
por: Sun, Guolei, et al.
Publicado: (2021)
por: Sun, Guolei, et al.
Publicado: (2021)
A Dual-Modulation Framework for RGB-T Crowd Counting via Spatially Modulated Attention and Adaptive Fusion
por: Feng, Yuhong, et al.
Publicado: (2025)
por: Feng, Yuhong, et al.
Publicado: (2025)
Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network
por: Zhou, Fei, et al.
Publicado: (2025)
por: Zhou, Fei, et al.
Publicado: (2025)
Local Information Matters: A Rethink of Crowd Counting
por: Pan, Tianhang, et al.
Publicado: (2025)
por: Pan, Tianhang, et al.
Publicado: (2025)
Curriculum for Crowd Counting -- Is it Worthy?
por: Khan, Muhammad Asif, et al.
Publicado: (2024)
por: Khan, Muhammad Asif, et al.
Publicado: (2024)
Semi-Supervised Crowd Counting with Contextual Modeling: Facilitating Holistic Understanding of Crowd Scenes
por: Qian, Yifei, et al.
Publicado: (2023)
por: Qian, Yifei, et al.
Publicado: (2023)
DSGC-Net: A Dual-Stream Graph Convolutional Network for Crowd Counting via Feature Correlation Mining
por: Wu, Yihong, et al.
Publicado: (2025)
por: Wu, Yihong, et al.
Publicado: (2025)
The Effectiveness of a Simplified Model Structure for Crowd Counting
por: Chen, Lei, et al.
Publicado: (2024)
por: Chen, Lei, et al.
Publicado: (2024)
Ejemplares similares
-
FGA: Fourier-Guided Attention Network for Crowd Count Estimation
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024) -
VoxMed: One-Step Respiratory Disease Classifier using Digital Stethoscope Sounds
por: Mundra, Paridhi, et al.
Publicado: (2024) -
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024) -
Towards Multilingual Audio-Visual Question Answering
por: Phukan, Orchid Chetia, et al.
Publicado: (2024) -
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)