Enhanced Multimodal Content Moderation of Children's Videos using Audiovisual Fusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Ahmed, Syed Hammad, Khan, Muhammad Junaid, Sukthankar, Gita |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Smart Sampling: Self-Attention and Bootstrapping for Improved Ensembled Q-Learning
di: Khan, Muhammad Junaid, et al.
Pubblicazione: (2024)
di: Khan, Muhammad Junaid, et al.
Pubblicazione: (2024)
SC-Phi2: A Fine-tuned Small Language Model for StarCraft II Macromanagement Tasks
di: Khan, Muhammad Junaid, et al.
Pubblicazione: (2024)
di: Khan, Muhammad Junaid, et al.
Pubblicazione: (2024)
Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification
di: Awan, Mahrukh, et al.
Pubblicazione: (2024)
di: Awan, Mahrukh, et al.
Pubblicazione: (2024)
Visual Episodic Memory-based Exploration
di: Vice, Jack, et al.
Pubblicazione: (2024)
di: Vice, Jack, et al.
Pubblicazione: (2024)
Probing Multimodal Fusion in the Brain: The Dominance of Audiovisual Streams in Naturalistic Encoding
di: Abdollahi, Hamid, et al.
Pubblicazione: (2025)
di: Abdollahi, Hamid, et al.
Pubblicazione: (2025)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
Crowd Scene Analysis using Deep Learning Techniques
di: Asif, Muhammad Junaid
Pubblicazione: (2025)
di: Asif, Muhammad Junaid
Pubblicazione: (2025)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
Star-Fusion: A Multi-modal Transformer Architecture for Discrete Celestial Orientation via Spherical Topology
di: Hammad, May, et al.
Pubblicazione: (2026)
di: Hammad, May, et al.
Pubblicazione: (2026)
CLIP-Decoder : ZeroShot Multilabel Classification using Multimodal CLIP Aligned Representation
di: Ali, Muhammad, et al.
Pubblicazione: (2024)
di: Ali, Muhammad, et al.
Pubblicazione: (2024)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos
di: Ding, Bonan, et al.
Pubblicazione: (2026)
di: Ding, Bonan, et al.
Pubblicazione: (2026)
Multimodal Guidance Network for Missing-Modality Inference in Content Moderation
di: Zhao, Zhuokai, et al.
Pubblicazione: (2023)
di: Zhao, Zhuokai, et al.
Pubblicazione: (2023)
Embedding-based Retrieval in Multimodal Content Moderation
di: Liang, Hanzhong, et al.
Pubblicazione: (2025)
di: Liang, Hanzhong, et al.
Pubblicazione: (2025)
Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
Exploring Convolutional Neural Networks for Rice Grain Classification: An Explainable AI Approach
di: Asif, Muhammad Junaid, et al.
Pubblicazione: (2025)
di: Asif, Muhammad Junaid, et al.
Pubblicazione: (2025)
EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion
di: Wei, Jiangchuan, et al.
Pubblicazione: (2025)
di: Wei, Jiangchuan, et al.
Pubblicazione: (2025)
Noise Crystallization and Liquid Noise: Zero-shot Video Generation using Image Diffusion Models
di: Khan, Muhammad Haaris, et al.
Pubblicazione: (2024)
di: Khan, Muhammad Haaris, et al.
Pubblicazione: (2024)
Context-Aware Detection of Mixed Critical Events using Video Classification
di: Akhlaq, Filza, et al.
Pubblicazione: (2024)
di: Akhlaq, Filza, et al.
Pubblicazione: (2024)
Uncertainty-Aware and Decoder-Aligned Learning for Video Summarization
di: Tariq, Omer, et al.
Pubblicazione: (2026)
di: Tariq, Omer, et al.
Pubblicazione: (2026)
Surgical Scene Understanding in the Era of Foundation AI Models: A Comprehensive Review
di: Khan, Ufaq, et al.
Pubblicazione: (2025)
di: Khan, Ufaq, et al.
Pubblicazione: (2025)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts
di: Son, Taein, et al.
Pubblicazione: (2024)
di: Son, Taein, et al.
Pubblicazione: (2024)
MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment
di: wang, Shuo, et al.
Pubblicazione: (2025)
di: wang, Shuo, et al.
Pubblicazione: (2025)
Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection
di: Jeong, Sungheon, et al.
Pubblicazione: (2025)
di: Jeong, Sungheon, et al.
Pubblicazione: (2025)
WorldCache: Content-Aware Caching for Accelerated Video World Models
di: Nawaz, Umair, et al.
Pubblicazione: (2026)
di: Nawaz, Umair, et al.
Pubblicazione: (2026)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024)
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024)
Advancing Content Moderation: Evaluating Large Language Models for Detecting Sensitive Content Across Text, Images, and Videos
di: AlDahoul, Nouar, et al.
Pubblicazione: (2024)
di: AlDahoul, Nouar, et al.
Pubblicazione: (2024)
U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation
di: Deng, Xiang, et al.
Pubblicazione: (2026)
di: Deng, Xiang, et al.
Pubblicazione: (2026)
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2025)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2025)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
di: She, Yifei, et al.
Pubblicazione: (2025)
di: She, Yifei, et al.
Pubblicazione: (2025)
ICM-Assistant: Instruction-tuning Multimodal Large Language Models for Rule-based Explainable Image Content Moderation
di: Wu, Mengyang, et al.
Pubblicazione: (2024)
di: Wu, Mengyang, et al.
Pubblicazione: (2024)
Solution for 10th Competition on Ambivalence/Hesitancy (AH) Video Recognition Challenge using Divergence-Based Multimodal Fusion
di: Souza, Aislan Gabriel O., et al.
Pubblicazione: (2026)
di: Souza, Aislan Gabriel O., et al.
Pubblicazione: (2026)
Conflict-Aware Multimodal Fusion for Ambivalence and Hesitancy Recognition
di: Bekhouche, Salah Eddine, et al.
Pubblicazione: (2026)
di: Bekhouche, Salah Eddine, et al.
Pubblicazione: (2026)
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
TEMSET-24K: Densely Annotated Dataset for Indexing Multipart Endoscopic Videos using Surgical Timeline Segmentation
di: Bilal, Muhammad, et al.
Pubblicazione: (2025)
di: Bilal, Muhammad, et al.
Pubblicazione: (2025)
Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model
di: AlJunaid, Reem, et al.
Pubblicazione: (2025)
di: AlJunaid, Reem, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Smart Sampling: Self-Attention and Bootstrapping for Improved Ensembled Q-Learning
di: Khan, Muhammad Junaid, et al.
Pubblicazione: (2024) -
SC-Phi2: A Fine-tuned Small Language Model for StarCraft II Macromanagement Tasks
di: Khan, Muhammad Junaid, et al.
Pubblicazione: (2024) -
Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification
di: Awan, Mahrukh, et al.
Pubblicazione: (2024) -
Visual Episodic Memory-based Exploration
di: Vice, Jack, et al.
Pubblicazione: (2024) -
Probing Multimodal Fusion in the Brain: The Dominance of Audiovisual Streams in Naturalistic Encoding
di: Abdollahi, Hamid, et al.
Pubblicazione: (2025)