Multi-Modal Video Feature Extraction for Popularity Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Haixu, Wang, Wenning, Zheng, Haoxiang, Jiang, Penghao, Wang, Qirui, Yan, Ruiqing, Sun, Qiuzhuang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tighnari: Multi-modal Plant Species Prediction Based on Hierarchical Cross-Attention Using Graph-Based and Vision Backbone-Extracted Features
par: Liu, Haixu, et autres
Publié: (2025)
par: Liu, Haixu, et autres
Publié: (2025)
Google is all you need: Semi-Supervised Transfer Learning Strategy For Light Multimodal Multi-Task Classification Model
par: Liu, Haixu, et autres
Publié: (2025)
par: Liu, Haixu, et autres
Publié: (2025)
Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
par: Lan, Tian, et autres
Publié: (2025)
par: Lan, Tian, et autres
Publié: (2025)
nnY-Net: Swin-NeXt with Cross-Attention for 3D Medical Images Segmentation
par: Liu, Haixu, et autres
Publié: (2025)
par: Liu, Haixu, et autres
Publié: (2025)
Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks
par: Wang, Yufei, et autres
Publié: (2026)
par: Wang, Yufei, et autres
Publié: (2026)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
Tighnari v2: Mitigating Label Noise and Distribution Shift in Multimodal Plant Distribution Prediction via Mixture of Experts and Weakly Supervised Learning
par: Liu, Haixu, et autres
Publié: (2026)
par: Liu, Haixu, et autres
Publié: (2026)
MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding
par: Zhu, Zhiyi, et autres
Publié: (2025)
par: Zhu, Zhiyi, et autres
Publié: (2025)
DA-STGCN: 4D Trajectory Prediction Based on Spatiotemporal Feature Extraction
par: Kuang, Yuheng, et autres
Publié: (2025)
par: Kuang, Yuheng, et autres
Publié: (2025)
Benefits of Feature Extraction and Temporal Sequence Analysis for Video Frame Prediction: An Evaluation of Hybrid Deep Learning Models
par: Velázquez, Jose M. Sánchez, et autres
Publié: (2025)
par: Velázquez, Jose M. Sánchez, et autres
Publié: (2025)
Multi-Modal Character Localization and Extraction for Chinese Text Recognition
par: Li, Qilong, et autres
Publié: (2026)
par: Li, Qilong, et autres
Publié: (2026)
Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model
par: Yang, Yang, et autres
Publié: (2025)
par: Yang, Yang, et autres
Publié: (2025)
TSP-OCS: A Time-Series Prediction for Optimal Camera Selection in Multi-Viewpoint Surgical Video Analysis
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
par: Zheng, Yuze, et autres
Publié: (2024)
par: Zheng, Yuze, et autres
Publié: (2024)
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction
par: Ji, Longbin, et autres
Publié: (2026)
par: Ji, Longbin, et autres
Publié: (2026)
Multi-Prompt with Depth Partitioned Cross-Modal Learning
par: Tian, Yingjie, et autres
Publié: (2023)
par: Tian, Yingjie, et autres
Publié: (2023)
Knowledge-Refined Dual Context-Aware Network for Partially Relevant Video Retrieval
par: Yang, Junkai, et autres
Publié: (2026)
par: Yang, Junkai, et autres
Publié: (2026)
Multi-Focused Video Group Activities Hashing
par: Qi, Zhongmiao, et autres
Publié: (2025)
par: Qi, Zhongmiao, et autres
Publié: (2025)
Automated Lane Change Behavior Prediction and Environmental Perception Based on SLAM Technology
par: Lei, Han, et autres
Publié: (2024)
par: Lei, Han, et autres
Publié: (2024)
All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
par: Zhang, Chunhui, et autres
Publié: (2023)
par: Zhang, Chunhui, et autres
Publié: (2023)
H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving
par: Chen, Siran, et autres
Publié: (2025)
par: Chen, Siran, et autres
Publié: (2025)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
par: Tian, Shulin, et autres
Publié: (2025)
par: Tian, Shulin, et autres
Publié: (2025)
CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration
par: Liu, Xuecong, et autres
Publié: (2026)
par: Liu, Xuecong, et autres
Publié: (2026)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
par: Zou, Heqing, et autres
Publié: (2024)
par: Zou, Heqing, et autres
Publié: (2024)
Multi-Modal Feature Fusion for Spatial Morphology Analysis of Traditional Villages via Hierarchical Graph Neural Networks
par: Zhang, Jiaxin, et autres
Publié: (2025)
par: Zhang, Jiaxin, et autres
Publié: (2025)
Learnable Expansion of Graph Operators for Multi-Modal Feature Fusion
par: Ding, Dexuan, et autres
Publié: (2024)
par: Ding, Dexuan, et autres
Publié: (2024)
CTA-Net: A CNN-Transformer Aggregation Network for Improving Multi-Scale Feature Extraction
par: Meng, Chunlei, et autres
Publié: (2024)
par: Meng, Chunlei, et autres
Publié: (2024)
GFE-Mamba: Mamba-based AD Multi-modal Progression Assessment via Generative Feature Extraction from MCI
par: Fang, Zhaojie, et autres
Publié: (2024)
par: Fang, Zhaojie, et autres
Publié: (2024)
ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdom
par: Zhou, Jingqi, et autres
Publié: (2024)
par: Zhou, Jingqi, et autres
Publié: (2024)
Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise
par: Geng, Zibin, et autres
Publié: (2026)
par: Geng, Zibin, et autres
Publié: (2026)
MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection
par: Zhao, Xiran, et autres
Publié: (2026)
par: Zhao, Xiran, et autres
Publié: (2026)
Audio-Sync Video Generation with Multi-Stream Temporal Control
par: Weng, Shuchen, et autres
Publié: (2025)
par: Weng, Shuchen, et autres
Publié: (2025)
A Unified Model for Longitudinal Multi-Modal Multi-View Prediction with Missingness
par: Chen, Boqi, et autres
Publié: (2024)
par: Chen, Boqi, et autres
Publié: (2024)
Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality
par: Chen, Sishuo, et autres
Publié: (2024)
par: Chen, Sishuo, et autres
Publié: (2024)
MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation
par: Wang, Weimin, et autres
Publié: (2024)
par: Wang, Weimin, et autres
Publié: (2024)
Distilling Cross-Modal Knowledge via Feature Disentanglement
par: Liu, Junhong, et autres
Publié: (2025)
par: Liu, Junhong, et autres
Publié: (2025)
ViSketch-GPT: Collaborative Multi-Scale Feature Extraction for Sketch Recognition and Generation
par: Federico, Giulio, et autres
Publié: (2025)
par: Federico, Giulio, et autres
Publié: (2025)
Sherlock: Towards Multi-scene Video Abnormal Event Extraction and Localization via a Global-local Spatial-sensitive LLM
par: Ma, Junxiao, et autres
Publié: (2025)
par: Ma, Junxiao, et autres
Publié: (2025)
Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design
par: Sun, Haoxiang, et autres
Publié: (2026)
par: Sun, Haoxiang, et autres
Publié: (2026)
XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models
par: Wang, Xingrui, et autres
Publié: (2025)
par: Wang, Xingrui, et autres
Publié: (2025)
Documents similaires
-
Tighnari: Multi-modal Plant Species Prediction Based on Hierarchical Cross-Attention Using Graph-Based and Vision Backbone-Extracted Features
par: Liu, Haixu, et autres
Publié: (2025) -
Google is all you need: Semi-Supervised Transfer Learning Strategy For Light Multimodal Multi-Task Classification Model
par: Liu, Haixu, et autres
Publié: (2025) -
Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
par: Lan, Tian, et autres
Publié: (2025) -
nnY-Net: Swin-NeXt with Cross-Attention for 3D Medical Images Segmentation
par: Liu, Haixu, et autres
Publié: (2025) -
Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks
par: Wang, Yufei, et autres
Publié: (2026)