SNP-S3: Shared Network Pre-training and Significant Semantic Strengthening for Various Video-Text Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Dong, Xingning, Guo, Qingpei, Gan, Tian, Wang, Qing, Wu, Jianlong, Ren, Xiangyuan, Cheng, Yuan, Chu, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Knowledge-enhanced Multi-perspective Video Representation Learning for Scene Recognition
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
di: Jiang, Chen, et al.
Pubblicazione: (2023)
di: Jiang, Chen, et al.
Pubblicazione: (2023)
RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training
di: Ding, Muhe, et al.
Pubblicazione: (2024)
di: Ding, Muhe, et al.
Pubblicazione: (2024)
Multimodal Emotion Recognition by Fusing Video Semantic in MOOC Learning Scenarios
di: Zhang, Yuan, et al.
Pubblicazione: (2024)
di: Zhang, Yuan, et al.
Pubblicazione: (2024)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
di: Wang, Yuyue, et al.
Pubblicazione: (2025)
di: Wang, Yuyue, et al.
Pubblicazione: (2025)
SHE-Net: Syntax-Hierarchy-Enhanced Text-Video Retrieval
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
SMC++: Masked Learning of Unsupervised Video Semantic Compression
di: Tian, Yuan, et al.
Pubblicazione: (2024)
di: Tian, Yuan, et al.
Pubblicazione: (2024)
Exploring Transferability of Multimodal Adversarial Samples for Vision-Language Pre-training Models with Contrastive Learning
di: Wang, Youze, et al.
Pubblicazione: (2023)
di: Wang, Youze, et al.
Pubblicazione: (2023)
TimeLogic Challenge @ CVPR 2026: Strong MLLMs Meet Evidence-Seeking Agents for Temporal-Logic Video Question Answering
di: Xu, Zhaoyang, et al.
Pubblicazione: (2026)
di: Xu, Zhaoyang, et al.
Pubblicazione: (2026)
FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding
di: He, Xusheng, et al.
Pubblicazione: (2025)
di: He, Xusheng, et al.
Pubblicazione: (2025)
Improving Text-guided Object Inpainting with Semantic Pre-inpainting
di: Chen, Yifu, et al.
Pubblicazione: (2024)
di: Chen, Yifu, et al.
Pubblicazione: (2024)
Reinforcing Pre-trained Models Using Counterfactual Images
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
T2VTree: User-Centered Visual Analytics for Agent-Assisted Thought-to-Video Authoring
di: Zheng, Zhuoyun, et al.
Pubblicazione: (2026)
di: Zheng, Zhuoyun, et al.
Pubblicazione: (2026)
Divide and Conquer: Multimodal Video Deepfake Detection via Cross-Modal Fusion and Localization
di: Li, Qingcao, et al.
Pubblicazione: (2026)
di: Li, Qingcao, et al.
Pubblicazione: (2026)
Learning Shared Sentiment Prototypes for Adaptive Multimodal Sentiment Analysis
di: Su, Chen, et al.
Pubblicazione: (2026)
di: Su, Chen, et al.
Pubblicazione: (2026)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Mitigating Shared-Private Branch Imbalance via Dual-Branch Rebalancing for Multimodal Sentiment Analysis
di: Meng, Chunlei, et al.
Pubblicazione: (2026)
di: Meng, Chunlei, et al.
Pubblicazione: (2026)
Task Presentation and Human Perception in Interactive Video Retrieval
di: Willis, Nina, et al.
Pubblicazione: (2024)
di: Willis, Nina, et al.
Pubblicazione: (2024)
Integrated Semantic and Temporal Alignment for Interactive Video Retrieval
di: Luu, Thanh-Danh, et al.
Pubblicazione: (2025)
di: Luu, Thanh-Danh, et al.
Pubblicazione: (2025)
Towards Unified Representation of Multi-Modal Pre-training for 3D Understanding via Differentiable Rendering
di: Fei, Ben, et al.
Pubblicazione: (2024)
di: Fei, Ben, et al.
Pubblicazione: (2024)
TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
BERT-like Pre-training for Symbolic Piano Music Classification Tasks
di: Chou, Yi-Hui, et al.
Pubblicazione: (2021)
di: Chou, Yi-Hui, et al.
Pubblicazione: (2021)
Contextual Wireless Video Semantic Communication in MIMO-OFDM Systems
di: Xie, Bingyan, et al.
Pubblicazione: (2026)
di: Xie, Bingyan, et al.
Pubblicazione: (2026)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
di: Tong, Haonan, et al.
Pubblicazione: (2024)
di: Tong, Haonan, et al.
Pubblicazione: (2024)
Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval
di: Wu, Jiaxin, et al.
Pubblicazione: (2025)
di: Wu, Jiaxin, et al.
Pubblicazione: (2025)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2025)
di: Xiao, Jian, et al.
Pubblicazione: (2025)
A Near-Raw Talking-Head Video Dataset for Various Computer Vision Tasks
di: Naderi, Babak, et al.
Pubblicazione: (2026)
di: Naderi, Babak, et al.
Pubblicazione: (2026)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
di: Ren, Yong, et al.
Pubblicazione: (2024)
di: Ren, Yong, et al.
Pubblicazione: (2024)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
A Survey of Information Disorder on Video-Sharing Platforms
di: Li, Meiyu, et al.
Pubblicazione: (2025)
di: Li, Meiyu, et al.
Pubblicazione: (2025)
Multimodal Pre-training Framework for Sequential Recommendation via Contrastive Learning
di: Zhang, Lingzi, et al.
Pubblicazione: (2023)
di: Zhang, Lingzi, et al.
Pubblicazione: (2023)
Rethinking Fusion: Disentangled Learning of Shared and Modality-Specific Information for Stance Detection
di: Xie, Zhiyu, et al.
Pubblicazione: (2026)
di: Xie, Zhiyu, et al.
Pubblicazione: (2026)
Semantic-Guided Unsupervised Video Summarization
di: Liu, Haizhou, et al.
Pubblicazione: (2026)
di: Liu, Haizhou, et al.
Pubblicazione: (2026)
Federated Multi-Task Clustering
di: Dai, Suyan, et al.
Pubblicazione: (2025)
di: Dai, Suyan, et al.
Pubblicazione: (2025)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
di: Lou, Haowei, et al.
Pubblicazione: (2024)
di: Lou, Haowei, et al.
Pubblicazione: (2024)
RETRACTION: English Writing Correction Based on Intelligent Text Semantic Analysis
di: Advances in Multimedia
Pubblicazione: (2025)
di: Advances in Multimedia
Pubblicazione: (2025)
Identity-Preserving Text-to-Video Generation by Frequency Decomposition
di: Yuan, Shenghai, et al.
Pubblicazione: (2024)
di: Yuan, Shenghai, et al.
Pubblicazione: (2024)
Scene-Text Grounding for Text-Based Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification
di: Calbucura, Nicolas, et al.
Pubblicazione: (2025)
di: Calbucura, Nicolas, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Knowledge-enhanced Multi-perspective Video Representation Learning for Scene Recognition
di: Yu, Xuzheng, et al.
Pubblicazione: (2024) -
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
di: Jiang, Chen, et al.
Pubblicazione: (2023) -
RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training
di: Ding, Muhe, et al.
Pubblicazione: (2024) -
Multimodal Emotion Recognition by Fusing Video Semantic in MOOC Learning Scenarios
di: Zhang, Yuan, et al.
Pubblicazione: (2024) -
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)