MVP: Winning Solution to SMP Challenge 2025 Video Track
Fuente:
arXiv
Guardado en:
| Autores principales: | Ye, Liliang, Zhang, Yunyao, Wu, Yafeng, Chen, Yi-Ping Phoebe, Yu, Junqing, Yang, Wei, Song, Zikai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HyperFusion: Hierarchical Multimodal Ensemble Learning for Social Media Popularity Prediction
por: Ye, Liliang, et al.
Publicado: (2025)
por: Ye, Liliang, et al.
Publicado: (2025)
Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction
por: Wang, Dali, et al.
Publicado: (2026)
por: Wang, Dali, et al.
Publicado: (2026)
OmniTrend: Content-Context Modeling for Scalable Social Popularity Prediction
por: Ye, Liliang, et al.
Publicado: (2026)
por: Ye, Liliang, et al.
Publicado: (2026)
GTATrack: Winner Solution to SoccerTrack 2025 with Deep-EIoU and Global Tracklet Association
por: Jian, Rong-Lin, et al.
Publicado: (2026)
por: Jian, Rong-Lin, et al.
Publicado: (2026)
Hypergraph-State Collaborative Reasoning for Multi-Object Tracking
por: Song, Zikai, et al.
Publicado: (2026)
por: Song, Zikai, et al.
Publicado: (2026)
SMP Challenge: An Overview and Analysis of Social Media Prediction Challenge
por: Wu, Bo, et al.
Publicado: (2024)
por: Wu, Bo, et al.
Publicado: (2024)
VQualA 2025 Challenge on Engagement Prediction for Short Videos: Methods and Results
por: Li, Dasong, et al.
Publicado: (2025)
por: Li, Dasong, et al.
Publicado: (2025)
Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge
por: Yang, Sicheng, et al.
Publicado: (2026)
por: Yang, Sicheng, et al.
Publicado: (2026)
A Sleep Monitoring System Based on Audio, Video and Depth Information
por: Chen, Lyn Chao-ling, et al.
Publicado: (2025)
por: Chen, Lyn Chao-ling, et al.
Publicado: (2025)
Autogenic Language Embedding for Coherent Point Tracking
por: Song, Zikai, et al.
Publicado: (2024)
por: Song, Zikai, et al.
Publicado: (2024)
ICME 2025 Grand Challenge on Video Super-Resolution for Video Conferencing
por: Naderi, Babak, et al.
Publicado: (2025)
por: Naderi, Babak, et al.
Publicado: (2025)
GateMOT: Q-Gated Attention for Dense Object Tracking
por: Lv, Mingjin, et al.
Publicado: (2026)
por: Lv, Mingjin, et al.
Publicado: (2026)
CurEvo: Curriculum-Guided Self-Evolution for Video Understanding
por: Zeng, Guiyi, et al.
Publicado: (2026)
por: Zeng, Guiyi, et al.
Publicado: (2026)
Failures to Surface Harmful Contents in Video Large Language Models
por: Cao, Yuxin, et al.
Publicado: (2025)
por: Cao, Yuxin, et al.
Publicado: (2025)
ICME 2025 Generalizable HDR and SDR Video Quality Measurement Grand Challenge
por: Chen, Yixu, et al.
Publicado: (2025)
por: Chen, Yixu, et al.
Publicado: (2025)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
por: Meng, Yiran, et al.
Publicado: (2025)
por: Meng, Yiran, et al.
Publicado: (2025)
Quizzard@INOVA Challenge 2025 -- Track A: Plug-and-Play Technique in Interleaved Multi-Image Model
por: Cuong, Dinh Viet, et al.
Publicado: (2025)
por: Cuong, Dinh Viet, et al.
Publicado: (2025)
AIS 2024 Challenge on Video Quality Assessment of User-Generated Content: Methods and Results
por: Conde, Marcos V., et al.
Publicado: (2024)
por: Conde, Marcos V., et al.
Publicado: (2024)
Ego3DT: Tracking Every 3D Object in Ego-centric Videos
por: Hao, Shengyu, et al.
Publicado: (2024)
por: Hao, Shengyu, et al.
Publicado: (2024)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
por: Wu, Jiaxin, et al.
Publicado: (2024)
por: Wu, Jiaxin, et al.
Publicado: (2024)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
por: Zhang, Long, et al.
Publicado: (2025)
por: Zhang, Long, et al.
Publicado: (2025)
MEGC2025: Micro-Expression Grand Challenge on Spot Then Recognize and Visual Question Answering
por: Fan, Xinqi, et al.
Publicado: (2025)
por: Fan, Xinqi, et al.
Publicado: (2025)
PolySmart @ TRECVid 2024 Medical Video Question Answering
por: Wu, Jiaxin, et al.
Publicado: (2024)
por: Wu, Jiaxin, et al.
Publicado: (2024)
LAVA: Language Driven Scalable and Versatile Traffic Video Analytics
por: Yu, Yanrui, et al.
Publicado: (2025)
por: Yu, Yanrui, et al.
Publicado: (2025)
Hybrid Local-Global Context Learning for Neural Video Compression
por: Zhai, Yongqi, et al.
Publicado: (2024)
por: Zhai, Yongqi, et al.
Publicado: (2024)
Generalized Video Anomaly Event Detection: Systematic Taxonomy and Comparison of Deep Models
por: Liu, Yang, et al.
Publicado: (2023)
por: Liu, Yang, et al.
Publicado: (2023)
VideoSTF: Stress-Testing Output Repetition in Video Large Language Models
por: Cao, Yuxin, et al.
Publicado: (2026)
por: Cao, Yuxin, et al.
Publicado: (2026)
Human Motion Video Generation: A Survey
por: Xue, Haiwei, et al.
Publicado: (2025)
por: Xue, Haiwei, et al.
Publicado: (2025)
Region-Constraint In-Context Generation for Instructional Video Editing
por: Zhang, Zhongwei, et al.
Publicado: (2025)
por: Zhang, Zhongwei, et al.
Publicado: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
por: Liang, Feng, et al.
Publicado: (2023)
por: Liang, Feng, et al.
Publicado: (2023)
Scene-Text Grounding for Text-Based Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2024)
por: Zhou, Sheng, et al.
Publicado: (2024)
VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
por: Gao, Shibo, et al.
Publicado: (2025)
por: Gao, Shibo, et al.
Publicado: (2025)
L-LBVC: Long-Term Motion Estimation and Prediction for Learned Bi-Directional Video Compression
por: Zhai, Yongqi, et al.
Publicado: (2025)
por: Zhai, Yongqi, et al.
Publicado: (2025)
Interpretable Embedding for Ad-hoc Video Search
por: Wu, Jiaxin, et al.
Publicado: (2024)
por: Wu, Jiaxin, et al.
Publicado: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
por: Qu, Mengxue, et al.
Publicado: (2024)
por: Qu, Mengxue, et al.
Publicado: (2024)
SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses
por: Tan, Chaolei, et al.
Publicado: (2024)
por: Tan, Chaolei, et al.
Publicado: (2024)
Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction
por: Li, Dong, et al.
Publicado: (2025)
por: Li, Dong, et al.
Publicado: (2025)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
por: Pramanick, Shraman, et al.
Publicado: (2025)
por: Pramanick, Shraman, et al.
Publicado: (2025)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
por: Feng, X., et al.
Publicado: (2024)
por: Feng, X., et al.
Publicado: (2024)
Context Guided Transformer Entropy Modeling for Video Compression
por: Tong, Junlong, et al.
Publicado: (2025)
por: Tong, Junlong, et al.
Publicado: (2025)
Ejemplares similares
-
HyperFusion: Hierarchical Multimodal Ensemble Learning for Social Media Popularity Prediction
por: Ye, Liliang, et al.
Publicado: (2025) -
Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction
por: Wang, Dali, et al.
Publicado: (2026) -
OmniTrend: Content-Context Modeling for Scalable Social Popularity Prediction
por: Ye, Liliang, et al.
Publicado: (2026) -
GTATrack: Winner Solution to SoccerTrack 2025 with Deep-EIoU and Global Tracklet Association
por: Jian, Rong-Lin, et al.
Publicado: (2026) -
Hypergraph-State Collaborative Reasoning for Multi-Object Tracking
por: Song, Zikai, et al.
Publicado: (2026)