CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
Fuente:
arXiv
Salvato in:
| Autori principali: | Qiao, Xiangshuo, Li, Xianxin, Qu, Xiaozhe, Zhang, Jie, Liu, Yang, Luo, Yu, Jin, Cihang, Ma, Jin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
di: Yang, Shuyu, et al.
Pubblicazione: (2024)
di: Yang, Shuyu, et al.
Pubblicazione: (2024)
Music Grounding by Short Video
di: Xin, Zijie, et al.
Pubblicazione: (2024)
di: Xin, Zijie, et al.
Pubblicazione: (2024)
LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment
di: Hao, Fangyu, et al.
Pubblicazione: (2026)
di: Hao, Fangyu, et al.
Pubblicazione: (2026)
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
di: Li, Ran, et al.
Pubblicazione: (2025)
di: Li, Ran, et al.
Pubblicazione: (2025)
MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models
di: Guo, Zile, et al.
Pubblicazione: (2026)
di: Guo, Zile, et al.
Pubblicazione: (2026)
Building and Evaluating a Realistic Virtual World for Large Scale Urban Exploration from 360° Videos
di: Takenawa, Mizuki, et al.
Pubblicazione: (2025)
di: Takenawa, Mizuki, et al.
Pubblicazione: (2025)
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
di: Liu, Shuo, et al.
Pubblicazione: (2024)
di: Liu, Shuo, et al.
Pubblicazione: (2024)
Personalized Playback Technology: How Short Video Services Create Excellent User Experience
di: Deng, Weihui, et al.
Pubblicazione: (2024)
di: Deng, Weihui, et al.
Pubblicazione: (2024)
Interpreting Multimodal Communication at Scale in Short-Form Video: Visual, Audio, and Textual Mental Health Discourse on TikTok
di: Zha, Mingyue, et al.
Pubblicazione: (2026)
di: Zha, Mingyue, et al.
Pubblicazione: (2026)
Towards Emotion Analysis in Short-form Videos: A Large-Scale Dataset and Baseline
di: Wu, Xuecheng, et al.
Pubblicazione: (2023)
di: Wu, Xuecheng, et al.
Pubblicazione: (2023)
Relationship Analysis of Image-Text Pair in SNS Posts
di: Nabeoka, Takuto, et al.
Pubblicazione: (2025)
di: Nabeoka, Takuto, et al.
Pubblicazione: (2025)
Generative Flow Networks for Personalized Multimedia Systems: A Case Study on Short Video Feeds
di: Jin, Yili, et al.
Pubblicazione: (2025)
di: Jin, Yili, et al.
Pubblicazione: (2025)
Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search
di: Xie, Zequn, et al.
Pubblicazione: (2026)
di: Xie, Zequn, et al.
Pubblicazione: (2026)
Real-Time Mobile Video Analytics for Pre-arrival Emergency Medical Services
di: Jin, Liuyi, et al.
Pubblicazione: (2025)
di: Jin, Liuyi, et al.
Pubblicazione: (2025)
A Large-scale Dataset with Behavior, Attributes, and Content of Mobile Short-video Platform
di: Shang, Yu, et al.
Pubblicazione: (2025)
di: Shang, Yu, et al.
Pubblicazione: (2025)
Probing Commonsense Reasoning Capability of Text-to-Image Generative Models via Non-visual Description
di: Pan, Mianzhi, et al.
Pubblicazione: (2023)
di: Pan, Mianzhi, et al.
Pubblicazione: (2023)
TAVGBench: Benchmarking Text to Audible-Video Generation
di: Mao, Yuxin, et al.
Pubblicazione: (2024)
di: Mao, Yuxin, et al.
Pubblicazione: (2024)
FinCall-Surprise: A Large Scale Multi-modal Benchmark for Earning Surprise Prediction
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
Semantic-Guided Unsupervised Video Summarization
di: Liu, Haizhou, et al.
Pubblicazione: (2026)
di: Liu, Haizhou, et al.
Pubblicazione: (2026)
Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval
di: Jiang, Xin, et al.
Pubblicazione: (2025)
di: Jiang, Xin, et al.
Pubblicazione: (2025)
Towards Real-world Video Face Restoration: A New Benchmark
di: Chen, Ziyan, et al.
Pubblicazione: (2024)
di: Chen, Ziyan, et al.
Pubblicazione: (2024)
Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline
di: Yang, Dingyi, et al.
Pubblicazione: (2024)
di: Yang, Dingyi, et al.
Pubblicazione: (2024)
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
di: Zhang, Han, et al.
Pubblicazione: (2025)
di: Zhang, Han, et al.
Pubblicazione: (2025)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
di: Zhao, Haochen, et al.
Pubblicazione: (2025)
di: Zhao, Haochen, et al.
Pubblicazione: (2025)
Robust Relevance Feedback for Interactive Known-Item Video Search
di: Ma, Zhixin, et al.
Pubblicazione: (2025)
di: Ma, Zhixin, et al.
Pubblicazione: (2025)
HeadsetOff: Enabling Photorealistic Video Conferencing on Economical VR Headsets
di: Jin, Yili, et al.
Pubblicazione: (2024)
di: Jin, Yili, et al.
Pubblicazione: (2024)
MaskSearch: Querying Image Masks at Scale
di: He, Dong, et al.
Pubblicazione: (2023)
di: He, Dong, et al.
Pubblicazione: (2023)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
di: Xie, Zequn, et al.
Pubblicazione: (2026)
di: Xie, Zequn, et al.
Pubblicazione: (2026)
Mining the Social Fabric: Unveiling Communities for Fake News Detection in Short Videos
di: Gong, Haisong, et al.
Pubblicazione: (2025)
di: Gong, Haisong, et al.
Pubblicazione: (2025)
Modeling the Impacts of Swipe Delay on User Quality of Experience in Short Video Streaming
di: Nguyen, Duc V., et al.
Pubblicazione: (2026)
di: Nguyen, Duc V., et al.
Pubblicazione: (2026)
Multimodal LLM-based Query Paraphrasing for Video Search
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
Feature Coding in the Era of Large Models: Dataset, Test Conditions, and Benchmark
di: Gao, Changsheng, et al.
Pubblicazione: (2024)
di: Gao, Changsheng, et al.
Pubblicazione: (2024)
ConCLVD: Controllable Chinese Landscape Video Generation via Diffusion Model
di: Liu, Dingming, et al.
Pubblicazione: (2024)
di: Liu, Dingming, et al.
Pubblicazione: (2024)
Short-Form Video Viewing Behavior Analysis and Multi-Step Viewing Time Prediction
di: Yen, Vu Thi Hai, et al.
Pubblicazione: (2026)
di: Yen, Vu Thi Hai, et al.
Pubblicazione: (2026)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
di: Li, Yaoru, et al.
Pubblicazione: (2025)
di: Li, Yaoru, et al.
Pubblicazione: (2025)
EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment
di: Gao, Lancheng, et al.
Pubblicazione: (2025)
di: Gao, Lancheng, et al.
Pubblicazione: (2025)
RFNNS: Robust Fixed Neural Network Steganography with Universal Text-to-Image Models
di: Cheng, Yu, et al.
Pubblicazione: (2025)
di: Cheng, Yu, et al.
Pubblicazione: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search
di: Xie, Zequn, et al.
Pubblicazione: (2026)
di: Xie, Zequn, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
di: Zhao, Fei, et al.
Pubblicazione: (2025) -
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
di: Yang, Shuyu, et al.
Pubblicazione: (2024) -
Music Grounding by Short Video
di: Xin, Zijie, et al.
Pubblicazione: (2024) -
LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment
di: Hao, Fangyu, et al.
Pubblicazione: (2026) -
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
di: Li, Ran, et al.
Pubblicazione: (2025)