E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Xianjie, Hu, Yiman, Wu, Liang, Hu, Ping, Zou, Yixiong, Xu, Jian, Zheng, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
por: Liu, Xianjie, et al.
Publicado: (2025)
por: Liu, Xianjie, et al.
Publicado: (2025)
Flatten Long-Range Loss Landscapes for Cross-Domain Few-Shot Learning
por: Zou, Yixiong, et al.
Publicado: (2024)
por: Zou, Yixiong, et al.
Publicado: (2024)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
por: Cai, Yuxuan, et al.
Publicado: (2025)
por: Cai, Yuxuan, et al.
Publicado: (2025)
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
por: Tong, Jintao, et al.
Publicado: (2025)
por: Tong, Jintao, et al.
Publicado: (2025)
Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding
por: Zhang, Yuanhan, et al.
Publicado: (2025)
por: Zhang, Yuanhan, et al.
Publicado: (2025)
EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs
por: He, Yuping, et al.
Publicado: (2025)
por: He, Yuping, et al.
Publicado: (2025)
PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs
por: Zhang, Zixin, et al.
Publicado: (2025)
por: Zhang, Zixin, et al.
Publicado: (2025)
STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?
por: Li, Yun, et al.
Publicado: (2025)
por: Li, Yun, et al.
Publicado: (2025)
SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
por: Tong, Jintao, et al.
Publicado: (2026)
por: Tong, Jintao, et al.
Publicado: (2026)
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
por: Liu, Yexin, et al.
Publicado: (2024)
por: Liu, Yexin, et al.
Publicado: (2024)
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
por: Zhu, Xiaorong, et al.
Publicado: (2025)
por: Zhu, Xiaorong, et al.
Publicado: (2025)
Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders
por: Fang, Bo, et al.
Publicado: (2025)
por: Fang, Bo, et al.
Publicado: (2025)
STORM: Benchmarking Visual Rating of MLLMs with a Comprehensive Ordinal Regression Dataset
por: Wang, Jinhong, et al.
Publicado: (2025)
por: Wang, Jinhong, et al.
Publicado: (2025)
Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs
por: Zhang, Gengyuan, et al.
Publicado: (2025)
por: Zhang, Gengyuan, et al.
Publicado: (2025)
MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness
por: Tang, Yolo Y., et al.
Publicado: (2025)
por: Tang, Yolo Y., et al.
Publicado: (2025)
Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs
por: Zhu, Rui, et al.
Publicado: (2026)
por: Zhu, Rui, et al.
Publicado: (2026)
MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding
por: Nie, Zhanheng, et al.
Publicado: (2025)
por: Nie, Zhanheng, et al.
Publicado: (2025)
D&M: Enriching E-commerce Videos with Sound Effects by Key Moment Detection and SFX Matching
por: Liu, Jingyu, et al.
Publicado: (2024)
por: Liu, Jingyu, et al.
Publicado: (2024)
SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
por: Ouyang, Kun, et al.
Publicado: (2025)
por: Ouyang, Kun, et al.
Publicado: (2025)
MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding
por: Wu, Junxian, et al.
Publicado: (2026)
por: Wu, Junxian, et al.
Publicado: (2026)
MLVU: Benchmarking Multi-task Long Video Understanding
por: Zhou, Junjie, et al.
Publicado: (2024)
por: Zhou, Junjie, et al.
Publicado: (2024)
MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding
por: Zhang, Daoze, et al.
Publicado: (2025)
por: Zhang, Daoze, et al.
Publicado: (2025)
X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding
por: Sun, Peiwen, et al.
Publicado: (2026)
por: Sun, Peiwen, et al.
Publicado: (2026)
Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
por: Zou, Xin, et al.
Publicado: (2025)
por: Zou, Xin, et al.
Publicado: (2025)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
por: Lin, Junming, et al.
Publicado: (2024)
por: Lin, Junming, et al.
Publicado: (2024)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
por: Wang, Youze, et al.
Publicado: (2025)
por: Wang, Youze, et al.
Publicado: (2025)
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
por: Yang, Zhenyu, et al.
Publicado: (2025)
por: Yang, Zhenyu, et al.
Publicado: (2025)
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
por: Huang, Zhe, et al.
Publicado: (2025)
por: Huang, Zhe, et al.
Publicado: (2025)
HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks
por: Zhou, Ting, et al.
Publicado: (2024)
por: Zhou, Ting, et al.
Publicado: (2024)
Benchmarking Large and Small MLLMs
por: Feng, Xuelu, et al.
Publicado: (2025)
por: Feng, Xuelu, et al.
Publicado: (2025)
M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding
por: Jiang, Juntao, et al.
Publicado: (2026)
por: Jiang, Juntao, et al.
Publicado: (2026)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
por: Lin, Jingli, et al.
Publicado: (2025)
por: Lin, Jingli, et al.
Publicado: (2025)
Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs
por: Zhang, Shan, et al.
Publicado: (2025)
por: Zhang, Shan, et al.
Publicado: (2025)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
por: Cheng, Zixu, et al.
Publicado: (2025)
por: Cheng, Zixu, et al.
Publicado: (2025)
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
por: Liu, Yuanxin, et al.
Publicado: (2025)
por: Liu, Yuanxin, et al.
Publicado: (2025)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
por: Hu, Pengfei, et al.
Publicado: (2025)
por: Hu, Pengfei, et al.
Publicado: (2025)
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation
por: Liang, Tianming, et al.
Publicado: (2025)
por: Liang, Tianming, et al.
Publicado: (2025)
Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?
por: Feng, Bo, et al.
Publicado: (2025)
por: Feng, Bo, et al.
Publicado: (2025)
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
por: Fu, Chaoyou, et al.
Publicado: (2026)
por: Fu, Chaoyou, et al.
Publicado: (2026)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
por: He, Haichen, et al.
Publicado: (2026)
por: He, Haichen, et al.
Publicado: (2026)
Ejemplares similares
-
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
por: Liu, Xianjie, et al.
Publicado: (2025) -
Flatten Long-Range Loss Landscapes for Cross-Domain Few-Shot Learning
por: Zou, Yixiong, et al.
Publicado: (2024) -
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
por: Cai, Yuxuan, et al.
Publicado: (2025) -
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
por: Tong, Jintao, et al.
Publicado: (2025) -
Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding
por: Zhang, Yuanhan, et al.
Publicado: (2025)