ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Bingjun, Wang, Tony, Chen, Chaoqi, Ding, Xinpeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
par: Luo, Bingjun, et autres
Publié: (2026)
par: Luo, Bingjun, et autres
Publié: (2026)
SimDiff: Depth Pruning via Similarity and Difference
par: Chen, Yuli, et autres
Publié: (2026)
par: Chen, Yuli, et autres
Publié: (2026)
SimDiff: Simulator-constrained Diffusion Model for Physically Plausible Motion Generation
par: Watanabe, Akihisa, et autres
Publié: (2025)
par: Watanabe, Akihisa, et autres
Publié: (2025)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
par: Lin, Junming, et autres
Publié: (2024)
par: Lin, Junming, et autres
Publié: (2024)
HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks
par: Zhou, Ting, et autres
Publié: (2024)
par: Zhou, Ting, et autres
Publié: (2024)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
par: Cai, Yuxuan, et autres
Publié: (2025)
par: Cai, Yuxuan, et autres
Publié: (2025)
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
par: Huang, Zhe, et autres
Publié: (2025)
par: Huang, Zhe, et autres
Publié: (2025)
ID-Sim: An Identity-Focused Similarity Metric
par: Chae, Julia, et autres
Publié: (2026)
par: Chae, Julia, et autres
Publié: (2026)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
par: Zeng, Xiangyu, et autres
Publié: (2024)
par: Zeng, Xiangyu, et autres
Publié: (2024)
LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?
par: Yu, Zhuang, et autres
Publié: (2026)
par: Yu, Zhuang, et autres
Publié: (2026)
Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis
par: Fadaei, Amir Hosein, et autres
Publié: (2025)
par: Fadaei, Amir Hosein, et autres
Publié: (2025)
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
par: Zhang, Qizhe, et autres
Publié: (2025)
par: Zhang, Qizhe, et autres
Publié: (2025)
Data-Efficient Meningioma Segmentation via Implicit Spatiotemporal Mixing and Sim2Real Semantic Injection
par: Xu, Yunhao, et autres
Publié: (2026)
par: Xu, Yunhao, et autres
Publié: (2026)
ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting
par: Ding, Jiayu, et autres
Publié: (2025)
par: Ding, Jiayu, et autres
Publié: (2025)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
par: Chen, Xueyi, et autres
Publié: (2025)
par: Chen, Xueyi, et autres
Publié: (2025)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
par: Liu, Xiaolin, et autres
Publié: (2026)
par: Liu, Xiaolin, et autres
Publié: (2026)
DIVE: Taming DINO for Subject-Driven Video Editing
par: Huang, Yi, et autres
Publié: (2024)
par: Huang, Yi, et autres
Publié: (2024)
Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs
par: Feng, Yigui, et autres
Publié: (2026)
par: Feng, Yigui, et autres
Publié: (2026)
From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information
par: Jiao, Qirui, et autres
Publié: (2024)
par: Jiao, Qirui, et autres
Publié: (2024)
ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs
par: Wu, Xin, et autres
Publié: (2026)
par: Wu, Xin, et autres
Publié: (2026)
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
par: Huang, Jincai, et autres
Publié: (2026)
par: Huang, Jincai, et autres
Publié: (2026)
Divide and Conquer: Object Co-occurrence Helps Mitigate Simplicity Bias in OOD Detection
par: Dai, Boyang, et autres
Publié: (2026)
par: Dai, Boyang, et autres
Publié: (2026)
KineST: A Kinematics-guided Spatiotemporal State Space Model for Human Motion Tracking from Sparse Signals
par: Zhao, Shuting, et autres
Publié: (2025)
par: Zhao, Shuting, et autres
Publié: (2025)
VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning
par: Yilmaz, Nilay, et autres
Publié: (2025)
par: Yilmaz, Nilay, et autres
Publié: (2025)
ColoDiff: Integrating Dynamic Consistency With Content Awareness for Colonoscopy Video Generation
par: Fu, Junhu, et autres
Publié: (2026)
par: Fu, Junhu, et autres
Publié: (2026)
Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person Retrieval
par: Luo, Bingjun, et autres
Publié: (2025)
par: Luo, Bingjun, et autres
Publié: (2025)
DiffSeg: A Segmentation Model for Skin Lesions Based on Diffusion Difference
par: Shuai, Zhihao, et autres
Publié: (2024)
par: Shuai, Zhihao, et autres
Publié: (2024)
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
par: Tang, Yolo Y., et autres
Publié: (2024)
par: Tang, Yolo Y., et autres
Publié: (2024)
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis
par: Menapace, Willi, et autres
Publié: (2024)
par: Menapace, Willi, et autres
Publié: (2024)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
par: Zhang, Zhihong, et autres
Publié: (2025)
par: Zhang, Zhihong, et autres
Publié: (2025)
Spatiotemporal Learning with Context-aware Video Tubelets for Ultrasound Video Analysis
par: Li, Gary Y., et autres
Publié: (2025)
par: Li, Gary Y., et autres
Publié: (2025)
M-LLM Based Video Frame Selection for Efficient Video Understanding
par: Hu, Kai, et autres
Publié: (2025)
par: Hu, Kai, et autres
Publié: (2025)
A Survey: Spatiotemporal Consistency in Video Generation
par: Yin, Zhiyu, et autres
Publié: (2025)
par: Yin, Zhiyu, et autres
Publié: (2025)
SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion
par: Chen, Xinyu, et autres
Publié: (2026)
par: Chen, Xinyu, et autres
Publié: (2026)
SimDiff: Simpler Yet Better Diffusion Model for Time Series Point Forecasting
par: Ding, Hang, et autres
Publié: (2025)
par: Ding, Hang, et autres
Publié: (2025)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
par: Jiang, Pengfei, et autres
Publié: (2025)
par: Jiang, Pengfei, et autres
Publié: (2025)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
par: Zheng, Naishan, et autres
Publié: (2025)
par: Zheng, Naishan, et autres
Publié: (2025)
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
par: Ma, Yinchao, et autres
Publié: (2026)
par: Ma, Yinchao, et autres
Publié: (2026)
Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes
par: Ling, Chen, et autres
Publié: (2026)
par: Ling, Chen, et autres
Publié: (2026)
Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives
par: Jiang, Kai, et autres
Publié: (2025)
par: Jiang, Kai, et autres
Publié: (2025)
Documents similaires
-
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
par: Luo, Bingjun, et autres
Publié: (2026) -
SimDiff: Depth Pruning via Similarity and Difference
par: Chen, Yuli, et autres
Publié: (2026) -
SimDiff: Simulator-constrained Diffusion Model for Physically Plausible Motion Generation
par: Watanabe, Akihisa, et autres
Publié: (2025) -
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
par: Lin, Junming, et autres
Publié: (2024) -
HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks
par: Zhou, Ting, et autres
Publié: (2024)