Xiaoice: Training-Free Video Understanding via Self-Supervised Spatio-Temporal Clustering of Semantic Features
Fuente:
arXiv
Salvato in:
| Autori principali: | Ji, Shihao, Song, Zihui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
di: Zhao, Zihui, et al.
Pubblicazione: (2025)
di: Zhao, Zihui, et al.
Pubblicazione: (2025)
S3Editor: A Sparse Semantic-Disentangled Self-Training Framework for Face Video Editing
di: Wang, Guangzhi, et al.
Pubblicazione: (2024)
di: Wang, Guangzhi, et al.
Pubblicazione: (2024)
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
di: Hyun, Jeongseok, et al.
Pubblicazione: (2025)
di: Hyun, Jeongseok, et al.
Pubblicazione: (2025)
STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing
di: Lee, Junsung, et al.
Pubblicazione: (2025)
di: Lee, Junsung, et al.
Pubblicazione: (2025)
Spatio-Temporal Side Tuning Pre-trained Foundation Models for Video-based Pedestrian Attribute Recognition
di: Wang, Xiao, et al.
Pubblicazione: (2024)
di: Wang, Xiao, et al.
Pubblicazione: (2024)
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
di: Chetan, Aditya, et al.
Pubblicazione: (2026)
di: Chetan, Aditya, et al.
Pubblicazione: (2026)
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
di: Fu, Honghao, et al.
Pubblicazione: (2026)
di: Fu, Honghao, et al.
Pubblicazione: (2026)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
VITED: Video Temporal Evidence Distillation
di: Lu, Yujie, et al.
Pubblicazione: (2025)
di: Lu, Yujie, et al.
Pubblicazione: (2025)
Weakly Supervised Video Anomaly Detection and Localization with Spatio-Temporal Prompts
di: Wu, Peng, et al.
Pubblicazione: (2024)
di: Wu, Peng, et al.
Pubblicazione: (2024)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
di: Lee, Daeun, et al.
Pubblicazione: (2025)
di: Lee, Daeun, et al.
Pubblicazione: (2025)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
di: Li, Shicheng, et al.
Pubblicazione: (2023)
di: Li, Shicheng, et al.
Pubblicazione: (2023)
FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding
di: Cao, Zhuo, et al.
Pubblicazione: (2024)
di: Cao, Zhuo, et al.
Pubblicazione: (2024)
Adaptive Greedy Frame Selection for Long Video Understanding
di: Huang, Yuning, et al.
Pubblicazione: (2026)
di: Huang, Yuning, et al.
Pubblicazione: (2026)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
di: Wang, Ye, et al.
Pubblicazione: (2025)
di: Wang, Ye, et al.
Pubblicazione: (2025)
Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better
di: Wang, Dianyi, et al.
Pubblicazione: (2025)
di: Wang, Dianyi, et al.
Pubblicazione: (2025)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
di: Wang, Shihao, et al.
Pubblicazione: (2025)
di: Wang, Shihao, et al.
Pubblicazione: (2025)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
di: Hong, Jixiang, et al.
Pubblicazione: (2025)
di: Hong, Jixiang, et al.
Pubblicazione: (2025)
PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection
di: Bi, Jinhe, et al.
Pubblicazione: (2025)
di: Bi, Jinhe, et al.
Pubblicazione: (2025)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
di: Cai, Mu, et al.
Pubblicazione: (2024)
di: Cai, Mu, et al.
Pubblicazione: (2024)
S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation
di: Xie, Yichen, et al.
Pubblicazione: (2025)
di: Xie, Yichen, et al.
Pubblicazione: (2025)
Clustering via Self-Supervised Diffusion
di: Uziel, Roy, et al.
Pubblicazione: (2025)
di: Uziel, Roy, et al.
Pubblicazione: (2025)
VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction
di: Wang, Hao, et al.
Pubblicazione: (2025)
di: Wang, Hao, et al.
Pubblicazione: (2025)
Semantic Matters: Multimodal Features for Affective Analysis
di: Hallmen, Tobias, et al.
Pubblicazione: (2025)
di: Hallmen, Tobias, et al.
Pubblicazione: (2025)
Self-Supervised Learning Based Handwriting Verification
di: Chauhan, Mihir, et al.
Pubblicazione: (2024)
di: Chauhan, Mihir, et al.
Pubblicazione: (2024)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
FILS: Self-Supervised Video Feature Prediction In Semantic Language Space
di: Ahmadian, Mona, et al.
Pubblicazione: (2024)
di: Ahmadian, Mona, et al.
Pubblicazione: (2024)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
di: Feng, Weixi, et al.
Pubblicazione: (2024)
di: Feng, Weixi, et al.
Pubblicazione: (2024)
MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
Learning Spatio-Temporal Feature Representations for Video-Based Gaze Estimation
di: Personnic, Alexandre, et al.
Pubblicazione: (2025)
di: Personnic, Alexandre, et al.
Pubblicazione: (2025)
APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention
di: Huang, Yuxiang, et al.
Pubblicazione: (2026)
di: Huang, Yuxiang, et al.
Pubblicazione: (2026)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding
di: Wu, Chang-Hsun, et al.
Pubblicazione: (2025)
di: Wu, Chang-Hsun, et al.
Pubblicazione: (2025)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
di: Li, Jialu, et al.
Pubblicazione: (2025)
di: Li, Jialu, et al.
Pubblicazione: (2025)
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
di: Lee, Dohun, et al.
Pubblicazione: (2025)
di: Lee, Dohun, et al.
Pubblicazione: (2025)
Temporal Preference Optimization for Long-Form Video Understanding
di: Li, Rui, et al.
Pubblicazione: (2025)
di: Li, Rui, et al.
Pubblicazione: (2025)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
di: Zhang, Xiaoyi, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
di: Zhao, Zihui, et al.
Pubblicazione: (2025) -
S3Editor: A Sparse Semantic-Disentangled Self-Training Framework for Face Video Editing
di: Wang, Guangzhi, et al.
Pubblicazione: (2024) -
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
di: Hyun, Jeongseok, et al.
Pubblicazione: (2025) -
STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing
di: Lee, Junsung, et al.
Pubblicazione: (2025) -
Spatio-Temporal Side Tuning Pre-trained Foundation Models for Video-based Pedestrian Attribute Recognition
di: Wang, Xiao, et al.
Pubblicazione: (2024)