$\text{PKS}^4$:Parallel Kinematic Selective State Space Scanners for Efficient Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Lingjie, Zhang, Hailun, Wang, Xiwen, Zhao, Qijun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dehallu3D: Hallucination-Mitigated 3D Generation from Single Image via Cyclic View Consistency Refinement
di: Wang, Xiwen, et al.
Pubblicazione: (2026)
di: Wang, Xiwen, et al.
Pubblicazione: (2026)
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024)
di: Li, Kunchang, et al.
Pubblicazione: (2024)
FOCUS: Efficient Keyframe Selection for Long Video Understanding
di: Zhu, Zirui, et al.
Pubblicazione: (2025)
di: Zhu, Zirui, et al.
Pubblicazione: (2025)
LiquidTAD: Efficient Temporal Action Detection via Parallel Liquid-Inspired Temporal Relaxation
di: Sun, Zepeng, et al.
Pubblicazione: (2026)
di: Sun, Zepeng, et al.
Pubblicazione: (2026)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
di: Zhang, Yunzhu, et al.
Pubblicazione: (2025)
di: Zhang, Yunzhu, et al.
Pubblicazione: (2025)
Efficient Self-Supervised Video Hashing with Selective State Spaces
di: Wang, Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Jinpeng, et al.
Pubblicazione: (2024)
Unleashing the Power of Motion and Depth: A Selective Fusion Strategy for RGB-D Video Salient Object Detection
di: He, Jiahao, et al.
Pubblicazione: (2025)
di: He, Jiahao, et al.
Pubblicazione: (2025)
MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models
di: Liu, Jiuming, et al.
Pubblicazione: (2024)
di: Liu, Jiuming, et al.
Pubblicazione: (2024)
CamoSAM2: Motion-Appearance Induced Auto-Refining Prompts for Video Camouflaged Object Detection
di: Zhang, Xin, et al.
Pubblicazione: (2025)
di: Zhang, Xin, et al.
Pubblicazione: (2025)
Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
MambaVF: State Space Model for Efficient Video Fusion
di: Zhao, Zixiang, et al.
Pubblicazione: (2026)
di: Zhao, Zixiang, et al.
Pubblicazione: (2026)
On the Perception Bottleneck of VLMs for Chart Understanding
di: Liu, Junteng, et al.
Pubblicazione: (2025)
di: Liu, Junteng, et al.
Pubblicazione: (2025)
StreamForest: Efficient Online Video Understanding with Persistent Event Memory
di: Zeng, Xiangyu, et al.
Pubblicazione: (2025)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2025)
Mamba-based Spatio-Frequency Motion Perception for Video Camouflaged Object Detection
di: Li, Xin, et al.
Pubblicazione: (2025)
di: Li, Xin, et al.
Pubblicazione: (2025)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
di: Zou, Jialv, et al.
Pubblicazione: (2025)
di: Zou, Jialv, et al.
Pubblicazione: (2025)
Event-Anchored Frame Selection for Effective Long-Video Understanding
di: Chen, Wang, et al.
Pubblicazione: (2026)
di: Chen, Wang, et al.
Pubblicazione: (2026)
VideoMamba: Spatio-Temporal Selective State Space Model
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding
di: Chen, Wang, et al.
Pubblicazione: (2026)
di: Chen, Wang, et al.
Pubblicazione: (2026)
S3T-Former: A Purely Spike-Driven State-Space Topology Transformer for Skeleton Action Recognition
di: Zheng, Naichuan, et al.
Pubblicazione: (2026)
di: Zheng, Naichuan, et al.
Pubblicazione: (2026)
An Efficient Streaming Video Understanding Framework with Agentic Control
di: Liu, Jinming, et al.
Pubblicazione: (2026)
di: Liu, Jinming, et al.
Pubblicazione: (2026)
Selective Structured State Space for Multispectral-fused Small Target Detection
di: Zhang, Qianqian, et al.
Pubblicazione: (2025)
di: Zhang, Qianqian, et al.
Pubblicazione: (2025)
Adaptively Bypassing Vision Transformer Blocks for Efficient Visual Tracking
di: Yang, Xiangyang, et al.
Pubblicazione: (2024)
di: Yang, Xiangyang, et al.
Pubblicazione: (2024)
GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding
di: Ma, Junpeng, et al.
Pubblicazione: (2026)
di: Ma, Junpeng, et al.
Pubblicazione: (2026)
Trajectory-aware Shifted State Space Models for Online Video Super-Resolution
di: Zhu, Qiang, et al.
Pubblicazione: (2025)
di: Zhu, Qiang, et al.
Pubblicazione: (2025)
M-LLM Based Video Frame Selection for Efficient Video Understanding
di: Hu, Kai, et al.
Pubblicazione: (2025)
di: Hu, Kai, et al.
Pubblicazione: (2025)
TRAM: Global Trajectory and Motion of 3D Humans from in-the-wild Videos
di: Wang, Yufu, et al.
Pubblicazione: (2024)
di: Wang, Yufu, et al.
Pubblicazione: (2024)
KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding
di: Lin, Boda, et al.
Pubblicazione: (2026)
di: Lin, Boda, et al.
Pubblicazione: (2026)
On Structured State-Space Duality
di: Hu, Jerry Yao-Chieh, et al.
Pubblicazione: (2025)
di: Hu, Jerry Yao-Chieh, et al.
Pubblicazione: (2025)
State Space Prompting via Gathering and Spreading Spatio-Temporal Information for Video Understanding
di: Zhou, Jiahuan, et al.
Pubblicazione: (2025)
di: Zhou, Jiahuan, et al.
Pubblicazione: (2025)
From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation
di: Li, Bohan, et al.
Pubblicazione: (2026)
di: Li, Bohan, et al.
Pubblicazione: (2026)
Ego4o: Egocentric Human Motion Capture and Understanding from Multi-Modal Input
di: Wang, Jian, et al.
Pubblicazione: (2025)
di: Wang, Jian, et al.
Pubblicazione: (2025)
ECMamba: Consolidating Selective State Space Model with Retinex Guidance for Efficient Multiple Exposure Correction
di: Dong, Wei, et al.
Pubblicazione: (2024)
di: Dong, Wei, et al.
Pubblicazione: (2024)
Explicit Motion Handling and Interactive Prompting for Video Camouflaged Object Detection
di: Zhang, Xin, et al.
Pubblicazione: (2024)
di: Zhang, Xin, et al.
Pubblicazione: (2024)
$\text{S}^{3}$Mamba: Arbitrary-Scale Super-Resolution via Scaleable State Space Model
di: Xia, Peizhe, et al.
Pubblicazione: (2024)
di: Xia, Peizhe, et al.
Pubblicazione: (2024)
Towards Long Video Understanding via Fine-detailed Video Story Generation
di: You, Zeng, et al.
Pubblicazione: (2024)
di: You, Zeng, et al.
Pubblicazione: (2024)
Towards Training-Free Scene Text Editing
di: Li, Yubo, et al.
Pubblicazione: (2026)
di: Li, Yubo, et al.
Pubblicazione: (2026)
Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding
di: Shi, Shuyao, et al.
Pubblicazione: (2026)
di: Shi, Shuyao, et al.
Pubblicazione: (2026)
Dynamic Patch-aware Enrichment Transformer for Occluded Person Re-Identification
di: Zhang, Xin, et al.
Pubblicazione: (2024)
di: Zhang, Xin, et al.
Pubblicazione: (2024)
Stable Part Diffusion 4D: Multi-View RGB and Kinematic Parts Video Generation
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
StereoDiff: Stereo-Diffusion Synergy for Video Depth Estimation
di: Li, Haodong, et al.
Pubblicazione: (2025)
di: Li, Haodong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Dehallu3D: Hallucination-Mitigated 3D Generation from Single Image via Cyclic View Consistency Refinement
di: Wang, Xiwen, et al.
Pubblicazione: (2026) -
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024) -
FOCUS: Efficient Keyframe Selection for Long Video Understanding
di: Zhu, Zirui, et al.
Pubblicazione: (2025) -
LiquidTAD: Efficient Temporal Action Detection via Parallel Liquid-Inspired Temporal Relaxation
di: Sun, Zepeng, et al.
Pubblicazione: (2026) -
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
di: Zhang, Yunzhu, et al.
Pubblicazione: (2025)