SIAM: A Simple Alternating Mixer for Video Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Xin, Peng, Ziang, Cao, Yuan, Shan, Hongming, Zhang, Junping |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Shushing! Let's Imagine an Authentic Speech from the Silent Video
par: Ye, Jiaxin, et autres
Publié: (2025)
par: Ye, Jiaxin, et autres
Publié: (2025)
MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attention
par: Zhao, Zilong, et autres
Publié: (2026)
par: Zhao, Zilong, et autres
Publié: (2026)
Modality-Aware and Shift Mixer for Multi-modal Brain Tumor Segmentation
par: Huang, Zhongzhen, et autres
Publié: (2024)
par: Huang, Zhongzhen, et autres
Publié: (2024)
PoM: Efficient Image and Video Generation with the Polynomial Mixer
par: Picard, David, et autres
Publié: (2024)
par: Picard, David, et autres
Publié: (2024)
FFNet: MetaMixer-based Efficient Convolutional Mixer Design
par: Yun, Seokju, et autres
Publié: (2024)
par: Yun, Seokju, et autres
Publié: (2024)
PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer
par: Picard, David, et autres
Publié: (2026)
par: Picard, David, et autres
Publié: (2026)
KAN-Mixers: a new deep learning architecture for image classification
par: Canuto, Jorge Luiz dos Santos, et autres
Publié: (2025)
par: Canuto, Jorge Luiz dos Santos, et autres
Publié: (2025)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
par: Wang, Sibo, et autres
Publié: (2024)
par: Wang, Sibo, et autres
Publié: (2024)
MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model
par: Niu, Muyao, et autres
Publié: (2024)
par: Niu, Muyao, et autres
Publié: (2024)
CausalVE: Face Video Privacy Encryption via Causal Video Prediction
par: Huang, Yubo, et autres
Publié: (2024)
par: Huang, Yubo, et autres
Publié: (2024)
TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding
par: Pan, Junwen, et autres
Publié: (2025)
par: Pan, Junwen, et autres
Publié: (2025)
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
par: Zheng, Yikai, et autres
Publié: (2026)
par: Zheng, Yikai, et autres
Publié: (2026)
Ivy-Fake: A Unified Explainable Framework and Benchmark for Image and Video AIGC Detection
par: Jiang, Changjiang, et autres
Publié: (2025)
par: Jiang, Changjiang, et autres
Publié: (2025)
Realism Control One-step Diffusion for Real-World Image Super-Resolution
par: Wu, Zongliang, et autres
Publié: (2025)
par: Wu, Zongliang, et autres
Publié: (2025)
TrajMamba: An Ego-Motion-Guided Mamba Model for Pedestrian Trajectory Prediction from an Egocentric Perspective
par: Peng, Yusheng, et autres
Publié: (2026)
par: Peng, Yusheng, et autres
Publié: (2026)
Rethinking Video Human-Object Interaction: Set Prediction over Time for Unified Detection and Anticipation
par: Luo, Yuanhao, et autres
Publié: (2026)
par: Luo, Yuanhao, et autres
Publié: (2026)
Progressive Image Restoration via Text-Conditioned Video Generation
par: Kang, Peng, et autres
Publié: (2025)
par: Kang, Peng, et autres
Publié: (2025)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
par: Yang, Cheng, et autres
Publié: (2025)
par: Yang, Cheng, et autres
Publié: (2025)
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
par: Bian, Yuxuan, et autres
Publié: (2025)
par: Bian, Yuxuan, et autres
Publié: (2025)
VideoMAR: Autoregressive Video Generatio with Continuous Tokens
par: Yu, Hu, et autres
Publié: (2025)
par: Yu, Hu, et autres
Publié: (2025)
DepMamba: Progressive Fusion Mamba for Multimodal Depression Detection
par: Ye, Jiaxin, et autres
Publié: (2024)
par: Ye, Jiaxin, et autres
Publié: (2024)
Towards Video Anomaly Retrieval from Video Anomaly Detection: New Benchmarks and Model
par: Wu, Peng, et autres
Publié: (2023)
par: Wu, Peng, et autres
Publié: (2023)
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
par: Yan, Bei, et autres
Publié: (2024)
par: Yan, Bei, et autres
Publié: (2024)
SeqTex: Generate Mesh Textures in Video Sequence
par: Yuan, Ze, et autres
Publié: (2025)
par: Yuan, Ze, et autres
Publié: (2025)
Efficient Video Diffusion with Sparse Information Transmission for Video Compression
par: Zhou, Mingde, et autres
Publié: (2026)
par: Zhou, Mingde, et autres
Publié: (2026)
IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models
par: Chen, Zhihao, et autres
Publié: (2023)
par: Chen, Zhihao, et autres
Publié: (2023)
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
par: Yang, Junqi, et autres
Publié: (2026)
par: Yang, Junqi, et autres
Publié: (2026)
Segment Anything for Videos: A Systematic Survey
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
UniSino: Physics-Driven Foundational Model for Universal CT Sinogram Standardization
par: Ai, Xingyu, et autres
Publié: (2025)
par: Ai, Xingyu, et autres
Publié: (2025)
A Simple Background Augmentation Method for Object Detection with Diffusion Model
par: Li, Yuhang, et autres
Publié: (2024)
par: Li, Yuhang, et autres
Publié: (2024)
CutDiffusion: A Simple, Fast, Cheap, and Strong Diffusion Extrapolation Method
par: Lin, Mingbao, et autres
Publié: (2024)
par: Lin, Mingbao, et autres
Publié: (2024)
Deep Learning for Video Anomaly Detection: A Review
par: Wu, Peng, et autres
Publié: (2024)
par: Wu, Peng, et autres
Publié: (2024)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
par: Tian, Shulin, et autres
Publié: (2025)
par: Tian, Shulin, et autres
Publié: (2025)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos
par: Fu, Hongming, et autres
Publié: (2026)
par: Fu, Hongming, et autres
Publié: (2026)
A Simple Aerial Detection Baseline of Multimodal Language Models
par: Li, Qingyun, et autres
Publié: (2025)
par: Li, Qingyun, et autres
Publié: (2025)
Point, Segment and Count: A Generalized Framework for Object Counting
par: Huang, Zhizhong, et autres
Publié: (2023)
par: Huang, Zhizhong, et autres
Publié: (2023)
VideoGuard: Protecting Video Content from Unauthorized Editing
par: Cao, Junjie, et autres
Publié: (2025)
par: Cao, Junjie, et autres
Publié: (2025)
BEVTrack: A Simple and Strong Baseline for 3D Single Object Tracking in Bird's-Eye View
par: Yang, Yuxiang, et autres
Publié: (2023)
par: Yang, Yuxiang, et autres
Publié: (2023)
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
par: Yuan, Liping, et autres
Publié: (2025)
par: Yuan, Liping, et autres
Publié: (2025)
Documents similaires
-
Shushing! Let's Imagine an Authentic Speech from the Silent Video
par: Ye, Jiaxin, et autres
Publié: (2025) -
MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attention
par: Zhao, Zilong, et autres
Publié: (2026) -
Modality-Aware and Shift Mixer for Multi-modal Brain Tumor Segmentation
par: Huang, Zhongzhen, et autres
Publié: (2024) -
PoM: Efficient Image and Video Generation with the Polynomial Mixer
par: Picard, David, et autres
Publié: (2024) -
FFNet: MetaMixer-based Efficient Convolutional Mixer Design
par: Yun, Seokju, et autres
Publié: (2024)