VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Aitrouga, Abdelilah, Hmamouche, Youssef, Seghrouchni, Amal El Fallah |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Strategic Deflection: Defending LLMs from Logit Manipulation
par: Rachidy, Yassine, et autres
Publié: (2025)
par: Rachidy, Yassine, et autres
Publié: (2025)
A multimodal LLM for the non-invasive decoding of spoken text from brain recordings
par: Hmamouche, Youssef, et autres
Publié: (2024)
par: Hmamouche, Youssef, et autres
Publié: (2024)
DiTraj: training-free trajectory control for video diffusion transformer
par: Lei, Cheng, et autres
Publié: (2025)
par: Lei, Cheng, et autres
Publié: (2025)
A BERT-Style Self-Supervised Learning CNN for Disease Identification from Retinal Images
par: Li, Xin, et autres
Publié: (2025)
par: Li, Xin, et autres
Publié: (2025)
Two-Stream temporal transformer for video action classification
par: Kurpukdee, Nattapong, et autres
Publié: (2026)
par: Kurpukdee, Nattapong, et autres
Publié: (2026)
EmoCAM: Toward Understanding What Drives CNN-based Emotion Recognition
par: Doulfoukar, Youssef, et autres
Publié: (2024)
par: Doulfoukar, Youssef, et autres
Publié: (2024)
Transfer Learning-based Real-time Handgun Detection
par: Elmir, Youssef
Publié: (2023)
par: Elmir, Youssef
Publié: (2023)
Reducing self-supervised learning complexity improves weakly-supervised classification performance in computational pathology
par: Lenz, Tim, et autres
Publié: (2024)
par: Lenz, Tim, et autres
Publié: (2024)
FusionVision: A comprehensive approach of 3D object reconstruction and segmentation from RGB-D cameras using YOLO and fast segment anything
par: Ghazouali, Safouane El, et autres
Publié: (2024)
par: Ghazouali, Safouane El, et autres
Publié: (2024)
Classification of systolic murmurs in heart sounds using multiresolution complex Gabor dictionary and vision transformer
par: Fakhry, Mahmoud, et autres
Publié: (2026)
par: Fakhry, Mahmoud, et autres
Publié: (2026)
SPDGAN: A Generative Adversarial Network based on SPD Manifold Learning for Automatic Image Colorization
par: Mourchid, Youssef, et autres
Publié: (2023)
par: Mourchid, Youssef, et autres
Publié: (2023)
Enhancing DeepLabV3+ to Fuse Aerial and Satellite Images for Semantic Segmentation
par: Berka, Anas, et autres
Publié: (2025)
par: Berka, Anas, et autres
Publié: (2025)
Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs
par: Zaazou, Youssef, et autres
Publié: (2026)
par: Zaazou, Youssef, et autres
Publié: (2026)
Normalization Equivariance for Arbitrary Backbones, with Application to Image Denoising
par: Saied, Youssef, et autres
Publié: (2026)
par: Saied, Youssef, et autres
Publié: (2026)
Can video generation replace cinematographers? Research on the cinematic language of generated video
par: Li, Xiaozhe, et autres
Publié: (2024)
par: Li, Xiaozhe, et autres
Publié: (2024)
Redefining cystoscopy with ai: bladder cancer diagnosis using an efficient hybrid cnn-transformer model
par: Amaouche, Meryem, et autres
Publié: (2024)
par: Amaouche, Meryem, et autres
Publié: (2024)
Eating Smart: Advancing Health Informatics with the Grounding DINO based Dietary Assistant App
par: Nossair, Abdelilah, et autres
Publié: (2024)
par: Nossair, Abdelilah, et autres
Publié: (2024)
D-STGCNT: A Dense Spatio-Temporal Graph Conv-GRU Network based on transformer for assessment of patient physical rehabilitation
par: Mourchid, Youssef, et autres
Publié: (2023)
par: Mourchid, Youssef, et autres
Publié: (2023)
Breast tumor classification based on self-supervised contrastive learning from ultrasound videos
par: Tang, Yunxin, et autres
Publié: (2024)
par: Tang, Yunxin, et autres
Publié: (2024)
Unified Attention Modeling for Efficient Free-Viewing and Visual Search via Shared Representations
par: Mohammed, Fatma Youssef, et autres
Publié: (2025)
par: Mohammed, Fatma Youssef, et autres
Publié: (2025)
Behavioral Cloning Models Reality Check for Autonomous Driving
par: Yildirim, Mustafa, et autres
Publié: (2024)
par: Yildirim, Mustafa, et autres
Publié: (2024)
CFE-PPAR: Compression-friendly encryption for privacy-preserving action recognition leveraging video transformers
par: Lin, Haiwei, et autres
Publié: (2026)
par: Lin, Haiwei, et autres
Publié: (2026)
Improving Pain Classification using Spatio-Temporal Deep Learning Approaches with Facial Expressions
par: Ridouan, Aafaf, et autres
Publié: (2025)
par: Ridouan, Aafaf, et autres
Publié: (2025)
Flow caching for autoregressive video generation
par: Ma, Yuexiao, et autres
Publié: (2026)
par: Ma, Yuexiao, et autres
Publié: (2026)
Rethinking Deep Clustering Paradigms: Self-Supervision Is All You Need
par: Shaheena, Amal, et autres
Publié: (2025)
par: Shaheena, Amal, et autres
Publié: (2025)
Multi-Modal interpretable automatic video captioning
par: Hanna-Asaad, Antoine, et autres
Publié: (2024)
par: Hanna-Asaad, Antoine, et autres
Publié: (2024)
EAGLE: Egocentric AGgregated Language-video Engine
par: Bi, Jing, et autres
Publié: (2024)
par: Bi, Jing, et autres
Publié: (2024)
RoofSeg: An edge-aware transformer-based network for end-to-end roof plane segmentation
par: You, Siyuan, et autres
Publié: (2025)
par: You, Siyuan, et autres
Publié: (2025)
Enhancing Deep Learning Model Robustness through Metamorphic Re-Training
par: Togru, Said, et autres
Publié: (2024)
par: Togru, Said, et autres
Publié: (2024)
Neural USD: An object-centric framework for iterative editing and control
par: Escontrela, Alejandro, et autres
Publié: (2025)
par: Escontrela, Alejandro, et autres
Publié: (2025)
A multi-purpose automatic editing system based on lecture semantics for remote education
par: Hu, Panwen, et autres
Publié: (2024)
par: Hu, Panwen, et autres
Publié: (2024)
Generative deep learning for foundational video translation in ultrasound
par: Tomic, Nikolina, et autres
Publié: (2025)
par: Tomic, Nikolina, et autres
Publié: (2025)
From Editor to Dense Geometry Estimator
par: Wang, JiYuan, et autres
Publié: (2025)
par: Wang, JiYuan, et autres
Publié: (2025)
Hallucination-aware intermediate representation edit in large vision-language models
par: Suo, Wei, et autres
Publié: (2026)
par: Suo, Wei, et autres
Publié: (2026)
DiaMond: Dementia Diagnosis with Multi-Modal Vision Transformers Using MRI and PET
par: Li, Yitong, et autres
Publié: (2024)
par: Li, Yitong, et autres
Publié: (2024)
A multi-scale vision transformer-based multimodal GeoAI model for mapping Arctic permafrost thaw
par: Li, Wenwen, et autres
Publié: (2025)
par: Li, Wenwen, et autres
Publié: (2025)
Auto-regressive transformation for image alignment
par: Lee, Kanggeon, et autres
Publié: (2025)
par: Lee, Kanggeon, et autres
Publié: (2025)
video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM
par: Sun, Guangzhi, et autres
Publié: (2025)
par: Sun, Guangzhi, et autres
Publié: (2025)
Study of detecting behavioral signatures within DeepFake videos
par: Miao, Qiaomu, et autres
Publié: (2022)
par: Miao, Qiaomu, et autres
Publié: (2022)
FFA Sora, video generation as fundus fluorescein angiography simulator
par: Wu, Xinyuan, et autres
Publié: (2024)
par: Wu, Xinyuan, et autres
Publié: (2024)
Documents similaires
-
Strategic Deflection: Defending LLMs from Logit Manipulation
par: Rachidy, Yassine, et autres
Publié: (2025) -
A multimodal LLM for the non-invasive decoding of spoken text from brain recordings
par: Hmamouche, Youssef, et autres
Publié: (2024) -
DiTraj: training-free trajectory control for video diffusion transformer
par: Lei, Cheng, et autres
Publié: (2025) -
A BERT-Style Self-Supervised Learning CNN for Disease Identification from Retinal Images
par: Li, Xin, et autres
Publié: (2025) -
Two-Stream temporal transformer for video action classification
par: Kurpukdee, Nattapong, et autres
Publié: (2026)