EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Meng, Rang, Wu, Weipeng, Li, Yuming, Ma, Chenguang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human Animation
di: Meng, Rang, et al.
Pubblicazione: (2025)
di: Meng, Rang, et al.
Pubblicazione: (2025)
EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human Animation
di: Meng, Rang, et al.
Pubblicazione: (2024)
di: Meng, Rang, et al.
Pubblicazione: (2024)
EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions
di: Chen, Zhiyuan, et al.
Pubblicazione: (2024)
di: Chen, Zhiyuan, et al.
Pubblicazione: (2024)
SwiftTry: Fast and Consistent Video Virtual Try-On with Diffusion Models
di: Nguyen, Hung, et al.
Pubblicazione: (2024)
di: Nguyen, Hung, et al.
Pubblicazione: (2024)
EchoShot: Multi-Shot Portrait Video Generation
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
Efficient Video Face Enhancement with Enhanced Spatial-Temporal Consistency
di: Wang, Yutong, et al.
Pubblicazione: (2024)
di: Wang, Yutong, et al.
Pubblicazione: (2024)
Echo-Path: Pathology-Conditioned Echo Video Generation
di: Muhammad, Kabir Hamzah, et al.
Pubblicazione: (2025)
di: Muhammad, Kabir Hamzah, et al.
Pubblicazione: (2025)
EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer
di: Yang, Yuxiao, et al.
Pubblicazione: (2025)
di: Yang, Yuxiao, et al.
Pubblicazione: (2025)
MultiModal Action Conditioned Video Generation
di: Li, Yichen, et al.
Pubblicazione: (2025)
di: Li, Yichen, et al.
Pubblicazione: (2025)
EchoFlow: A Foundation Model for Cardiac Ultrasound Image and Video Generation
di: Reynaud, Hadrien, et al.
Pubblicazione: (2025)
di: Reynaud, Hadrien, et al.
Pubblicazione: (2025)
SneakPeek: Future-Guided Instructional Streaming Video Generation
di: Hong, Cheeun, et al.
Pubblicazione: (2025)
di: Hong, Cheeun, et al.
Pubblicazione: (2025)
FlashVideo: A Framework for Swift Inference in Text-to-Video Generation
di: Lei, Bin, et al.
Pubblicazione: (2023)
di: Lei, Bin, et al.
Pubblicazione: (2023)
BiSwift: Bandwidth Orchestrator for Multi-Stream Video Analytics on Edge
di: Sun, Lin, et al.
Pubblicazione: (2023)
di: Sun, Lin, et al.
Pubblicazione: (2023)
ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
di: Luo, Yawen, et al.
Pubblicazione: (2026)
di: Luo, Yawen, et al.
Pubblicazione: (2026)
StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
di: Wang, Yifei, et al.
Pubblicazione: (2025)
di: Wang, Yifei, et al.
Pubblicazione: (2025)
Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation
di: Wu, Mingqiang, et al.
Pubblicazione: (2026)
di: Wu, Mingqiang, et al.
Pubblicazione: (2026)
EchoNet-Synthetic: Privacy-preserving Video Generation for Safe Medical Data Sharing
di: Reynaud, Hadrien, et al.
Pubblicazione: (2024)
di: Reynaud, Hadrien, et al.
Pubblicazione: (2024)
SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment
di: Sun, Yanxiao, et al.
Pubblicazione: (2025)
di: Sun, Yanxiao, et al.
Pubblicazione: (2025)
Stream-T1: Test-Time Scaling for Streaming Video Generation
di: Tu, Yijing, et al.
Pubblicazione: (2026)
di: Tu, Yijing, et al.
Pubblicazione: (2026)
EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion
di: Wei, Jiangchuan, et al.
Pubblicazione: (2025)
di: Wei, Jiangchuan, et al.
Pubblicazione: (2025)
InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution
di: Zhang, Ziqing, et al.
Pubblicazione: (2025)
di: Zhang, Ziqing, et al.
Pubblicazione: (2025)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding
di: Yang, Haolin, et al.
Pubblicazione: (2025)
di: Yang, Haolin, et al.
Pubblicazione: (2025)
EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs
di: Li, Jiameng, et al.
Pubblicazione: (2026)
di: Li, Jiameng, et al.
Pubblicazione: (2026)
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
di: Wu, Bin, et al.
Pubblicazione: (2026)
di: Wu, Bin, et al.
Pubblicazione: (2026)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
di: Zhao, Lin, et al.
Pubblicazione: (2026)
di: Zhao, Lin, et al.
Pubblicazione: (2026)
MAVEN A Multi-Agent Framework for Multicultural Text-to-Video Generation
di: Li, Shuowei, et al.
Pubblicazione: (2026)
di: Li, Shuowei, et al.
Pubblicazione: (2026)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
di: Li, Liyang, et al.
Pubblicazione: (2026)
di: Li, Liyang, et al.
Pubblicazione: (2026)
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
di: Li, Bingxuan, et al.
Pubblicazione: (2025)
di: Li, Bingxuan, et al.
Pubblicazione: (2025)
On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection
di: Song, Xiufeng, et al.
Pubblicazione: (2024)
di: Song, Xiufeng, et al.
Pubblicazione: (2024)
EchoingECG: An Electrocardiogram Cross-Modal Model for Echocardiogram Tasks
di: Gao, Yuan, et al.
Pubblicazione: (2025)
di: Gao, Yuan, et al.
Pubblicazione: (2025)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
di: Bai, Purui, et al.
Pubblicazione: (2026)
di: Bai, Purui, et al.
Pubblicazione: (2026)
Multi-Modal Generative Embedding Model
di: Ma, Feipeng, et al.
Pubblicazione: (2024)
di: Ma, Feipeng, et al.
Pubblicazione: (2024)
Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining
di: Li, Yuxuan, et al.
Pubblicazione: (2026)
di: Li, Yuxuan, et al.
Pubblicazione: (2026)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
di: Huang, Jiehui, et al.
Pubblicazione: (2025)
di: Huang, Jiehui, et al.
Pubblicazione: (2025)
SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation
di: Liu, YaoYang, et al.
Pubblicazione: (2026)
di: Liu, YaoYang, et al.
Pubblicazione: (2026)
StreamChat: Chatting with Streaming Video
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
StreamGVE: Training-Free Video Editing via Few-Step Streaming Video Generation
di: Jiao, Guanlong, et al.
Pubblicazione: (2026)
di: Jiao, Guanlong, et al.
Pubblicazione: (2026)
Audio-Sync Video Generation with Multi-Stream Temporal Control
di: Weng, Shuchen, et al.
Pubblicazione: (2025)
di: Weng, Shuchen, et al.
Pubblicazione: (2025)
Towards Explainable AI: Multi-Modal Transformer for Video-based Image Description Generation
di: Agarwal, Lakshita, et al.
Pubblicazione: (2025)
di: Agarwal, Lakshita, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human Animation
di: Meng, Rang, et al.
Pubblicazione: (2025) -
EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human Animation
di: Meng, Rang, et al.
Pubblicazione: (2024) -
EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions
di: Chen, Zhiyuan, et al.
Pubblicazione: (2024) -
SwiftTry: Fast and Consistent Video Virtual Try-On with Diffusion Models
di: Nguyen, Hung, et al.
Pubblicazione: (2024) -
EchoShot: Multi-Shot Portrait Video Generation
di: Wang, Jiahao, et al.
Pubblicazione: (2025)