Layer-Aware Video Composition via Split-then-Merge
Fuente:
arXiv
Guardado en:
| Autores principales: | Kara, Ozgur, Chen, Yujia, Yang, Ming-Hsuan, Rehg, James M., Chu, Wen-Sheng, Tran, Du |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DiffEye: Diffusion-Based Continuous Eye-Tracking Data Generation Conditioned on Natural Images
por: Kara, Ozgur, et al.
Publicado: (2025)
por: Kara, Ozgur, et al.
Publicado: (2025)
Immune2V: Image Immunization Against Dual-Stream Image-to-Video Generation
por: Long, Zeqian, et al.
Publicado: (2026)
por: Long, Zeqian, et al.
Publicado: (2026)
SEAL: Semantic Attention Learning for Long Video Representation
por: Wang, Lan, et al.
Publicado: (2024)
por: Wang, Lan, et al.
Publicado: (2024)
ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models
por: Kara, Ozgur, et al.
Publicado: (2025)
por: Kara, Ozgur, et al.
Publicado: (2025)
FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning
por: Lyu, Weijie, et al.
Publicado: (2026)
por: Lyu, Weijie, et al.
Publicado: (2026)
DiffVax: Optimization-Free Image Immunization Against Diffusion-Based Editing
por: Ozden, Tarik Can, et al.
Publicado: (2024)
por: Ozden, Tarik Can, et al.
Publicado: (2024)
ToSA: Token Merging with Spatial Awareness
por: Huang, Hsiang-Wei, et al.
Publicado: (2025)
por: Huang, Hsiang-Wei, et al.
Publicado: (2025)
DreamScene4D: Dynamic Multi-Object Scene Generation from Monocular Videos
por: Chu, Wen-Hsuan, et al.
Publicado: (2024)
por: Chu, Wen-Hsuan, et al.
Publicado: (2024)
Streaming Autoregressive Video Generation via Diagonal Distillation
por: Liu, Jinxiu, et al.
Publicado: (2026)
por: Liu, Jinxiu, et al.
Publicado: (2026)
Split to Merge: Unifying Separated Modalities for Unsupervised Domain Adaptation
por: Li, Xinyao, et al.
Publicado: (2024)
por: Li, Xinyao, et al.
Publicado: (2024)
Leveraging Object Priors for Point Tracking
por: Boote, Bikram, et al.
Publicado: (2024)
por: Boote, Bikram, et al.
Publicado: (2024)
Unified Dense Prediction of Video Diffusion
por: Yang, Lehan, et al.
Publicado: (2025)
por: Yang, Lehan, et al.
Publicado: (2025)
Token Merging via Spatiotemporal Information Mining for Surgical Video Understanding
por: Jiang, Xixi, et al.
Publicado: (2025)
por: Jiang, Xixi, et al.
Publicado: (2025)
How Much 3D Do Video Foundation Models Encode?
por: Huang, Zixuan, et al.
Publicado: (2025)
por: Huang, Zixuan, et al.
Publicado: (2025)
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
por: Rasheed, Hanoona, et al.
Publicado: (2025)
por: Rasheed, Hanoona, et al.
Publicado: (2025)
SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single Images
por: Huang, Zixuan, et al.
Publicado: (2025)
por: Huang, Zixuan, et al.
Publicado: (2025)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
por: Wu, Hang, et al.
Publicado: (2026)
por: Wu, Hang, et al.
Publicado: (2026)
From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition
por: Lo, Ling, et al.
Publicado: (2025)
por: Lo, Ling, et al.
Publicado: (2025)
LEGO: Learning EGOcentric Action Frame Generation via Visual Instruction Tuning
por: Lai, Bolin, et al.
Publicado: (2023)
por: Lai, Bolin, et al.
Publicado: (2023)
Enhancing Quantization-Aware Training on Edge Devices via Relative Entropy Coreset Selection and Cascaded Layer Correction
por: Tong, Yujia, et al.
Publicado: (2025)
por: Tong, Yujia, et al.
Publicado: (2025)
Tex4D: Zero-shot 4D Scene Texturing with Video Diffusion Models
por: Bao, Jingzhi, et al.
Publicado: (2024)
por: Bao, Jingzhi, et al.
Publicado: (2024)
Merging and Splitting Diffusion Paths for Semantically Coherent Panoramas
por: Quattrini, Fabio, et al.
Publicado: (2024)
por: Quattrini, Fabio, et al.
Publicado: (2024)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
por: Rasheed, Hanoona, et al.
Publicado: (2025)
por: Rasheed, Hanoona, et al.
Publicado: (2025)
Weakly Supervised 3D Object Detection via Multi-Level Visual Guidance
por: Huang, Kuan-Chih, et al.
Publicado: (2023)
por: Huang, Kuan-Chih, et al.
Publicado: (2023)
VideoMerge: Towards Training-free Long Video Generation
por: Zhang, Siyang, et al.
Publicado: (2025)
por: Zhang, Siyang, et al.
Publicado: (2025)
Unified Text-Image-to-Video Generation: A Training-Free Approach to Flexible Visual Conditioning
por: Lai, Bolin, et al.
Publicado: (2025)
por: Lai, Bolin, et al.
Publicado: (2025)
DynamicScaler: Seamless and Scalable Video Generation for Panoramic Scenes
por: Liu, Jinxiu, et al.
Publicado: (2024)
por: Liu, Jinxiu, et al.
Publicado: (2024)
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
por: Kim, Junho, et al.
Publicado: (2026)
por: Kim, Junho, et al.
Publicado: (2026)
MambaVideo for Discrete Video Tokenization with Channel-Split Quantization
por: Argaw, Dawit Mureja, et al.
Publicado: (2025)
por: Argaw, Dawit Mureja, et al.
Publicado: (2025)
Vinedresser3D: Agentic Text-guided 3D Editing
por: Chi, Yankuan, et al.
Publicado: (2026)
por: Chi, Yankuan, et al.
Publicado: (2026)
In the Eye of Transformer: Global-Local Correlation for Egocentric Gaze Estimation
por: Lai, Bolin, et al.
Publicado: (2022)
por: Lai, Bolin, et al.
Publicado: (2022)
Symmetry Strikes Back: From Single-Image Symmetry Detection to 3D Generation
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Cue3D: Quantifying the Role of Image Cues in Single-Image 3D Generation
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
Towards Affordance-Aware Articulation Synthesis for Rigged Objects
por: Yu, Yu-Chu, et al.
Publicado: (2025)
por: Yu, Yu-Chu, et al.
Publicado: (2025)
One-for-All: Towards Universal Domain Translation with a Single StyleGAN
por: Du, Yong, et al.
Publicado: (2023)
por: Du, Yong, et al.
Publicado: (2023)
Teaching Prompts to Coordinate: Hierarchical Layer-Grouped Prompt Tuning for Continual Learning
por: Jiang, Shengqin, et al.
Publicado: (2025)
por: Jiang, Shengqin, et al.
Publicado: (2025)
Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging
por: Fu, Zihang, et al.
Publicado: (2026)
por: Fu, Zihang, et al.
Publicado: (2026)
VSViG: Real-time Video-based Seizure Detection via Skeleton-based Spatiotemporal ViG
por: Xu, Yankun, et al.
Publicado: (2023)
por: Xu, Yankun, et al.
Publicado: (2023)
IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation
por: Lin, Yuanze, et al.
Publicado: (2025)
por: Lin, Yuanze, et al.
Publicado: (2025)
Efficient Video Object Segmentation via Modulated Cross-Attention Memory
por: Shaker, Abdelrahman, et al.
Publicado: (2024)
por: Shaker, Abdelrahman, et al.
Publicado: (2024)
Ejemplares similares
-
DiffEye: Diffusion-Based Continuous Eye-Tracking Data Generation Conditioned on Natural Images
por: Kara, Ozgur, et al.
Publicado: (2025) -
Immune2V: Image Immunization Against Dual-Stream Image-to-Video Generation
por: Long, Zeqian, et al.
Publicado: (2026) -
SEAL: Semantic Attention Learning for Long Video Representation
por: Wang, Lan, et al.
Publicado: (2024) -
ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models
por: Kara, Ozgur, et al.
Publicado: (2025) -
FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning
por: Lyu, Weijie, et al.
Publicado: (2026)