Enregistré dans:
| Auteurs principaux: | Denninger, Luis, Azar, Sina Mokhtarzadeh, Gall, Juergen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2504.06022 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses
par: Pallotta, Enrico, et autres
Publié: (2025)
par: Pallotta, Enrico, et autres
Publié: (2025)
SyncVP: Joint Diffusion for Synchronous Multi-Modal Video Prediction
par: Pallotta, Enrico, et autres
Publié: (2025)
par: Pallotta, Enrico, et autres
Publié: (2025)
Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization
par: Azar, Sina Mokhtarzadeh, et autres
Publié: (2025)
par: Azar, Sina Mokhtarzadeh, et autres
Publié: (2025)
Video Panels for Long Video Understanding
par: Doorenbos, Lars, et autres
Publié: (2025)
par: Doorenbos, Lars, et autres
Publié: (2025)
CamI2V: Camera-Controlled Image-to-Video Diffusion Model
par: Zheng, Guangcong, et autres
Publié: (2024)
par: Zheng, Guangcong, et autres
Publié: (2024)
StableMamba: Distillation-free Scaling of Large SSMs for Images and Videos
par: Suleman, Hamid, et autres
Publié: (2024)
par: Suleman, Hamid, et autres
Publié: (2024)
FlowNar: Scalable Streaming Narration for Long-Form Videos
par: Zhong, Zeyun, et autres
Publié: (2026)
par: Zhong, Zeyun, et autres
Publié: (2026)
Video-Panda: Parameter-efficient Alignment for Encoder-free Video-Language Models
par: Yi, Jinhui, et autres
Publié: (2024)
par: Yi, Jinhui, et autres
Publié: (2024)
RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
Enhancing Video-Based Robot Failure Detection Using Task Knowledge
par: Thoduka, Santosh, et autres
Publié: (2025)
par: Thoduka, Santosh, et autres
Publié: (2025)
LC-SLab -- An Object-based Deep Learning Framework for Large-scale Land Cover Classification from Satellite Imagery and Sparse In-situ Labels
par: Leonhardt, Johannes, et autres
Publié: (2025)
par: Leonhardt, Johannes, et autres
Publié: (2025)
Identifying Spatio-Temporal Drivers of Extreme Events
par: Eddin, Mohamad Hakam Shams, et autres
Publié: (2024)
par: Eddin, Mohamad Hakam Shams, et autres
Publié: (2024)
CamCloneMaster: Enabling Reference-based Camera Control for Video Generation
par: Luo, Yawen, et autres
Publié: (2025)
par: Luo, Yawen, et autres
Publié: (2025)
CamPVG: Camera-Controlled Panoramic Video Generation with Epipolar-Aware Diffusion
par: Ji, Chenhao, et autres
Publié: (2025)
par: Ji, Chenhao, et autres
Publié: (2025)
CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation
par: Xu, Dejia, et autres
Publié: (2024)
par: Xu, Dejia, et autres
Publié: (2024)
STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering
par: Bahrami, Emad, et autres
Publié: (2026)
par: Bahrami, Emad, et autres
Publié: (2026)
Context-aware Talking Face Video Generation
par: Xuanyuan, Meidai, et autres
Publié: (2024)
par: Xuanyuan, Meidai, et autres
Publié: (2024)
Massively Multi-Person 3D Human Motion Forecasting with Scene Context
par: Mueller, Felix B, et autres
Publié: (2024)
par: Mueller, Felix B, et autres
Publié: (2024)
Self-Intersection-Aware 3D Human Motion Generation Using an Efficient Human Sphere Proxy
par: Herrmann, Pascal, et autres
Publié: (2026)
par: Herrmann, Pascal, et autres
Publié: (2026)
ReCamMaster: Camera-Controlled Generative Rendering from A Single Video
par: Bai, Jianhong, et autres
Publié: (2025)
par: Bai, Jianhong, et autres
Publié: (2025)
RealCam: Real-Time Novel-View Video Generation with Interactive Camera Control
par: Xu, Youcan, et autres
Publié: (2026)
par: Xu, Youcan, et autres
Publié: (2026)
Using Visual Anomaly Detection for Task Execution Monitoring
par: Thoduka, Santosh, et autres
Publié: (2021)
par: Thoduka, Santosh, et autres
Publié: (2021)
Learning a Neural Association Network for Self-supervised Multi-Object Tracking
par: Li, Shuai, et autres
Publié: (2024)
par: Li, Shuai, et autres
Publié: (2024)
ADA-Track++: End-to-End Multi-Camera 3D Multi-Object Tracking with Alternating Detection and Association
par: Ding, Shuxiao, et autres
Publié: (2024)
par: Ding, Shuxiao, et autres
Publié: (2024)
Hierarchical Vector Quantization for Unsupervised Action Segmentation
par: Spurio, Federico, et autres
Publié: (2024)
par: Spurio, Federico, et autres
Publié: (2024)
OmniCam: Unified Multimodal Video Generation via Camera Control
par: Yang, Xiaoda, et autres
Publié: (2025)
par: Yang, Xiaoda, et autres
Publié: (2025)
MemCam: Memory-Augmented Camera Control for Consistent Video Generation
par: Gao, Xinhang, et autres
Publié: (2026)
par: Gao, Xinhang, et autres
Publié: (2026)
PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention
par: Chen, Yipeng, et autres
Publié: (2025)
par: Chen, Yipeng, et autres
Publié: (2025)
ReCamDriving: LiDAR-Free Camera-Controlled Novel Trajectory Video Generation
par: Li, Yaokun, et autres
Publié: (2025)
par: Li, Yaokun, et autres
Publié: (2025)
RECALL: Rehearsal-free Continual Learning for Object Classification
par: Knauer, Markus, et autres
Publié: (2022)
par: Knauer, Markus, et autres
Publié: (2022)
DeltaCam: Differential Intrinsic Camera Modeling for Video Generation
par: Mandal, Debabrata, et autres
Publié: (2026)
par: Mandal, Debabrata, et autres
Publié: (2026)
CamLit: Unified Video Diffusion with Explicit Camera and Lighting Control
par: Kuang, Zhiyi, et autres
Publié: (2026)
par: Kuang, Zhiyi, et autres
Publié: (2026)
Skeleton Motion Words for Unsupervised Skeleton-Based Temporal Action Segmentation
par: Gökay, Uzay, et autres
Publié: (2025)
par: Gökay, Uzay, et autres
Publié: (2025)
Towards Generalizing Temporal Action Segmentation to Unseen Views
par: Bahrami, Emad, et autres
Publié: (2025)
par: Bahrami, Emad, et autres
Publié: (2025)
DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation
par: Zhang, Hongfei, et autres
Publié: (2025)
par: Zhang, Hongfei, et autres
Publié: (2025)
Modular-Cam: Modular Dynamic Camera-view Video Generation with LLM
par: Pan, Zirui, et autres
Publié: (2025)
par: Pan, Zirui, et autres
Publié: (2025)
FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning
par: Lyu, Weijie, et autres
Publié: (2026)
par: Lyu, Weijie, et autres
Publié: (2026)
A Survey on Deep Learning Techniques for Action Anticipation
par: Zhong, Zeyun, et autres
Publié: (2023)
par: Zhong, Zeyun, et autres
Publié: (2023)
MV-Match: Multi-View Matching for Domain-Adaptive Identification of Plant Nutrient Deficiencies
par: Yi, Jinhui, et autres
Publié: (2024)
par: Yi, Jinhui, et autres
Publié: (2024)
A Multimodal Handover Failure Detection Dataset and Baselines
par: Thoduka, Santosh, et autres
Publié: (2024)
par: Thoduka, Santosh, et autres
Publié: (2024)
Documents similaires
-
EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses
par: Pallotta, Enrico, et autres
Publié: (2025) -
SyncVP: Joint Diffusion for Synchronous Multi-Modal Video Prediction
par: Pallotta, Enrico, et autres
Publié: (2025) -
Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization
par: Azar, Sina Mokhtarzadeh, et autres
Publié: (2025) -
Video Panels for Long Video Understanding
par: Doorenbos, Lars, et autres
Publié: (2025) -
CamI2V: Camera-Controlled Image-to-Video Diffusion Model
par: Zheng, Guangcong, et autres
Publié: (2024)