SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Tong, Yang, Shuya, Wang, Junyi, Bai, Long, Ren, Hongliang, Zhou, Luping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EVA: An Embodied World Model for Future Video Anticipation
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
HR-INR: Continuous Space-Time Video Super-Resolution via Event Camera
di: Lu, Yunfan, et al.
Pubblicazione: (2024)
di: Lu, Yunfan, et al.
Pubblicazione: (2024)
XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments
di: Qian, Kangan, et al.
Pubblicazione: (2026)
di: Qian, Kangan, et al.
Pubblicazione: (2026)
2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
di: Wang, Sen, et al.
Pubblicazione: (2025)
di: Wang, Sen, et al.
Pubblicazione: (2025)
EQ-TAA: Equivariant Traffic Accident Anticipation via Diffusion-Based Accident Video Synthesis
di: Fang, Jianwu, et al.
Pubblicazione: (2025)
di: Fang, Jianwu, et al.
Pubblicazione: (2025)
CFMW: Cross-modality Fusion Mamba for Robust Object Detection under Adverse Weather
di: Li, Haoyuan, et al.
Pubblicazione: (2024)
di: Li, Haoyuan, et al.
Pubblicazione: (2024)
WoW: Towards a World omniscient World model Through Embodied Interaction
di: Chi, Xiaowei, et al.
Pubblicazione: (2025)
di: Chi, Xiaowei, et al.
Pubblicazione: (2025)
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
di: Huang, Zhijian, et al.
Pubblicazione: (2024)
di: Huang, Zhijian, et al.
Pubblicazione: (2024)
MambaMOS: LiDAR-based 3D Moving Object Segmentation with Motion-aware State Space Model
di: Zeng, Kang, et al.
Pubblicazione: (2024)
di: Zeng, Kang, et al.
Pubblicazione: (2024)
WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar
di: Guan, Runwei, et al.
Pubblicazione: (2024)
di: Guan, Runwei, et al.
Pubblicazione: (2024)
Whole-Body Conditioned Egocentric Video Prediction
di: Bai, Yutong, et al.
Pubblicazione: (2025)
di: Bai, Yutong, et al.
Pubblicazione: (2025)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
UniScene: Multi-Camera Unified Pre-training via 3D Scene Reconstruction for Autonomous Driving
di: Min, Chen, et al.
Pubblicazione: (2023)
di: Min, Chen, et al.
Pubblicazione: (2023)
Integrating Multi-Modal Sensors: A Review of Fusion Techniques for Intelligent Vehicles
di: Wei, Chuheng, et al.
Pubblicazione: (2025)
di: Wei, Chuheng, et al.
Pubblicazione: (2025)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
di: Yang, Haibo, et al.
Pubblicazione: (2024)
di: Yang, Haibo, et al.
Pubblicazione: (2024)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
HopaDIFF: Holistic-Partial Aware Fourier Conditioned Diffusion for Referring Human Action Segmentation in Multi-Person Scenarios
di: Peng, Kunyu, et al.
Pubblicazione: (2025)
di: Peng, Kunyu, et al.
Pubblicazione: (2025)
Bernini: Latent Semantic Planning for Video Diffusion
di: Bernini Team, et al.
Pubblicazione: (2026)
di: Bernini Team, et al.
Pubblicazione: (2026)
RefAtomNet++: Advancing Referring Atomic Video Action Recognition using Semantic Retrieval based Multi-Trajectory Mamba
di: Peng, Kunyu, et al.
Pubblicazione: (2025)
di: Peng, Kunyu, et al.
Pubblicazione: (2025)
How Far Are Surgeons from Surgical World Models? A Pilot Study on Zero-shot Surgical Video Generation with Expert Assessment
di: Chen, Zhen, et al.
Pubblicazione: (2025)
di: Chen, Zhen, et al.
Pubblicazione: (2025)
A Very Big Video Reasoning Suite
di: Wang, Maijunxian, et al.
Pubblicazione: (2026)
di: Wang, Maijunxian, et al.
Pubblicazione: (2026)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
di: Liu, Luping, et al.
Pubblicazione: (2024)
di: Liu, Luping, et al.
Pubblicazione: (2024)
E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes
di: Zhai, Jiajun, et al.
Pubblicazione: (2026)
di: Zhai, Jiajun, et al.
Pubblicazione: (2026)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
di: Yan, Xin, et al.
Pubblicazione: (2024)
di: Yan, Xin, et al.
Pubblicazione: (2024)
UniVid: Pyramid Diffusion Model for High Quality Video Generation
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
Geo-RepNet: Geometry-Aware Representation Learning for Surgical Phase Recognition in Endoscopic Submucosal Dissection
di: Tang, Rui, et al.
Pubblicazione: (2025)
di: Tang, Rui, et al.
Pubblicazione: (2025)
Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
Context Guided Transformer Entropy Modeling for Video Compression
di: Tong, Junlong, et al.
Pubblicazione: (2025)
di: Tong, Junlong, et al.
Pubblicazione: (2025)
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
di: Guan, Jiazhi, et al.
Pubblicazione: (2025)
di: Guan, Jiazhi, et al.
Pubblicazione: (2025)
SAM 2 in Robotic Surgery: An Empirical Evaluation for Robustness and Generalization in Surgical Video Segmentation
di: Yu, Jieming, et al.
Pubblicazione: (2024)
di: Yu, Jieming, et al.
Pubblicazione: (2024)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
di: Zhang, Deyu, et al.
Pubblicazione: (2025)
di: Zhang, Deyu, et al.
Pubblicazione: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation
di: Zheng, Sixiao, et al.
Pubblicazione: (2025)
di: Zheng, Sixiao, et al.
Pubblicazione: (2025)
Generalized Video Anomaly Event Detection: Systematic Taxonomy and Comparison of Deep Models
di: Liu, Yang, et al.
Pubblicazione: (2023)
di: Liu, Yang, et al.
Pubblicazione: (2023)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
di: Li, Minghan, et al.
Pubblicazione: (2026)
di: Li, Minghan, et al.
Pubblicazione: (2026)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
CreativeVR: Diffusion-Prior-Guided Approach for Structure and Motion Restoration in Generative and Real Videos
di: Panambur, Tejas, et al.
Pubblicazione: (2025)
di: Panambur, Tejas, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EVA: An Embodied World Model for Future Video Anticipation
di: Chi, Xiaowei, et al.
Pubblicazione: (2024) -
HR-INR: Continuous Space-Time Video Super-Resolution via Event Camera
di: Lu, Yunfan, et al.
Pubblicazione: (2024) -
XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments
di: Qian, Kangan, et al.
Pubblicazione: (2026) -
2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness
di: Zheng, Zihao, et al.
Pubblicazione: (2026) -
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
di: Wang, Sen, et al.
Pubblicazione: (2025)