SurGen: Text-Guided Diffusion Model for Surgical Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Cho, Joseph, Schmidgall, Samuel, Zakka, Cyril, Mathur, Mrudang, Kaur, Dhamanpreet, Shad, Rohan, Hiesinger, William |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Generalist Model for Diverse Text-Guided Medical Image Synthesis
di: Cho, Joseph, et al.
Pubblicazione: (2024)
di: Cho, Joseph, et al.
Pubblicazione: (2024)
GP-VLS: A general-purpose vision language model for surgery
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
Almanac Copilot: Towards Autonomous Electronic Health Record Navigation
di: Zakka, Cyril, et al.
Pubblicazione: (2024)
di: Zakka, Cyril, et al.
Pubblicazione: (2024)
A Generalizable Deep Learning System for Cardiac MRI
di: Shad, Rohan, et al.
Pubblicazione: (2023)
di: Shad, Rohan, et al.
Pubblicazione: (2023)
SurGen: 1020 H&E-stained Whole Slide Images With Survival and Genetic Markers
di: Myles, Craig, et al.
Pubblicazione: (2025)
di: Myles, Craig, et al.
Pubblicazione: (2025)
AgentRxiv: Towards Collaborative Autonomous Research
di: Schmidgall, Samuel, et al.
Pubblicazione: (2025)
di: Schmidgall, Samuel, et al.
Pubblicazione: (2025)
PERCS: Persona-Guided Controllable Biomedical Summarization Dataset
di: Salvi, Rohan Charudatt, et al.
Pubblicazione: (2025)
di: Salvi, Rohan Charudatt, et al.
Pubblicazione: (2025)
TextOmics-Guided Diffusion for Hit-like Molecular Generation
di: Yuan, Hang, et al.
Pubblicazione: (2025)
di: Yuan, Hang, et al.
Pubblicazione: (2025)
EROS: Entity-Driven Controlled Policy Document Summarization
di: Singh, Joykirat, et al.
Pubblicazione: (2024)
di: Singh, Joykirat, et al.
Pubblicazione: (2024)
GenProve: Learning to Generate Text with Fine-Grained Provenance
di: Wei, Jingxuan, et al.
Pubblicazione: (2026)
di: Wei, Jingxuan, et al.
Pubblicazione: (2026)
AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
Target-Augmented Shared Fusion-based Multimodal Sarcasm Explanation Generation
di: Goel, Palaash, et al.
Pubblicazione: (2025)
di: Goel, Palaash, et al.
Pubblicazione: (2025)
Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
di: Lee, Daeun, et al.
Pubblicazione: (2024)
di: Lee, Daeun, et al.
Pubblicazione: (2024)
Scaling Concept With Text-Guided Diffusion Models
di: Huang, Chao, et al.
Pubblicazione: (2024)
di: Huang, Chao, et al.
Pubblicazione: (2024)
ComfyGen: Prompt-Adaptive Workflows for Text-to-Image Generation
di: Gal, Rinon, et al.
Pubblicazione: (2024)
di: Gal, Rinon, et al.
Pubblicazione: (2024)
Persona-aware Generative Model for Code-mixed Language
di: Sengupta, Ayan, et al.
Pubblicazione: (2023)
di: Sengupta, Ayan, et al.
Pubblicazione: (2023)
Text-Guided Molecule Generation with Diffusion Language Model
di: Gong, Haisong, et al.
Pubblicazione: (2024)
di: Gong, Haisong, et al.
Pubblicazione: (2024)
VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning
di: Lin, Han, et al.
Pubblicazione: (2023)
di: Lin, Han, et al.
Pubblicazione: (2023)
GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
PlotGen: Multi-Agent LLM-based Scientific Data Visualization via Multimodal Feedback
di: Goswami, Kanika, et al.
Pubblicazione: (2025)
di: Goswami, Kanika, et al.
Pubblicazione: (2025)
QUENCH: Measuring the gap between Indic and Non-Indic Contextual General Reasoning in LLMs
di: Khan, Mohammad Aflah, et al.
Pubblicazione: (2024)
di: Khan, Mohammad Aflah, et al.
Pubblicazione: (2024)
SQLSpace: A Representation Space for Text-to-SQL to Discover and Mitigate Robustness Gaps
di: Srikanth, Neha, et al.
Pubblicazione: (2025)
di: Srikanth, Neha, et al.
Pubblicazione: (2025)
Sentiment-guided Commonsense-aware Response Generation for Mental Health Counseling
di: Srivastava, Aseem, et al.
Pubblicazione: (2025)
di: Srivastava, Aseem, et al.
Pubblicazione: (2025)
Incongruence Identification in Eyewitness Testimony
di: Nair, Akshara, et al.
Pubblicazione: (2025)
di: Nair, Akshara, et al.
Pubblicazione: (2025)
HiGen: Hierarchy-Aware Sequence Generation for Hierarchical Text Classification
di: Jain, Vidit, et al.
Pubblicazione: (2024)
di: Jain, Vidit, et al.
Pubblicazione: (2024)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
di: Feng, Weixi, et al.
Pubblicazione: (2024)
di: Feng, Weixi, et al.
Pubblicazione: (2024)
Assess and Prompt: A Generative RL Framework for Improving Engagement in Online Mental Health Communities
di: Gaur, Bhagesh, et al.
Pubblicazione: (2025)
di: Gaur, Bhagesh, et al.
Pubblicazione: (2025)
Table-to-Text Generation with Pretrained Diffusion Models
di: Krylov, Aleksei S., et al.
Pubblicazione: (2024)
di: Krylov, Aleksei S., et al.
Pubblicazione: (2024)
Private Synthetic Text Generation with Diffusion Models
di: Ochs, Sebastian, et al.
Pubblicazione: (2024)
di: Ochs, Sebastian, et al.
Pubblicazione: (2024)
LatticeGen: A Cooperative Framework which Hides Generated Text in a Lattice for Privacy-Aware Generation on Cloud
di: Zhang, Mengke, et al.
Pubblicazione: (2023)
di: Zhang, Mengke, et al.
Pubblicazione: (2023)
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
di: Jing, Liqiang, et al.
Pubblicazione: (2025)
di: Jing, Liqiang, et al.
Pubblicazione: (2025)
Review, Remask, Refine (R3): Process-Guided Block Diffusion for Text Generation
di: Mounier, Nikita, et al.
Pubblicazione: (2025)
di: Mounier, Nikita, et al.
Pubblicazione: (2025)
EasyGen: Easing Multimodal Generation with BiDiffuser and LLMs
di: Zhao, Xiangyu, et al.
Pubblicazione: (2023)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2023)
Map&Make: Schema Guided Text to Table Generation
di: Ahuja, Naman, et al.
Pubblicazione: (2025)
di: Ahuja, Naman, et al.
Pubblicazione: (2025)
Controlling Reading Ease with Gaze-Guided Text Generation
di: Säuberli, Andreas, et al.
Pubblicazione: (2026)
di: Säuberli, Andreas, et al.
Pubblicazione: (2026)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
di: Li, Jialu, et al.
Pubblicazione: (2025)
di: Li, Jialu, et al.
Pubblicazione: (2025)
Smoothie: Smoothing Diffusion on Token Embeddings for Text Generation
di: Shabalin, Alexander, et al.
Pubblicazione: (2025)
di: Shabalin, Alexander, et al.
Pubblicazione: (2025)
PEPPER: Perception-Guided Perturbation for Robust Backdoor Defense in Text-to-Image Diffusion Models
di: Chew, Oscar, et al.
Pubblicazione: (2025)
di: Chew, Oscar, et al.
Pubblicazione: (2025)
Enhancing Phrase Representation by Information Bottleneck Guided Text Diffusion Process for Keyphrase Extraction
di: Luo, Yuanzhen, et al.
Pubblicazione: (2023)
di: Luo, Yuanzhen, et al.
Pubblicazione: (2023)
Tox-BART: Leveraging Toxicity Attributes for Explanation Generation of Implicit Hate Speech
di: Yadav, Neemesh, et al.
Pubblicazione: (2024)
di: Yadav, Neemesh, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Generalist Model for Diverse Text-Guided Medical Image Synthesis
di: Cho, Joseph, et al.
Pubblicazione: (2024) -
GP-VLS: A general-purpose vision language model for surgery
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024) -
Almanac Copilot: Towards Autonomous Electronic Health Record Navigation
di: Zakka, Cyril, et al.
Pubblicazione: (2024) -
A Generalizable Deep Learning System for Cardiac MRI
di: Shad, Rohan, et al.
Pubblicazione: (2023) -
SurGen: 1020 H&E-stained Whole Slide Images With Survival and Genetic Markers
di: Myles, Craig, et al.
Pubblicazione: (2025)