Salvato in:
| Autori principali: | Ran, Lingmin, Cun, Xiaodong, Liu, Jia-Wei, Zhao, Rui, Zijie, Song, Wang, Xintao, Keppo, Jussi, Shou, Mike Zheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2312.02238 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FairyGen: Storied Cartoon Video from a Single Child-Drawn Character
di: Zheng, Jiayi, et al.
Pubblicazione: (2025)
di: Zheng, Jiayi, et al.
Pubblicazione: (2025)
Instant3D: Instant Text-to-3D Generation
di: Li, Ming, et al.
Pubblicazione: (2023)
di: Li, Ming, et al.
Pubblicazione: (2023)
TPDiff: Temporal Pyramid Video Diffusion Model
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
Concept Drift Guided LayerNorm Tuning for Efficient Multimodal Metaphor Identification
di: Qian, Wenhao, et al.
Pubblicazione: (2025)
di: Qian, Wenhao, et al.
Pubblicazione: (2025)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
di: Cai, Minghong, et al.
Pubblicazione: (2024)
di: Cai, Minghong, et al.
Pubblicazione: (2024)
Paper2Video: Automatic Video Generation from Scientific Papers
di: Zhu, Zeyu, et al.
Pubblicazione: (2025)
di: Zhu, Zeyu, et al.
Pubblicazione: (2025)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
Factorized Learning for Temporally Grounded Video-Language Models
di: Zeng, Wenzheng, et al.
Pubblicazione: (2025)
di: Zeng, Wenzheng, et al.
Pubblicazione: (2025)
Code2Video: A Code-centric Paradigm for Educational Video Generation
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
di: Song, Zijie, et al.
Pubblicazione: (2023)
di: Song, Zijie, et al.
Pubblicazione: (2023)
ChartAdapter: Large Vision-Language Model for Chart Summarization
di: Xu, Peixin, et al.
Pubblicazione: (2024)
di: Xu, Peixin, et al.
Pubblicazione: (2024)
FakeSV-VLM: Taming VLM for Detecting Fake Short-Video News via Progressive Mixture-Of-Experts Adapter
di: Wang, Junxi, et al.
Pubblicazione: (2025)
di: Wang, Junxi, et al.
Pubblicazione: (2025)
PiGW: A Plug-in Generative Watermarking Framework
di: Ma, Rui, et al.
Pubblicazione: (2024)
di: Ma, Rui, et al.
Pubblicazione: (2024)
Learning Video Context as Interleaved Multimodal Sequences
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
DT-UFC: Universal Large Model Feature Coding via Peaky-to-Balanced Distribution Transformation
di: Gao, Changsheng, et al.
Pubblicazione: (2025)
di: Gao, Changsheng, et al.
Pubblicazione: (2025)
Universally Unfiltered and Unseen:Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards
di: Yan, Song, et al.
Pubblicazione: (2025)
di: Yan, Song, et al.
Pubblicazione: (2025)
Multimodal growth and development assessment model
di: Li, Ying, et al.
Pubblicazione: (2024)
di: Li, Ying, et al.
Pubblicazione: (2024)
BeFA: A General Behavior-driven Feature Adapter for Multimedia Recommendation
di: Fan, Qile, et al.
Pubblicazione: (2024)
di: Fan, Qile, et al.
Pubblicazione: (2024)
Interdisciplinary Translations: Sensory Perception as a Universal Language
di: Kang, Xindi, et al.
Pubblicazione: (2024)
di: Kang, Xindi, et al.
Pubblicazione: (2024)
Music Grounding by Short Video
di: Xin, Zijie, et al.
Pubblicazione: (2024)
di: Xin, Zijie, et al.
Pubblicazione: (2024)
LiftProj: Space Lifting and Projection-Based Panorama Stitching
di: Jia, Yuan, et al.
Pubblicazione: (2025)
di: Jia, Yuan, et al.
Pubblicazione: (2025)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2025)
di: Xiao, Jian, et al.
Pubblicazione: (2025)
MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation
di: Zhao, Yuan, et al.
Pubblicazione: (2026)
di: Zhao, Yuan, et al.
Pubblicazione: (2026)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
di: Xing, Yazhou, et al.
Pubblicazione: (2024)
di: Xing, Yazhou, et al.
Pubblicazione: (2024)
MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter
di: Liu, Zhiyuan, et al.
Pubblicazione: (2023)
di: Liu, Zhiyuan, et al.
Pubblicazione: (2023)
CARAT: Contrastive Feature Reconstruction and Aggregation for Multi-Modal Multi-Label Emotion Recognition
di: Peng, Cheng, et al.
Pubblicazione: (2023)
di: Peng, Cheng, et al.
Pubblicazione: (2023)
UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
di: Jiang, Haoyu, et al.
Pubblicazione: (2024)
di: Jiang, Haoyu, et al.
Pubblicazione: (2024)
Language-oriented Semantic Communication for Image Transmission with Fine-Tuned Diffusion Model
di: Wei, Xinfeng, et al.
Pubblicazione: (2024)
di: Wei, Xinfeng, et al.
Pubblicazione: (2024)
DiffCL: A Diffusion-Based Contrastive Learning Framework with Semantic Alignment for Multimodal Recommendations
di: Song, Qiya, et al.
Pubblicazione: (2025)
di: Song, Qiya, et al.
Pubblicazione: (2025)
Latent Feature-Guided Conditional Diffusion for Generative Image Semantic Communication
di: Chen, Zehao, et al.
Pubblicazione: (2025)
di: Chen, Zehao, et al.
Pubblicazione: (2025)
FCBoost-Net: A Generative Network for Synthesizing Multiple Collocated Outfits via Fashion Compatibility Boosting
di: Zhou, Dongliang, et al.
Pubblicazione: (2025)
di: Zhou, Dongliang, et al.
Pubblicazione: (2025)
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
di: Li, Ran, et al.
Pubblicazione: (2025)
di: Li, Ran, et al.
Pubblicazione: (2025)
M3ST-DTI: A multi-task learning model for drug-target interactions based on multi-modal features and multi-stage alignment
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
HCVR Scene Generation: High Compatibility Virtual Reality Environment Generation for Extended Redirected Walking
di: Zhang, Yiran, et al.
Pubblicazione: (2026)
di: Zhang, Yiran, et al.
Pubblicazione: (2026)
Knowledge-aware Diffusion-Enhanced Multimedia Recommendation
di: Mo, Xian, et al.
Pubblicazione: (2025)
di: Mo, Xian, et al.
Pubblicazione: (2025)
AMB-DSGDN: Adaptive Modality-Balanced Dynamic Semantic Graph Differential Network for Multimodal Emotion Recognition
di: Wang, Yunsheng, et al.
Pubblicazione: (2026)
di: Wang, Yunsheng, et al.
Pubblicazione: (2026)
BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion
di: Jia, Tianzhi, et al.
Pubblicazione: (2026)
di: Jia, Tianzhi, et al.
Pubblicazione: (2026)
BlobCtrl: Taming Controllable Blob for Element-level Image Editing
di: Li, Yaowei, et al.
Pubblicazione: (2025)
di: Li, Yaowei, et al.
Pubblicazione: (2025)
DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter
di: Dong, Ziyi, et al.
Pubblicazione: (2022)
di: Dong, Ziyi, et al.
Pubblicazione: (2022)
Documenti analoghi
-
FairyGen: Storied Cartoon Video from a Single Child-Drawn Character
di: Zheng, Jiayi, et al.
Pubblicazione: (2025) -
Instant3D: Instant Text-to-3D Generation
di: Li, Ming, et al.
Pubblicazione: (2023) -
TPDiff: Temporal Pyramid Video Diffusion Model
di: Ran, Lingmin, et al.
Pubblicazione: (2025) -
Concept Drift Guided LayerNorm Tuning for Efficient Multimodal Metaphor Identification
di: Qian, Wenhao, et al.
Pubblicazione: (2025) -
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)